論文の概要: Emergence of Reputation-Based Cooperation in LLM Agents
- arxiv url: http://arxiv.org/abs/2608.04507v1
- Date: Wed, 05 Aug 2026 06:46:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.761155
- Title: Emergence of Reputation-Based Cooperation in LLM Agents
- Title(参考訳): LLMエージェントにおける評価に基づく協調の創発
- Authors: Kazuya Horibe, Kenji Itao, Wataru Toyokawa,
- Abstract要約: 本研究では,大規模言語モデル(LLM)によるフリーライダの侵入対策について検討する。
フリーライダーの侵入に対する堅牢性は、桁違いに変化する。
リーディング・ハイト L1 ノルムへの順守はロバスト性を予測するものではない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Can cooperation among large language model (LLM) agents be evolutionarily stable against free-rider invasion? We study an indirect reciprocity donation game where LLM agents observe behavioral traces and donate on a continuous scale. Strategies, represented as natural language prompts, evolve through cultural transmission across generations. Across four LLM backends, robustness to free-rider invasion varies by more than an order of magnitude. The strongest predictor of this robustness is opponent endowment sensitivity, the degree to which agents discriminate between cooperative and uncooperative opponents, operationalizing the classical Image Scoring mechanism. By contrast, adherence to the Leading-Eight L1 norm does not predict robustness. Robustness depends on defector exclusion: while both cooperator reward and defector punishment vary across models, only the stringency of defector exclusion predicts resistance to free-rider invasion. These findings reveal that LLM agents are confined to Image Scoring-like discrimination and fail to develop the more robust Leading-Eight norms, highlighting a fundamental vulnerability in culturally evolved LLM cooperation and motivating bottom-up approaches to norm construction.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェント間の協調は、進化的にフリーライダーの侵入に対して安定できるか?
本研究では, LLMエージェントが行動トレースを観察し, 連続的なスケールで寄付を行う間接的相互寄付ゲームについて検討する。
自然言語のプロンプトとして表現される戦略は、世代間で文化的な伝達を通じて進化する。
LLMバックエンドの4つにまたがって、フリーライダーの侵入に対する堅牢性は、桁違いに変化する。
この頑健さの最も強い予測者は、エージェントが協力的な相手と非協力的な相手を区別し、古典的なイメージスコーリング機構を運用する度合いである、反対寄付感度である。
対照的に、Leading-Eight L1 ノルムへの固さは頑健さを予測しない。
共役の報酬と欠陥の処罰はモデルによって異なるが、欠陥の排除の厳格さだけがフリーライダーの侵入に対する抵抗を予測している。
これらの結果から, LLMエージェントはイメージ・スコーリングのような識別に制限され, より堅牢なリード・ハイト・ノルムの開発に失敗し, 文化的に進化したLCM協調の根本的な脆弱性を浮き彫りにし, ボトムアップ・アプローチの規範構築への動機付けを図った。
関連論文リスト
- Collective cooperation without individual fidelity in LLM agents [0.0]
大規模言語モデル (LLMs) は、社会システムのシミュレーションのエージェントとしてますます使われている。
彼らの行動がいつ人間の意思決定の忠実な代行であると解釈されるのかは、いまだ不明である。
論文 参考訳(メタデータ) (2026-06-29T15:22:21Z) - MobEvolve: An Agentic Self-Evolving Heuristic System for Interpretable Human Mobility Generation [51.824145170051516]
MobEvolveは、人間のモビリティ生成のための自己進化フレームワークである。
エージェントを使用して、内部ロジックを反復的に進化させる。
最先端の深層生成法とLLMベースの手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-06-01T03:46:25Z) - Social Catalysts, Not Moral Agents: The Illusion of Alignment in LLM Societies [0.7944997500468641]
本研究は,公共財ゲーム(PGG)における利他的主体の育成におけるアンコリング・エージェントの有効性について検討する。
アンコリングエージェントは局所的な協力率を高めることに成功したが、認知的分解と伝達テストにより、この効果は真のノルム内部化ではなく、戦略的コンプライアンスと認知的オフロードによって引き起こされたことが判明した。
これらの知見は, 人工社会における行動修飾と真の価値アライメントの間に重要なギャップを浮き彫りにした。
論文 参考訳(メタデータ) (2026-02-01T17:07:10Z) - Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails [103.05296856071931]
本稿では,自己進化型大規模言語モデル(LLM)エージェントに特有の,アライメント・ティッピング・プロセス(ATP)を同定する。
ATPは、連続的な相互作用によってエージェントが訓練中に確立されたアライメント制約を放棄し、強化された自己関心の戦略を支持するときに生じる。
実験の結果、アライメントの利点は自己進化の下で急速に低下し、最初は整合性のない状態に収束したモデルであることが判明した。
論文 参考訳(メタデータ) (2025-10-06T14:48:39Z) - AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning [78.5751183537704]
AdvEvo-MARLは、タスクエージェントに安全性を内部化する、共進化型マルチエージェント強化学習フレームワークである。
外部ガードに頼るのではなく、AdvEvo-MARLは攻撃者と防御者を共同で最適化する。
論文 参考訳(メタデータ) (2025-10-02T02:06:30Z) - ICLShield: Exploring and Mitigating In-Context Learning Backdoor Attacks [61.06621533874629]
In-context Learning (ICL)は、大規模言語モデル(LLM)において顕著な成功を収めた。
本稿では,LLMがタスク関連潜伏概念とバックドア関連潜伏概念の両方を同時に学習する,という二重学習仮説を初めて提案する。
そこで本研究では,概念選好比を動的に調整する防衛機構であるICLShieldを提案する。
論文 参考訳(メタデータ) (2025-07-02T03:09:20Z) - Corrupted by Reasoning: Reasoning Language Models Become Free-Riders in Public Goods Games [87.5673042805229]
大規模言語モデルは、アライメント、堅牢性、安全なデプロイメントを保証する上で、いかに自己関心と集合的幸福のバランスをとるかが重要な課題である。
我々は、行動経済学から制度的に選択した公共財ゲームに適応し、異なるLLMがいかに社会的ジレンマをナビゲートするかを観察することができる。
意外なことに、o1シリーズのようなLCMの推論は、協調にかなり苦労している。
論文 参考訳(メタデータ) (2025-06-29T15:02:47Z) - The Machine Psychology of Cooperation: Can GPT models operationalise prompts for altruism, cooperation, competitiveness and selfishness in economic games? [0.0]
GPT-3.5大言語モデル(LLM)を用いて,協調的,競争的,利他的,利己的行動の自然言語記述を操作可能とした。
被験者と実験心理学研究で用いられるのと同様のプロトコルを用いて,課題環境を記述するためのプロンプトを用いた。
この結果から,LLM が様々な協調姿勢の自然言語記述を適切な作業行動の記述にある程度翻訳できることが示唆された。
論文 参考訳(メタデータ) (2023-05-13T17:23:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。