論文の概要: Integrated Altruistic and Fairness Preference Induces Advanced Mutual Cooperation in Sequential Social Dilemmas
- arxiv url: http://arxiv.org/abs/2607.04710v1
- Date: Mon, 06 Jul 2026 06:26:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.060551
- Title: Integrated Altruistic and Fairness Preference Induces Advanced Mutual Cooperation in Sequential Social Dilemmas
- Title(参考訳): 逐次的社会的ジレンマにおける統合的アルトゥルスティック・フェアネス選好による相互協力の促進
- Abstract要約: Altruistic and Fairness Preference (AFP)は、自己と他人の報酬を協調行動のためのインセンティブに変換する報酬共有メカニズムである。
AFPエージェントは、ベースラインよりも集団報酬とより高い株式との相互協力を成功裏に達成したことを示す。
その結果、利他主義的な嗜好は、エージェントが公共財に貢献することを奨励し、公正な嗜好はエージェント間の相互行動を引き起こすことが示唆された。
- 参考スコア(独自算出の注目度): 4.290615174131893
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Inducing cooperation among distributed agents is still a difficult problem in the field of multi-agent reinforcement learning (MARL), particularly in social dilemma situations. There, individual interests are misaligned with the common good and individual rationality leads to suboptimal group outcomes. In contrast, humans are able to achieve cooperation with one another in such situations. A common explanation for such cooperative behavior is that individuals have social preferences. In order to achieve cooperation in MARL, we design a new utility function integrating altruistic preferences (incentive for other's reward) and fairness preferences (incentive for equality) from social psychology and behavioral economics, namely, Altruistic and Fairness Preference (AFP), a reward-sharing mechanism which converts one's own and other's rewards to incentives for cooperative behavior. We performed comparative experiments with standard RL and inequity aversion agents in two challenging sequential social dilemma games, and showed that AFP agents successfully achieved mutual cooperation with more collective rewards and higher equity than the baselines. To further understand the progression of AFP during training, we subsequently explore the effects of altruistic preferences and fairness preferences on agents' behavior. The results suggest that altruistic preferences encourage agents to contribute to the public goods, and fairness preferences induce mutual behavior between agents.
- Abstract(参考訳): マルチエージェント強化学習(MARL)分野,特に社会的ジレンマ状況において,分散エージェント間の協調を促すことは依然として難しい問題である。
ここでは、個人の関心は共通の善と不一致であり、個人の合理性は、最適群の結果をもたらす。
対照的に、人間はこのような状況下で互いに協力することができる。
そのような協調行動の一般的な説明は、個人が社会的嗜好を持っていることである。
MARLにおける協調を実現するために、社会心理学や行動経済学から利他主義的選好(他者の報奨へのインセンティブ)と公正選好(平等へのインセンティブ)を取り入れた新たなユーティリティ機能、すなわち、自己と他者の報奨を協調行動のインセンティブに変換する報酬共有機構(AFP)を設計する。
我々は,2つの挑戦的なソーシャルジレンマゲームにおいて,標準RLと不等式回避剤の比較実験を行い,AFPエージェントが,ベースラインよりも集団報酬とより高いエクイティとの相互協力を達成できたことを示した。
トレーニング中のAFPの進行を更に理解するため,利他的嗜好と公正嗜好がエージェントの行動に及ぼす影響を考察した。
その結果、利他主義的な嗜好は、エージェントが公共財に貢献することを奨励し、公正な嗜好はエージェント間の相互行動を引き起こすことが示唆された。
関連論文リスト
- Co-evolution of social reward and punishment under institutional interventions [4.789843817744408]
我々は,社会ジレンマにおける協力,社会福祉,執行効率の進化を,ピアインセンティブと制度インセンティブが共同でどのように形成するかを検討する。
4つの戦略を持つ囚人ジレンマでは、中央集権的なピアインセンティブと中央集権的な機関インセンティブが同時に作用することを許可する。
対人罰は協力を強く促進する一方、対人報酬は社会福祉にとってより有益である。
論文 参考訳(メタデータ) (2026-08-02T12:06:46Z) - Mechanism Design Is Not Enough: Prosocial Agents for Cooperative AI [49.05972944310475]
契約がすべての関連する将来の事態を区別できない場合、現実的なメカニズムを排除できない、厳密な肯定的な福祉損失が存在することを示す。
このギャップを埋め、社会的に優越し、個々に有益である結果が得られることを示す。
論文 参考訳(メタデータ) (2026-05-08T19:37:07Z) - Altruism and Fair Objective in Mixed-Motive Markov games [0.0]
ゲーム理論において、社会的ジレンマは、個人の関心と集合的な結果の間のこの二分法を必要とする。
本稿では,標準実用目的を比例フェアネスに置き換えることで,より公平な協力を促進する新しい枠組みを提案する。
論文 参考訳(メタデータ) (2026-02-09T08:40:52Z) - Corrupted by Reasoning: Reasoning Language Models Become Free-Riders in Public Goods Games [87.5673042805229]
大規模言語モデルは、アライメント、堅牢性、安全なデプロイメントを保証する上で、いかに自己関心と集合的幸福のバランスをとるかが重要な課題である。
我々は、行動経済学から制度的に選択した公共財ゲームに適応し、異なるLLMがいかに社会的ジレンマをナビゲートするかを観察することができる。
意外なことに、o1シリーズのようなLCMの推論は、協調にかなり苦労している。
論文 参考訳(メタデータ) (2025-06-29T15:02:47Z) - Achieving Collective Welfare in Multi-Agent Reinforcement Learning via Suggestion Sharing [12.167248367980449]
自己利益と集団福祉の対立は、しばしば共有福祉を達成する努力を妨げる。
この問題に対処する新しいマルチエージェント強化学習法(MARL)を提案する。
報酬、価値、ポリシーを共有する従来の協調型MARLソリューションとは異なり、エージェントがアクション提案を交換する新しいMARLアプローチを提案する。
論文 参考訳(メタデータ) (2024-12-16T19:44:44Z) - Learning to Balance Altruism and Self-interest Based on Empathy in Mixed-Motive Games [47.8980880888222]
マルチエージェントのシナリオは、しばしば混合モチベーションを伴い、潜在的な搾取に対する自己保護が可能な利他的エージェントを要求する。
共感に基づくアルトリズムと自己利益のバランスをとるためのLASE学習を提案する。
LASEはその報酬の一部を共同プレイヤにギフトとして割り当て、このアロケーションは社会的関係に基づいて動的に適応する。
論文 参考訳(メタデータ) (2024-10-10T12:30:56Z) - Learning Roles with Emergent Social Value Orientations [49.16026283952117]
本稿では、人間社会における典型的な「労働・役割の分断」のメカニズムを紹介する。
我々は、社会的価値指向(SVO)を伴う時空間的社会的ジレンマ(ISD)に対する有望な解決策を提供する。
創発的SVOによる学習ロール(RESVO)と呼ばれる新しい学習フレームワークは、役割の学習を社会的価値指向の出現に変換するために提案されている。
論文 参考訳(メタデータ) (2023-01-31T17:54:09Z) - Aligning to Social Norms and Values in Interactive Narratives [89.82264844526333]
我々は、インタラクティブな物語やテキストベースのゲームにおいて、社会的に有益な規範や価値観に沿って行動するエージェントを作成することに注力する。
我々は、特別な訓練を受けた言語モデルに存在する社会的コモンセンス知識を用いて、社会的に有益な値に整合した行動にのみ、その行動空間を文脈的に制限するGAALADエージェントを紹介した。
論文 参考訳(メタデータ) (2022-05-04T09:54:33Z) - Normative Disagreement as a Challenge for Cooperative AI [56.34005280792013]
典型的な協調誘導学習アルゴリズムは、問題の解決に協力することができないと論じる。
我々は,ノルム適応政策のクラスを開発し,これらが協調性を著しく向上させることを示す実験を行った。
論文 参考訳(メタデータ) (2021-11-27T11:37:42Z) - Balancing Rational and Other-Regarding Preferences in
Cooperative-Competitive Environments [4.705291741591329]
混合環境は利己的で社会的利益の衝突で悪名高い。
個人と社会的インセンティブのバランスをとるBAROCCOを提案します。
メタアルゴリズムは、Qラーニングとアクタークリティカルの両方のフレームワークと互換性があります。
論文 参考訳(メタデータ) (2021-02-24T14:35:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。