論文の概要: Adaptive Punishment for Cooperation in Mixed-Motive Games
- arxiv url: http://arxiv.org/abs/2605.24516v1
- Date: Sat, 23 May 2026 11:01:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.152215
- Title: Adaptive Punishment for Cooperation in Mixed-Motive Games
- Title(参考訳): 混合運動ゲームにおける協調のための適応的罰則
- Authors: Min Tang, Fanqi Kong, Linyuan Lü, Xue Feng,
- Abstract要約: 利己的なエージェントは、しばしば即時報酬のために欠陥し、長期的な利益と集団福祉を改善する利他的な協力の可能性を見越す。
ピア罰は欠陥を抑えることができるが、コストのかかる二階利他主義として、その永続的な仮定は罰官の利益を損なう可能性がある。
本稿では, 動的罰の確率と欠陥の深刻度の両方に基づいて, 罰の強度を決定する適応的協力罰を提案する。
- 参考スコア(独自算出の注目度): 7.763884853916347
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixed-motive scenarios are ubiquitous in real-world multi-agent interactions, where self-interested agents often defect for immediate rewards, overlooking the potential of altruistic cooperation to improve long-term gains and collective welfare. Peer punishment can deter defection, but as costly second-order altruism, its persistent imposition may undermine the punisher's interests. Existing approaches often struggle to effectively implement punishment to promote cooperation. To balance the efficacy and cost of punishment, we propose Adaptive Punishment for Cooperation (APC), a distributed method that determines punishment intensity based on both a dynamic punishment probability and the severity of defection. This dynamic probability substantially reduces costly and ineffective punishment while also promotes cooperation. To accurately assess defection and its severity, we use a defection awareness module, whose learning is guided by game reward. Theoretical analysis and empirical results show APC performs effectively in iterated public goods game. Empirically, APC also significantly outperforms existing baselines across sequential social dilemmas, learning rational and effective punishment policies that foster cooperation by strategically deterring defection.
- Abstract(参考訳): 混合モチベーションのシナリオは、実世界のマルチエージェント相互作用においてユビキタスであり、利他的協力による長期的な利益と集団福祉の改善の可能性を見越して、利己的なエージェントが即時報酬のためにしばしば欠陥を負う。
ピア罰は欠陥を抑えることができるが、コストのかかる二階利他主義として、その永続的な仮定は罰官の利益を損なう可能性がある。
既存のアプローチは、しばしば協力を促進するために効果的に罰を実施するのに苦労する。
罰の有効性とコストのバランスをとるために,動的罰の確率と欠陥の深刻度の両方に基づいて罰の強度を決定する分散手法であるAdaptive Punishment for Cooperation (APC)を提案する。
このダイナミックな確率は、コストと効果の低い罰を著しく低減し、協調を促進する。
欠陥とその重症度を正確に評価するために,ゲーム報酬によって学習が誘導される欠陥認識モジュールを用いる。
理論的解析と実証結果から、APCは反復的な公共グッズゲームにおいて効果的に機能することが示された。
経験的に、APCは、戦略的に欠陥を抑えることで協力を促進する合理的かつ効果的な罰則を学習し、シーケンシャルな社会的ジレンマにまたがる既存のベースラインを著しく上回っている。
関連論文リスト
- Integrated strong reciprocity enables productive punishment and protective defection [1.4323566945483497]
我々は、上流と下流の相互性とコストのかかる罰を統合する進化型ゲームモデルを分析する。
ISR は ISR の安定な混合平衡と非条件欠陥を認めていることを示す。
同時に、ISRとALLDの混合平衡は、控えめな複雑さの下でも頑健である。
論文 参考訳(メタデータ) (2026-01-07T08:03:49Z) - Rethinking Reward Miscalibration of GRPO in Agentic RL [18.495499496405635]
結果に基づく報酬は、これらの欠陥のある中間ステップに対して期待される負の優位性を保証することを示す。
我々は,善悪行為の埋め込みを分離するために,善悪行為を分類するアクターの訓練を提案する。
論文 参考訳(メタデータ) (2025-09-28T13:24:38Z) - Integrative Experiments Identify How Punishment Impacts Welfare in Public Goods Games [2.359185514776351]
本研究では,大規模統合実験を通じて,共同作業環境における罰の効果について検討した。
我々は,新しい実験における罰則の予測において,人間の予測よりも優れるモデルを開発した。
我々の結果は、それが機能し、機能しない特定の条件に「機能する」か否かの罰に関する議論を再燃させます。
論文 参考訳(メタデータ) (2025-08-23T22:07:27Z) - Deceptive Sequential Decision-Making via Regularized Policy Optimization [54.38738815697299]
我々は,自律的なシステムをマルコフ決定プロセスとしてモデル化し,逆強化学習を用いて報酬関数を復元する。
本稿では,システム報酬に対する敵意を積極的に欺く政策合成問題に対する3つの規則化戦略を示す。
我々は,その最適かつ非知覚的価値の少なくとも97%の累積報酬を達成しつつ,反逆的,標的的,公平な詐欺が虚偽の信念に逆らうことを示している。
論文 参考訳(メタデータ) (2025-01-30T23:41:40Z) - Learning to Balance Altruism and Self-interest Based on Empathy in Mixed-Motive Games [47.8980880888222]
マルチエージェントのシナリオは、しばしば混合モチベーションを伴い、潜在的な搾取に対する自己保護が可能な利他的エージェントを要求する。
共感に基づくアルトリズムと自己利益のバランスをとるためのLASE学習を提案する。
LASEはその報酬の一部を共同プレイヤにギフトとして割り当て、このアロケーションは社会的関係に基づいて動的に適応する。
論文 参考訳(メタデータ) (2024-10-10T12:30:56Z) - The Benefits of Power Regularization in Cooperative Reinforcement Learning [5.141502818619855]
我々は、協調RLシステムにおける電力集中を明示的に規則化すると、単一のエージェントの故障に対してより堅牢なシステムが得られると主張している。
我々は,このパワーレギュラー化目標に向けて,SBPR(Sample Based Power Regularization)とPRIM(Intrinsic Motivation)によるパワーレギュラー化(Power Regularization)の2つのアルゴリズムを提案する。
実験の結果、両アルゴリズムがタスク報酬とパワーのバランスをとっており、パワーの低下と破滅的な事象の回避に繋がることがわかった。
論文 参考訳(メタデータ) (2024-06-17T06:10:37Z) - Incentivized Communication for Federated Bandits [67.4682056391551]
我々は,サーバがインセンティブを提供することでクライアントにデータを共有する動機付けを行う,フェデレートされた盗賊に対するインセンティブ付きコミュニケーション問題を導入する。
本稿では,実証可能な通信とインセンティブコスト保証により,ほぼ最適の後悔を実現する,最初のインセンティブ付き通信プロトコルであるInc-FedUCBを提案する。
論文 参考訳(メタデータ) (2023-09-21T00:59:20Z) - Case Study: Predictive Fairness to Reduce Misdemeanor Recidivism Through
Social Service Interventions [4.651149317838983]
ロサンゼルス市検事局は、新しいRecidivism Reduction and Drug Diversion Unit (R2D2)を創設した。
本稿では,機械学習に基づく意思決定に予測的株式を組み込むケーススタディとして,この新しいユニットとのコラボレーションについて述べる。
論文 参考訳(メタデータ) (2020-01-24T23:52:55Z) - Cooperative Inverse Reinforcement Learning [64.60722062217417]
協調強化学習(CIRL)としての値アライメント問題の形式的定義を提案する。
CIRL問題は、人間とロボットの2人のエージェントによる協調的部分情報ゲームであり、どちらも人間の報酬関数に従って報酬を受けるが、ロボットは当初それが何であるかを知らない。
古典的なIRLとは対照的に、人間は孤立して最適な行動をとると仮定されるが、最適なCIRLソリューションは活発な教育、活発な学習、コミュニケーション行動などの行動を生み出す。
論文 参考訳(メタデータ) (2016-06-09T22:39:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。