論文の概要: Mitigating Retaliatory Algorithmic Collusion in Repeated Games
- arxiv url: http://arxiv.org/abs/2609.20548v1
- Date: Thu, 17 Sep 2026 15:12:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.337354
- Title: Mitigating Retaliatory Algorithmic Collusion in Repeated Games
- Title(参考訳): 繰り返し競技における報復的アルゴリズムの衝突の軽減
- Abstract要約: 反復的相互作用における自己報酬を最大化するために訓練された強化学習エージェントは、明示的な共謀に類似した超競争的な結果に収束することができる。
我々は、Q-learning Colllusionにおける経験的観察とSPCの古典的理論との関係を定式化する。
本稿では、Qラーニング中にこの全変動(TV)距離信号をペナルティ化する報酬形成フレームワークCURBを提案する。
- 参考スコア(独自算出の注目度): 0.764671395172401
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning agents trained to maximize their own reward in repeated interactions can converge to supra-competitive outcomes resembling explicit collusion, without communication or shared design. Existing mitigation approaches are largely tied to specific economic settings, like two-sided platforms and auctions, leaving open how to design interventions for general repeated games. We address this gap by formalizing the connection between empirical observations from prior work on Q-learning collusion and classical theory of Simple Penal Codes (SPCs). We show any non-trivial SPC induces a quantifiable conditional dependence in agents' policies, detectable via the total variation distance between an agent's action distributions across cooperation and defection histories. Building on this connection, we propose CURB (Collusion Unwinding via Reward shaping and Belief injection), a reward-shaping framework that penalizes this Total Variation (TV) distance signal during Q-learning and is guaranteed to convert any SPC fixed point of the dynamics into a trivial one, thus precluding collusive equilibria sustained by punishment threats. Empirically, CURB substantially reduces collusion by Q-learning agents in both Bertrand and Cournot Competition Repeated Games. We further demonstrate that CURB extends to deep Q-network agents in Bertrand competition, suggesting the mechanism generalizes beyond tabular Q-learning.
- Abstract(参考訳): 反復的相互作用において自身の報酬を最大化するために訓練された強化学習エージェントは、コミュニケーションや共有設計なしに、明示的な共謀に類似した超競争的な結果に収束することができる。
既存の緩和アプローチは、両面のプラットフォームやオークションのような特定の経済設定に大きく結びついており、一般的な繰り返しゲームのための介入を設計する方法をオープンにしている。
本稿では,Q-learning ColllusionとSPC(Simple Penal Codes)の古典理論の先行研究から経験的観察の関連を定式化することによって,このギャップに対処する。
我々は,非自明なSPCがエージェントのポリシーに定量的な条件依存を生じさせることを示す。
この接続に基づいて,Qラーニング中にこの全変動(TV)距離信号をペナルティ化する報酬形成フレームワークであるCURB(Collusion Unwinding via Reward Shaping and Belief Injection)を提案する。
CURBは、BertrandとCournot Competition Repeated Gamesの両方において、Qラーニングエージェントによる共謀を著しく減少させる。
さらに我々は,CURBがBertrandコンペティションの深層Qネットワークエージェントに拡張できることを実証し,このメカニズムが表型Qラーニングを超えて一般化されることを示唆した。
関連論文リスト
- TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Provable Robustness against Backdoor Attacks via the Primal-Dual Perspective on Differential Privacy [51.758416625168]
ランダムな平滑化は、敵の摂動に対する堅牢性を証明するための強力なツールである。
本稿では,複雑な構成機構の認証のためのフレームワークを提案する。
複雑な脅威モデル下での堅牢性を証明するために複合メカニズムを使用するための原則的で一般的なフレームワークを提供する。
論文 参考訳(メタデータ) (2026-05-20T22:17:29Z) - Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges [87.04241991512386]
本稿では、報酬ハッキングを理解するための統一フレームワークとして、PCH(Proxy Compression hypothesis)を提案する。
この観点では、報酬のハッキングは、客観的圧縮、最適化増幅、評価器-政治共適応の相互作用から生じる。
この視点は、RLHF、RLAIF、RLVR体制をまたいだ経験的現象を統一し、局所的ショートカット学習がより広範な誤認識へと一般化する方法について説明している。
論文 参考訳(メタデータ) (2026-04-15T08:11:34Z) - Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration [49.9937230730202]
本稿では,新たなアクター・リファイナ・コラボレーション・フレームワークであるSearch-R2を提案する。
提案手法は,生成過程をアクターに分解し,最初の推論軌道を生成する。
本稿では,検索-R2がモデルスケール全体にわたって強力なRAGとRLベースのベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-03T15:32:09Z) - Compressed Federated Reinforcement Learning with a Generative Model [11.074080383657453]
強化学習は近年、前例のない人気を得たが、それでもサンプルの非効率さに悩まされている。
この課題に対処するため、フェデレーション強化学習(FedRL)が出現し、エージェントは局所的な推定を集約することで単一のポリシーを協調的に学習する。
通信効率のよいFedRL手法であるCompFedRLを提案する。
論文 参考訳(メタデータ) (2024-03-26T15:36:47Z) - Distributed Adaptive Learning Under Communication Constraints [54.22472738551687]
本研究では,コミュニケーション制約下での運用を目的とした適応型分散学習戦略について検討する。
我々は,ストリーミングデータの連続的な観察から,オンライン最適化問題を解決しなければならないエージェントのネットワークを考える。
論文 参考訳(メタデータ) (2021-12-03T19:23:48Z) - Parallelized Reverse Curriculum Generation [62.25453821794469]
強化学習では, エージェントが, まばらな報酬のために, 特定の一連の行動を必要とするタスクをマスターすることが困難である。
逆カリキュラム生成(RCG)は、エージェントが学習するカリキュラムを自動的に生成する逆拡張アプローチを提供する。
本稿では,複数のACペアを同時に訓練し,定期的に批判を交換する並列化手法を提案する。
論文 参考訳(メタデータ) (2021-08-04T15:58:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。