論文の概要: Turnover-Orthogonal Credit Assignment for Open-Team Multi-Agent Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.02847v1
- Date: Fri, 02 Oct 2026 05:35:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.232071
- Title: Turnover-Orthogonal Credit Assignment for Open-Team Multi-Agent Reinforcement Learning
- Title(参考訳): オープンチームマルチエージェント強化学習のためのターンオーバー直交型クレジットアサインメント
- Abstract要約: オープンチームには,アクションエフェクト,純粋なターンオーバーエフェクト,アクション-ターンオーバーインタラクションを分離するターンオーバー・オルソニカル・クレジット・アサイン(TOCA)を導入します。
制御された診断実験は、TOCAがイベント認識MAPPOスタイルの批判に対するリターンを改善することを示している。
これらの結果から,動的協力型チームにおいて,行動クレジットからターンオーバーを明示的に分離することが,堅牢な学習に有用であることが示唆された。
- 参考スコア(独自算出の注目度): 0.3222802562733787
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-team multi-agent reinforcement learning studies cooperative systems in which agents may join, leave, or be replaced during an episode. In such settings, the team return changes both because agents choose useful actions and because the active population itself changes. Standard centralized critics and shared advantages often mix these two effects into one scalar credit signal, allowing surviving agents to be rewarded or penalized for exogenous turnover events outside their control. We introduce turnover-orthogonal credit assignment (TOCA), a value decomposition for open teams that separates action effects, pure turnover effects, and action--turnover interactions. Under exogenous turnover, the event-conditioned value admits a centered decomposition whose event-conditioned baseline removes the pure turnover component while preserving credit for actions that make the team robust to future replacements. We instantiate this idea with a permutation-invariant centralized critic over variable-size agent sets and event tokens, and derive both a counterfactual per-agent credit signal and a softly weighted interaction variant, TOCA-$β$, for high-variance control environments. Controlled diagnostic experiments show that TOCA improves return over event-aware MAPPO-style critics and that removing interaction credit substantially hurts performance. In a replacement-only Dynamic Spread benchmark, TOCA-$β$ achieves the best mean return at high turnover rates and improves over its no-interaction ablation. These results suggest that explicitly separating turnover from action credit is a useful principle for robust learning in dynamic cooperative teams.
- Abstract(参考訳): オープンチームマルチエージェント強化学習は、エピソード中にエージェントが参加、離脱、または置き換えられるような協調システムを研究する。
このような設定では、エージェントが有用なアクションを選択し、アクティブな集団自体が変化するため、チームは変更を返す。
標準的な中央集権的批評家や共有アドバンテージは、これらの2つの効果を1つのスカラークレジット信号に混ぜることで、生き残ったエージェントを彼らのコントロール外の外因性転倒イベントに対して報酬や罰を与えることができる。
オープンチームにとって、アクション効果、純粋なターンオーバー効果、アクション-ターンオーバー相互作用を分離する価値分解である、ターンオーバー・オルソニナル・クレジット・アサイン(TOCA)を導入します。
イベント条件付き値は、イベント条件付きベースラインが純粋なターンオーバーコンポーネントを削除し、チームが将来のリプレースに対して堅牢なアクションのクレジットを保持する、中心的な分解を許可する。
可変サイズのエージェントセットとイベントトークンに対して、置換不変な中央集権的批判でこのアイデアをインスタンス化し、高分散制御環境において、対実的なエージェント単位のクレジット信号とソフトに重み付けされたインタラクション変種であるTOCA-$β$の両方を導出する。
制御された診断実験により、TOCAはイベント認識MAPPOスタイルの批評家に対するリターンを改善し、インタラクションクレジットの削除がパフォーマンスを著しく損なうことが示された。
置換のみのDynamic Spreadベンチマークでは、TOCA-$β$は高いターンオーバー率で最高の平均リターンを達成し、非干渉アブレーションを改善する。
これらの結果から,動的協力型チームにおいて,行動クレジットからターンオーバーを明示的に分離することが,堅牢な学習に有用であることが示唆された。
関連論文リスト
- Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization [13.354353071601379]
我々は、特権付き監督を成果ベースアクションクレジットに変換するTASPOを紹介する。
3つのエージェントベンチマークで、TASPOはGRPOよりも10.6%改善し、目に見えないタスクを一般化する。
論文 参考訳(メタデータ) (2026-08-31T16:51:50Z) - TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning [10.917273110894469]
エージェント強化学習では、環境に配慮した行動にクレジットを割り当てる必要がある。
標準GRPOは全てのアクショントークンに対する一様優位性として最終検証結果を使用する。
本稿では,ロール型クレジット代入フレームワークであるTRIAGEを提案する。
論文 参考訳(メタデータ) (2026-06-30T17:48:07Z) - GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization [54.596224644751565]
訓練後強化学習(RL)は多次元報酬に頼り、包括的能力を育成する。
これを解決するために、グループ報酬分離政策最適化(GDPO)のような既存の手法は、総合的なスコアを独立した報酬グループに分解し、各グループ内でRL損失を個別に計算する。
本稿では,GD$2$PO(Group-Dynamic reward-Decoupled Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-06-15T14:19:28Z) - HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning [53.42577591449649]
グループ協力政策最適化は、トレーニングパラダイムをロールアウト競争からチーム協力へとシフトさせる。
GCPOは独立したロールアウトスコアをチームレベルのクレジット割り当てに置き換える。
チームへの平均的な限界貢献に従って、各ロールアウトに対して、グループチームの報酬を再分配する。
論文 参考訳(メタデータ) (2026-05-12T03:20:24Z) - Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration [13.299987551113809]
グループ認知学習(グループ認知学習、Group Cognition Learning、GCL)は、モダリティ固有の符号化の後に2段階のプロトコルを適用する、管理された協調パラダイムである。
GCLはモダリティの優位性と結合を緩和し、回帰ベンチマークと分類ベンチマークの両方で最先端の結果を確立する。
論文 参考訳(メタデータ) (2026-05-01T03:19:34Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。