論文の概要: One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL
- arxiv url: http://arxiv.org/abs/2608.12253v2
- Date: Mon, 17 Aug 2026 17:48:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 13:30:43.584171
- Title: One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL
- Title(参考訳): 凍ったシミュレーターが1つ:マルチエージェントRLでのシミュレーターの崩壊
- Abstract要約: ヒューマン・AIインタラクションのためのマルチエージェント強化学習は、通常、ユーザの振る舞いをシミュレートするために単一の大きな言語モデルに依存する。
本研究では,本手法が一般化に失敗し,シミュレーション崩壊の失敗を追及することを示す。
推論時に1つ,訓練時に1つの相補的解を提案する。
- 参考スコア(独自算出の注目度): 75.34038228759182
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multi-agent reinforcement learning for human-AI interaction typically relies on a single large language model to simulate user behavior. We show that this approach systematically fails to generalize, and trace the failure to simulator collapse: because the simulator LLM is mode-collapsed, an LLM policy trained against it overfits to narrow strategies that exploit the simulator's dominant mode, and such a policy transfers poorly to unseen simulators and real users. We formalize this collapse theoretically and propose two complementary solutions, one at inference time and one at training time. The inference-time solution, Verbalized Sampling, broadens the simulator's behavior by sampling from a verbalized response distribution, reducing mode collapse. The training-time solution, Co-Training, jointly optimizes the policy against a population of trainable simulators, preventing it from overfitting to any single simulator's mode. We validate both solutions on three multi-turn benchmarks: Persuasion for Good, $τ^2$-bench, and CooperBench. Verbalized Sampling improves held-out success by up to 9% over single-simulator RL, and Co-Training pushes gains further to 14%; the human study shows similar gain on real users. Both solutions preserve the policy diversity that collapses under single-simulator RL. To support further work in this direction, we release SCOPE, an open-source framework for Population Co-Training multi-agent RL. More broadly, our results suggest that the diversity of the training environment, not only the policy, is critical to the generalization of multi-turn RL to real-world deployment.
- Abstract(参考訳): ヒューマン・AIインタラクションのためのマルチエージェント強化学習は、通常、ユーザの振る舞いをシミュレートするために単一の大きな言語モデルに依存する。
シミュレーションLCMはモード崩壊のため,シミュレータの優位性を生かした狭い戦略に過度に適合し,非表示のシミュレータや実ユーザへのポリシー転送が不十分である。
この崩壊を理論的に定式化し、推論時に1つ、訓練時に1つの相補的な解を提案する。
推論時ソリューションであるVerbalized Samplingは、言語化された応答分布からサンプリングすることでシミュレータの動作を拡大し、モード崩壊を低減する。
トレーニングタイムソリューションであるCo-Trainingは、トレーニング可能なシミュレータの集団に対するポリシーを共同で最適化し、単一のシミュレータのモードにオーバーフィットすることを防ぐ。
両ソリューションを3つのマルチターンベンチマークで検証する: Persuasion for Good, $τ^2$-bench, CooperBench。
Verbalized Samplingは、シングルシミュレータRLよりも最大9%成功し、Co-Trainingは14%向上した。
どちらのソリューションも、単一シミュレータRLの下で崩壊するポリシーの多様性を保っている。
この方向のさらなる作業を支援するため,人口共同学習型マルチエージェントRLのためのオープンソースフレームワークであるSCOPEをリリースする。
より広範に,本研究の結果から,マルチターンRLの現実展開への一般化には,政策だけでなく,トレーニング環境の多様性が不可欠であることが示唆された。
関連論文リスト
- Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL [55.05743310621117]
Co-RLは、パラメータを共有しない複数の分離されたモデルを、仲間から派生した報酬を使ってRLを通じて同時に最適化するフレームワークである。
我々は,コホート多様性の増大が,自己強化フィードバックループを駆動する相関誤差を減少させることを示す。
論文 参考訳(メタデータ) (2026-08-18T01:16:02Z) - Theoretical Foundations and Effective Algorithms for Policy-Aware Simulator Learning [65.62918039166772]
本稿では,モデルプレイヤと逆ポリシープレイヤのゼロサムミニマックスゲームを提案する。
提案手法は,戦略的に重要な領域における予測誤差を1.5$-$2.2times$に減らし,シミュレーションで純粋に訓練されたポリシーを最適に近い実世界の性能に適合させることができることを示す。
論文 参考訳(メタデータ) (2026-05-27T19:31:37Z) - Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents [28.85410475505536]
Persona Policies (PPol) は、ユーザシミュレータの現実的な振る舞い変化を誘導するコントロール層である。
PPolはドメイン内のあらゆるタスクに対して、多種多様な人間のようなペルソナを生産する。
PPolで訓練されたエージェントは、挑戦的で非分配的な振る舞いに対してより堅牢であり、既存のシミュレートされたインタラクションのみに関するトレーニングに比べて、タスクの成功率が+17%向上する。
論文 参考訳(メタデータ) (2026-05-13T02:16:51Z) - Mind the Sim2Real Gap in User Simulation for Agentic Tasks [101.69142591891234]
ユーザシミュレーションにおけるSim2Realのギャップを形式化し、実際の人間に対して$$$-benchプロトコルを実行する最初の研究を示す。
LLMシミュレータは過度に協調的であり、スタイリスティックに均一であり、現実的なフラストレーションや曖昧さを欠いている。
これらの知見は, LLMベースのユーザシミュレータをエージェント開発サイクルで使用する際の人間による検証の重要性を強調した。
論文 参考訳(メタデータ) (2026-03-11T19:12:31Z) - PolySim: Bridging the Sim-to-Real Gap for Humanoid Control via Multi-Simulator Dynamics Randomization [53.7088694598817]
複数の異種シミュレータを統合するWBCトレーニングプラットフォームであるPolySimを紹介する。
理論的には、PolySimは単シミュレータトレーニングよりもシミュレータ誘導バイアスの強い上限が得られることを示す。
論文 参考訳(メタデータ) (2025-10-02T06:31:42Z) - Learned Controllers for Agile Quadrotors in Pursuit-Evasion Games [42.74003740156243]
我々は,アジャイル1v1クアッドロータ追従回避の問題に対処する。
これらの問題に対処するために,非同期多段階人口ベース (AMSPB) アルゴリズムを提案する。
このフレームワークでは、ベロシティコマンドまたはボディーレートを集合推力で出力するニューラルネットワークコントローラをトレーニングします。
論文 参考訳(メタデータ) (2025-06-03T13:19:23Z) - Autonomous Vehicle Controllers From End-to-End Differentiable Simulation [57.278726604424556]
そこで我々は,AVコントローラのトレーニングにAPG(analytic Policy gradients)アプローチを適用可能なシミュレータを提案し,その設計を行う。
提案するフレームワークは, エージェントがより根底的なポリシーを学ぶのを助けるために, 環境力学の勾配を役立てる, エンド・ツー・エンドの訓練ループに, 微分可能シミュレータを組み込む。
ダイナミクスにおけるパフォーマンスとノイズに対する堅牢性の大幅な改善と、全体としてより直感的なヒューマンライクな処理が見られます。
論文 参考訳(メタデータ) (2024-09-12T11:50:06Z) - Sim2Rec: A Simulator-based Decision-making Approach to Optimize
Real-World Long-term User Engagement in Sequential Recommender Systems [43.31078296862647]
逐次リコメンデータシステム(SRS)における長期ユーザエンゲージメント(LTE)最適化は強化学習(RL)に適している
RLには欠点があり、特に探索には多数のオンラインサンプルが必要である。
シミュレーション・ツー・レコメンデーション(Sim2Rec)というシミュレーターベースの推奨ポリシートレーニング手法を提案する。
論文 参考訳(メタデータ) (2023-05-03T19:21:25Z) - Zero-shot Sim2Real Adaptation Across Environments [45.44896435487879]
本稿では,実世界のシミュレートされたポリシーを模倣することを学ぶリバースアクショントランスフォーメーション(RAT)ポリシーを提案する。
RATは、新しい環境へのゼロショット適応を達成するために、Universal Policy Network上にデプロイできる。
論文 参考訳(メタデータ) (2023-02-08T11:59:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。