論文の概要: COvolve: Adversarial Co-Evolution of Large-Language-Model-Generated Policies and Environments via Two-Player Zero-Sum Game
- arxiv url: http://arxiv.org/abs/2603.28386v1
- Date: Mon, 30 Mar 2026 12:56:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.401459
- Title: COvolve: Adversarial Co-Evolution of Large-Language-Model-Generated Policies and Environments via Two-Player Zero-Sum Game
- Title(参考訳): Covolve: 2プレイヤーゼロサムゲームによる大規模モデル生成ポリシーと環境のアドバイザリ共進化
- Authors: Alkis Sygkounas, Rishi Hazra, Andreas Persson, Pedro Zuidberg Dos Martires, Amy Loutfi,
- Abstract要約: Covolveは継続的改善エージェントを構築するための共進化的なフレームワークである。
実行可能Pythonコードとして表現された環境とエージェントポリシーの両方を生成する。
この結果は,オープンエンド学習を実現するためのLLM駆動型共進化の可能性を示すものである。
- 参考スコア(独自算出の注目度): 15.550671286269209
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A central challenge in building continually improving agents is that training environments are typically static or manually constructed. This restricts continual learning and generalization beyond the training distribution. We address this with COvolve, a co-evolutionary framework that leverages large language models (LLMs) to generate both environments and agent policies, expressed as executable Python code. We model the interaction between environment and policy designers as a two-player zero-sum game, ensuring adversarial co-evolution in which environments expose policy weaknesses and policies adapt in response. This process induces an automated curriculum in which environments and policies co-evolve toward increasing complexity. To guarantee robustness and prevent forgetting as the curriculum progresses, we compute the mixed-strategy Nash equilibrium (MSNE) of the zero-sum game, thereby yielding a meta-policy. This MSNE meta-policy ensures that the agent does not forget to solve previously seen environments while learning to solve previously unseen ones. Experiments in urban driving, symbolic maze-solving, and geometric navigation showcase that COvolve produces progressively more complex environments. Our results demonstrate the potential of LLM-driven co-evolution to achieve open-ended learning without predefined task distributions or manual intervention.
- Abstract(参考訳): 継続的改善エージェントの構築における中心的な課題は、トレーニング環境が通常、静的または手動で構築されていることである。
これにより、トレーニング分布を超えた連続的な学習と一般化が制限される。
大規模言語モデル(LLM)を活用して,実行可能なPythonコードとして表現される環境とエージェントポリシの両方を生成する,共進化的フレームワークであるCovolveでこの問題に対処する。
環境と政策設計者の相互作用を2人プレイのゼロサムゲームとしてモデル化し、環境が政策の弱点を露呈し、ポリシーが対応できるような敵の共進化を保証する。
このプロセスは、環境とポリシーが複雑さの増大に向けて共進化する自動化カリキュラムを誘導する。
そこで, ゼロサムゲームの混合戦略ナッシュ均衡(MSNE)を計算し, メタ政治を実現する。
このMSNEメタポリティクスは、エージェントが未確認環境の解決を忘れないようにし、未確認環境の解決を学習する。
都市部での運転、象徴的な迷路解決、幾何学的なナビゲーションの実験では、コボルブは徐々に複雑な環境を作り出している。
本研究は, LLMによるオープンエンドラーニングの実現に, タスク分布や手作業による介入を伴わない可能性を示すものである。
関連論文リスト
- Autonomous Continual Learning of Computer-Use Agents for Environment Adaptation [57.65688895630163]
ACuRLは自律的なカリキュラム強化学習フレームワークで、エージェントを人間データゼロの特定の環境に継続的に適応させる。
本研究では,環境内学習と環境横断学習の両方を効果的に実現し,既存の環境を忘れずに4~22%の性能向上を実現した。
論文 参考訳(メタデータ) (2026-02-10T23:06:02Z) - Policy-Conditioned Policies for Multi-Agent Task Solving [53.67744322553693]
本研究では,ポリシーを人間の解釈可能なソースコードとして表現することでギャップを埋めるパラダイムシフトを提案する。
本研究では,Large Language Models (LLM) を近似インタプリタとして利用することにより,学習問題を再構築する。
我々はこのプロセスを,ポリシーコードをテキスト勾配で最適化するアルゴリズムである TextitProgrammatic Iterated Best Response (PIBR) として定式化する。
論文 参考訳(メタデータ) (2025-12-24T07:42:10Z) - Co-Evolving Complexity: An Adversarial Framework for Automatic MARL Curricula [0.0]
汎用知的エージェントは、それらが訓練される環境に本質的に関連している。
手作りの環境は有限であり、しばしば暗黙のバイアスを含むため、エージェントが真に一般化可能で堅牢なスキルを開発する可能性を制限する。
本稿では,環境生成過程を対戦ゲームとしてフレーミングすることで,無拘束かつ適応的な課題のカリキュラムを生成するパラダイムを提案する。
論文 参考訳(メタデータ) (2025-09-03T23:32:39Z) - COMBO-Grasp: Learning Constraint-Based Manipulation for Bimanual Occluded Grasping [56.907940167333656]
集積ロボットグルーピングは、表面衝突などの環境制約により、所望のグルーピングポーズが運動的に不可能な場所である。
従来のロボット操作アプローチは、人間が一般的に使用する非包括的または双対的戦略の複雑さに苦しむ。
本稿では,2つの協調ポリシーを活用する学習ベースアプローチであるCOMBO-Grasp(Constraint-based Manipulation for Bimanual Occluded Grasping)を紹介する。
論文 参考訳(メタデータ) (2025-02-12T01:31:01Z) - Octopus: Embodied Vision-Language Programmer from Environmental Feedback [58.04529328728999]
身体視覚言語モデル(VLM)は多モード認識と推論において大きな進歩を遂げた。
このギャップを埋めるために、我々は、計画と操作を接続する媒体として実行可能なコード生成を使用する、具体化された視覚言語プログラマであるOctopusを紹介した。
Octopusは、1)エージェントの視覚的およびテキスト的タスクの目的を正確に理解し、2)複雑なアクションシーケンスを定式化し、3)実行可能なコードを生成するように設計されている。
論文 参考訳(メタデータ) (2023-10-12T17:59:58Z) - MAESTRO: Open-Ended Environment Design for Multi-Agent Reinforcement
Learning [22.28076947612619]
オープンエンドラーニングのためのマルチエージェント環境設計ストラテジスト(MAESTRO)を紹介する。
MAESTROは、2プレイヤーゼロサム設定のための最初のマルチエージェントUEDアプローチである。
実験の結果,MAESTROは,対戦型2プレーヤゲームにおいて,強力なベースラインを達成していることがわかった。
論文 参考訳(メタデータ) (2023-03-06T18:57:41Z) - Dichotomy of Control: Separating What You Can Control from What You
Cannot [129.62135987416164]
政策の制御(行動)と政策の制御(環境)以外のメカニズムを分離する将来の条件付き教師あり学習フレームワークを提案する。
我々は,DoCが条件付入力と整合したポリシを出力し,学習したポリシを所望のハイリターン未来結果に条件付けすることで,高リターン行動が正しく引き起こされることを示す。
論文 参考訳(メタデータ) (2022-10-24T17:49:56Z) - Dynamics-Adaptive Continual Reinforcement Learning via Progressive
Contextualization [29.61829620717385]
動的環境におけるCRL(Continuous reinforcement Learning)の鍵となる課題は、環境が生涯にわたって変化するにつれて、RLエージェントの挙動を迅速に適応させることである。
DaCoRLは、進行的文脈化を用いた文脈条件付きポリシーを学習する。
DaCoRLは、安定性、全体的な性能、一般化能力の観点から、既存の方法よりも一貫した優位性を特徴としている。
論文 参考訳(メタデータ) (2022-09-01T10:26:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。