論文の概要: Environment Evolution for Terminal Agents
- arxiv url: http://arxiv.org/abs/2609.04128v1
- Date: Thu, 03 Sep 2026 17:26:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.185823
- Title: Environment Evolution for Terminal Agents
- Title(参考訳): ターミナルエージェントの環境進化
- Authors: Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, Jiang Zhou, Jiangtao Guan, Jincheng Liu, Yun Yang, Dingxin Hu, Zhuo Han, Xing Wu, Feng Zhang, Lilin Wang,
- Abstract要約: 対話的で検証可能な環境のスケーリングは、端末エージェントのトレーニングに不可欠である。
最近の共進化法は、モデルの学習可能なフロンティア付近の環境を反復的に合成する。
本稿では,環境の難易度を段階的に向上させる環境進化を提案する。
- 参考スコア(独自算出の注目度): 15.907942366553302
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scaling interactive and verifiable environments is critical for training terminal agents. As frontier models become more capable, environments synthesized from scratch become less challenging and thus provide limited learning signals. Recent co-evolution methods iteratively synthesize environments near the model's learnable frontier based on weaknesses exposed during rollouts. However, their dependence on on-policy rollouts limits generalization and the continuous provision of learning signals as the model becomes stronger. In this paper, we propose environment evolution, which incrementally increases environment difficulty off-policy and schedules the evolved environments generation by generation during training to provide continuous learning signals. We derive three evolution directions that influence environment difficulty from the multi-turn learning objective and then implement evolution along these directions through a loop-engineered multi-agent harness. Quantitative rollout experiments with Hy4 preview, Claude Opus 5, and GPT-5.6 Sol show that environment evolution consistently produces more difficult environments. We validate its effectiveness on Qwen3.6-27B and Qwen3.6-35B-A3B through simple long-horizon RL training, improving their performance by 14.4 and 18.0 percentage points on Terminal-Bench 2.1, respectively.
- Abstract(参考訳): 対話的で検証可能な環境のスケーリングは、端末エージェントのトレーニングに不可欠である。
フロンティアモデルがより有能になるにつれて、スクラッチから合成された環境は難しくなり、限られた学習信号を提供する。
最近の共進化的手法は、ロールアウト時に露出する弱点に基づいて、モデルの学習可能なフロンティア付近の環境を反復的に合成する。
しかし、オンラインロールアウトへの依存は、モデルがより強くなるにつれて、一般化と学習信号の継続的な供給を制限する。
本稿では、環境の難易度を段階的に向上させる環境進化法を提案し、継続的な学習信号を提供するために、学習中の世代別環境生成をスケジュールする。
マルチターン学習目標から環境難易度に影響を与える3つの進化方向を導出し,ループ駆動型マルチエージェントハーネスを用いてこれらの方向に沿って進化する。
Hy4プレビュー、Claude Opus 5、GPT-5.6 Solによる定量的ロールアウト実験は、環境の進化が一貫してより困難な環境を生み出すことを示している。
本研究では,Qwen3.6-27B と Qwen3.6-35B-A3B に対して,簡易な長距離RLトレーニングにより有効性を検証し,端末弁2.1 で 14.4 と 18.0 の精度向上を図った。
関連論文リスト
- EnvHarness: Awakening Static Worlds for Agent Learning [58.54600450547412]
Environment Harnessは静的な環境をラップして、基礎となるロジックを変更することなく振る舞いを再構築する。
EnvHarnessは様々な領域にまたがって適用され、すべての再形環境が元の検証元を保持する。
EnvRiggerはターゲットポリシーをブラックボックスとして扱い、その実行軌跡を観察して、診断された欠陥をターゲットとしたEnvHarnessコンポーネントを合成する。
論文 参考訳(メタデータ) (2026-08-20T10:42:06Z) - SPADE: Self-Play in Adaptive Synthetic Executable Environments [110.80471334001574]
1つのLLMが2つの役割を演じるセルフプレイのRLフレームワークであるSPADEを紹介する。
Environment Designerは、OpenAI Gymスタイルのreset()/step()インターフェイスで実行可能なコードとして、完全な長距離トレーニング環境を記述する。
環境デザイナは,大規模な事前学習コーパスから採取した文書に基づいて構築し,蓄積した環境記憶を与える。
論文 参考訳(メタデータ) (2026-08-19T17:58:56Z) - Can RL Improve Generalization of LLM Agents? An Empirical Study [68.19349692042341]
Reinforcement Fine-tuning (RFT) は環境フィードバックに基づいてマルチターン意思決定を行うための LLM エージェントの訓練を約束している。
現実世界のデプロイメントでは、エージェントは異なるバックグラウンド知識を持つ見えない環境で動作することができる。
RFTは環境内のタスクの難易度でよく一般化されるが、見えない環境へのより弱い移動を示す。
論文 参考訳(メタデータ) (2026-03-12T14:54:59Z) - Towards Adaptive Environment Generation for Training Embodied Agents [6.22572530511425]
身体的なエージェントは、新しい環境に一般化するのに苦労します。
これらのトレーニング環境を生成するための現在のアプローチは、オープンループのパラダイムに従っている。
エージェントの現在の能力に難易度を適応させるクローズドループ環境生成のための概念実証を行う。
論文 参考訳(メタデータ) (2026-02-06T03:50:46Z) - Improving Regret Approximation for Unsupervised Dynamic Environment Generation [19.50608711043436]
無監督環境設計(UED)は、強化学習(RL)エージェントのための訓練カリキュラムを自動生成することを目指している。
現在の手法は、困難な信用割当問題に悩まされており、難易度を特定できない後悔の近似に依存している。
より高密度なジェネレータ報酬信号を実現するために,UEDのための動的環境生成を提案する。
論文 参考訳(メタデータ) (2026-01-21T12:58:40Z) - RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments [111.87296453908199]
適応検証環境(RLVE)を用いた強化学習の導入
RLVEは、各検証可能な環境が、トレーニングが進むにつれて、問題の難易度分布をポリシーモデルの能力に動的に適応させることを可能にする。
環境スケーリング,すなわち,トレーニング環境の収集を拡大することで,推論能力が継続的に向上することを示す。
論文 参考訳(メタデータ) (2025-11-10T17:18:35Z) - Improving adaptability to new environments and removing catastrophic
forgetting in Reinforcement Learning by using an eco-system of agents [3.5786621294068373]
強化学習(RL)エージェントを目に見えない環境に適応させることは、トレーニング環境に典型的な過度な適合のために難しい課題である。
破滅的な忘れ込みの危険性があり、これまで見られた環境のパフォーマンスが著しく妨げられている。
本稿では,エージェントのエコシステムを利用して双方の懸念に対処する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2022-04-13T17:52:54Z) - Evolving Curricula with Regret-Based Environment Design [37.70275057075986]
我々は、原則化された後悔に基づくカリキュラムで進化の力を活用することを提案する。
我々の手法はエージェントの能力の最前線で常にレベルを発生させることを試みており、その結果、単純から始まるがますます複雑になるキュリキュラが生まれる。
論文 参考訳(メタデータ) (2022-03-02T18:40:00Z) - Emergent Complexity and Zero-shot Transfer via Unsupervised Environment
Design [121.73425076217471]
本研究では,未知のパラメータを持つ環境を提供するUnsupervised Environment Design (UED)を提案する。
プロタゴニスト・アンタゴニストによるレグレト環境デザイン(PAIRED)と呼ぶ。
実験により, PAIREDは複雑な環境の自然なカリキュラムを生産し, PAIREDエージェントは, 高度に新規な環境での試験において, 高いゼロショット転送性能が得られることを示した。
論文 参考訳(メタデータ) (2020-12-03T17:37:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。