論文の概要: SEAL: Synergistic Co-Evolution of Agents and Learning Environments
- arxiv url: http://arxiv.org/abs/2605.24426v1
- Date: Sat, 23 May 2026 06:41:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.05195
- Title: SEAL: Synergistic Co-Evolution of Agents and Learning Environments
- Title(参考訳): SEAL: エージェントと学習環境の相乗的共進化
- Authors: Yihao Hu, Zhihao Wen, Xiujin Liu, Pan Wang, Xin Zhang, Wei Wu,
- Abstract要約: 大きな言語モデル(LLM)エージェントは、インタラクションによってますます改善されている。
ほとんどの自己進化的手法は、政策または学習環境を独立に適応させる。
対話型ツール利用エージェントのためのクローズドループ共進化フレームワークSEALを提案する。
- 参考スコア(独自算出の注目度): 11.720414165425256
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Model (LLM) agents are increasingly improved through interaction, yet most self-evolution methods adapt either the policy or the learning environment in isolation. We identify this structural gap as \emph{Agent-Environment Misalignment}: the agent's capability frontier changes during training, while the environment that provides supervision remains static or only weakly coupled to the agent's revealed failures. We propose SEAL, a closed-loop co-evolution framework for interactive tool-use agents. SEAL collects on-policy trajectories under executable verification, diagnoses failed rollouts into turn-level failure labels, and uses these diagnoses as a shared signal for both environment-side adaptation and model-side policy optimization. The environment evolves its training-time learning interface by exposing clearer tool affordance cues, constraint information, and recovery-oriented feedback, while the policy is updated with diagnosis-guided advantage reweighting. Extensive experiments across in-distribution and out-of-distribution multi-turn tool-use evaluations show that SEAL improves low-resource agent learning: with only 400 training samples, it yields +8.25 to +26.25 average-point gains across three backbones and exhibits positive out-of-distribution transfer. These results demonstrate the value of jointly adapting the learner and its training-time learning substrate for robust self-improving LLM agents.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、インタラクションを通じてますます改善されているが、ほとんどの自己進化手法は、ポリシーまたは学習環境を独立して適応する。
この構造的ギャップを,訓練中にエージェントの能力フロンティアが変化するのに対して,監督を提供する環境は,エージェントが明らかにした障害に静的あるいは弱い結合を保ったままである,という,‘emph{Agent-Environment Misalignment}’と同定する。
対話型ツール利用エージェントのためのクローズドループ共進化フレームワークSEALを提案する。
SEALは、実行可能検証の下で、オンライントラジェクトリを収集し、失敗したロールアウトをターンレベルの障害ラベルに診断し、これらの診断を環境側適応とモデル側ポリシー最適化の共用信号として使用する。
環境は、より明確なツールの余裕、制約情報、リカバリ指向のフィードバックを明らかにすることで、トレーニング時間学習インタフェースを進化させ、診断誘導による優位性の再重み付けによってポリシーを更新する。
SEALは400のトレーニングサンプルしか持たないが、+8.25から+26.25の平均点ゲインを3つのバックボーンで獲得し、正のアウト・オブ・ディストリビューション伝達を示す。
これらの結果は,学習者とその訓練時間学習基盤を,堅牢な自己改善 LLM エージェントに適応させることの価値を示す。
関連論文リスト
- AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning [13.755500788361815]
強化学習(RL)は、大規模言語モデル(LLM)エージェントが環境と相互作用し、マルチターンタスクを解く能力を大幅に改善した。
既存のアプローチは、プロセス報酬モデルや補助的な自己監督信号など、密集した中間監視を導入することが多い。
本稿では、RLトレーニング中にエントロピーダイナミクスを適応的に調整し、探索・探索トレードオフを改善するための監督不要な信用割当手法であるAEMを提案する。
論文 参考訳(メタデータ) (2026-05-01T05:54:37Z) - CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution [17.762976387817762]
CoEvolveはエージェントデータ相互進化フレームワークで、LLMエージェントはクローズドループ、インタラクション駆動トレーニングを通じて改善できる。
CoEvolveは、ロールアウトトラジェクトリからの忘れや不確実性といったフィードバック信号を抽出して、障害が発生しやすいインタラクションパターンを特定する。
合成されたタスクは環境相互作用を通じて検証され、データ分布の更新に利用され、エージェントとそのデータの共同適応を可能にする。
論文 参考訳(メタデータ) (2026-04-17T08:41:26Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - Data-Centric Interpretability for LLM-based Multi-Agent Reinforcement Learning [39.84288631342219]
フルストレス外交の高度環境から大規模強化学習訓練を実施する。
本稿では,SAE特徴をトレーニング力学に関する解釈可能な仮説にグループ化するメタオートインタプリタを紹介する。
私たちは、主観的に興味深く、一見有用なSAE機能でさえ、人間にとって役に立たないよりも悪いかもしれないことに気付きました。
論文 参考訳(メタデータ) (2026-02-05T01:21:22Z) - Grounded Test-Time Adaptation for LLM Agents [75.62784644919803]
大規模言語モデル(LLM)ベースのエージェントは、新規で複雑な環境への一般化に苦慮している。
環境特化情報を活用することで, LLMエージェントを適応するための2つの戦略を提案する。
論文 参考訳(メタデータ) (2025-11-06T22:24:35Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails [103.05296856071931]
本稿では,自己進化型大規模言語モデル(LLM)エージェントに特有の,アライメント・ティッピング・プロセス(ATP)を同定する。
ATPは、連続的な相互作用によってエージェントが訓練中に確立されたアライメント制約を放棄し、強化された自己関心の戦略を支持するときに生じる。
実験の結果、アライメントの利点は自己進化の下で急速に低下し、最初は整合性のない状態に収束したモデルであることが判明した。
論文 参考訳(メタデータ) (2025-10-06T14:48:39Z) - Collaborative Value Function Estimation Under Model Mismatch: A Federated Temporal Difference Analysis [55.13545823385091]
フェデレーション強化学習(FedRL)は、エージェント間のデータ交換を防止し、データのプライバシを維持しながら協調学習を可能にする。
現実世界のアプリケーションでは、各エージェントは若干異なる遷移ダイナミクスを経験し、固有のモデルミスマッチを引き起こす。
情報共有の適度なレベルでさえ、環境固有のエラーを著しく軽減することを示す。
論文 参考訳(メタデータ) (2025-03-21T18:06:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。