論文の概要: State2State: Environment-Derived Mid-Training for LLM Agents
- arxiv url: http://arxiv.org/abs/2608.04934v1
- Date: Wed, 05 Aug 2026 15:02:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.966867
- Title: State2State: Environment-Derived Mid-Training for LLM Agents
- Title(参考訳): State2 State: LLMエージェントの環境依存ミッドトレーニング
- Authors: Xuanyu Lei, Yiqi Zhu, Chenliang Li, Kaiming Liu, Peng Li, Ming Yan, Jieping Ye, Ya-Qin Zhang, Yang Liu,
- Abstract要約: 本研究では,エージェントが環境相互作用のみを通じてインタラクションと操作能力を取得する環境学習パラダイムについて検討する。
本研究では,調査対象の環境状態を学習目標に変換する環境学習手法であるState2Stateを提案する。
ALFWorldとScienceWorldの実験によると、State2Stateは、ほとんどの設定において、スタンドアロンの環境学習ステージとしてのエージェントパフォーマンスを改善している。
- 参考スコア(独自算出の注目度): 67.08889234341996
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Training LLM agents commonly relies on supervised fine-tuning from expert trajectories or online reinforcement learning over human-specified tasks with handcrafted verifiers. Though effective, both remain bottlenecked by externally specified tasks and supervision signals, limiting the scalability and diversity of agent training. We study an environment learning paradigm in which agents acquire interaction and manipulation capabilities solely through environment interaction, without externally specified tasks. We propose State2State, an environment-derived mid-training method that converts explored environment states into training objectives, challenging agents to reach a specified target state. By deriving tasks from environment exploration and verifying success through rule-based state matching, State2State provides scalable and verifiable training objectives without expert supervision or manual task design. Experiments on ALFWorld and ScienceWorld show that State2State improves agent performance as a standalone environment-learning stage in most settings. As initialization for downstream RL, it further improves final performance and learning efficiency, with promising evidence of cross-environment generalization.
- Abstract(参考訳): LLMエージェントの訓練は、専門家の軌跡から監督された微調整や、手作りの検証器を用いた人為的なタスクに対するオンライン強化学習に依存するのが一般的である。
効果はあるものの、どちらも外部に指定されたタスクや監視信号によってボトルネックを被り、エージェントトレーニングのスケーラビリティと多様性を制限している。
本研究では,エージェントが外部に特定されたタスクを使わずに,環境インタラクションのみを通じてインタラクションと操作能力を取得する環境学習パラダイムについて検討する。
本研究では,調査対象の環境状態を学習目標に変換し,特定の目標状態に到達するためのエージェントに挑戦する,環境由来の中間訓練手法であるState2Stateを提案する。
環境調査からタスクを導き、ルールベースの状態マッチングを通じて成功を検証することによって、State2Stateは、専門家の監督や手動のタスク設計なしに、スケーラブルで検証可能なトレーニング目標を提供する。
ALFWorldとScienceWorldの実験によると、State2Stateは、ほとんどの設定において、スタンドアロンの環境学習ステージとしてのエージェントパフォーマンスを改善している。
下流RLの初期化として、クロス環境一般化の有望な証拠とともに、最終性能と学習効率をさらに向上させる。
関連論文リスト
- Can RL Improve Generalization of LLM Agents? An Empirical Study [68.19349692042341]
Reinforcement Fine-tuning (RFT) は環境フィードバックに基づいてマルチターン意思決定を行うための LLM エージェントの訓練を約束している。
現実世界のデプロイメントでは、エージェントは異なるバックグラウンド知識を持つ見えない環境で動作することができる。
RFTは環境内のタスクの難易度でよく一般化されるが、見えない環境へのより弱い移動を示す。
論文 参考訳(メタデータ) (2026-03-12T14:54:59Z) - Autonomous Continual Learning of Computer-Use Agents for Environment Adaptation [57.65688895630163]
ACuRLは自律的なカリキュラム強化学習フレームワークで、エージェントを人間データゼロの特定の環境に継続的に適応させる。
本研究では,環境内学習と環境横断学習の両方を効果的に実現し,既存の環境を忘れずに4~22%の性能向上を実現した。
論文 参考訳(メタデータ) (2026-02-10T23:06:02Z) - What Do LLM Agents Know About Their World? Task2Quiz: A Paradigm for Studying Environment Understanding [50.35012849818872]
大規模言語モデル(LLM)エージェントは、複雑な意思決定やツール使用タスクにおいて顕著な能力を示した。
本研究では,タスク実行と世界状態理解の分離を目的とした決定論的かつ自動評価パラダイムであるTask-to-Quiz(T2Q)を提案する。
実験の結果,タスク成功は環境理解の指標として不十分な場合が多く,現在の記憶機構はエージェントが環境の基底モデルを取得するのに有効ではないことが明らかとなった。
論文 参考訳(メタデータ) (2026-01-14T14:09:11Z) - The Agent's First Day: Benchmarking Learning, Exploration, and Scheduling in the Workplace Scenarios [34.25281365374991]
本稿では,新しい環境を継続的に探索する「訓練」エージェントをシミュレートする動的評価環境である方法を紹介する。
従来のベンチマークとは違って,(1)優先度の異なるストリーミングタスクのコンテキストアウェアスケジューリング,(2)能動的探索による幻覚の低減のための巧妙な情報取得,(3)規則に基づく動的生成タスクから一般化戦略を抽出した継続的進化,の3つの側面に沿ってエージェントを評価する。
私たちの研究は、エージェントの信頼性を評価するためのフレームワークを確立し、静的テストから現実的な実運用指向のシナリオに評価をシフトします。
論文 参考訳(メタデータ) (2026-01-13T03:09:18Z) - Agent Learning via Early Experience [93.83579011718858]
言語エージェントの長期的な目標は、彼ら自身の経験から学び、改善することであり、最終的には複雑な現実世界のタスクにおいて人間より優れています。
現在のエージェントのほとんどは、専門家データによる教師付き微調整に依存しており、スケールと一般化が不十分である。
本研究では,(1)環境力学における政策の基盤として収集された状態を利用するインプリシット・ワールド・モデリング,(2)エージェントが最適な行動から学習し,推論と意思決定を改善するための自己回帰という2つの手法について検討する。
論文 参考訳(メタデータ) (2025-10-09T17:59:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。