論文の概要: Agent Learning via Early Experience
- arxiv url: http://arxiv.org/abs/2510.08558v2
- Date: Mon, 13 Oct 2025 23:25:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-10-15 12:06:24.242052
- Title: Agent Learning via Early Experience
- Title(参考訳): 初歩的体験によるエージェント学習
- Abstract要約: 言語エージェントの長期的な目標は、彼ら自身の経験から学び、改善することであり、最終的には複雑な現実世界のタスクにおいて人間より優れています。
現在のエージェントのほとんどは、専門家データによる教師付き微調整に依存しており、スケールと一般化が不十分である。
本研究では,(1)環境力学における政策の基盤として収集された状態を利用するインプリシット・ワールド・モデリング,(2)エージェントが最適な行動から学習し,推論と意思決定を改善するための自己回帰という2つの手法について検討する。
- 参考スコア(独自算出の注目度): 93.83579011718858
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A long-term goal of language agents is to learn and improve through their own experience, ultimately outperforming humans in complex, real-world tasks. However, training agents from experience data with reinforcement learning remains difficult in many environments, which either lack verifiable rewards (e.g., websites) or require inefficient long-horizon rollouts (e.g., multi-turn tool use). As a result, most current agents rely on supervised fine-tuning on expert data, which is challenging to scale and generalizes poorly. This limitation stems from the nature of expert demonstrations: they capture only a narrow range of scenarios and expose the agent to limited environment diversity. We address this limitation with a middle-ground paradigm we call early experience: interaction data generated by the agent's own actions, where the resulting future states serve as supervision without reward signals. Within this paradigm we study two strategies of using such data: (1) Implicit world modeling, which uses collected states to ground the policy in environment dynamics; and (2) Self-reflection, where the agent learns from its suboptimal actions to improve reasoning and decision-making. We evaluate across eight diverse environments and multiple model families. Our approaches consistently improve effectiveness and out-of-domain generalization, highlighting the value of early experience. Moreover, in environments with verifiable rewards, our results provide promising signals that early experience offers a strong foundation for subsequent reinforcement learning, positioning it as a practical bridge between imitation learning and fully experience-driven agents.
- Abstract(参考訳): 言語エージェントの長期的な目標は、彼ら自身の経験から学び、改善することであり、最終的には複雑な現実世界のタスクにおいて人間より優れています。
しかし、強化学習による経験データからのトレーニングエージェントは、検証可能な報酬(ウェブサイトなど)の欠如や、非効率な長期ロールアウト(マルチターンツールの使用など)を必要とする多くの環境において、依然として困難である。
その結果、現在のエージェントのほとんどは、専門家データによる教師付き微調整に依存しており、スケールと一般化が不十分である。
この制限は専門家によるデモンストレーションの性質に起因しており、限られた範囲のシナリオのみをキャプチャし、エージェントを限られた環境多様性に公開する。
我々は、この制限を、我々が初期経験と呼ぶ中核的なパラダイムで解決する:エージェント自身のアクションによって生成されたインタラクションデータ。
本パラダイムでは,(1)環境力学における政策の基盤として収集された状態を利用するインプリシト・ワールド・モデリング,(2)エージェントが最適な行動から学習し,推論と意思決定を改善するための自己回帰という2つの手法について検討する。
我々は8つの多様な環境と複数のモデルファミリーを評価した。
当社のアプローチは、早期体験の価値を浮き彫りにして、有効性とドメイン外の一般化を継続的に改善します。
さらに、検証可能な報奨のある環境では、初期経験が後続の強化学習の強力な基盤となり、模倣学習と完全経験主体のエージェントの実践的な橋渡しとして位置づけられるという有望なシグナルが得られている。
関連論文リスト
- State2State: Environment-Derived Mid-Training for LLM Agents [67.08889234341996]
本研究では,エージェントが環境相互作用のみを通じてインタラクションと操作能力を取得する環境学習パラダイムについて検討する。
本研究では,調査対象の環境状態を学習目標に変換する環境学習手法であるState2Stateを提案する。
ALFWorldとScienceWorldの実験によると、State2Stateは、ほとんどの設定において、スタンドアロンの環境学習ステージとしてのエージェントパフォーマンスを改善している。
論文 参考訳(メタデータ) (2026-08-05T15:02:41Z) - Look Before You Leap: Autonomous Exploration for LLM Agents [46.001025916022066]
大規模言語モデルに基づくエージェントは、未熟な環境において、未熟な利用のために失敗することが多い。
我々は,自律探査を適応エージェント構築の重要かつ未探索の能力とみなす。
論文 参考訳(メタデータ) (2026-05-15T16:24:16Z) - Rethinking Experience Utilization in Self-Evolving Language Model Agents [51.10420305280499]
自己進化剤は過去の相互作用から経験を蓄積し再利用することで改善する。
本稿では,自己進化型エージェントの重要設計次元としての利用経験について考察する。
論文 参考訳(メタデータ) (2026-05-08T02:48:49Z) - SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents [35.45207852488779]
本稿では,ツールメモリをベースとした自己進化型エージェントフレームワークSEARLを紹介する。
インタラクションエクスペリエンスを直接利用するアプローチとは異なり,本手法では,計画と実行を統合する構造化されたエクスペリエンスメモリを構築している。
我々は,知識推論と数学タスクの枠組みを評価し,より実践的で効率的な学習を実現する上での有効性を実証した。
論文 参考訳(メタデータ) (2026-04-09T04:38:47Z) - Retrieval-Augmented LLM Agents: Learning to Learn from Experience [16.248836438253814]
本研究では,検索対象のLLMエージェントを学習し,検索したトラジェクトリをコンテキスト内で活用する方法について検討する。
最先端のエージェントトレーニングパイプラインよりも優れたロラを用いた,堅牢な教師付き微調整(SFT)レシピを確立した。
その結果,この組み合わせによるタスクの一般化が著しく向上することが示唆された。
論文 参考訳(メタデータ) (2026-03-18T20:45:04Z) - Autonomous Continual Learning of Computer-Use Agents for Environment Adaptation [57.65688895630163]
ACuRLは自律的なカリキュラム強化学習フレームワークで、エージェントを人間データゼロの特定の環境に継続的に適応させる。
本研究では,環境内学習と環境横断学習の両方を効果的に実現し,既存の環境を忘れずに4~22%の性能向上を実現した。
論文 参考訳(メタデータ) (2026-02-10T23:06:02Z) - Self-Consolidation for Self-Evolving Agents [51.94826934403236]
大規模言語モデル(LLM)エージェントは静的システムとして機能し、生涯にわたる相互作用を通じて進化する能力に欠ける。
相補的進化機構を導入したLLMエージェントのための新しい自己進化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-02T11:16:07Z) - Large Language Model Agents Are Not Always Faithful Self-Evolvers [84.08646612111092]
自己進化型大規模言語モデル(LLM)エージェントは、過去の経験を蓄積し再利用することによって継続的に改善される。
本稿では,経験の忠実さ,エージェントの判断が与えられた経験に因果的依存を初めて体系的に調査する。
論文 参考訳(メタデータ) (2026-01-30T01:05:15Z) - What Do LLM Agents Know About Their World? Task2Quiz: A Paradigm for Studying Environment Understanding [50.35012849818872]
大規模言語モデル(LLM)エージェントは、複雑な意思決定やツール使用タスクにおいて顕著な能力を示した。
本研究では,タスク実行と世界状態理解の分離を目的とした決定論的かつ自動評価パラダイムであるTask-to-Quiz(T2Q)を提案する。
実験の結果,タスク成功は環境理解の指標として不十分な場合が多く,現在の記憶機構はエージェントが環境の基底モデルを取得するのに有効ではないことが明らかとなった。
論文 参考訳(メタデータ) (2026-01-14T14:09:11Z) - From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning [62.54484062185869]
本稿では,エージェントの強化学習プロセスの最適化にステップワイド報酬を利用するStepAgentを紹介する。
エージェント反射とポリシー調整を容易にする暗黙の逆・逆の強化学習手法を提案する。
論文 参考訳(メタデータ) (2024-11-06T10:35:11Z) - OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization [66.22117723598872]
マルチモーダルWebエージェントの開発を容易にするために設計されたオープンソースフレームワークを紹介する。
まず、基本モデルを模倣学習で訓練し、基礎能力を得る。
次に、エージェントにオープンウェブを探索させ、その軌道に関するフィードバックを収集する。
論文 参考訳(メタデータ) (2024-10-25T15:01:27Z) - "Give Me an Example Like This": Episodic Active Reinforcement Learning from Demonstrations [3.637365301757111]
専門家デモ(RLED)からの強化学習(Reinforcement Learning from Expert Demonstrations)のような手法は、学習プロセス中のエージェント探索を促進するために外部の専門家によるデモンストレーションを導入します。
学習にとって最も有益な人間のデモのベストセットをどうやって選ぶかが、大きな関心事になります。
本稿では,学習エージェントが軌跡に基づく特徴空間において,専門家による実演を最適化したクエリを生成できるアルゴリズムEARLYを提案する。
論文 参考訳(メタデータ) (2024-06-05T08:52:21Z) - Maximum diffusion reinforcement learning [7.334017970483869]
相関は機械学習に根本的な課題を生み出す。
エージェントのシーケンシャルな経験からデータが直接収集される強化学習では、この仮定の違反は避けられないことが多い。
エージェントエクスペリエンスを関連付けることで、継続的デプロイメントにおけるシングルショット学習を確実に実現します。
論文 参考訳(メタデータ) (2023-09-26T22:14:56Z) - ExpeL: LLM Agents Are Experiential Learners [57.13685954854463]
実験学習エージェント(ExpeL)を導入し、パラメトリック更新を必要とせずにエージェント体験から学習できるようにする。
我々のエージェントは、経験を自律的に収集し、学習課題の集合から自然言語を用いて知識を抽出する。
推論において、エージェントは抽出された洞察と過去の経験をリコールし、情報的決定を行う。
論文 参考訳(メタデータ) (2023-08-20T03:03:34Z) - Asking Before Acting: Gather Information in Embodied Decision Making with Language Models [20.282749796376063]
本研究では,Large Language Models (LLM) が,不慣れな環境で重要な情報を効率的に収集する上で,課題に直面していることを示す。
我々は,自然言語を用いた関連する情報に対して,エージェントが外部ソースと積極的に問い合わせることを可能にする方法であるtextitAsking Before Acting (ABA)を提案する。
本研究では,テキストベースの日常タスク,ロボットアーム操作タスク,実世界のオープンドメインイメージベース実施タスクを含む,幅広い環境実験を行う。
論文 参考訳(メタデータ) (2023-05-25T04:05:08Z) - Co-Imitation Learning without Expert Demonstration [39.988945772085465]
我々は,エージェントの過去の優れた経験を専門家のデモンストレーションなしで活用するための,CoIL(Co-Imitation Learning)と呼ばれる新しい学習フレームワークを提案する。
経験は有用か誤解を招く可能性があるが、期待される値関数の利得によって各経験の潜在的有用性を評価することを提案する。
各種課題に対する実験結果から,提案したコイミテーション学習フレームワークの有意な優位性を示した。
論文 参考訳(メタデータ) (2021-03-27T06:58:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。