論文の概要: EDGE: Experience-Distillation for Guided Exploration in Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.21946v2
- Date: Wed, 26 Aug 2026 15:51:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:14.941934
- Title: EDGE: Experience-Distillation for Guided Exploration in Agentic Reinforcement Learning
- Title(参考訳): EDGE:エージェント強化学習におけるガイド付き探索のための体験蒸留
- Abstract要約: インタラクショントラジェクトリに埋め込まれた再利用可能な探索パターンは、単一のポリシー更新後に大部分が破棄される。
本研究では,検索した経験を仮訓練時の足場として扱うフレームワークであるEDGE(Experience-Distillation for Guided Exploration)を提案する。
EDGEは強力なRLベースラインを最大12.5ポイント改善し、推論時の足場やプロプライエタリなリフレクタを使わずに有効である。
- 参考スコア(独自算出の注目度): 25.200068256200293
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with outcome-based objectives such as GRPO enables LLM-based agents to solve complex, long-horizon tasks, yet the reusable exploration patterns embedded in interaction trajectories are largely discarded after a single policy update. Existing experience-augmented approaches retrieve historical guidance at inference time, but they apply experiences without accounting for the policy's evolving capability and create persistent dependencies on external retrieval. We propose EDGE (Experience-Distillation for Guided Exploration), a framework that treats retrieved experiences as temporary training-time scaffolds and progressively internalizes their benefits into the parametric policy. Concretely, EDGE partitions each rollout group into experience-conditioned and experience-free trajectories to estimate and admit only positive marginal gains without extra sampling, then distills the induced behavior into the base policy via a reverse-KL objective on its own empirical support. A co-evolutionary experience bank further synthesizes guidance from emerging failure modes and prunes obsolete entries as the policy evolves. Across embodied, web, and search-based QA tasks, EDGE improves over strong RL baselines by up to 12.5 points and remains effective without inference-time scaffolds or a proprietary reflector. The code is available at https://github.com/xvolcano02/EDGE.
- Abstract(参考訳): GRPOのような結果に基づく目的による強化学習により、LLMベースのエージェントは複雑な長期的タスクを解くことができるが、インタラクショントラジェクトリに埋め込まれた再利用可能な探索パターンは、単一のポリシー更新後に大部分が破棄される。
既存のエクスペリエンス強化アプローチは、推論時に過去のガイダンスを検索するが、ポリシーの進化能力を考慮せずに経験を適用し、外部検索に永続的な依存関係を作成する。
本研究では, 得られた経験を仮訓練時の足場として扱うフレームワークであるEDGE(Experience-Distillation for Guided Exploration)を提案する。
具体的には、EDGEは各ロールアウトグループを経験条件付きおよび経験自由な軌道に分割し、余分なサンプリングなしで正の利得のみを推定し、それを認める。
共同進化経験銀行は、新たな障害モードからのガイダンスをさらに合成し、政策の進展に伴って陳腐化したエントリを創出する。
組み込み、Web、検索ベースのQAタスク全体で、EDGEは強力なRLベースラインを最大12.5ポイント改善し、推論時の足場やプロプライエタリなリフレクタなしで有効である。
コードはhttps://github.com/xvolcano02/EDGEで公開されている。
関連論文リスト
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - Self-Improving Large Language Models via Progressive Experience Evolution [52.03479747358687]
textbfSPEE(textbfSelf-textbfProgressive textbfExperience textbfEvolution)を提案する。
5つの数学的推論ベンチマークの実験は、SPEEが3つのモデルスケールでテスト時間とトレーニング時間の両方の自己進化ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-08-03T12:27:32Z) - PATH-Bench: Path-Dependent Evaluation of Lifelong Agents [27.837334107109786]
PATH-Benchは、生涯エージェントのパス依存評価のためのベンチマークである。
SEU(Selective Experience Use)は,経路蓄積経験が各タスクにどのように影響するかを制御するエージェントハーネスである。
論文 参考訳(メタデータ) (2026-08-02T11:00:04Z) - Group-Reflective Self-Distillation for Agentic Reinforcement Learning [8.041052886037766]
GRSD(Group-Reflective Self-Distillation)は、政策が検証したロールアウトから、能力の整合性と結果の差別的なガイダンスを導出する。
GRSDは競争ベースラインを一貫して上回り、目に見えないタスクをより効果的に一般化する。
論文 参考訳(メタデータ) (2026-07-30T11:49:46Z) - SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning [38.54413500261524]
アウトカムベース強化学習(RL)は、実用的な最適化パラダイムを提供するが、その疎度な軌道レベルの報酬は、中間決定に関する限られたガイダンスを提供する。
筆者らは,自己進化型フレームワークSEED(Self-Evolving On-Policy Distillation)を提案する。
論文 参考訳(メタデータ) (2026-07-16T09:57:18Z) - RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards [76.17893114021757]
長い形式のレポートを計画し、調査し、エビデンスを評価し、合成する深層研究システムには、根本的な答えがなく、多くのツール強化された決定にまたがる。
本研究では,ルーブリックは最終回答評価者だけでなく,ポリシーの実行,判断フィードバック,エージェントメモリを構成する共有インターフェースとして機能すべきである,と論じる。
我々は、段階的な政策分解とリフレクションに基づくメタ政治進化を組み合わせたルーリック誘導強化学習フレームワークEMを導入する。
論文 参考訳(メタデータ) (2026-05-11T17:40:38Z) - AIPO: Learning to Reason from Active Interaction [54.10819421625103]
AIPOは、ポリシーモデルが、推論ボトルネックに遭遇するときに、3つの機能的協調エージェントを積極的に相談することを可能にする。
AIPOは推論性能を継続的に改善し、異なるポリシーモデルとRLVRアルゴリズムをまたいで堅牢に一般化し、ポリシーモデルの推論能力境界を効果的に拡張する。
論文 参考訳(メタデータ) (2026-05-08T19:06:55Z) - Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation [50.696688705287755]
我々は、強化学習におけるスパース報酬課題を克服するために、相互情報自己評価を提案する。
MISEにより、エージェントは、疎外的信号を補う高密度な内部報酬から自律的に学習することができる。
我々は、後見自己評価報酬を利用することは、政策と代行報酬政策の間のKL分散項と相互情報を組み合わせた目的を最小化することと等価であることを示す。
論文 参考訳(メタデータ) (2026-04-13T15:18:51Z) - Internalizing Agency from Reflective Experience [20.650609947690196]
LEAFEは、リカバリエージェンシーをリフレクティブエクスペリエンスから内部化するフレームワークである。
ベースモデルよりも一貫してPass@1を改善し、結果駆動ベースラインよりも高いPass@kを実現している。
論文 参考訳(メタデータ) (2026-03-17T17:50:47Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning [41.90621652673528]
エージェントLLMを学習するためのカリキュラムベースの自己アニメーション学習(SIL)レシピであるSPEARを提案する。
具体的には,本手法は,本質的な報奨を生かして,技術レベルの探究を促進するためのカリキュラムを取り入れている。
さらにトレーニングを安定させるために、リプレイバッファでの経験の利点を再検討し、潜在的ポリシードリフトに対処する。
論文 参考訳(メタデータ) (2025-09-26T17:20:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。