論文の概要: SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.14777v1
- Date: Thu, 16 Jul 2026 09:57:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.058411
- Title: SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
- Title(参考訳): SEED: エージェント強化学習のための自己進化型オンライン蒸留
- Authors: Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao,
- Abstract要約: アウトカムベース強化学習(RL)は、実用的な最適化パラダイムを提供するが、その疎度な軌道レベルの報酬は、中間決定に関する限られたガイダンスを提供する。
筆者らは,自己進化型フレームワークSEED(Self-Evolving On-Policy Distillation)を提案する。
- 参考スコア(独自算出の注目度): 38.54413500261524
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between episode-level outcomes and token-level policy learning. We propose SEED (SElf-Evolving On-Policy Distillation), a self-evolving framework that converts completed on-policy trajectories into training-time hindsight skills and distills their behavioral effect back into the policy model. SEED first fine-tunes the policy to analyze completed trajectories and generate natural-language skills that capture reusable workflows, decisive observations, or failure-avoidance rules. During RL, the current policy both collects trajectories and serves as the analyzer that extracts hindsight skills from them. Policy updates therefore improve subsequent decision making and skill analysis together, allowing hindsight supervision to evolve with the policy. SEED then re-scores the sampled actions under ordinary and skill-augmented contexts, converting the skill-induced probability shift into a dense token-level on-policy distillation signal. This signal is jointly optimized with outcome-based RL, keeping the auxiliary supervision aligned with the current trajectory distribution. Extensive experiments on text-based and vision-based agentic tasks show that SEED consistently improves performance and sample efficiency, exhibiting robust generalization to unseen scenarios. Our code is available at https://github.com/jinyangwu/SEED.
- Abstract(参考訳): 大規模言語モデルは、多ターンインタラクション、ツールの使用、環境フィードバックを含む長期タスクのための対話的エージェントとして、ますます訓練されている。
アウトカムベースの強化学習(RL)は、実用的な最適化のパラダイムを提供するが、その粗い軌道レベルの報酬は中間的な決定について限定的なガイダンスを与え、エピソードレベルの結果とトークンレベルの政策学習の間の監督的ギャップを残している。
本研究は, 自己発展型フレームワークSEED(Self-Evolving On-Policy Distillation)を提案する。
SEEDはまず、完成した軌跡を分析し、再利用可能なワークフロー、決定的な観察、障害回避ルールをキャプチャする自然言語スキルを生成するポリシーを微調整する。
RL中、現在のポリシーはどちらも軌跡を収集し、それらから後見スキルを抽出するアナライザとして機能する。
政策更新は、その後の意思決定とスキル分析を一緒に改善し、後見監督が政策とともに進化することを可能にする。
その後、SEEDはサンプルされたアクションを通常のおよびスキル拡張された文脈で再スコアし、スキル誘起確率シフトを高密度なトークンレベルのオン・ポリケート蒸留信号に変換する。
この信号は結果に基づくRLと協調的に最適化され、現在の軌道分布に合わせて補助的な監督が維持される。
テキストベースおよび視覚ベースのエージェントタスクに関する大規模な実験により、SEEDはパフォーマンスとサンプル効率を一貫して改善し、目に見えないシナリオへの堅牢な一般化を示している。
私たちのコードはhttps://github.com/jinyangwu/SEED.comで公開されています。
関連論文リスト
- SPyCE: Skill-Policy Co-evolution for Multimodal Agents [12.105041985483167]
階層型スキルライブラリにトラジェクトリを蒸留し,強化学習を通じて更新するフレームワークであるSPyCEを提案する。
トレーニング中、ポリシーモデルはそのロールアウトをガイドするために回収されたスキルに条件を課し、スキルライブラリはポリシーによって生成された貴重なロールアウトを使用して進化する。
8つのベンチマークの実験では、SPyCEはRLベースとメモリベースの両方のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-15T14:01:48Z) - OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning [38.54413500261524]
オンデマンドの自己蒸留は、密集したトークンレベルの監督を提供する。
textbfOPID (textbfOn-textbfPolicy Sktextbfill textbfDistillation) は、軌道上で完了したスキル管理を直接抽出するフレームワークである。
論文 参考訳(メタデータ) (2026-06-25T09:24:09Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - COVLM-RL: Critical Object-Oriented Reasoning for Autonomous Driving Using VLM-Guided Reinforcement Learning [55.83415345423854]
批判的オブジェクト指向(CO)推論と強化学習(RL)を統合した新しいエンドツーエンド駆動フレームワークCOVLM-RLを提案する。
CARLAシミュレータで行った実験により、COVLM-RLはトレーニング運転環境における成功率を30%向上することが示された。
論文 参考訳(メタデータ) (2025-12-10T06:18:16Z) - Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning [41.90621652673528]
エージェントLLMを学習するためのカリキュラムベースの自己アニメーション学習(SIL)レシピであるSPEARを提案する。
具体的には,本手法は,本質的な報奨を生かして,技術レベルの探究を促進するためのカリキュラムを取り入れている。
さらにトレーニングを安定させるために、リプレイバッファでの経験の利点を再検討し、潜在的ポリシードリフトに対処する。
論文 参考訳(メタデータ) (2025-09-26T17:20:38Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning [62.54484062185869]
本稿では,エージェントの強化学習プロセスの最適化にステップワイド報酬を利用するStepAgentを紹介する。
エージェント反射とポリシー調整を容易にする暗黙の逆・逆の強化学習手法を提案する。
論文 参考訳(メタデータ) (2024-11-06T10:35:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。