論文の概要: OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2606.26790v1
- Date: Thu, 25 Jun 2026 09:24:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.225523
- Title: OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
- Title(参考訳): OPID: エージェント強化学習のためのオンラインスキル蒸留
- Authors: Shuo Yang, Jinyang Wu, Zhengxi Lu, Yuhao Shen, Fan Zhang, Lang Feng, Shuai Zhang, Haoran Luo, Zheng Lian, Zhengqi Wen, Jianhua Tao,
- Abstract要約: オンデマンドの自己蒸留は、密集したトークンレベルの監督を提供する。
textbfOPID (textbfOn-textbfPolicy Sktextbfill textbfDistillation) は、軌道上で完了したスキル管理を直接抽出するフレームワークである。
- 参考スコア(独自算出の注目度): 38.54413500261524
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Outcome-based reinforcement learning provides a stable optimization backbone for language agents, but its sparse trajectory-level rewards provide little guidance on which intermediate decisions should be reinforced or suppressed. On-policy self-distillation offers dense token-level supervision, yet existing skill-conditioned variants often rely on external skill memories or retrieved privileged context, which are costly to maintain and can be mismatched with the state distribution induced by the current policy in multi-turn interaction. We propose \textbf{OPID} (\textbf{O}n-\textbf{P}olicy Sk\textbf{i}ll \textbf{D}istillation), a framework that extracts skill supervision directly from completed on-policy trajectories. OPID represents trajectory hindsight as hierarchical skills: episode-level skills capture global workflows or failure-avoidance rules, while step-level skills capture local decision knowledge at critical timesteps. A critical-first routing mechanism uses step-level skills when critical decisions are identified and falls back to episode-level skills as default guidance otherwise. The selected skill is injected into the interaction history, allowing the old policy to re-score the same sampled response under both original and skill-augmented contexts. The resulting log-probability shift yields a token-level self-distillation advantage, which is combined with the outcome advantage for policy optimization. OPID thus preserves RL as the primary training objective while introducing dense, distribution-matched hindsight supervision. Experiments on ALFWorld, WebShop and Search-based QA demonstrate that OPID generally improves agent performance, sample efficiency, and robustness over outcome-only RL and existing skill-distillation baselines. Our code is available at https://github.com/jinyangwu/OPID/tree/main.
- Abstract(参考訳): アウトカムベースの強化学習は、言語エージェントに安定した最適化バックボーンを提供するが、その粗い軌道レベルの報酬は、中間的な決定を補強または抑制するかについてのガイダンスをほとんど提供しない。
オンラインの自己蒸留は、密集したトークンレベルの監視を提供するが、既存のスキル条件付き変種は、しばしば外部のスキル記憶や、回収された特権的コンテキストに依存し、メンテナンスにコストがかかり、マルチターンインタラクションにおいて現在のポリシーによって引き起こされる状態分布と一致しない。
そこで本稿では, 完成したオンライントラジェクトリから直接, スキル管理を直接抽出するフレームワークである \textbf{OPID} (\textbf{O}n-\textbf{P}olicy Sk\textbf{i}ll \textbf{D}istillation を提案する。
エピソードレベルのスキルはグローバルなワークフローや障害回避ルールを、ステップレベルのスキルはクリティカルなタイミングでローカルな意思決定知識をキャプチャします。
クリティカルファーストのルーティングメカニズムは、クリティカルな決定が特定されるとステップレベルのスキルを使用し、デフォルトのガイダンスとしてエピソードレベルのスキルにフォールバックする。
選択されたスキルはインタラクション履歴に注入され、古いポリシーは、オリジナルとスキル拡張されたコンテキストの両方で、同じサンプルレスポンスを再スコアできる。
結果として生じる対数確率シフトはトークンレベルの自己蒸留の利点をもたらし、これは政策最適化の結果の利点と組み合わせられる。
OPIDはRLを第一の訓練目標として保存し、密集した分布整合後視監督を導入する。
ALFWorld、WebShop、検索ベースのQAの実験では、OPIDは一般的に、結果のみのRLと既存のスキル蒸留ベースラインよりも、エージェントのパフォーマンス、サンプル効率、堅牢性を改善している。
私たちのコードはhttps://github.com/jinyangwu/OPID/tree/mainで利用可能です。
関連論文リスト
- SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment [4.336665585098371]
本稿では,このコントラストを内部化のための直接学習信号に変換するContrastive Skill Credit Assignment (CSCA) に基づくフレームワークであるSkillCを提案する。
textscSkillCは、同じポリシー更新内でアクティブなスキルタイプからのタスクに対して、ペア化されたスキル注入とスキルフリーのロールアウトをサンプリングする。
スムーズな検証レベル信号は、帰属強度、ロールアウトアロケーション、単調なアクティブセットプルーニングよりも適応的なカリキュラムを駆動する。
論文 参考訳(メタデータ) (2026-05-27T03:21:19Z) - Harnessing LLM Agents with Skill Programs [58.356514745548026]
HASPは、実行可能なプログラム関数(PF)にスキルをアップグレードする新しいフレームワークです。
PFは障害が発生しやすい状態を起動し、次のアクションを変更したり、修正コンテキストを注入する実行可能なガードレールとして機能する。
HASPは、Web検索、数学推論、コーディングタスクにおいて、トレーニング不要とトレーニングベースの両方の手法と比較して、大幅に向上している。
論文 参考訳(メタデータ) (2026-05-18T01:35:11Z) - SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization [61.37478254738943]
推論時のスキル向上は基本的に制限されている。
SKILL0は,スキル内部化のためのコンテキスト内強化学習フレームワークである。
SKILL0は標準のRLベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-04-02T17:03:05Z) - ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning [17.98540130851038]
ARISE(Agent Reasoning via Intrinsic Skill Evolution)は階層的な強化学習フレームワークである。
共有ポリシを使用して、ハイレベルなスキルを管理し、低レベルなレスポンスを生成する。
階層的な報酬設計は、推論能力と図書館品質の共進化を導く。
論文 参考訳(メタデータ) (2026-03-17T02:03:17Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。