論文の概要: RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.20784v1
- Date: Thu, 17 Sep 2026 17:52:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.41656
- Title: RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning
- Title(参考訳): RetireOPD: エージェント強化学習のための自給オンポリティ蒸留
- Abstract要約: まず,環境に配慮したスキル条件の教師を最適化し,RLとOPDを併用してスキルフリーの生徒を訓練するRetireOPD(Self-Retiring On-Policy Distillation)を提案する。
1.5Bから7BまでのQwen2.5モデル全体で、RetireOPDはRLベースラインよりもALFWorldの成功率を14.1%から18.8%、WebShopの精度を11.8%から19.0%改善した。
- 参考スコア(独自算出の注目度): 30.454055967946047
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-turn agents trained with reinforcement learning (RL) receive a single scalar reward per trajectory, which motivates self on-policy distillation (OPD) to supply dense token-level supervision from a self-teacher with privileged task skills, letting a skill-free student internalize them. This recipe, however, is undermined by two findings in agentic tasks: privileged information alone does not always make a teacher reliable, and the benefit of teacher supervision is stage-dependent. We therefore propose RetireOPD (Self-Retiring On-Policy Distillation), which first optimizes a decoupled, skill-conditioned teacher with environment rewards and then trains a skill-free student jointly with RL and OPD. Rather than following a predefined distillation schedule, RetireOPD adopts Adaptive Retirement: the student drops the teacher on its own once their discrepancy stops shrinking and it reaches a target fraction of the teacher's success rate, after which training proceeds with RL alone. Across Qwen2.5 models from 1.5B to 7B, RetireOPD improves ALFWorld success rate over RL baseline by 14.1% to 18.8% and WebShop accuracy by 11.8% to 19.0%, and surpasses its own skill-conditioned teacher in every setting.
- Abstract(参考訳): 強化学習(RL)で訓練されたマルチターンエージェントは、軌跡ごとに1つのスカラー報酬を受け取り、これは自己のオンライン蒸留(OPD)を動機付け、特権的なタスクスキルを持つ自己教師から密集したトークンレベルの監督を供給し、スキルのない学生に内在化させる。
しかし、このレシピはエージェント業務における2つの発見によって損なわれている。特権情報だけでは教師を信頼させるとは限らないし、教師監督の利点はステージ依存である。
そこで本研究では,まず,環境に配慮した分離されたスキル条件の教師を最適化し,RLとOPDと共同でスキルフリーの学生を訓練するRetireOPD(Self-Retiring On-Policy Distillation)を提案する。
RetireOPDは、あらかじめ定義された蒸留スケジュールに従うのではなく、Adaptive Retirementを採用する: 学生は、不一致が縮小し、教師の成功率の目標値に到達し、RL単独でトレーニングを行う。
1.5Bから7BまでのQwen2.5モデル全体で、RetireOPDはRLベースラインよりもALFWorldの成功率を14.1%から18.8%、WebShopの精度を11.8%から19.0%に改善し、各設定で独自のスキル条件の教師を上回っている。
関連論文リスト
- Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall [79.59596652272923]
教師が自信を持つトークンを蒸留する簡易な中間訓練目的であるスイッチ蒸留を提案する。
標準的なNTPとは対照的に、推論性能は1.61-1.71x、知識と常識性能は1.13-1.19xである。
論文 参考訳(メタデータ) (2026-09-01T17:00:30Z) - OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning [10.695443572995345]
教員のオンライン蒸留は、有望な方向性を提供するが、2つの問題に悩まされている。
タスク固有の訓練教師は、タスク固有の微調整を伴わずに、オフ・ザ・シェルフの教師とPDを直接適用しながら、相当な訓練コストを発生させる。
我々は,教師の微調整を必要としない最初の蒸留パラダイムであるPDSearch+を提案する。
論文 参考訳(メタデータ) (2026-08-25T09:39:16Z) - Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance [50.77757355236912]
本稿では,RSTG(Recovering Learning Signals via Adaptive Teacher Guidance)を提案する。
RSTGは数学では+4.02%、コードでは+3.05%の速さでGRPO+OPDを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-08-01T17:29:14Z) - From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents [16.67357658768852]
我々は,OVCSD(Outcome-Verified Comparison Self-Distillation)を提案する。
OVCSDは失敗に終わった学生をプレフィックスツリーに配置し、学生が設定した状態からスキル条件の教師を適応的に呼び出す。
3つのモデルスケールにわたるALFWorldとWebShopの実験は、OVCSDがスキルのないRLと既存の自己蒸留ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-07-30T09:47:58Z) - On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents [50.78688247330029]
オン・ポリシィ蒸留(On-Policy Distillation、OPD)は、小規模の学生にその能力を伝達するための自然なレシピである。
本稿では,教師と生徒が生成するターンを各ロールアウトに混在させるシンプルなアルゴリズムであるGuided-OPD(Guided-OPD)を提案する。
Guided-OPDは、平均してバニラOPDよりも21.1%、成功率25.5%向上している。
論文 参考訳(メタデータ) (2026-06-14T16:41:45Z) - Self-Distilled Agentic Reinforcement Learning [65.24201057390938]
自己蒸留型エージェント強化学習は、トークンレベルの信号をシグモノイドゲートにマップする。
SDARはモデルスケール全体のハイブリッドRL--OPSDベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-14T17:51:26Z) - Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents [24.99615788156812]
Skill-SDはエージェント自身の軌道を動的トレーニングのみの監視に変換するフレームワークである。
我々は, 重み付き逆KL損失を導出し, 勾配補正型トークンレベルの蒸留を行った。
エージェントベンチマークの実験結果は、Skill-SDが標準RLベースラインを大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-04-12T14:57:52Z) - Reinforcement-aware Knowledge Distillation for LLM Reasoning [63.53679456364683]
強化学習(Reinforcement Learning, RL)ポストトレーニングは、最近、大型言語モデル(LLM)の長いチェーン・オブ・プリーティングにおいて、進歩をもたらした。
既存の知識蒸留法の多くは、教師による微調整(SFT)のために設計されており、固定された教師のトレースや教師の学生であるKulback-Leibler(KL)の発散に基づく正規化に依存している。
本稿では,RLにおける選択的な模倣を行うRL-aware distillation (RLAD)を提案する。
論文 参考訳(メタデータ) (2026-02-26T00:20:39Z) - Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation [57.524909883706556]
オンライン蒸留(OPD)は、学生のパフォーマンス向上に強い経験的利益をもたらしている。
この研究は、フレキシブルな参照モデルと報酬項の相対重みをKL正規化に対して制御する報酬スケーリング係数を導入している。
特に、同じ学生モデルにドメイン固有RLを適用して得られた異なるドメインエキスパートの知識をマージする環境では、ExOPDは生徒が教師のパフォーマンス境界を越えられるようにします。
論文 参考訳(メタデータ) (2026-02-12T16:14:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。