論文の概要: REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2608.11698v2
- Date: Thu, 13 Aug 2026 01:29:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.780177
- Title: REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation
- Title(参考訳): REOPD : オンデマンド蒸留における信頼性適応型逆流外挿法
- Abstract要約: REOPDは、オンデマンド蒸留のための信頼性適応型報酬外挿フレームワークである。
信頼性の高い教師参照方向に沿って選択的に外挿しながら、教師のアライメントを保ちます。
- 参考スコア(独自算出の注目度): 10.492445451268727
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) trains a student on its own trajectories under dense token-level supervision from a teacher. Reward-extrapolation methods such as ExOPD amplify the teacher-reference log-likelihood ratio to move beyond direct imitation, but apply a single global coefficient $λ$ to every token. This can drive the student to fit extreme peaks in the implicit reward, causing reward hacking and unstable training, and the optimal $λ$ varies across domains, requiring costly sweeps. We propose REOPD, a reliability-adaptive reward extrapolation framework for OPD. REOPD combines a token-level compatibility weight with a batch-level adaptive budget, yielding a token-wise coefficient $λ_{b,t}=1+γ_b q_t$ that preserves teacher alignment while selectively extrapolating along reliable teacher-reference directions. It requires no verifier, reward model, value model, or extra rollout beyond standard OPD. REOPD outperforms G-OPD on single-teacher mathematics and on both domains in the multi-teacher setting, while matching G-OPD on single-teacher code, demonstrating effective fine-grained reliability adaptation across domains and teacher configurations.
- Abstract(参考訳): オンライン蒸留(On-policy distillation、OPD)は、教師から密集したトークンレベルの監督の下で、生徒を自身の軌道で訓練する。
ExOPDのような逆測度法は、教師-参照対数-類似度比を増幅して直接模倣を超えて移動させるが、全てのトークンに対して1つの大域係数$λ$を適用する。
これにより、学生は暗黙の報酬に極端にピークを合わせることができ、報酬のハッキングと不安定なトレーニングを引き起こし、最適な$λ$はドメインによって異なるため、コストがかかる。
OPDのための信頼性適応型報酬外挿フレームワークREOPDを提案する。
REOPDはトークンレベルの適合度重みとバッチレベルの適応予算を結合し、信頼度の高い教師参照方向に沿って選択的に外挿しながら教師アライメントを保持するトークンワイド係数 $λ_{b,t}=1+γ_b q_t$ を得る。
検証や報酬モデル,バリューモデル,あるいは標準PDを越えた追加のロールアウトは必要ありません。
REOPDはG-OPDを単教師数とマルチ教師数の両方で上回り、G-OPDを単教師コードでマッチングし、ドメインや教師構成にまたがる効果的なきめ細かな信頼性適応を示す。
関連論文リスト
- Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher [36.07614733558147]
フローマッチングモデルのための教師なしOPDフレームワークである textbfSelf-OPD を紹介する。
Self-OPDは決定論的次状態予測を$K$SDE候補に分割し、ODEサンプルとロールアウトして、決定論的自己参照ベースラインと比較する。
単品と混合報酬のベンチマーク実験により、セルフOPDはタスク固有の教師を伴わずに、以前のRLとOPDメソッドよりも優れていた。
論文 参考訳(メタデータ) (2026-08-27T09:34:23Z) - ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation [25.69241346799495]
我々は,教師が生徒の接頭辞から正しい回答を得られる確率として,プロンプトレベルの教師継続信頼性を$R$と定義する。
我々は、高いR$プロンプトがより大きなOPDゲインをもたらし、下降するR$トレーニングがランダムな順序と上昇順序より優れていることを示す。
論文 参考訳(メタデータ) (2026-08-11T13:27:56Z) - Simple-OPD: Demystifying Warm-up for On-policy Distillation [51.693357695326846]
オンライン蒸留(On-policy distillation、OPD)は、教師モデルからトークンレベルの監督を受け、生徒を自身のロールアウトで訓練する。
データとトレーニングの両方の観点から、OPDのウォームアップをデミスティフィケートします。
論文 参考訳(メタデータ) (2026-08-07T04:47:38Z) - Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance [50.77757355236912]
本稿では,RSTG(Recovering Learning Signals via Adaptive Teacher Guidance)を提案する。
RSTGは数学では+4.02%、コードでは+3.05%の速さでGRPO+OPDを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-08-01T17:29:14Z) - $β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation [85.07190808882523]
オンライン自己蒸留は推論言語モデルを改善するための有望なアプローチである。
我々は,$-OPSDがバニラOPSDを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-07-30T17:41:16Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation [25.25989941933095]
マルチターンOPD用に設計された検証不要な選択的介入フレームワークであるSAGE-OPDを提案する。
SAGE-OPDは、教師の監督を全ターンで均一に行うのではなく、まず環境フィードバックを観察し、各生徒の反応をスキップするか介入するかを決定するために教師の判断を使用する。
エージェントタスクの実験では、SAGE-OPDはベースラインよりも一貫して改善され、ALFWorldの13.3%の相対的な改善を実現している。
論文 参考訳(メタデータ) (2026-06-17T23:58:14Z) - SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling [22.832360652920332]
オンライン蒸留 (On-policy distillation, OPD) は、生徒を自身の軌道で訓練し、より強い教師から集中的な指導を受ける。
本稿では,教師の信頼信号として二分検証器を用いるサインゲートオンポリシィ蒸留(SG-OPD)を提案する。
競合レベルの数学的推論ベンチマークの実験では、SG-OPDは標準PDよりも一貫して優れていた。
論文 参考訳(メタデータ) (2026-06-08T10:11:58Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z) - Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation [57.524909883706556]
オンライン蒸留(OPD)は、学生のパフォーマンス向上に強い経験的利益をもたらしている。
この研究は、フレキシブルな参照モデルと報酬項の相対重みをKL正規化に対して制御する報酬スケーリング係数を導入している。
特に、同じ学生モデルにドメイン固有RLを適用して得られた異なるドメインエキスパートの知識をマージする環境では、ExOPDは生徒が教師のパフォーマンス境界を越えられるようにします。
論文 参考訳(メタデータ) (2026-02-12T16:14:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。