論文の概要: REVO: Rollout-Efficient Off-Policy Distillation via Variance-Guided Reuse
- arxiv url: http://arxiv.org/abs/2609.37500v1
- Date: Mon, 28 Sep 2026 17:52:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.529748
- Title: REVO: Rollout-Efficient Off-Policy Distillation via Variance-Guided Reuse
- Title(参考訳): REVO: 可変誘導リユースによるロールアウト効率の良いオフポリシング
- Abstract要約: オンライン蒸留(OPD)は、学生が生み出す軌跡の密集したトークンレベルの教師監督を用いて言語モデルを訓練する。
複数段階の学習者更新のために各学生のロールアウトを再利用することにより、ロールアウト効率を向上させるオフ政治蒸留フレームワークであるREVOを紹介する。
- 参考スコア(独自算出の注目度): 16.13383921658664
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) trains language models using dense token-level teacher supervision on student-generated trajectories. However, its reliance on frequently refreshed student rollouts often incurs substantial generation cost. We introduce REVO, an off-policy distillation framework that improves rollout efficiency by reusing each student rollout for multi-step learner updates. REVO addresses prefix-level and current-token policy mismatch through stabilized prefix weighting and one-step resampling from the current student, which enables repeated updates without regenerating full trajectories. To prioritize informative token positions within reused rollouts, REVO uses the variance of the student-teacher log-probability ratio to quantify the remaining token-level learning signal and guide repeated optimization. Across multiple student-teacher scales, REVO with only 50 rollout iterations matches or exceeds OPD baselines trained for 200 iterations on both in-domain and cross-domain reasoning benchmarks.
- Abstract(参考訳): オンライン蒸留(OPD)は、学生が生み出す軌跡の密集したトークンレベルの教師監督を用いて言語モデルを訓練する。
しかし、しばしばリフレッシュされた学生のロールアウトに依存しているため、かなりの世代費用がかかることが多い。
複数段階の学習者更新のために各学生のロールアウトを再利用することにより、ロールアウト効率を向上させるオフ政治蒸留フレームワークであるREVOを紹介する。
REVOはプレフィックスレベルとカレントツーケンポリシーのミスマッチを、安定化プレフィックス重み付けと、現在の学生からのワンステップ再サンプリングを通じて解決し、完全なトラジェクトリを再生することなく繰り返し更新を可能にする。
再利用ロールアウト内の情報トークン位置を優先するために、REVOは学生と教師の対数確率比の分散を利用して残りのトークンレベルの学習信号を定量化し、繰り返し最適化する。
複数の学生と教師のスケールで、REVOは50回しかロールアウトしないが、ドメイン内とクロスドメインの推論ベンチマークの両方で200回のイテレーションでトレーニングされたPDベースラインを超えている。
関連論文リスト
- SIPO: Unifying Reinforcement Learning with On-Policy Self-Distillation [24.836022752759035]
検証可能な報酬付き強化学習(RLVR)は,様々なタスクにおいて大規模言語モデル(LLM)を改善するための標準パラダイムとなっている。
我々は,自己指導型政策最適化(SIPO)と対照的な自己指導型政策最適化(SIPO)を提案する。
論文 参考訳(メタデータ) (2026-09-29T05:15:41Z) - WAM-OPD: Sharpening World Action Models via On-Policy Distillation [84.1328443874472]
事前訓練された世界行動モデル(WAM)は、多様なロボット操作タスクにまたがる汎用機能を提供する。
WAMのオンライン蒸留(OPD)とWAM-OPDの導入について検討する。
We show WAM-OPD improves target-task performance while maintaining near-itial performance on tasks excludeed by adapt。
論文 参考訳(メタデータ) (2026-09-28T03:56:23Z) - RISE: Recursive Improvement via Self-Extrapolating Policy Distillation [47.92477203057629]
textbfRISE (textbfRecursive textbfImprovement via textbfSelf-textbfExtrapolating Policy Distillation)を提案する。
RISEは、モデル自身のRLVRトレーニング軌道から直接合成教師を構築する。
数学的推論、マルチドメインSTEM、コード生成、マルチターンエージェントタスクにまたがる実験により、RISEはRLVRのみのトレーニングや政治上の自己蒸留よりも優れていることが示された。
論文 参考訳(メタデータ) (2026-09-04T15:47:51Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Multi-Turn On-Policy Distillation with Prefix Replay [73.10000453999088]
エージェントタスクに対するReplayed-Prefix On-Policy Distillation (ReOPD)を提案する。
ReOPDは、プレコンパイルされた教師の軌跡を再生プレフィックスとして再利用する。
OPDレベルの精度を保存または改善し、学生のトレーニング中にゼロツールコールを使用し、PDよりもトレーニングステップあたり最低4$times$高速である。
論文 参考訳(メタデータ) (2026-07-06T07:56:53Z) - Are Full Rollouts Necessary for On-Policy Distillation? [63.18243901591995]
オンライン蒸留(OPD)は、学生が生み出すロールアウトに沿って密集した教師のフィードバックを提供する。
我々は、ロールアウトの地平線を、トレーニング効率に大きく影響を及ぼすOPDの重要なボトルネックとみなす。
本稿では,トレーニング中に徐々にロールアウト地平線を拡大するプログレッシブPDと,信頼性の高い切り抜きロールアウトで恒久的に蒸留を行うTrncated OPDの2つの簡単な水平制御戦略を提案する。
論文 参考訳(メタデータ) (2026-05-29T16:12:54Z) - ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation [11.916633988612439]
オンライン蒸留(OPD)は、学生が生み出す軌道に沿って教師のフィードバックを訓練することで、推論の振る舞いを伝達する。
我々は、ロールアウト長をオンライン許容判定として扱うOPD用適応ウィンドウフレームワークADWINを提案する。
論文 参考訳(メタデータ) (2026-05-27T12:33:44Z) - Teacher-Guided Policy Optimization for LLM Distillation [90.49982387646861]
Teacher-Guided Policy Optimization (TGPO) は、生徒のロールアウトに条件付き教師予測を活用することで、高密度な方向性誘導を取り入れたオンラインアルゴリズムである。
複雑な推論ベンチマークの実験では、TGPOは標準ベースラインを著しく上回り、異なる教師にとって堅牢であることが示されている。
論文 参考訳(メタデータ) (2026-05-13T09:20:03Z) - Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards [69.74686029941881]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論能力を改善するための効果的なパラダイムである。
トレーニングを通して高価値ロールアウトを適応的に選択する統合型ニューラルネットワークスケジューリングフレームワークを提案する。
6つの数学的推論ベンチマークの実験では、複数のRLVR最適化手法で性能と訓練効率が一貫した向上を示した。
論文 参考訳(メタデータ) (2026-02-09T10:51:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。