論文の概要: Simple-OPD: Demystifying Warm-up for On-policy Distillation
- arxiv url: http://arxiv.org/abs/2608.06802v1
- Date: Fri, 07 Aug 2026 04:47:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.362836
- Title: Simple-OPD: Demystifying Warm-up for On-policy Distillation
- Title(参考訳): Simple-OPD: オンライン蒸留における温暖化対策
- Authors: Tao Liu, Taiqiang Wu, Mao Zheng, Xuan Luo, Runming Yang, Xuewei Yang, Junjie Wang, Yujiu Yang,
- Abstract要約: オンライン蒸留(On-policy distillation、OPD)は、教師モデルからトークンレベルの監督を受け、生徒を自身のロールアウトで訓練する。
データとトレーニングの両方の観点から、OPDのウォームアップをデミスティフィケートします。
- 参考スコア(独自算出の注目度): 51.693357695326846
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) trains a student on its own rollouts with token-level supervision from teacher models, but its effectiveness can depend strongly on the warm-up stage before OPD. In this paper, we demystify warm-up for OPD from both data and training perspectives. For data, we find that effective warm-up relies on teacher-compatible chain-of-thought supervision, and that even incorrect teacher rollouts can provide comparable benefits to correct ones. This suggests that warm-up primarily transfers a teacher-compatible thinking pattern rather than merely correct answers. For training, we show that low-rank adaptation (LoRA) with a near-saturation training duration better balances in-domain adaptation and out-of-distribution generalization than full-parameter SFT. Based on these findings, we propose Simple-OPD, a plug-and-play initialization method that warms up the student on teacher-generated CoT with LoRA before OPD. Experiments across diverse settings demonstrate the effectiveness and robustness of Simple-OPD.
- Abstract(参考訳): オンライン蒸留(OPD)は、教師モデルからのトークンレベルの監督で生徒を自身のロールアウトで訓練するが、その効果はOPD以前のウォームアップステージに強く依存する。
本稿では,データとトレーニングの両面からOPDのウォームアップをデミスティフィケートする。
データの場合、効果的なウォームアップは教師と互換性のあるチェーン・オブ・思想の監督に依存している。
このことは、ウォームアップが単に正しい答えではなく、主に教師互換の思考パターンを伝達していることを示唆している。
トレーニングでは,低ランク適応 (LoRA) とほぼ飽和トレーニング期間は,全パラメータSFTよりもドメイン適応とアウト・オブ・ディストリビューション一般化のバランスが良好であることを示す。
そこで本研究では,OPDの前に教師生成CoTをLoRAで温めるプラグイン・アンド・プレイ初期化手法であるSimple-OPDを提案する。
さまざまな環境での実験は、Simple-OPDの有効性と堅牢性を示している。
関連論文リスト
- Contrastive On-Policy Distillation [36.47487086937924]
対照的なオンライン蒸留フレームワークである COPD を提案する。
COPDは生徒モデルに直接、より簡潔で効率的な推論戦略を学ぶよう促す。
論文 参考訳(メタデータ) (2026-07-21T12:35:04Z) - SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation [25.25989941933095]
マルチターンOPD用に設計された検証不要な選択的介入フレームワークであるSAGE-OPDを提案する。
SAGE-OPDは、教師の監督を全ターンで均一に行うのではなく、まず環境フィードバックを観察し、各生徒の反応をスキップするか介入するかを決定するために教師の判断を使用する。
エージェントタスクの実験では、SAGE-OPDはベースラインよりも一貫して改善され、ALFWorldの13.3%の相対的な改善を実現している。
論文 参考訳(メタデータ) (2026-06-17T23:58:14Z) - SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling [22.832360652920332]
オンライン蒸留 (On-policy distillation, OPD) は、生徒を自身の軌道で訓練し、より強い教師から集中的な指導を受ける。
本稿では,教師の信頼信号として二分検証器を用いるサインゲートオンポリシィ蒸留(SG-OPD)を提案する。
競合レベルの数学的推論ベンチマークの実験では、SG-OPDは標準PDよりも一貫して優れていた。
論文 参考訳(メタデータ) (2026-06-08T10:11:58Z) - Are Full Rollouts Necessary for On-Policy Distillation? [63.18243901591995]
オンライン蒸留(OPD)は、学生が生み出すロールアウトに沿って密集した教師のフィードバックを提供する。
我々は、ロールアウトの地平線を、トレーニング効率に大きく影響を及ぼすOPDの重要なボトルネックとみなす。
本稿では,トレーニング中に徐々にロールアウト地平線を拡大するプログレッシブPDと,信頼性の高い切り抜きロールアウトで恒久的に蒸留を行うTrncated OPDの2つの簡単な水平制御戦略を提案する。
論文 参考訳(メタデータ) (2026-05-29T16:12:54Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Rubric-based On-policy Distillation [62.11106822527392]
オンライン蒸留(OPD)はモデルアライメントの強力なパラダイムであるが、教師のロジットに依存しているため、ホワイトボックスのシナリオへの適用が制限される。
構造化された意味ルーブリックは教師のロジットに代わるスケーラブルな代替品として機能し,教師が生成した応答のみを用いてOPDを可能にする。
具体的には、ROPDは教師と学生のコントラストからプロンプト固有のルーリックを誘導し、これらのルーリックを使用して学生のロールアウトをオンライン最適化に活用する。
論文 参考訳(メタデータ) (2026-05-08T07:52:15Z) - Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization [18.027254451537342]
既存の自己蒸留法は、文脈拡張型教師モデルに向けた学習をKLマッチングに大きく還元する。
textbfPreference-textbfBased textbfSelf-textbfDistillation (textbfPBSD)を提案する。
論文 参考訳(メタデータ) (2026-05-06T15:31:50Z) - Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation [7.2992280064983825]
オンライン蒸留(OPD)は、大規模言語モデルの効率的な後訓練パラダイムとして登場した。
標準PDは、トレーニングを通してライブの教師推論サーバーを必要とし、その結果、かなりのインフラストラクチャーオーバーヘッドを発生させる。
我々は,教師の対数確率をSFTロールアウトにプリ計算することで教師の一貫性を強制するオフラインのオンライン蒸留フレームワークであるLightning OPDを提案する。
論文 参考訳(メタデータ) (2026-04-14T17:44:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。