論文の概要: Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models
- arxiv url: http://arxiv.org/abs/2607.28449v1
- Date: Thu, 30 Jul 2026 16:17:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.655627
- Title: Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models
- Title(参考訳): Lightning OPD 2.0: 大規模共振モデルのための教師間オンライン蒸留におけるスタイルバイアスの緩和
- Abstract要約: We introduced Lightning OPD 2.0 with cross-fitted style residualization。
数学的推論とコード生成のベンチマークを通じて、Lightning OPD 2.0は、教師間の設定でLightning OPDを一貫して上回っている。
- 参考スコア(独自算出の注目度): 23.269235615604245
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation (OPD) provides dense token-level supervision from a teacher, but its effectiveness can depend on teacher consistency, meaning that the model providing OPD supervision should also have generated the demonstrations used to train the supervised fine-tuning (SFT) reference. However, this condition is frequently violated in practice when SFT data have mixed or unknown provenance or when different models are preferred for SFT data generation and subsequent distillation. In such cross-teacher settings, even a stronger OPD teacher can yield little improvement over the SFT reference. We find that raw teacher--reference disagreement contains potentially useful context-specific teacher evidence as well as a recurring component associated with differences in wording, formatting, and reasoning cadence. We introduce Lightning OPD 2.0 with cross-fitted style residualization, which uses rollout-level cross-fitting to estimate this recurring component as an operational proxy for style-token bias and subtracts it before constructing the token-level OPD update. Across mathematical reasoning and code generation benchmarks, Lightning OPD 2.0 consistently outperforms Lightning OPD in cross-teacher settings. Starting from Klear-Reasoner-8B-SFT, Lightning OPD 2.0 reaches 82.4% on AIME 2024 and 63.0% on LiveCodeBench v5. Together, these results establish Lightning OPD 2.0 as a practical approach to cross-teacher OPD, relaxing teacher consistency as a prerequisite and allowing the SFT data generator and distillation teacher to be selected independently. Code will be released soon.
- Abstract(参考訳): オンライン蒸留(OPD)は教師から密集したトークンレベルの監督を提供するが、その効果は教師の整合性に依存する可能性がある。
しかし、この条件は、SFTデータが混合または未知の出現率を持つ場合や、SFTデータ生成とその後の蒸留に異なるモデルが好まれる場合に頻繁に違反する。
このようなクロス教師の設定では、強力なOPD教師でさえ、SFT参照よりもほとんど改善しない。
生の教師参照不一致には, 語学, フォーマッティング, 推論のケイデンスの違いに関連付けられた繰り返し成分だけでなく, 潜在的に有意義な文脈特有な教師証拠が含まれていることが判明した。
我々は,この繰り返しコンポーネントを,トークンレベルのOPD更新を構築する前に動作プロキシとして推定し,それを減算する,クロスフィットなスタイル残差化を備えたLightning OPD 2.0を紹介した。
数学的推論とコード生成のベンチマークを通じて、Lightning OPD 2.0は、教師間の設定でLightning OPDを一貫して上回っている。
Klear-Reasoner-8B-SFTを皮切りに、Lightning OPD 2.0はAIME 2024で82.4%、LiveCodeBench v5で63.0%に達した。
これらの結果から,Lightning OPD 2.0 を教員間 OPD の実践的アプローチとして確立し,教師の一貫性を前提条件として緩和し,SFT データ生成器と蒸留器教師を独立して選択できるようにした。
コードはまもなくリリースされる。
関連論文リスト
- REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation [10.492445451268727]
REOPDは、オンデマンド蒸留のための信頼性適応型報酬外挿フレームワークである。
信頼性の高い教師参照方向に沿って選択的に外挿しながら、教師のアライメントを保ちます。
論文 参考訳(メタデータ) (2026-08-12T06:15:33Z) - Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging [13.653084100002737]
教師が生徒自身が生成するサンプルを補正するオンライン蒸留は、2つのモデルが同じ言語を話すことを前提にしている。
我々は、Any-OPDについて、任意対の潜流整合発生器間のオンライン蒸留のための最初のフレームワークについて述べる。
論文 参考訳(メタデータ) (2026-08-04T08:23:57Z) - Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance [50.77757355236912]
本稿では,RSTG(Recovering Learning Signals via Adaptive Teacher Guidance)を提案する。
RSTGは数学では+4.02%、コードでは+3.05%の速さでGRPO+OPDを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-08-01T17:29:14Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification [21.095025092772257]
On-Policy Distillation (OPD)は、強力な教師からの密集したトークンレベルフィードバックの下で、生徒モデルを自身の生成軌道上で訓練する。
OmniOPDはロジットフリーでチャンクレベルの監視信号を通じて両方の制限に対処する新しいフレームワークである。
論文 参考訳(メタデータ) (2026-05-31T22:31:15Z) - Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation [81.10000755917712]
オンライン蒸留は,教師からのトークンレベルのフィードバックを用いて,学生モデルを自作の軌道上で訓練することにより,推論能力を伝達する。
生徒が生成した接頭辞が長くなるにつれて、教師の次点の分布は自信を減らし、差別性が低下する。
SFDを緩和するため, textbfLookahead Group Reward (ours) を導入する。
論文 参考訳(メタデータ) (2026-05-29T04:39:20Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z) - Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation [7.2992280064983825]
オンライン蒸留(OPD)は、大規模言語モデルの効率的な後訓練パラダイムとして登場した。
標準PDは、トレーニングを通してライブの教師推論サーバーを必要とし、その結果、かなりのインフラストラクチャーオーバーヘッドを発生させる。
我々は,教師の対数確率をSFTロールアウトにプリ計算することで教師の一貫性を強制するオフラインのオンライン蒸留フレームワークであるLightning OPDを提案する。
論文 参考訳(メタデータ) (2026-04-14T17:44:50Z) - Self-Distilled RLVR [57.37526213765131]
特権教師からのみ派生した学習信号が,情報漏洩と不安定な長期学習をもたらすことを示す。
textbfSelf-textbfDistillationを用いたtextbfRLSD(textbfRLVR)を提案する。
これにより、RSSDはRLVRとOPSDの両方の強度を同時に利用でき、高い収束天井と優れたトレーニング安定性を実現することができる。
論文 参考訳(メタデータ) (2026-04-03T15:50:07Z) - Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation [57.524909883706556]
オンライン蒸留(OPD)は、学生のパフォーマンス向上に強い経験的利益をもたらしている。
この研究は、フレキシブルな参照モデルと報酬項の相対重みをKL正規化に対して制御する報酬スケーリング係数を導入している。
特に、同じ学生モデルにドメイン固有RLを適用して得られた異なるドメインエキスパートの知識をマージする環境では、ExOPDは生徒が教師のパフォーマンス境界を越えられるようにします。
論文 参考訳(メタデータ) (2026-02-12T16:14:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。