論文の概要: Towards Unbiased On-Policy Distillation for Block Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2610.05373v1
- Date: Sun, 04 Oct 2026 17:00:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 14:17:34.765018
- Title: Towards Unbiased On-Policy Distillation for Block Diffusion Language Models
- Title(参考訳): ブロック拡散言語モデルのための非バイアスオン・ポリシィ蒸留に向けて
- Abstract要約: 教師と学生のミスマッチブロック境界がtextbftextitcontext の誤認識を引き起こすことを示す。
OPD のtextbftextitintrinsic 最適化バイアスは、破滅的な過信の崩壊に弱い学生を罠にかける、早急に自信の急上昇を引き起こす。
そこで本稿では,BDLMトレーニングを安定化させるための新しい2つの枠組みを持つ非バイアスのオンライン蒸留フレームワークであるmboxtextbfUn-OPDを提案する。
- 参考スコア(独自算出の注目度): 60.72199728386045
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation (OPD) has emerged as an effective post-training paradigm for language models, with recent efforts extending it to block diffusion language models (BDLMs). However, existing studies focus almost exclusively on small block sizes, leaving distillation into student models with larger blocks underexplored. In this work, we investigate this regime and reveal two critical optimization biases that induce severe training instability. First, mismatched block boundaries between teacher and student cause \textbf{\textit{context misalignment}}, providing distorted supervisory signals that misguide student decoding. Second, even under aligned contexts, an \textbf{\textit{intrinsic optimization bias}} in OPD, where the student tends to rapidly absorb high-support signals while lagging on low-support updates, drives a premature confidence surge that traps weaker students in catastrophic overconfidence collapse. To resolve these, we propose \mbox{\textbf{Un-OPD}}, an unbiased on-policy distillation framework with two novelties for stabilizing BDLM training. First, Un-OPD introduces a boundary-aware step filtering strategy that eliminates context-misaligned decoding steps. Second, Un-OPD proposes moderating optimization intensity at high-support positions via a support-rebalanced confidence calibration, thereby bypassing overconfidence collapse. Beyond stability, we also introduce a rollout reuse mechanism to reduce rollout generation overhead. Extensive experiments on math reasoning and code generation benchmarks show that Un-OPD consistently stabilizes training and delivers superior performance while reducing wall-clock training time by approximately half.
- Abstract(参考訳): オンライン蒸留 (OPD) は, 拡散言語モデル (BDLM) をブロックするために, 言語モデルの効果的な後訓練パラダイムとして登場した。
しかし、既存の研究では、ほとんど小さなブロックサイズにのみ焦点が当てられ、より大きなブロックが探索されていない学生モデルに蒸留が残されている。
本研究は,本体制を考察し,重度のトレーニング不安定を誘発する2つの重要な最適化バイアスを明らかにする。
まず、教師と生徒の間のミスマッチしたブロック境界である \textbf{\textit{context misalignment}} 。
第二に、OPD の \textbf{\textit{intrinsic optimization bias}} では、低サポート更新を遅延しながら高サポート信号を素早く吸収する傾向にあり、破滅的な過信の崩壊で弱体化を阻害する早急な自信の急上昇を引き起こす。
そこで本稿では,BDLMトレーニングを安定化させるための新しい2つの枠組みを持つ非バイアスのオンライン蒸留フレームワークである \mbox{\textbf{Un-OPD}} を提案する。
まず、Un-OPDはコンテキストミスのデコードステップを排除する境界対応のステップフィルタリング戦略を導入する。
第2に、Un-OPDは、高い支持位置における最適化強度の調整を、高信頼度キャリブレーションによって提案し、過信崩壊を回避している。
安定性以外にも,ロールアウト生成オーバーヘッドを低減するためのロールアウト再利用機構も導入しています。
算数推論とコード生成ベンチマークに関する大規模な実験により、Un-OPDはトレーニングを安定させ、ウォールクロックのトレーニング時間を約半分削減しながら優れたパフォーマンスを提供する。
関連論文リスト
- Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models [65.89572755202245]
拡散言語モデル(DLM)は、より強力なグローバル認識と高い並列生成を提供する。
標準負のエビデンス下界(NELBO)に基づく教師付き微調整後のDLMは非効率である。
そこで本研究では,学習を推論の容易かつハードな構造に整合させる,自己蒸留軌道に基づくポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T09:39:06Z) - Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation [51.210887267509854]
OPDの効率は、トレーニングの初期段階において最終モデルに向けた安定的な更新軌道を確立する、フォレスト・オブ・ザ・イヤーズ(foresight')の形式に起因している、と我々は主張する。
我々は、外挿ステップのサイズを適応的に選択し、現在の更新方向に沿って移動することにより、OPDを高速化するプラグイン・アンド・プレイ・アクセラレーション手法である textbfEffOPD を提案する。
論文 参考訳(メタデータ) (2026-05-12T08:19:15Z) - SOD: Step-wise On-policy Distillation for Small Language Model Agents [32.49707795291693]
ツール統合推論は、小さな言語モデルにスケールすることが難しい。
近年,教師から密集したトークンレベルの監督を施すことで,オンライン蒸留が普及している。
スモールランゲージモデルエージェントのための段階的オンライン蒸留フレームワークであるSODを提案する。
論文 参考訳(メタデータ) (2026-05-08T13:30:42Z) - Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning [16.244366307890832]
textbfDeepLatent Reasoning(DLR)を提案する。
このフレームワークは、試行錯誤コストを、高価なトークンレベルのフルシーケンス生成から連続潜在多様体へシフトさせる。
実験により、DLRはより安定した訓練収束を実現し、より長い水平推論チェーンをサポートし、推論能力の持続的な蓄積を促進することが示されている。
論文 参考訳(メタデータ) (2026-01-24T03:18:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。