論文の概要: Pivot-SD: Efficient Self-Distillation for Masked Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2610.03665v1
- Date: Fri, 02 Oct 2026 17:37:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.532948
- Title: Pivot-SD: Efficient Self-Distillation for Masked Diffusion Language Models
- Title(参考訳): Pivot-SD:masked Diffusion Languageモデルのための効率的な自己蒸留
- Abstract要約: マスク付き拡散言語モデル(dLM)は、複雑な推論のために自己回帰モデルに代わる有望な並列性を提供する。
dLMのトレーニング後レシピのほとんどは、どのトークンをトレーニングするかを決定するためにこの信号を使用しない。
本稿では,これらの高インパクトコミットメントのみを監督する効率的なオフライン自己蒸留フレームワークであるPivot-SDを紹介する。
- 参考スコア(独自算出の注目度): 39.211072068858414
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Masked diffusion language models (dLMs) offer a promising parallel alternative to autoregressive models for complex reasoning. However, they face a distinct credit-assignment challenge, since a few commitments during denoising sharply reduce the uncertainty over the remaining masked positions and shape much of the response. Most post-training recipes for dLMs do not use this signal to decide which tokens to train on: they typically train on the final text or assign rewards to whole denoising steps, rather than selecting the individual commitments that shape the response. We introduce Pivot-SD, an efficient offline self-distillation framework that supervises only these high-impact commitments (pivots). Pivot-SD selects pivots using an information-gain metric measuring uncertainty reduction over the remaining masked positions. Pivots from successful trajectories are trained with cross-entropy, and pivots from failed trajectories with targeted unlikelihood, leaving the rest of the failed trajectory untouched. Using only 200 questions and four rollouts each, Pivot-SD improves LLaDA-8B-Instruct over full-sequence SFT and budget-matched diffusion RL baselines across math and code benchmarks.
- Abstract(参考訳): マスク付き拡散言語モデル(dLM)は、複雑な推論のために自己回帰モデルに代わる有望な並列性を提供する。
しかし、デノイング中のいくつかのコミットメントは、残りのマスクされた位置に対する不確実性を著しく減らし、応答の大部分を形作るため、クレジット割り当ての難しさに直面している。
dLMのトレーニング後のほとんどのレシピは、どのトークンをトレーニングするかを決定するためにこの信号を使用しません。
我々は、これらの高インパクトコミットメント(pivots)のみを監督する効率的なオフライン自己蒸留フレームワークであるPivot-SDを紹介する。
Pivot-SDは、残りのマスキング位置に対する不確かさを計測する情報ゲイン計量を用いてピボットを選択する。
成功した軌跡からのピボットはクロスエントロピーで訓練され、失敗した軌跡からのピボットは目標と異なる方向を向いており、残りの軌跡は触れられていない。
Pivot-SDは200の質問と4つのロールアウトしか使用せず、LLaDA-8B-InstructをフルシーケンスのSFTと予算に適合した拡散RLベースラインよりも改善している。
関連論文リスト
- Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models [59.51249894128724]
マスク付き拡散言語モデルは、反復を識別するごとに複数のトークンを明らかにすることで推論ステップを削減することができる。
パラレルマスク拡散復号法のためのトレーニング不要な復号法であるADASを提案する。
論文 参考訳(メタデータ) (2026-06-09T13:17:27Z) - Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models [65.89572755202245]
拡散言語モデル(DLM)は、より強力なグローバル認識と高い並列生成を提供する。
標準負のエビデンス下界(NELBO)に基づく教師付き微調整後のDLMは非効率である。
そこで本研究では,学習を推論の容易かつハードな構造に整合させる,自己蒸留軌道に基づくポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T09:39:06Z) - Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - Learning Unmasking Policies for Diffusion Language Models [33.44995119635116]
言語モデル(dLLM)は、多くのタスクにおいて、自己回帰的な処理の下流のパフォーマンスにマッチする。
特別なマスクトークンで満たされたバッファが、モデルの語彙からサンプリングされたトークンに徐々に置き換えられる。
本研究では,強化学習を用いたサンプリング手順の訓練を提案する。
論文 参考訳(メタデータ) (2025-12-09T20:44:33Z) - BOTS: A Unified Framework for Bayesian Online Task Selection in LLM Reinforcement Finetuning [82.925106913459]
強化微調整(Reinforcement Finetuning, RFT)は、大規模言語モデル(LLM)を人間の嗜好と整合させ、推論を強化するための重要な手法である。
RFT強化微調整におけるベイズオンラインタスク選択のための統合フレームワークBOTSを紹介する。
論文 参考訳(メタデータ) (2025-10-30T11:15:23Z) - Plan for Speed: Dilated Scheduling for Masked Diffusion Language Models [13.575063025878208]
マスク付き拡散言語モデルは高速で非自己回帰的なテキスト生成を約束する。
モデルの信頼性に基づいてアンマスクするトークンを選択する既存のサンプルは、複数の位置を並列にアンマスクする際のインタラクションを無視する。
DUS(Dilated Unmasking Scheduler)は、列位置を非隣接拡張群に分割し、それらを並列に分割する推論のみのプランナーフリーな手法である。
論文 参考訳(メタデータ) (2025-06-23T18:49:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。