論文の概要: Spec-AUF: Accept-Until-Fail Training under Train-Inference Misalignment for Masked Block Drafters
- arxiv url: http://arxiv.org/abs/2607.01893v1
- Date: Thu, 02 Jul 2026 08:44:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.748973
- Title: Spec-AUF: Accept-Until-Fail Training under Train-Inference Misalignment for Masked Block Drafters
- Title(参考訳): Spec-AUF:マズークブロックドローターの列車ミスアライメントにおけるアクセプション・アンティル・フェイルトレーニング
- Abstract要約: ブロック(DLMスタイル)のドラフトラは、全ブロックを並列に予測し、高速だがフルブロックのクロスエントロピーでトレーニングする。
最近の受け入れ認識の目的は、全ブロック損失を再重み付けすることで、この問題に対処する。
AUFは、ドラフト作成者が最初に予測した失敗を通してのみ、クロスエントロピーのサポートを維持することで、損失側のプレフィックスセンシティブな監視を近似する。
- 参考スコア(独自算出の注目度): 3.9513930662588863
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speculative decoding accelerates autoregressive generation by drafting a block of tokens that the target model verifies left-to-right, committing only the longest accepted prefix. Block (DLM-style) drafters predict the whole block in parallel, which is fast but trained with a full-block cross-entropy that supervises every position against the gold continuation -- even though inference discards every token after the first rejection. Recent acceptance-aware objectives patch this by reweighting the full-block loss; we instead use teacher-forced learning as a motivation for how supervision should concentrate on the accepted prefix. A mask-only block drafter has no input-side channel for gold-prefix conditioning, so AUF approximates that prefix-sensitive supervision on the loss side by keeping the cross-entropy support only through the drafter's first predicted failure. AUF is a single, detached change to the CE support -- no auxiliary objective, no verifier rollouts, and no change to the inference pipeline or the exactness contract. Within fixed drafter backbones and serving settings on Qwen3-8B, AUF raises the DFlash drafter's average emitted length $τ$, averaged over six benchmarks, from 2.40 to 2.61, with a gain on every benchmark, and transfers to Domino's two-branch head (2.56 to 2.68). Two findings sharpen the picture: the decay-only baseline reaches higher token accuracy on the shared block mask yet decodes worse, and on DFlash, once AUF truncates the support, the standard exponential position-decay weighting becomes empirically inert.
- Abstract(参考訳): 投機的復号化は、ターゲットモデルが左から右に検証するトークンのブロックを起草することで自己回帰生成を加速し、最も長いプレフィックスのみをコミットする。
ブロック(DLMスタイル)のドラフトラは、ブロック全体を並列に予測します。高速ですが、フルブロックのクロスエントロピーでトレーニングされています。
近年の受入意識は,全ブロック損失を再重み付けすることでこの問題に対処し,教師が指導する学習を,受入前置詞にどのように集中すべきかのモチベーションとして活用している。
マスクのみのブロックドラフトラは、ゴールドプリフィックス条件付けのための入力側チャネルを持たないので、AUFは、ドラフトラが最初に予測した失敗を通してのみ、クロスエントロピーのサポートを保持することにより、損失側のプレフィックスセンシティブな監視を近似する。
AUFはCEサポートの分離された1つの変更 -- 補助的な目的もなく、検証対象のロールアウトもなく、推論パイプラインや正確性契約も変更されない。
固定されたドラフトナバックボーンとQwen3-8Bのサービス設定の中で、AUFはDFlashドラフトナの平均出力長$τ$を2.40から2.61まで6ベンチマークに引き上げ、ドミノの2ブランチヘッド(2.56から2.68)に転送する。
DFlashでは、AUFが支持を断ち切ると、標準指数的位置ずれ重み付けは経験的に不活性になる。
関連論文リスト
- Ceiling-Clipped Acceptance Histograms Indicate Stranded Speed-up in Block-Diffusion Speculative Decoding [0.008640713300591884]
投機的復号化は効率的なドラフトモデルによる生成を高速化する(後述)
DFlashやDFlareのような高速なブロック拡散ドラフトラは、ブロック全体を1つの並列パスで埋める。
我々は、新しく公開された位置を強調する短いカリキュラムで、より長いブロックでドラフト作成者の訓練を後押しする。
論文 参考訳(メタデータ) (2026-08-31T08:23:14Z) - Verification-Aware Training for Speculative Decoding [57.84976863792784]
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
論文 参考訳(メタデータ) (2026-08-31T01:42:10Z) - From Positionwise Confidence to Prefix Scheduling: Verifier Skipping in Speculative Decoding [41.41611499810411]
投機拡散復号(SDD)は、離散拡散モデルと並行してドラフトブロック内のすべての位置を生成する。
本稿では,これが新しい制御ハンドルを生成することを認識している。
論文 参考訳(メタデータ) (2026-08-14T18:00:08Z) - CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference [24.176666448303095]
拡散言語モデルは、多くのトークンを並列に更新するが、実用的なデコーダは、しばしば固定されたdenoising horizonを使用する。
本研究では,CORA-Diffを提案する。CORA-Diffは,元のトランスファールールを保護し,ルールが未解決な位置にのみ信頼とパーシステンスをゲーティングする訓練自由法である。
その結果,タスク品質を保ったままの繰り返し認知を低減し,信頼感と持続性が確実な残留受容を可能にすることが示唆された。
論文 参考訳(メタデータ) (2026-07-31T07:32:10Z) - FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models [16.404926372068047]
ブロックワイド拡散大言語モデル (dLLM) はブロックレベルで逐次デコードし、ブロック間で有効なKVキャッシュの再利用を可能にするが、ブロック間デコーディングを厳密にシリアライズする。
2つのメカニズム上に構築されたトレーニング不要な並列デコーディングフレームワークである textbfflowblock を提案する。
LLaDA-2.1とLLaDA-2.0の2つのシリアルブロック単位のdLLMを最大2.95$times$と4.01$times$に改善し、レイテンシを最大53.6%、77.1%削減した。
論文 参考訳(メタデータ) (2026-07-20T08:05:03Z) - Teaching Diffusion to Speculate Left-to-Right [3.205247598097648]
大規模言語モデル(LLM)は、幅広いタスクにわたって顕著なパフォーマンスを達成するが、その自己回帰的復号処理は、かなりの推論コストを発生させる。
投機的復号化はこのボトルネックに対処するため、軽量なドラフトモデルを使用して、後により大きなターゲットモデルによって並列に検証される複数の将来のトークンを提案する。
最近の研究は、拡散言語モデルがこの設定に適しており、パラレルでドラフトトークンのブロック全体を生成できることを実証している。
論文 参考訳(メタデータ) (2026-06-10T01:21:56Z) - D^2SD: Accelerating Speculative Decoding with Dual Diffusion Draft Models [27.44373450962651]
最近の拡散ベースのドラフトラはトークンのブロック全体を並列に生成するが、通常は検証毎に単一のドラフトシーケンスにコミットする。
D2SDは,候補を信頼誘導プレフィックスツリーに整理する,二重拡散ドラフト投機的復号化フレームワークである。
結果として得られた共有誘導候補は、カスケードの注意を通して共同で検証される。
論文 参考訳(メタデータ) (2026-06-03T04:48:00Z) - OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification [21.095025092772257]
On-Policy Distillation (OPD)は、強力な教師からの密集したトークンレベルフィードバックの下で、生徒モデルを自身の生成軌道上で訓練する。
OmniOPDはロジットフリーでチャンクレベルの監視信号を通じて両方の制限に対処する新しいフレームワークである。
論文 参考訳(メタデータ) (2026-05-31T22:31:15Z) - Prefix-Adaptive Block Diffusion for Efficient Document Recognition [52.15352911463151]
ブロック拡散モデル(BDM)は並列生成、フレキシブルな出力、KVキャッシュをサポートし、効率的な文書解析を約束する。
本稿では,前置詞から接尾辞への因果表記に代えて,ブロック内双方向化を代替するPrefix-Block Diffusion Model (PA-BDM)を提案する。
実験の結果、3B PA-BDMはいくつかのベンチマークで高い認識スコアを達成し、2.5B MinerU-Diffusionに対して推論スループットを71.6%向上した。
論文 参考訳(メタデータ) (2026-05-16T07:50:13Z) - D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting [59.204113363599994]
投機的復号化は、小さなドラフト作成者がより大きなターゲットモデルが並列に検証するトークンを提案することによって推論を加速する。
最近の拡散ベースの並列ドラフトア(DFlashなど)は、1つの前方パスで完全なB-tokenブロックを予測し、より深いドラフトアとより長い許容ブロックを可能にする。
各位置の重みと、その対数確率の寄与とを一致させて、期待されるドラフト長の相違可能なサロゲートから、位置毎のトレーニングウェイトを導出する。
6つのベンチマークと2つのQwen3-4Bドラフト深度、2つの復号温度、2つの追加ターゲットモデル、D-PACEは一貫してウォールクロックのスピードアップと平均の両方を改善している。
論文 参考訳(メタデータ) (2026-05-12T06:27:57Z) - From Next-Token to Next-Block: A Principled Adaptation Path for Diffusion LLMs [58.640039233470766]
原理的AR-to-block-diffusion適応は,DLMをスクラッチからトレーニングする上で,有効かつ効率的な代替手段であることを示す。
NBDiff-7B(BaseとInstruct)は、長文のモデリングと推論機能を継承し、最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-12-07T10:28:21Z) - Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding [73.67253077506672]
大規模言語モデル(LLM)は、優れた生成品質を提供するが、非常に高い推論コストをもたらす。
早期排他的自己投機的復号法(EESD)がこのコストを軽減するために登場した。
ドラフトと検証作業を完全にパイプライン化するパイプライン・パラレル自己スペクティブ・デコーディング(PPSD)を提案する。
論文 参考訳(メタデータ) (2025-09-19T04:51:41Z) - Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding [60.06816407728172]
離散拡散言語モデルは、テキスト生成に強い可能性を示している。
半自己回帰推論による微調整ミスアライメントの標準化
我々は、応答を固定サイズブロックに分割するBlockwise SFTを提案する。
論文 参考訳(メタデータ) (2025-08-27T02:49:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。