論文の概要: D-Loop: Looped Diffusion Drafting for Speculative Decoding
- arxiv url: http://arxiv.org/abs/2610.06011v1
- Date: Mon, 05 Oct 2026 09:08:24 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:47:31.683094
- Title: D-Loop: Looped Diffusion Drafting for Speculative Decoding
- Title(参考訳): D-Loop: 投機的復号のためのループ拡散ドラフト
- Abstract要約: ブロック拡散は、1つのフォワードパスで複数のトークンを起草することで投機的復号化を加速する。
各位置は、以前の提案されたトークンを観察せずに限界分布を予測し、ドラフト品質と受け入れ長を制限する。
最近の手法では、追加の因果頭部または別々に訓練されたドラフトナーで限界予測を洗練させる。
D-Loopを提案する。これは、モデルコンポーネントを追加せずにオリジナルの拡散プロダクタ内にエンピントラブロック因果条件を導入する。
- 参考スコア(独自算出の注目度): 40.63736504523389
- License:
- Abstract: Block diffusion accelerates speculative decoding by drafting multiple tokens in one forward pass. However, each position predicts a marginal distribution without observing earlier proposed tokens, limiting draft quality and acceptance length. We identify a concrete failure, the \emph{repetition trap}, in which neighboring positions produce redundant copies of the same token. We explain this tendency theoretically and empirically examine its association with shorter accepted drafts. Recent methods refine marginal predictions with an additional causal head or a separately trained drafter, increasing parameter storage and introducing separate training objectives. We instead propose D-Loop, which introduces \emph{intra-block causal conditioning} within the original diffusion drafter without additional model components. Inspired by semi-autoregressive generation and parameter sharing, D-Loop reuses the same backbone across looped passes. The first pass proposes a block, and the second conditions on a selected prefix to regenerate the suffix in parallel. A complementary prefix--suffix objective trains the shared drafter for both anchor-only prefix prediction and prefix-conditioned suffix prediction. Across eight math, code, and chat benchmarks, D-Loop can beat DFlash and DSpark on Qwen3-4B and Qwen3-8B with obvious gains.
- Abstract(参考訳): ブロック拡散は、1つのフォワードパスで複数のトークンを起草することで投機的復号化を加速する。
しかし,各位置は従来提案されていたトークンを観測することなく限界分布を予測し,ドラフト品質と受入長を制限した。
我々は、隣接する位置が同じトークンの重複コピーを生成する具体的な失敗である 'emph{repetition trap} を特定する。
この傾向を理論的・実証的に説明し,短い草案との関連性について考察する。
最近の手法では、追加の因果頭部または別々に訓練されたドラフトアで限界予測を洗練させ、パラメータ記憶を増大させ、個別の訓練目標を導入する。
そこで我々は,D-Loopを提案する。D-Loopは,モデルコンポーネントを追加することなく,元の拡散ドラフトラ内に \emph{intra-block causal conditioning} を導入する。
半自己回帰生成とパラメータ共有にインスパイアされたD-Loopは、ループされたパスで同じバックボーンを再利用する。
第1のパスはブロックを提案し、第2の条件は選択されたプレフィックス上でサフィックスを並列に再生する。
補完的な接頭辞-接頭辞対象は、アンカーのみの接頭辞予測と接頭辞条件の接頭辞予測の両方のために共有ドラフトアを訓練する。
8つの数学、コード、チャットのベンチマークで、D-LoopはQwen3-4BとQwen3-8BでDFlashとDSparkに勝てる。
関連論文リスト
- When Parallel Drafter Meets Parallel Speculative Decoding [30.84797800779407]
DParaは効果的な並列ドラフトを再利用するフレームワークだが、バックボーンは保証されている。
Qwen3-8B と Qwen3-14B の実験では、DPara の平均速度は3.21times$と3.52times$である。
論文 参考訳(メタデータ) (2026-09-23T05:53:48Z) - DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding [26.72775347772003]
対象サンプリング分布のエントロピーが増加するにつれて,受理されたドラフト長が劣化することを示す。
本稿では,トークン位置上での低ランク遅延混合に基づいて,受入指向の学習目標を補完する依存ブロック起草手法を提案する。
論文 参考訳(メタデータ) (2026-08-05T22:49:54Z) - xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding [15.519504114030221]
ブロック拡散型ドラフトラは、1つのフォワードパスで、ドラフトトークンのブロック全体を生成する。
拡散型ドラフトラにおいて欠落した因果関係を復元する手段としてxPressを提案する。
論文 参考訳(メタデータ) (2026-08-03T16:18:22Z) - PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding [98.71600061506206]
PRESTOは、木ベースのドラフトを拡散ドラフトラに拡張する、原則化されたフレームワークである。
PRESTOは、最先端の専用拡散プロダクタSD上で、平均1.5タイムのエンドツーエンドスループットのスピードアップを達成する。
論文 参考訳(メタデータ) (2026-06-20T14:32:14Z) - D^2SD: Accelerating Speculative Decoding with Dual Diffusion Draft Models [27.44373450962651]
最近の拡散ベースのドラフトラはトークンのブロック全体を並列に生成するが、通常は検証毎に単一のドラフトシーケンスにコミットする。
D2SDは,候補を信頼誘導プレフィックスツリーに整理する,二重拡散ドラフト投機的復号化フレームワークである。
結果として得られた共有誘導候補は、カスケードの注意を通して共同で検証される。
論文 参考訳(メタデータ) (2026-06-03T04:48:00Z) - TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding [32.75269650141292]
投機的復号化のためのワンショットブロックのドラフトは、1つのフォワードパスで完全なドラフトを生成する。
それぞれのドラフトトークンはプレフィックスコンテキストのみに条件付けされ、以前のドラフトトークンに依存しない。
この非自己回帰条件は、ドラフトの深さが大きくなるにつれて、検証者の真の自己回帰分布からドラフトの分布が分岐する。
そこで我々は,この問題に対処するために,プロダクタの隠蔽状態とそれ以前のトークンに条件付きレイヤを組み込んで,自己回帰分布を近似するTreeFlashを提案する。
論文 参考訳(メタデータ) (2026-06-02T16:00:18Z) - D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting [59.204113363599994]
投機的復号化は、小さなドラフト作成者がより大きなターゲットモデルが並列に検証するトークンを提案することによって推論を加速する。
最近の拡散ベースの並列ドラフトア(DFlashなど)は、1つの前方パスで完全なB-tokenブロックを予測し、より深いドラフトアとより長い許容ブロックを可能にする。
各位置の重みと、その対数確率の寄与とを一致させて、期待されるドラフト長の相違可能なサロゲートから、位置毎のトレーニングウェイトを導出する。
6つのベンチマークと2つのQwen3-4Bドラフト深度、2つの復号温度、2つの追加ターゲットモデル、D-PACEは一貫してウォールクロックのスピードアップと平均の両方を改善している。
論文 参考訳(メタデータ) (2026-05-12T06:27:57Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion [61.03681839276652]
拡散強制(Diffusion Forcing)は、拡散モデルをトレーニングし、トークンの集合に独立した音レベルを付与する、新たなトレーニングパラダイムである。
因果的次トーケン予測モデルを訓練して1つまたは複数の未来のトークンを生成することで、シーケンス生成モデルに拡散強制を適用する。
論文 参考訳(メタデータ) (2024-07-01T15:43:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。