論文の概要: Accelerating Speculative Decoding with Block Diffusion Draft Trees
- arxiv url: http://arxiv.org/abs/2604.12989v1
- Date: Tue, 14 Apr 2026 17:23:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-15 19:11:32.583303
- Title: Accelerating Speculative Decoding with Block Diffusion Draft Trees
- Title(参考訳): ブロック拡散ドラフトツリーによる投機的デコーディングの高速化
- Authors: Liran Ringel, Yaniv Romano,
- Abstract要約: 投機的復号化は、軽量なドラフトラを使って複数の未来のトークンを提案することで、自己回帰言語モデルを加速する。
DFlashは、ブロック拡散ドラフトラが1つのフォワードパスでドラフトブロック全体を生成することができることを示している。
Vanilla DFlashは、ラウンド毎に1つのドラフトされた軌道のみを検証する。
DDTreeは,ブロック拡散型ドラフトラの配置分布から直接ドラフトツリーを構築する手法である。
- 参考スコア(独自算出の注目度): 20.28933257827737
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speculative decoding accelerates autoregressive language models by using a lightweight drafter to propose multiple future tokens, which the target model then verifies in parallel. DFlash shows that a block diffusion drafter can generate an entire draft block in a single forward pass and achieve state-of-the-art speculative decoding performance, outperforming strong autoregressive drafters such as EAGLE-3. Vanilla DFlash, however, still verifies only a single drafted trajectory per round, potentially limiting its acceptance length. We introduce DDTree (Diffusion Draft Tree), a method that constructs a draft tree directly from the per-position distributions of a block diffusion drafter. Under a fixed node budget, DDTree uses a simple best-first heap algorithm to select the continuations that are most likely to match the target model according to a surrogate defined by the draft model's output. The resulting tree is verified efficiently in a single target model forward pass using an ancestor-only attention mask. Because DDTree builds on DFlash, a leading draft model for speculative decoding, these gains place DDTree among the leading approaches to speculative decoding.
- Abstract(参考訳): 投機的復号化は、軽量なドラフトラを使用して複数の将来のトークンを提案し、ターゲットモデルが並列に検証することで、自己回帰言語モデルを加速させる。
DFlashは、ブロック拡散ドラフトラが1つのフォワードパスでドラフトブロック全体を生成し、最先端の投機的復号化性能を実現し、ERGLE-3のような強力な自己回帰的ドラフトラよりも優れていることを示す。
しかしながら、Vanilla DFlashは、ラウンド毎に1つのドラフトされた軌道のみを検証し、受け入れ期間を制限している可能性がある。
DDTree(Diffusion Draft Tree)は,ブロック拡散ドラフトラの配置分布から直接ドラフトツリーを構築する手法である。
固定ノード予算の下では、DDTreeは単純な最優先ヒープアルゴリズムを使用して、ドラフトモデルの出力によって定義されたサロゲートに従って、ターゲットモデルに最もマッチする可能性のある継続を選択する。
結果のツリーは、祖先のみの注目マスクを用いて、単一のターゲットモデルフォワードパスで効率よく検証される。
DDTreeは投機的復号化のための主要なドラフトモデルであるDFlash上に構築されているため、DDTreeは投機的復号化における主要なアプローチとなっている。
関連論文リスト
- Fast Inference of Visual Autoregressive Model with Adjacency-Adaptive Dynamical Draft Trees [50.230925890958936]
本稿では,隣接するトークン状態と先行受入率を活用することで,ドラフトツリーの深さと幅を調整できる適応型動的ドラフトツリーを提案する。
ADT-Treeは、それぞれ3.13xと3.05xのスピードアップを実現し、LANTERNのような緩やかなサンプリング手法とシームレスに統合する。
論文 参考訳(メタデータ) (2025-12-26T04:45:49Z) - Fast Inference via Hierarchical Speculative Decoding [65.40448210801763]
階層的投機的復号法(HSD)は,各モデルがトークンを提案し,次に大きなモデルが1つのフォワードパスで検証する階層構造に,ドラフトモデルを積み重ねるアルゴリズムである。
HSDは最高の単軸ベースラインよりも1.2倍のスピードアップを達成している。
論文 参考訳(メタデータ) (2025-10-22T15:56:19Z) - Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs [63.82840470917859]
本稿では,dLLMの復号化機構をモデル属性の強力なツールとして利用できることを示す。
本稿では、デコードステップ間の構造的関係を捉え、モデル固有の振る舞いをよりよく明らかにする、DDM(Directed Decoding Map)と呼ばれる新しい情報抽出手法を提案する。
論文 参考訳(メタデータ) (2025-10-02T06:25:10Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - RASD: Retrieval-Augmented Speculative Decoding [5.3926068062773895]
投機的復号化は大規模言語モデル(LLM)における推論を加速する
本稿では,モデルに基づく投機的復号化を促進する検索手法を採用したRASD(Retrieval-Augmented Speculative Decoding)を提案する。
論文 参考訳(メタデータ) (2025-03-05T12:10:14Z) - OPT-Tree: Speculative Decoding with Adaptive Draft Tree Structure [40.9990864658776]
投機的復号には、複数のトークンを1ステップで生成できるようにする"ドラフトと検証"機構が使用されている。
既存の手法は主に固定されたドラフト構造を採用しており、異なる状況に適応できない。
我々は適応的でスケーラブルなドラフトツリーを構築するアルゴリズムであるOPT-Treeを提案する。
論文 参考訳(メタデータ) (2024-06-25T04:45:53Z) - Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative Decoding [65.94521678103237]
投機的復号化(英: Speculative decoding)は、大規模言語モデルの生成プロセスを加速する広く使われている手法である。
我々は,草案作成プロセスの並列化のために,草案文を生成するOuroborosを紹介した。
ウロボロは投機的復号化で最大2.8倍、バニラ復号化で3.9倍のスピードアップを達成できる。
論文 参考訳(メタデータ) (2024-02-21T11:31:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。