論文の概要: GRAFT: Adaptive DLM-Based Draft Tree Construction with Target-Distilled Edge Scoring
- arxiv url: http://arxiv.org/abs/2608.20375v1
- Date: Wed, 24 Jun 2026 03:06:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.289048
- Title: GRAFT: Adaptive DLM-Based Draft Tree Construction with Target-Distilled Edge Scoring
- Title(参考訳): GRAFT:ターゲット蒸留エッジスコーリングを用いた適応DLMベースドラフトツリーの構築
- Abstract要約: ツリーベースの投機的復号化は、複数のドラフトパスを検証することによって、標準投機的復号化の平均的なトークンを上昇させる。
DDTreeはこのギャップを、各将来の配置分布からの高確率トークンを候補ノードとして扱うことで埋める。
我々は,DLMに基づく投機的復号化のためのドラフトツリー構築フレームワークであるGRAFTを提案する。
- 参考スコア(独自算出の注目度): 14.757882467079853
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tree-based speculative decoding raises the mean accepted tokens of standard speculative decoding by verifying multiple draft paths, and existing tree builders typically construct these paths through parent-conditioned expansion, where each child token is generated conditioned on its parent path. This construction is incompatible with diffusion language model (DLM) drafters such as DFlash, which produces all future-position distributions in a single forward pass. DDTree bridges this gap by treating high-probability tokens from each future-position distribution as candidate nodes and selecting edges between consecutive positions under a fixed node budget. However, its edge selection relies on token probability alone without modeling parent--child compatibility, so target-compatible tokens can be attached to wrong parents; moreover, its fixed budget ignores that the throughput-optimal tree size varies with the decoding state. We propose GRAFT, a draft-tree construction framework for DLM-based speculative decoding. GRAFT introduces Target-Distilled Edge Scoring (TDES), which distills parent--child preferences from target-model traces to select target-compatible edges, and State-Aware Budget Allocation (SABA), which sets the per-round tree budget by balancing expected draft gain against verification cost. Across multiple models and tasks, GRAFT achieves $2.13\times$--$6.36\times$ end-to-end speedup over autoregressive decoding while adding less than $0.5$\,ms of overhead per round, approximately $1.4\%$ of the target-model verification latency.
- Abstract(参考訳): ツリーベースの投機的復号化は、複数のドラフトパスを検証することで標準投機的復号化の平均的なトークンを上昇させる。
この構造は、DFlashのような拡散言語モデル(DLM)のドラフトと互換性がない。
DDTreeはこのギャップを、各将来の配置分布からの高確率トークンを候補ノードとして扱い、固定ノード予算の下で連続した位置間のエッジを選択することで埋める。
しかし、エッジの選択は、親子互換をモデル化せずにトークンの確率のみに依存するため、ターゲット互換トークンを間違った親にアタッチすることができる。
我々は,DLMに基づく投機的復号化のためのドラフトツリー構築フレームワークであるGRAFTを提案する。
GRAFTは、ターゲットモデルトレースから親子選好を抽出してターゲット互換エッジを選択するTDES(Target-Distilled Edge Scoring)と、期待されるドラフト利得と検証コストのバランスをとることで、概ねツリー予算を設定するSABA(State-Aware Budget Allocation)を導入している。
複数のモデルとタスクにわたって、GRAFTは自動回帰復号よりも2.13\times$-6.36\times$ end-to-end speedupを達成し、1ラウンドあたり0.5$\,ms未満のオーバーヘッドを追加し、目標モデルの検証レイテンシの約1.4\%を達成している。
関連論文リスト
- TreeSpark: Calibrated, Load-Adaptive Draft Trees for Semi-Autoregressive Speculative Decoding [3.210063008779709]
TreeSparkは、ドラフトアの既存のMarkovヘッドから、無視可能なコストで、親条件のディストリビューションを読み取る。
TreeSparkは1ラウンドあたり15~25%のドラフトトークンを受け入れ、単一要求のウォールクロックで8~14%高速にデコードする。
論文 参考訳(メタデータ) (2026-08-12T05:30:46Z) - PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding [98.71600061506206]
PRESTOは、木ベースのドラフトを拡散ドラフトラに拡張する、原則化されたフレームワークである。
PRESTOは、最先端の専用拡散プロダクタSD上で、平均1.5タイムのエンドツーエンドスループットのスピードアップを達成する。
論文 参考訳(メタデータ) (2026-06-20T14:32:14Z) - Cost-Aware Diffusion Draft Trees for Speculative Decoding [17.900184934329666]
textbfCaDDTree (Cost-aware Diffusion Draft Tree) は,木構造とノード予算を協調的に選択することで,トークンスループット(単位時間当たりの予測トークン)を直接最適化する手法である。
Qwen3-4BとQwen3-8Bの実験では、推論、コーディング、命令追従タスクにまたがる8つのベンチマークで、caDDTreeがDDTreeとほぼ全てのタスクでオラクルの予算選択と一致または上回っていることが示されている。
論文 参考訳(メタデータ) (2026-06-01T07:29:56Z) - Bastion: Budget-Aware Speculative Decoding with Tree-structured Block Diffusion Drafting [36.83545196908392]
BASTIONは、ツリーベースの拡散ドラフトを備えた、予算対応の投機的デコーディングフレームワークである。
本フレームワークは,(1)経路信頼度によって予測される受理長を推定する受理サロゲート,(2)ハードウェアを意識した屋上モデルのキャリブレーションを行うオンライン遅延推定器,(3)積算検証コストを正当化しなくなるまで木を成長させる適応的最優先拡張の3つの相乗的要素を統合する。
論文 参考訳(メタデータ) (2026-05-28T10:21:34Z) - D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting [59.204113363599994]
投機的復号化は、小さなドラフト作成者がより大きなターゲットモデルが並列に検証するトークンを提案することによって推論を加速する。
最近の拡散ベースの並列ドラフトア(DFlashなど)は、1つの前方パスで完全なB-tokenブロックを予測し、より深いドラフトアとより長い許容ブロックを可能にする。
各位置の重みと、その対数確率の寄与とを一致させて、期待されるドラフト長の相違可能なサロゲートから、位置毎のトレーニングウェイトを導出する。
6つのベンチマークと2つのQwen3-4Bドラフト深度、2つの復号温度、2つの追加ターゲットモデル、D-PACEは一貫してウォールクロックのスピードアップと平均の両方を改善している。
論文 参考訳(メタデータ) (2026-05-12T06:27:57Z) - Accelerating Speculative Decoding with Block Diffusion Draft Trees [20.28933257827737]
投機的復号化は、軽量なドラフトラを使って複数の未来のトークンを提案することで、自己回帰言語モデルを加速する。
DFlashは、ブロック拡散ドラフトラが1つのフォワードパスでドラフトブロック全体を生成することができることを示している。
Vanilla DFlashは、ラウンド毎に1つのドラフトされた軌道のみを検証する。
DDTreeは,ブロック拡散型ドラフトラの配置分布から直接ドラフトツリーを構築する手法である。
論文 参考訳(メタデータ) (2026-04-14T17:23:14Z) - TALON: Confidence-Aware Speculative Decoding with Adaptive Token Trees [18.53532655905144]
投機的復号化(SD)は、出力品質を犠牲にすることなくLPM推論を高速化する標準技術となっている。
我々は、既存のツリーベースの手法にプラグイン可能な、トレーニングフリーで予算駆動の適応木拡張フレームワークであるTALONを紹介した。
TALONは最先端のイーグル3より一貫して優れており、自動回帰復号よりも最大5.16倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-01-12T09:26:45Z) - Fast Inference of Visual Autoregressive Model with Adjacency-Adaptive Dynamical Draft Trees [50.230925890958936]
本稿では,隣接するトークン状態と先行受入率を活用することで,ドラフトツリーの深さと幅を調整できる適応型動的ドラフトツリーを提案する。
ADT-Treeは、それぞれ3.13xと3.05xのスピードアップを実現し、LANTERNのような緩やかなサンプリング手法とシームレスに統合する。
論文 参考訳(メタデータ) (2025-12-26T04:45:49Z) - Fast Inference via Hierarchical Speculative Decoding [65.40448210801763]
階層的投機的復号法(HSD)は,各モデルがトークンを提案し,次に大きなモデルが1つのフォワードパスで検証する階層構造に,ドラフトモデルを積み重ねるアルゴリズムである。
HSDは最高の単軸ベースラインよりも1.2倍のスピードアップを達成している。
論文 参考訳(メタデータ) (2025-10-22T15:56:19Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。