論文の概要: Trees from Marginals: Autoregressive drafting with factorized priors
- arxiv url: http://arxiv.org/abs/2607.06763v2
- Date: Sun, 12 Jul 2026 19:52:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 13:33:35.677356
- Title: Trees from Marginals: Autoregressive drafting with factorized priors
- Title(参考訳): Marginalsのツリー: 要因付き前置詞による自己回帰的起草
- Authors: Yuma Oda, Ryan Mathieu, Roman Knyazhitskiy, Artur Chakhvadze,
- Abstract要約: 投機的復号化は自己回帰言語モデルの相互作用性を大幅に向上させる。
我々はWeaverを紹介した。Weaverは軽量な自動回帰アダプタで、分解されたドラフトの上位K縁から提案ツリーを構築する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speculative decoding greatly increases the interactivity of autoregressive language models by trading off computation for extra tokens generated in a single forward pass. Factorized draft models are especially efficient because they predict future-token marginals in parallel, but their independence assumption causes acceptance rates to degrade sharply as the speculative budget grows. We analyze this limitation and introduce Weaver, a lightweight autoregressive adapter that constructs proposal trees from the top-K marginals of a factorized drafter. Weaver restores conditional dependencies between proposed tokens while avoiding a full-vocabulary projection. To support fast verification for models with Gated Delta Net layers, we derive a rollback-free tree-verification algorithm and implement optimized CUDA kernels in SGLang. By combining these model and systems contributions we achieve a 4.37-fold speedup over autoregressive decoding, and outperform a highly optimized DFlash baseline by 24.7%.
- Abstract(参考訳): 投機的復号化は、1つのフォワードパスで生成された余分なトークンの計算をオフにすることで自己回帰言語モデルの相互作用性を大幅に向上させる。
因子化されたドラフトモデルは、将来的な限界を並列に予測するため、特に効率的であるが、その独立性の仮定は、投機的予算が増加するにつれて、受け入れ率を急激に低下させる。
この制限を解析してWeaverを導入する。これは軽量な自己回帰型アダプタで、分解された草案の上位K縁から提案木を構築する。
Weaverは、完全な語彙投影を避けながら、提案されたトークン間の条件依存を復元する。
Gated Delta Net 層を持つモデルの高速検証を支援するため,ロールバックのないツリー検証アルゴリズムを導出し,SGLang で最適化されたCUDA カーネルを実装した。
これらのモデルとシステムへのコントリビューションを組み合わせることで、自動回帰デコーディングよりも4.37倍のスピードアップを実現し、高度に最適化されたDFlashベースラインを24.7%上回った。
関連論文リスト
- Bastion: Budget-Aware Speculative Decoding with Tree-structured Block Diffusion Drafting [36.83545196908392]
BASTIONは、ツリーベースの拡散ドラフトを備えた、予算対応の投機的デコーディングフレームワークである。
本フレームワークは,(1)経路信頼度によって予測される受理長を推定する受理サロゲート,(2)ハードウェアを意識した屋上モデルのキャリブレーションを行うオンライン遅延推定器,(3)積算検証コストを正当化しなくなるまで木を成長させる適応的最優先拡張の3つの相乗的要素を統合する。
論文 参考訳(メタデータ) (2026-05-28T10:21:34Z) - SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration [13.454534256560558]
投機的復号化は、大規模言語モデルにおける自己回帰推論を加速するための有望なアプローチとして現れている。
そこで本稿では, 早期終了判定において, 温度アニールによる急激な信頼を抑える, 新たなセルフドラフトフレームワークを提案する。
提案手法は,従来の自己回帰復号法に比べて最大2.33倍の高速化を実現する。
論文 参考訳(メタデータ) (2026-04-14T03:47:04Z) - Scaling LLM Speculative Decoding: Non-Autoregressive Forecasting in Large-Batch Scenarios [76.85739138203014]
本稿では,一方向および注目メカニズムを加速する新しいアーキテクチャであるSpecFormerを紹介する。
また,SpecFormerはトレーニング要求の低減と計算コストの削減を実現している。
論文 参考訳(メタデータ) (2025-11-25T14:20:08Z) - Fast Inference via Hierarchical Speculative Decoding [65.40448210801763]
階層的投機的復号法(HSD)は,各モデルがトークンを提案し,次に大きなモデルが1つのフォワードパスで検証する階層構造に,ドラフトモデルを積み重ねるアルゴリズムである。
HSDは最高の単軸ベースラインよりも1.2倍のスピードアップを達成している。
論文 参考訳(メタデータ) (2025-10-22T15:56:19Z) - R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning [80.104336426172]
CoT(Chain-of- Thought)は、大規模言語モデルの問題解決能力を高める。
CoTは長い自己回帰軌道のためにかなりの推論コストを発生させる。
トレーニング不要なハイブリッドデコーディングフレームワークであるR-Stitchを紹介する。
論文 参考訳(メタデータ) (2025-07-23T08:14:36Z) - Graph-Structured Speculative Decoding [52.94367724136063]
投機的復号化は、大規模言語モデルの推論を加速する有望な手法として登場した。
本稿では, 有向非巡回グラフ(DAG)を応用して, 起案された仮説を管理する革新的な手法を提案する。
我々は1.73$times$から1.96$times$に顕著なスピードアップを観察し、標準投機的復号法を大幅に上回った。
論文 参考訳(メタデータ) (2024-07-23T06:21:24Z) - Cascade Speculative Drafting for Even Faster LLM Inference [24.199907533534535]
投機的復号化により、大言語モデル(LLM)推論の効率が向上する。
本稿では2種類のカスケードを組み込んだ投機的実行アルゴリズムCascade Speculative Draftingを紹介する。
CSドラフトは,対象モデルと同じ出力分布を保ちながら,実験のベースラインよりも高い高速化を実現する。
論文 参考訳(メタデータ) (2023-12-18T18:59:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。