論文の概要: SpecFold: Folding Multi-Branch Redundancy for Faster Speculative Decoding in Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2610.04875v2
- Date: Tue, 06 Oct 2026 03:42:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.338387
- Title: SpecFold: Folding Multi-Branch Redundancy for Faster Speculative Decoding in Diffusion Language Models
- Title(参考訳): SpecFold: 拡散言語モデルにおける高速な投機的デコーディングのためのマルチブランチ冗長化
- Abstract要約: SpecFoldはマルチブランチ冗長性を利用して、投機的検証のコストを削減する。
アルゴリズム的には、SpecFoldはトークンレベルの残差ゲーティングを実行し、折り畳まれた注意とFFNを通じて親を選択的に再利用する。
システム的には、Tritonカーネルの実装は、このきめ細かい再利用をエンドツーエンドのスループットゲインに変換する。
- 参考スコア(独自算出の注目度): 20.1067775287509
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion large language models (DLLMs) generate text through iterative block denoising, and multi-branch speculative decoding accelerates this process by verifying a main branch together with multiple draft branches in a single forward pass. While prior DLLM acceleration methods primarily exploit temporal redundancy across denoising steps, we identify a complementary redundancy axis within each speculative verification step: multi-branch computational redundancy. During speculative verification, draft branches inherit most tokens from their parents while unmasking a small set of additional positions, causing large portions of hidden states to remain highly similar across branches. We propose SpecFold, an algorithm-system co-design that exploits this multi-branch redundancy to reduce the cost of multi-branch speculative verification. Algorithmically, SpecFold performs token-level residual gating and selectively reuses parent computation through folded attention and FFN while preserving residual hidden states. Systemically, a Triton kernel implementation translates this fine-grained reuse into end-to-end throughput gains through efficient sparse multi-branch execution. SpecFold is orthogonal to temporal caching and compatible with existing DLLM speculation strategies. Across two DLLM families, five models, and five standard benchmarks, SpecFold achieves up to 1.64x throughput over Spiffy and up to 1.99x over vanilla decoding, while maintaining comparable task performance.
- Abstract(参考訳): 拡散大言語モデル (DLLM) は反復ブロックの復号化を通じてテキストを生成し、マルチブランチの投機的復号化は、メインブランチと複数のドラフトブランチを1つのフォワードパスで検証することにより、このプロセスを加速させる。
従来のDLLMアクセラレーション手法では,各投機的検証ステップ内の相補的冗長性軸を多分岐計算冗長性(multi-branch computer redundancy)と呼ぶ。
投機的検証の間、ドラフトブランチは両親からほとんどのトークンを継承し、少数の追加のポジションを解き放ち、隠れた状態の大部分が枝全体で非常によく似ている。
我々は,このマルチブランチ冗長性を利用して,マルチブランチ投機的検証のコストを削減するアルゴリズム・システムの共同設計であるSpecFoldを提案する。
アルゴリズム的には、SpecFoldはトークンレベルの残差ゲーティングを実行し、残差隠蔽状態を保持しながら折り畳まれた注意とFFNを通して親計算を選択的に再利用する。
システム的には、Tritonカーネルの実装は、このきめ細かい再利用を効率的なスパースマルチブランチ実行を通じてエンドツーエンドのスループットゲインに変換する。
SpecFoldは時間キャッシュに直交しており、既存のDLLM推測戦略と互換性がある。
2つのDLLMファミリー、5つのモデル、5つの標準ベンチマークで、SpecFoldはSpiffyで最大1.64倍のスループット、バニラデコーディングで最大1.99倍のスループットを実現し、同等のタスク性能を維持している。
関連論文リスト
- Early-Bird Decoding: Accelerating Diffusion LLMs with Learnable Block Sizes and Parallel Sampling [11.823547220829083]
拡散大言語モデル(dLLM)は、自己回帰生成の代替として有望な並列デコードパラダイムを提供する。
同様に低いエントロピーを持つトークンがクラスタ化される傾向にあるという観察から動機付けられた「アーリーバード(EB)」デコーディングフレームワークを提案する。
EB-Decodeは,(1)類似の不確実性のあるトークンを,固定ブロックサイズに依存するのではなく,可変長ブロックに適応的にグループ化する学習可能なネットワーク,(2)予測された可変長ブロック内の復号ステップを減らして,並列でトークンをアンマスクする位置認識型サンプリング,という2つの重要なイネーラを統合する。
論文 参考訳(メタデータ) (2026-09-15T00:12:37Z) - Trajectory-Level Speculative Decoding for Diffusion Language Models [16.97093186372498]
拡散ベースの言語モデル (dLLM) は反復的復号化による並列トークン生成を可能にするが、既存の復号化戦略は信頼性の低い単一トークン生成に崩壊する。
そこで我々は,信頼層木探索による起草軌道構築のためのトラジェクトリレベルの投機フレームワークを開発した。
我々のフレームワークはデノーミングを30~40%削減し、トークン単位のステップを2.6から4.3に増やし、バニラdLLMを7~14倍、Fast-dLLMを1.3倍、推論とコードベンチマークを1%未満で高速化する。
論文 参考訳(メタデータ) (2026-08-27T09:42:20Z) - Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes [10.877713536966601]
Longestahead Prefix(LSP)スケジューラは、モノリシックプレフィックスの吸収に基づく、トレーニング不要でモデルに依存しない推論パラダイムである。
LSPは1つのフォワードパスを介してトークンの安定性を評価し、安定な予測の連続した左整列ブロックを動的に識別する。
原子のコミットメントの前に、言語や構造的受容の境界を画定する。
論文 参考訳(メタデータ) (2026-03-05T18:25:26Z) - Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models [96.0074341403456]
LLM推論を改善するための実用的な方法として、推論時計算が再導入されている。
テスト時間スケーリング(TTS)アルゴリズムの多くは、自動回帰デコーディングに依存している。
そこで我々は,dLLM のための効率的な TTS フレームワーク Prism を提案する。
論文 参考訳(メタデータ) (2026-02-02T09:14:51Z) - WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference [44.87788417755154]
本稿では,標準因果注意に基づく拡散復号化フレームワークWeDLMを提案する。
WeDLMは強力なARバックボーンの品質を維持しつつ,大幅な高速化を実現している。
論文 参考訳(メタデータ) (2025-12-28T01:25:48Z) - Accelerate Speculative Decoding with Sparse Computation in Verification [49.74839681322316]
投機的復号化は、複数のドラフトトークンを並列に検証することにより、自動回帰言語モデル推論を加速する。
既存のスペーシフィケーション方式は主にトークン・バイ・トーケンの自己回帰復号化のために設計されている。
そこで本研究では,注目度,FFN,MoEを両立させるスパース検証フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-26T07:53:41Z) - Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models [8.407364705777587]
本稿では,DLLMに適した高速デコードアルゴリズムFree Draft-and-Verification(FreeDave)を紹介する。
FreeDaveは、パフォーマンスを低下させることなく、推論スループットを最大3.78倍に向上させることが証明されている。
論文 参考訳(メタデータ) (2025-09-30T21:28:04Z) - Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding [51.711605076319216]
拡散に基づく大規模言語モデル (Diffusion LLM) は、並列復号機能を持つ非自己回帰テキスト生成を約束している。
本稿では,双方向拡散モデルに適したブロック単位で近似したKVキャッシュ機構を提案する。
本稿では,信頼しきい値を超えるトークンを選択的に復号し,依存関係違反を軽減し,生成品質を維持できる信頼度対応並列復号方式を提案する。
論文 参考訳(メタデータ) (2025-05-28T17:39:15Z) - Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration [54.897493351694195]
本稿では,複数連続するトークンを1つのフォワードパスで同時に復号する,新しい並列復号法,すなわちthithidden Transferを提案する。
加速度測定では,Medusa や Self-Speculative decoding など,単モデル加速技術よりも優れています。
論文 参考訳(メタデータ) (2024-04-18T09:17:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。