論文の概要: WhiFlash: Accelerating Speculative Decoding with Token-Level Cross-Paradigm Routing
- arxiv url: http://arxiv.org/abs/2606.07710v1
- Date: Fri, 05 Jun 2026 13:23:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:05.302124
- Title: WhiFlash: Accelerating Speculative Decoding with Token-Level Cross-Paradigm Routing
- Title(参考訳): WhiFlash:Token-Levelクロスパラダイムルーティングによる投機的デコーディングの高速化
- Authors: Young D. Kwon, Miles Williams, Rui Li, Alexandros Kouris, Stylianos I. Venieris,
- Abstract要約: WhiFlashは、単一トークンレベルのコントローラの下で自動回帰および拡散ベースの並列ドラフトを統一する、クロスパラダイムなSDメソッドである。
また,WhiFlashは高い受信長を実現し,カテゴリ固有のスループットを最大69.6%向上させることを示した。
- 参考スコア(独自算出の注目度): 44.656073829954636
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The autoregressive nature of large language models (LLMs) remains a significant bottleneck for inference, particularly in complex agentic workloads. While speculative decoding (SD) accelerates inference, current approaches rely on static drafting paradigms, utilising either autoregressive drafting models for reasoning or diffusion-based parallel drafting models for structured outputs. We empirically find that drafting accuracy fluctuates dramatically within a single sequence, leaving significant performance unrealised by static paradigms and coarse-grained routing. To address this volatility, we introduce WhiFlash, the first cross-paradigm SD method that unifies autoregressive and diffusion-based parallel drafting under a single token-level controller. WhiFlash adopts a fine-grained routing mechanism that employs either a lightweight entropy-based or a learned neural policy, both parametrised to provide a tunable balance between expected token gain and latency. To make high-frequency switching computationally viable, we introduce novel cache-management optimisations, Lazy Catch-up and KV-only Prefill, reducing switching overhead to below 7% of per-round latency. By capitalising on the complementary strengths of fundamentally distinct drafting architectures, WhiFlash achieves significantly higher acceptance lengths, yielding category-specific throughput gains of up to 69.6% over the state-of-the-art autoregressive EAGLE-3 and 37.3% over the diffusion-based DFlash.
- Abstract(参考訳): 大規模言語モデル(LLM)の自己回帰性は、特に複雑なエージェントワークロードにおいて、推論において重要なボトルネックとなっている。
投機的復号化(SD)は推論を加速するが、現在のアプローチは静的な起草パラダイムに依存し、推論のための自己回帰起草モデルか、構造化された出力のための拡散ベースの並列起草モデルを利用する。
提案手法は,静的なパラダイムや粗い粒度のルーティングによって実現不可能な性能を保ちながら,単一シーケンス内でドラフト精度が劇的に変動することを実証的に見出した。
このボラティリティに対処するために,単一トークンレベルコントローラの下で自己回帰型および拡散型並列ドラフトを統一する,最初のクロスパラダイムSD方式であるWhiFlashを導入する。
WhiFlashは、軽量なエントロピーベースまたは学習済みのニューラルポリシーを使用する、きめ細かいルーティングメカニズムを採用しており、どちらも期待されるトークンゲインとレイテンシの調整可能なバランスを提供するためにパラメトリされている。
高速スイッチングを計算可能にするため,新しいキャッシュ管理最適化であるLazy Catch-upとKVのみのPrefillを導入し,オーバヘッドを1ラウンドあたりのレイテンシの7%以下に削減した。
基本的に異なるドラフトアーキテクチャの相補的な強みを活かすことで、WhiFlashは極めて高い受け入れ長を達成し、最先端の自己回帰型EAGLE-3よりも69.6%、拡散ベースのDFlashより37.3%まで、カテゴリ固有のスループットが向上した。
関連論文リスト
- Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models [0.0]
モデルの深さ多様体上での連続的な運動積分に離散的なプルーニングを高める新しい枠組みを提案する。
Qwen-2.5-7B と LLaMA-3-8B の試験により、高スパーシティのシステムの性能は40%向上した。
RKUはGSM8Kで40%の精度で13.34%の精度を達成し、最強のベースラインを上回った。
論文 参考訳(メタデータ) (2026-05-09T15:47:53Z) - DFlash: Block Diffusion for Flash Speculative Decoding [11.98141750480807]
自己回帰型大規模言語モデル(LLM)は高い性能を提供するが、本質的にシーケンシャルなデコーディングを必要とする。
本稿では,並列起草のための軽量ブロック拡散モデルを用いた投機的復号化フレームワークであるDFlashを紹介する。
論文 参考訳(メタデータ) (2026-02-05T18:59:30Z) - Causal Autoregressive Diffusion Language Model [70.7353007255797]
CARDは厳密な因果注意マスク内の拡散過程を再構成し、単一の前方通過で密集した1対1の監視を可能にする。
我々の結果は,CARDが並列生成のレイテンシの利点を解放しつつ,ARMレベルのデータ効率を実現することを示す。
論文 参考訳(メタデータ) (2026-01-29T17:38:29Z) - Fast-ARDiff: An Entropy-informed Acceleration Framework for Continuous Space Autoregressive Generation [12.384836052394272]
自己回帰(AR)拡散ハイブリッドパラダイムはARの構造モデリングと拡散合成を組み合わせたものである。
両コンポーネントを協調的に最適化するAR拡散フレームワークFast-ARDiffを提案する。
Fast-ARDiffは、さまざまなモデルにわたる最先端のアクセラレーションを実現する。
論文 参考訳(メタデータ) (2025-12-09T12:35:18Z) - SDAR: A Synergistic Diffusion-AutoRegression Paradigm for Scalable Sequence Generation [62.14510717860079]
本稿では, 自己回帰モデルの学習効率を, 拡散の並列推論能力で統一するSynergistic Diffusion-Autoregressionパラダイムを提案する。
SDARは、十分に訓練された自己回帰モデル(AR)を、簡潔でデータ効率のよい適応を通じてブロックワイズ拡散モデルに変換する、軽量なパラダイム変換を実行する。
この知見に基づいて、SDARは最小コストで効率的なAR-拡散変換を実現し、並列生成を可能にしながら、ARレベルのパフォーマンスを維持する。
論文 参考訳(メタデータ) (2025-10-07T17:29:28Z) - RAPID^3: Tri-Level Reinforced Acceleration Policies for Diffusion Transformer [86.57077884971478]
ディフュージョントランスフォーマー(DiT)は、視覚発生時に優れるが、遅いサンプリングによって妨げられる。
本稿では,RAPID3: Tri-Level Reinforced Acceleration Policies for Diffusion Transformersを紹介する。
ベースジェネレータの更新をゼロにするイメージワイドアクセラレーションを提供する。
競合する生成品質でサンプリングを3倍近く高速化する。
論文 参考訳(メタデータ) (2025-09-26T13:20:52Z) - FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion [22.207275433870937]
拡散言語モデルは並列トークン生成と本質的に双方向性を提供する。
最先端拡散モデル(ドリーム7B、LLaDA 8Bなど)は推論が遅い。
我々は,トークンアンマキングを監督するために,軽量な事前学習型自己回帰モデルを用いた学習自由度法であるガイドド拡散を導入する。
論文 参考訳(メタデータ) (2025-05-27T17:39:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。