論文の概要: Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast, Memory-Efficient Diffusion LLMs
- arxiv url: http://arxiv.org/abs/2609.26796v1
- Date: Tue, 22 Sep 2026 17:59:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.782883
- Title: Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast, Memory-Efficient Diffusion LLMs
- Title(参考訳): Flash-dLLM:高速・メモリ効率な拡散LDMのためのIO対応KVキャッシングと並列デコーディング
- Abstract要約: Flash-dLLMは、高速でメモリ効率の良いdLLMのためのトレーニング不要な推論アクセラレーションフレームワークである。
Flash-dLLMは、KVキャッシュ対応のdLLM推論において、GPUメモリI/Oが主要なボトルネックであると認識している。
この最適化されたキャッシュメカニズムに基づいて、Flash-dLLMは効率的なKVキャッシュ駆動のドラフト・アンド・バリデーション・デコーディング戦略を提案する。
- 参考スコア(独自算出の注目度): 36.94369617373333
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion Large Language Models (dLLMs) have recently emerged as a promising alternative to autoregressive LLMs by enabling non-autoregressive text generation. However, their practical deployment remains limited by inefficient inference, largely due to the absence of effective Key-Value (KV) caching and scalable parallel decoding mechanisms. Existing acceleration methods typically study KV caching and parallel decoding in isolation, overlooking the I/O bottlenecks that arise when cache reuse and parallel token verification are jointly applied. In this work, we introduce $\textbf{Flash-dLLM}$, a training-free inference acceleration framework for fast and memory-efficient dLLMs. Flash-dLLM first identifies GPU memory I/O as a dominant bottleneck in KV-cache-enabled dLLM inference and addresses it with an I/O-aware fused KV-cache kernel that reduces redundant memory movement. Building on this optimized cache mechanism, Flash-dLLM further proposes an efficient KV-cache-driven draft-and-verify decoding strategy, where the dLLM itself serves as both drafter and verifier without requiring an auxiliary model. This unified design enables faster decoding while preserving generation quality and improving scalability to longer sequences and larger batch size. Extensive experiments on mathematical reasoning and code-generation benchmarks demonstrate that Flash-dLLM consistently outperforms existing state-of-the-art dLLM acceleration methods in both inference speed and memory efficiency. In particular, it achieves $5.1\times$ and $11.0\times$ speedups over prior strongest baseline Elastic-Cache on GSM8K and HumanEval, respectively.
- Abstract(参考訳): Diffusion Large Language Models (dLLMs) は、非自己回帰型テキスト生成を可能にすることで、自己回帰型 LLM に代わる有望な代替品として最近登場した。
しかしながら,キーバリュー(KV)キャッシングと拡張性のある並列デコード機構が欠如していることから,非効率な推論によって,実用的デプロイメントは依然として制限されている。
既存の加速法は、キャッシュ再利用と並列トークン検証を併用して発生するI/Oボトルネックを見越して、KVキャッシュと並列デコーディングを分離して研究するのが一般的である。
本稿では,高速かつメモリ効率の良いdLLMのためのトレーニング不要推論加速フレームワークである$\textbf{Flash-dLLM}$を紹介する。
Flash-dLLMは、最初にGPUメモリI/OをKVキャッシュ対応のdLLM推論における主要なボトルネックとして認識し、冗長なメモリ移動を減らすI/O対応のKV-cacheカーネルで処理する。
この最適化されたキャッシュ機構に基づいて、Flash-dLLMはさらに効率的なKVキャッシュ駆動のドラフト・アンド・バリデーション・デコード戦略を提案している。
この統一された設計は、生成品質を維持しながら高速なデコードを可能にし、より長いシーケンスとより大きなバッチサイズへのスケーラビリティを向上させる。
数学的推論とコード生成ベンチマークに関する大規模な実験により、Flash-dLLMは推論速度とメモリ効率の両方で既存の最先端のdLLM加速度法より一貫して優れていることが示された。
特に、GSM8KとHumanEvalでそれぞれ最強のベースラインであるElastic-Cacheよりも5.1\times$と11.0\times$のスピードアップを達成している。
関連論文リスト
- LLM Inference in a Flash! [66.43896490006965]
大規模言語モデル(LLM)は、さまざまな自然言語処理タスクで印象的な機能を示している。
我々は、高価な浮動小数点演算をなくすために、エンドツーエンドの整数のみの量子化手法を提案する。
論文 参考訳(メタデータ) (2026-09-14T18:04:30Z) - Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding [51.48425605758328]
我々は,Faster Flash Decoding (FFD) という,長文デコーディングにおいてメモリ壁を壊すように設計されたハードウェア・アルゴリズムの共同設計フレームワークを提示する。
FFDはセレクタとコンピュータを完全に融合したカーネルに統合し、外部メタデータのインデックスをコンテンツ認識スキャンに置き換える。
最大11.6倍のカーネルレベルのスピードアップと256Kコンテキスト長のスケーリングを実現し、2.37倍のスループット向上を実現している。
論文 参考訳(メタデータ) (2026-08-31T15:13:20Z) - Dynamic-dLLM: Dynamic Cache-Budget and Adaptive Parallel Decoding for Training-Free Acceleration of Diffusion LLM [35.77320928871856]
トレーニング不要なフレームワークであるDynamic-dLLMを提案する。
LLaDA-8B-Instruct、LLaDA-1.5、Dream-v0-7B-Instructといったモデルの実験では、動的dLLMが推論速度を大幅に改善することを示した。
論文 参考訳(メタデータ) (2026-05-27T02:47:50Z) - Orchestrating Dual-Boundaries: An Arithmetic Intensity Inspired Acceleration Framework for Diffusion Language Models [8.516574616235427]
ODB-dLLMはdLLM推論を加速するために二重境界を編成するフレームワークである。
我々は,ODB-dLLMがベースラインdLLMとFast-dLLMで46-162xと2.63-6.30xの高速化を達成したことを示す。
論文 参考訳(メタデータ) (2025-11-24T13:36:54Z) - Fast-dLLM v2: Efficient Block-Diffusion LLM [64.38006546510337]
Fast-dLLM v2はブロック拡散言語モデルで、訓練済みのARモデルをdLLMに適応して並列テキストを生成する。
これは、Dream(580Bトークン)のようなフルアテンション拡散LDMと比較して、トレーニングデータの500倍の減少を示す。
論文 参考訳(メタデータ) (2025-09-30T14:40:18Z) - Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction [72.27673320976933]
Diffusion Large Language Models (dLLMs) は推論と並列デコードにおけるブレークスルーを可能にする。
現在のキャッシュ技術は、フルレイヤ状態を保存することでデコーディングを加速するが、メモリ使用量を大幅に増加させる。
Sparse-dLLMは、動的キャッシュ消去とスパースアテンションを統合した最初のトレーニングフリーフレームワークである。
論文 参考訳(メタデータ) (2025-08-04T16:14:03Z) - QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache [67.84112700032007]
大きな言語モデル(LLM)は、長いコンテキスト設定のためにエッジデバイスにデプロイされることが増えている。
これらのシナリオでは、キーバリュー(KV)キャッシュがGPUメモリとレイテンシの両方において主要なボトルネックとなっている。
そこで本研究では,ターゲットモデルのアーキテクチャを共有するが,階層的な4ビット量子化KVキャッシュと4ビット量子化重みを併用して高速化を行う,新たな自己推論型デコーディングフレームワークであるQuantSpecを提案する。
論文 参考訳(メタデータ) (2025-02-05T20:43:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。