論文の概要: Mask-Guided KV Cache Eviction in Block Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2610.06996v1
- Date: Sun, 04 Oct 2026 07:52:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.499563
- Title: Mask-Guided KV Cache Eviction in Block Diffusion Language Models
- Title(参考訳): ブロック拡散言語モデルにおけるマスク型KVキャッシュ推定
- Abstract要約: ブロック拡散言語モデルは、世代を通して大きなキーバリューキャッシュを保持し、デノイングステップ毎にそれに参加します。
本研究では,マスククエリによるランキング機構を用いて,両方のタスクを学習不要で解決するMaskAheadを提案する。
MaskAheadはKVメモリを平均9.5 times$に減らし、1.2ポイントの平均F1損失を密度推論と比較する。
- 参考スコア(独自算出の注目度): 42.99716861039235
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Block diffusion language models keep a large key-value (KV) cache throughout generation and attend to it at every denoising step, limiting both memory capacity and generation speed. Reducing these costs requires deciding which past tokens to use for denoising the current block (selection) and which to keep in memory for future blocks (eviction). We propose MaskAhead, a training-free method that solves both tasks with a single mask-query-based ranking mechanism. Current-block masks guide selection, while probes of upcoming masked blocks guide eviction. Both rank KV entries by their estimated contribution to the attention output. Our quantized variant, Q-MaskAhead, computes selection and attention directly from low-bit KV, largely preserving the selected entries. Experiments on Fast-dLLM-v2, DreamReasoner, and LLaDA2.0-mini cover long-generation reasoning, long-prompt question answering, and needle-in-a-haystack retrieval. On long-prompt QA, MaskAhead reduces KV memory by $9.5\times$ on average with a 1.2-point mean F1 loss relative to dense inference. Q-MaskAhead increases the reduction to $20.1\times$ with a 2.3-point mean F1 loss. In a batch-32 systems profile, MaskAhead achieves $1.23\times$ end-to-end and $1.68\times$ decode-stage speedups over dense inference.
- Abstract(参考訳): ブロック拡散言語モデルは、生成を通して大きなキー値(KV)キャッシュを保持し、デノナイジングステップ毎にそれに参加し、メモリ容量と生成速度を制限します。
これらのコストを削減するには、現在のブロック(選択)を飾るために使用する過去のトークンと、将来のブロック(削除)のためにメモリに保持するトークンを決定する必要がある。
本研究では,マスククエリによるランキング機構を用いて,両方のタスクを学習不要で解決するMaskAheadを提案する。
現在のブロックマスクは選択を誘導し、次のマスクブロックのプローブは消去を誘導する。
両方のランクのKVは、アテンション出力に対する推定貢献によってエントリーされる。
我々の量子化変種であるQ-MaskAheadは、選択と注目を直接低ビットKVから計算し、選択したエントリをほとんど保存する。
Fast-dLLM-v2、DreamReasoner、LLaDA2.0-miniの実験は、長世代推論、長時間の質問応答、およびニードル・イン・ア・ヘイスタック検索をカバーしている。
長時間のQAでは、MaskAheadはKVメモリを平均9.5\times$に減らし、1.2ポイントの平均F1損失は密度推論と比較して減少する。
Q-MaskAheadは20.1\times$に値上がりし、平均F1損失は2.3ポイントである。
バッチ32システムプロファイルでは、MaskAheadは1.23\times$ end-to-endと1.68\times$ decode-stage speedups over dense inferenceを達成している。
関連論文リスト
- Active Data Acquisition with Side Information via Discrete Diffusion Priors [3.2299643462065277]
データの取得にはコストがかかる – 高い測定忠実度は電力とストレージを犠牲にし、無関係なコンテンツを収集するリスクを負う。
このトレードオフを,1つのモデルではなく,幅広いタスクに関連するデータを取得する情報理論のフレームワークで解決する。
マスクポリシーは、予算の下で、離散画像とその部分観察との間の相互情報を最大化するために、どの画素を計測するかを選択する。
論文 参考訳(メタデータ) (2026-09-26T05:15:19Z) - CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration [67.17709877327232]
ケイトKVは、一貫したヘッドに対して重要なトークン情報のみを保持するハイブリッドKVキャッシュ方式である。
Cate KV はメモリ使用量を最大$2.72 times$に減らし、シングルサンプル入力で$2.18times$に減らした。
論文 参考訳(メタデータ) (2026-08-31T06:02:37Z) - FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models [16.404926372068047]
ブロックワイド拡散大言語モデル (dLLM) はブロックレベルで逐次デコードし、ブロック間で有効なKVキャッシュの再利用を可能にするが、ブロック間デコーディングを厳密にシリアライズする。
2つのメカニズム上に構築されたトレーニング不要な並列デコーディングフレームワークである textbfflowblock を提案する。
LLaDA-2.1とLLaDA-2.0の2つのシリアルブロック単位のdLLMを最大2.95$times$と4.01$times$に改善し、レイテンシを最大53.6%、77.1%削減した。
論文 参考訳(メタデータ) (2026-07-20T08:05:03Z) - LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models [49.93891888238178]
ブロックワイド拡散言語モデル(DLM)は任意の順序で複数のトークンを生成し、自動回帰復号パイプラインに代わる有望な代替手段を提供する。
異なるクエリが異なるプレフィックス位置を選択する場合、KVインフレーション問題により、DLM上では裸のスパースアテンションが失敗する。
キャッシュされたプレフィックスアテンション結果を安定したトークンに再利用し、アクティブトークンのみにスパースアテンションを適用するLOSA(Locality-aware Sparse Attention)を提案する。
論文 参考訳(メタデータ) (2026-04-13T20:53:51Z) - DMax: Aggressive Parallel Decoding for dLLMs [77.24184219948337]
効率的な拡散言語モデル(dLLM)のための新しいパラダイムであるDMaxを提案する。
並列デコードにおけるエラーの蓄積を軽減し、生成品質を維持しながらアグレッシブデコードを可能にする。
当社のアプローチの核心は、マスクと均一なdLLMを効率的に統合する新しいトレーニング戦略であるOn-Policy Uniform Trainingである。
論文 参考訳(メタデータ) (2026-04-09T14:35:42Z) - EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models [8.323540970510809]
本稿では,新たに復号されたトークン分布の最大エントロピーを,いつ再計算するかを決定するための定コスト信号として利用する,トレーニング不要なKVキャッシュ手法であるEntropyCacheを提案する。
LLaDA-8B-InstructとDream-7B-Instructの実験によると、EntropyCacheは15.2times$-26.4times$標準ベンチマークのスピードアップ、22.4times$-24.1times$-24.1times$。
論文 参考訳(メタデータ) (2026-03-19T04:46:34Z) - Attention Is All You Need for KV Cache in Diffusion LLMs [36.94369617373333]
Elastic-Cacheは、拡散大言語モデルのための適応型層対応キャッシュ更新を実行する。
提案手法は,既存の信頼度に基づく手法よりも高いスループット(GSM8Kで6.8時間)を実現する。
論文 参考訳(メタデータ) (2025-10-16T17:59:48Z) - Mask Tokens as Prophet: Fine-Grained Cache Eviction for Efficient dLLM Inference [27.2461395361407]
拡散大言語モデル(dLLMs)は、支配的な自己回帰モデル(ARMs)に代わる有望な選択肢を提供する
既存のキャッシュ消去戦略はARM向けに設計されており、dLLMのユニークな特性を無視しているため、不満足なパフォーマンスにつながる。
トレーニング不要なキャッシュ消去フレームワークであるMaskKVを紹介した。
論文 参考訳(メタデータ) (2025-10-10T12:01:16Z) - KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache [67.9776980972508]
我々はKIVIというチューニング不要な2ビットKVキャッシュ量子化アルゴリズムを開発した。
KIVI は Llama, Falcon, Mistral のモデルを $mathbf2.6times$ less peak memory を使用しながらほぼ同じ品質を維持することができる。
論文 参考訳(メタデータ) (2024-02-05T06:06:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。