論文の概要: GroupKV: Hierarchical KV Cache Management for Long-Context Diffusion LLM Inference
- arxiv url: http://arxiv.org/abs/2609.17573v1
- Date: Thu, 30 Jul 2026 16:19:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.571651
- Title: GroupKV: Hierarchical KV Cache Management for Long-Context Diffusion LLM Inference
- Title(参考訳): GroupKV:長期拡散LLM推論のための階層型KVキャッシュ管理
- Abstract要約: textscGroupKVは、長文dLLM推論のための軽量階層型KVキャッシュ管理システムである。
textscGroupKVはコンテキストを連続したグループに分割し、粗い粒度選択を行う。
実験の結果、textscGroupKVは最大使用可能なコンテキスト長を最大48.00times$まで拡張している。
- 参考スコア(独自算出の注目度): 7.469277601079312
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion large language models (dLLMs) are emerging as a promising generative paradigm that complements autoregressive decoding. In long-context settings, KV cache bloat and offloading transfer overhead have become primary bottlenecks in inference systems. Meanwhile, the periodic full-sequence recomputation and localized token updates in dLLMs make the KV lifecycle substantially more dynamic, complicating cache management and prefetch scheduling while making heavyweight token-level indexing or clustering schemes harder to amortize effectively during decoding. To address these challenges, we present \textsc{GroupKV}, a lightweight hierarchical KV cache management system for long-context dLLM inference. We observe that under block-wise decoding, tokens within the same generation block tend to access highly overlapping and spatially concentrated context regions, making group-level sparse selection effective. Building on this observation, \textsc{GroupKV} partitions the context into contiguous groups and performs coarse-to-fine sparse selection. \textsc{GroupKV} further exploits cross-layer consistency to enable predictive prefetching, and incorporates a staleness correction mechanism to maintain cache coherence under dynamic KV updates. Additionally, \textsc{GroupKV} adopts streaming prefill to reduce peak memory consumption during prefilling. Experiments show that \textsc{GroupKV} extends the maximum serviceable context length by up to $48.00\times$ under constrained GPU memory, improves end-to-end inference performance by up to $3.73\times$ in offload-based long-context settings, and maintains competitive task accuracy.
- Abstract(参考訳): 拡散大言語モデル (dLLM) は自己回帰復号を補完する有望な生成パラダイムとして出現している。
長いコンテキスト設定では、KVキャッシュの肥大化とオフロード転送オーバーヘッドが、推論システムにおいて主要なボトルネックとなっている。
一方、dLLMの周期的なフルシーケンス再計算とローカライズされたトークン更新により、KVライフサイクルが大幅に動的になり、キャッシュ管理とプリフェッチスケジューリングが複雑になり、デコード時に重み付きトークンレベルのインデックス付けやクラスタリングのスキームを効果的に償却することが困難になる。
これらの課題に対処するために、長文dLLM推論のための軽量階層型KVキャッシュ管理システムである \textsc{GroupKV} を提案する。
ブロック単位の復号化では,同一生成ブロック内のトークンは重なり合い,空間的に集中したコンテキスト領域にアクセスし,グループレベルのスパース選択を効果的に行う傾向にある。
この観測に基づいて、textsc{GroupKV} はコンテキストを連続群に分割し、粗い粒度選択を行う。
\textsc{GroupKV}はさらに、階層間の一貫性を活用して予測プリフェッチを可能にし、静的なKV更新下でキャッシュコヒーレンスを維持するための安定化補正機構を組み込んでいる。
さらに、‘textsc{GroupKV} はストリーミングプリフィルを採用し、プリフィル中のピークメモリ消費を減らす。
実験によると、 \textsc{GroupKV} は最大サービス可能なコンテキスト長を最大48.00\times$まで拡張し、制約付きGPUメモリ下では最大38.00\times$、オフロードベースのロングコンテキスト設定では最大3.73\times$まで改善し、競合するタスク精度を維持する。
関連論文リスト
- GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs [97.36238579001544]
コンテキスト長が拡張された大規模言語モデル(LLM)は、キー値(KV)キャッシュに依存して、以前のトークンに対する注意をサポートする。
KVキャッシュを維持することは、KVキャッシュ圧縮メソッドを動機付け、かなりのメモリオーバーヘッドを引き起こす。
GRKVは,圧縮キャッシュとフルキャッシュのアテンション出力の差を直接最小化する,トレーニング不要なKV-cacheマージ手法である。
論文 参考訳(メタデータ) (2026-05-29T10:16:30Z) - KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference [23.683284557561112]
我々は、GPUメモリ、ホストDRAM、SSDにまたがる総合的なマルチ層KVキャッシュ管理システムであるKVDriveを紹介する。
KVDriveは、キャッシュ配置、パイプラインスケジューリング、階層間の調整を共同でオーケストレーションするシステムの観点から、この問題に取り組む。
このシステムは精度を保ちながら最先端の作業に比べて最大1.74倍のスループットを実現している。
論文 参考訳(メタデータ) (2026-05-18T08:54:16Z) - Kwai Summary Attention Technical Report [69.40814939510126]
長文の能力は、次世代の大規模言語モデルの最も重要な方向性の1つになっている。
標準ソフトマックスアテンションは、シーケンスの長さに関して2次時間複雑性を示す。
歴史的文脈を圧縮することでシーケンスモデリングコストを削減する新しいアテンションメカニズムであるKwai Summary Attention (KSA)を提案する。
論文 参考訳(メタデータ) (2026-04-27T12:59:53Z) - DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity [50.52392445266824]
そこで本稿では,KV表現における長距離間類似性と高共有遅延成分を動機とする残差ベースのKVキャッシュ圧縮フレームワークを提案する。
DeltaKVはトークンを捨てる代わりに、検索した履歴参照に対するセマンティックな残基をエンコードし、保存を著しく削減する。
実験によると、DeltaKVは、LongBench、SCBench、AIMEでほぼロスレスの精度を維持しながら、KVキャッシュメモリを元の29%に削減している。
論文 参考訳(メタデータ) (2026-02-08T15:14:36Z) - OjaKV: Context-Aware Online Low-Rank KV Cache Compression with Oja's Rule [54.37983890753086]
我々は,戦略的ハイブリッドストレージポリシとオンラインサブスペース適応を統合したフレームワークであるOjaKVを紹介する。
OjaKVは、重要かつ最新のトークンをフルランクで保存し、注意のために高忠実なアンカーを維持している。
オンライン主成分分析のためのOjaのアルゴリズムを用いて、プロジェクションベースを漸進的に適応させることにより、低ランク圧縮を適用する。
論文 参考訳(メタデータ) (2025-09-25T21:42:27Z) - TreeKV: Smooth Key-Value Cache Compression with Tree Structures [19.06842704338332]
TreeKVは、スムーズなキャッシュ圧縮のためにツリー構造を利用するトレーニング不要の手法である。
PG19とOpenWebText2の言語モデリングタスクのベースラインモデルを一貫して上回っている。
論文 参考訳(メタデータ) (2025-01-09T06:00:27Z) - SCBench: A KV Cache-Centric Analysis of Long-Context Methods [61.025422435235456]
KVキャッシュ中心の視点から長文の手法を評価するベンチマークであるSCBenchを紹介する。
我々は、Gated Linear RNNsやMamba-Attention Hybridsを含む8つのカテゴリの長期コンテキストソリューションについて、広範なKVキャッシュ中心の分析を行う。
本研究は,O(n)メモリとサブO(n2)プリフィルによるスパース符号化が堅牢に動作する一方で,サブO(n)メモリ手法がマルチターンシナリオに悩まされていることを示す。
論文 参考訳(メタデータ) (2024-12-13T17:59:52Z) - ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression [10.003118268356017]
ロングコンテキストは推論効率に重大な課題をもたらす。
本稿では,意味クラスタの粒度でトークンをリコールするClusterKVを紹介する。
実験結果から、ClusterKVは32kのコンテキスト長を持つ様々なタスクにおいて、無視可能な精度の損失が得られることがわかった。
論文 参考訳(メタデータ) (2024-12-04T10:58:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。