論文の概要: CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference
- arxiv url: http://arxiv.org/abs/2606.24467v1
- Date: Tue, 23 Jun 2026 11:59:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.935385
- Title: CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference
- Title(参考訳): CompressKV:資源効率の長いLLM推論のための意味検索型KVキャッシュ圧縮
- Authors: Xiaolin Lin, Jingcun Wang, Olga Kondrateva, Yiyu Shi, Bing Li, Grace Li Zhang,
- Abstract要約: 長文大言語モデル(LLM)推論は、メモリフットプリントとキー値キャッシュのデコードコストによって、ますます制限されている。
我々は、GQAベースのLLMのためのリソース効率の良いKV-cache圧縮フレームワークであるCompressKVを提案する。
LongBench と Needle-in-a-Haystack の実験により、CompressKV はメモリ予算全体で既存の KV-cache 消去手法を一貫して上回っていることが示された。
- 参考スコア(独自算出の注目度): 9.416125453771361
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Long-context large language model (LLM) inference is increasingly constrained by the memory footprint and decoding cost of key-value (KV) caches, limiting sustainable deployment on resource-constrained hardware. Existing KV cache eviction methods typically apply heuristic token scoring over all heads in GQA-based LLMs. These methods ignore the different functionalities of attention heads, leading to the eviction of critical tokens and thus degrading the performance of LLMs. To address this issue, we propose CompressKV, a resource-efficient KV-cache compression framework for GQA-based LLMs. Instead of aggregating attention scores from all heads, CompressKV identifies Semantic Retrieval Heads (SRHs) that capture both the initial and final tokens of a prompt and semantically important mid-context evidence, and uses them to select tokens whose KV pairs should be retained. Furthermore, CompressKV allocates cache budgets across layers according to offline estimates of layer-wise eviction error. Experiments on LongBench and Needle-in-a-Haystack show that CompressKV consistently outperforms existing KV-cache eviction methods across memory budgets. Notably, it preserves over 97\% of full-cache performance using only 3\% of the KV cache on LongBench question-answering tasks and achieves 90\% accuracy with just 0.7\% KV storage on Needle-in-a-Haystack. These results demonstrate an improved resource--performance trade-off for long-context LLM inference. Our code is publicly available at: https://github.com/TUDa-HWAI/CompressKV
- Abstract(参考訳): 長期コンテキスト大言語モデル(LLM)推論は、メモリフットプリントとキー値(KV)キャッシュのデコードコストによってますます制約され、リソース制約のあるハードウェアへの持続可能なデプロイが制限される。
既存のKVキャッシュ消去法は、GQAベースのLLMにおいて、すべてのヘッドに対してヒューリスティックトークンスコアリングを適用するのが一般的である。
これらの手法はアテンションヘッドの異なる機能を無視し、クリティカルトークンを排除し、LCMの性能を低下させる。
この問題に対処するために,GQA ベースの LLM のためのリソース効率の高い KV-cache 圧縮フレームワーク CompressKV を提案する。
CompressKVは、すべての頭から注意点を集約する代わりに、プロンプトと意味的に重要な中文脈証拠の初期トークンと最終トークンの両方をキャプチャーし、KVペアを保持すべきトークンを選択するために使用するセマンティック検索ヘッド(SRH)を識別する。
さらに、CompressKVは、レイヤ単位の消去エラーのオフライン推定に基づいて、レイヤ間でキャッシュ予算を割り当てる。
LongBench と Needle-in-a-Haystack の実験により、CompressKV はメモリ予算全体で既存の KV-cache 消去手法を一貫して上回っていることが示された。
特に、LongBenchの質問応答タスクではKVキャッシュの3倍しか使用せず、Needle-in-a-Haystackではわずか0.7倍のKVストレージで90%の精度を実現している。
これらの結果から,長文LLM推論におけるリソース・パフォーマンストレードオフの改善が示された。
私たちのコードは、https://github.com/TUDa-HWAI/CompressKVで公開されています。
関連論文リスト
- MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering [75.0394545769057]
KVキャッシュは、LLMプリフィルを介して歴史的なトークンのキーバリューを格納する。
MuKV は KV キャッシュ圧縮モジュールと半階層的検索手法を特徴とする手法である。
長時間ストリーミングのVideoQAベンチマークの実験では、MKVはメモリとオンラインQA効率を犠牲にすることなく、回答の正確性を大幅に向上することが示された。
論文 参考訳(メタデータ) (2026-05-21T10:13:03Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - WindowKV: Task-Adaptive Group-Wise KV Cache Window Selection for Efficient LLM Inference [9.572076809796448]
タスク適応型KVキャッシュウィンドウ選択手法であるWindowKVを提案する。
WindowKVは、元のKVキャッシュの12%しか使用せず、完全なKVキャッシュ保持に匹敵する性能を維持していることを示す。
提案手法は,Needle-in-a-Haystack評価における最先端の結果も達成し,その有効性と堅牢性を強調した。
論文 参考訳(メタデータ) (2025-03-23T03:36:52Z) - DBudgetKV: Dynamic Budget in KV Cache Compression for Ensuring Optimal Performance [125.81664663201282]
我々はDBudgetKVと呼ばれる新しいKVキャッシュ圧縮手法を提案する。
残りのKVキャッシュがフルキャッシュのパフォーマンスにマッチしない場合、注意ベースのメトリクスが特徴である。
提案手法は, 平均圧縮率25%を超え, 無損失KVプルーニングを効果的かつ堅牢に実現している。
論文 参考訳(メタデータ) (2025-02-24T06:33:39Z) - ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference [61.412894960600205]
大きな言語モデル(LLM)は、長いテキストを処理する際に大きなGPUメモリを必要とする。
ChunkKVは、セマンティックチャンクを基本的な圧縮単位として扱うことで、KVキャッシュ圧縮を再定義する。
結果: ChunkKVは最先端の手法を最大8.7%精度で上回る。
論文 参考訳(メタデータ) (2025-02-01T03:49:47Z) - ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression [10.003118268356017]
ロングコンテキストは推論効率に重大な課題をもたらす。
本稿では,意味クラスタの粒度でトークンをリコールするClusterKVを紹介する。
実験結果から、ClusterKVは32kのコンテキスト長を持つ様々なタスクにおいて、無視可能な精度の損失が得られることがわかった。
論文 参考訳(メタデータ) (2024-12-04T10:58:27Z) - Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference [78.65321721142624]
我々はキー値(KV)キャッシュによって課されるメモリボトルネックに焦点を当てる。
既存のKVキャッシュ手法は、比較的重要でないKVペアの大きなスワストを刈り取ったり、取り除いたりすることでこの問題に対処する。
本稿では,固定サイズキャッシュと退避型キャッシュを簡易に統合したLESSを提案する。
論文 参考訳(メタデータ) (2024-02-14T18:54:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。