論文の概要: DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
- arxiv url: http://arxiv.org/abs/2604.24647v1
- Date: Mon, 27 Apr 2026 16:15:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 17:12:08.154405
- Title: DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference
- Title(参考訳): DepthKV:長期LLM推論のための層依存性KVキャッシュプルーニング
- Authors: Zahra Dehghanighobadi, Asja Fischer,
- Abstract要約: 感性に基づいて,各層に固定されたグローバルKV予算を割り当てる階層依存型プルーニングフレームワークを提案する。
複数のモデルとタスクにわたって、DepthKVは、同じグローバルプルーニング比で一様プルーニングを一貫して上回っている。
- 参考スコア(独自算出の注目度): 11.462434448123169
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context reasoning is a critical capability of large language models (LLMs), enabling applications such as long-document understanding, summarization, and code generation. However, efficient autoregressive inference relies on the key-value (KV) cache, whose memory footprint grows linearly with sequence length, leading to a major memory bottleneck. To mitigate this overhead, KV cache pruning methods discard cached tokens with low attention scores during inference. Most existing methods apply a uniform pruning ratio across layers, implicitly assuming that all layers contribute equally to overall model performance. We show that this assumption is suboptimal, as layers differ significantly in their sensitivity to pruning. We propose DepthKV, a layer-dependent pruning framework that allocates a fixed global KV budget across layers based on their sensitivity, rather than using a uniform allocation. Across multiple models and tasks, DepthKV consistently outperforms uniform pruning at the same global pruning ratio, demonstrating more effective utilization of the KV cache budget through layer-dependent allocation.
- Abstract(参考訳): 長文推論(Long-context reasoning)は、大規模言語モデル(LLM)の重要な機能であり、長い文書理解、要約、コード生成などのアプリケーションを可能にする。
しかし、効率的な自己回帰推論はキー値(KV)キャッシュに依存し、そのメモリフットプリントはシーケンス長とともに線形に増加し、大きなメモリボトルネックを引き起こす。
このオーバーヘッドを軽減するため、KVキャッシュプルーニングメソッドは、推論中に低い注意スコアでキャッシュされたトークンを破棄する。
既存のほとんどのメソッドは、すべてのレイヤがモデル全体のパフォーマンスに等しく寄与することを暗黙的に仮定して、レイヤ間の均一なプルーニング比を適用します。
この仮定は層がプルーニングに対する感度に大きく異なるため, 準最適であることを示す。
DepthKVは、均一なアロケーションを使わずに、各層の感度に基づいて、固定されたグローバルKV予算を割り当てる、層依存型プルーニングフレームワークである。
複数のモデルとタスクにわたって、DepthKVは同じグローバルプルーニング比で一様プルーニングを一貫して上回り、層依存アロケーションを通じてKVキャッシュ予算をより効果的に活用することを示す。
関連論文リスト
- KVCompose: Efficient Structured KV Cache Compression with Composite Tokens [7.922206020386125]
大規模言語モデル(LLM)は、効率的な自己回帰復号化のためにキー値(KV)キャッシュに依存している。
我々は,注意誘導型,層適応型複合トークンに基づく,シンプルで効果的なKVキャッシュ圧縮フレームワークを提案する。
本手法は精度を保ちながらメモリの大幅な削減を実現し,従来手法と半構造化手法を一貫して上回っている。
論文 参考訳(メタデータ) (2025-09-05T14:58:24Z) - DBudgetKV: Dynamic Budget in KV Cache Compression for Ensuring Optimal Performance [125.81664663201282]
我々はDBudgetKVと呼ばれる新しいKVキャッシュ圧縮手法を提案する。
残りのKVキャッシュがフルキャッシュのパフォーマンスにマッチしない場合、注意ベースのメトリクスが特徴である。
提案手法は, 平均圧縮率25%を超え, 無損失KVプルーニングを効果的かつ堅牢に実現している。
論文 参考訳(メタデータ) (2025-02-24T06:33:39Z) - ZigZagkv: Dynamic KV Cache Compression for Long-context Modeling based on Layer Uncertainty [35.947737679664016]
推論長が増加するにつれて、KVキャッシュの増加はメモリ外問題を引き起こす可能性がある。
本稿では,各層に予算規模を割り当てるために,層不確実性を利用した簡易かつ効果的なKVキャッシュ圧縮手法を提案する。
実験の結果,提案手法はフルKV推定と比較して,KVキャッシュのメモリ使用量を$sim$20%に削減できることがわかった。
論文 参考訳(メタデータ) (2024-12-12T07:52:56Z) - PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation [97.41972925670508]
大規模視覚言語モデル(LVLM)は、推論中に重要な計算とメモリオーバーヘッドを引き起こす。
ここでは、PrefixKVについて述べる。ここでは、Prefixは、元のシーケンスの位置ではなく、重要度に基づいて、上位ランクのKVを意味する。
本手法は他の手法と比較して最先端の性能を実現する。
論文 参考訳(メタデータ) (2024-12-04T15:48:59Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。