論文の概要: DynaCalKV: Key-Value Cache Compression via Head Grouping and Adaptive Rank Allocation
- arxiv url: http://arxiv.org/abs/2607.24331v1
- Date: Mon, 27 Jul 2026 12:08:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.411662
- Title: DynaCalKV: Key-Value Cache Compression via Head Grouping and Adaptive Rank Allocation
- Title(参考訳): DynaCalKV: Head GroupingとAdaptive Rank Allocationによるキーバリューキャッシュ圧縮
- Authors: Tan T. Nguyen, Quan V. Dang,
- Abstract要約: 改良された低ランクKVキャッシュ圧縮フレームワークを提案する。
提案手法は,競合精度を維持しつつ,キーキャッシュパラメータの数を削減できることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As the inference phase of Large Language Models (LLMs) requires handling long context windows, the Key-Value (KV) cache initially appears to address this challenge but eventually becomes a significant bottleneck as the context window continues to grow. Low-rank compression has recently been studied as an effective approach to reduce KV cache memory while maintaining model performance. However, only a few existing methods treat the Key and Value caches differently, despite their distinct roles. Moreover, these methods typically employ fixed attention-head grouping, which may not fully exploit the structural similarity among attention heads. In this paper, we propose an improved low-rank KV cache compression framework. For the Key cache, we dynamically group attention heads based on Centered Kernel Alignment (CKA) similarity and allocate the rank budget adaptively under a parameter budget. For the Value cache, we adopt the same approach as ReCalKV, refining the low-rank decomposition through offline calibration to improve reconstruction quality. Experimental results on three instruction-tuned LLMs show that our method reduces the number of Key cache parameters while maintaining competitive accuracy. We further observe that the proposed strategy is particularly effective for Multi-Head Attention (MHA) models, whereas it should be applied more conservatively to Grouped-Query Attention (GQA) models, especially in long-context settings.
- Abstract(参考訳): LLM(Large Language Models)の推論フェーズでは、長いコンテキストウインドウを扱う必要があるため、キーバリュー(KV)キャッシュは、当初この課題に対処するように見えるが、コンテキストウインドウが成長し続けるにつれて、最終的に重要なボトルネックとなる。
モデル性能を維持しながら、KVキャッシュメモリの削減に有効な手法として、最近低ランク圧縮が研究されている。
しかし、キーキャッシュとバリューキャッシュは異なる役割を担っているにも関わらず、いくつかの既存のメソッドしか扱いません。
さらに、これらの手法は一般に固定されたアテンションヘッドグルーピングを用いており、アテンションヘッド間の構造的類似性を十分に活用していない。
本稿では,低ランクなKVキャッシュ圧縮フレームワークを提案する。
Keyキャッシュでは、CKA(Centered Kernel Alignment)の類似性に基づいて、動的にアテンションヘッドをグループ化し、パラメータ予算の下でランク予算を適応的に割り当てる。
Valueキャッシュでは、ReCalKVと同じアプローチを採用し、オフラインキャリブレーションによる低ランク分解を精細化し、再構築品質を向上させる。
3つの命令調整LDMによる実験結果から,提案手法は競合精度を維持しつつキーキャッシュパラメータ数を削減できることがわかった。
さらに,提案手法はMHA(Multi-Head Attention)モデルに特に有効であるが,GQA(Grouped-Query Attention)モデルにはより保守的に適用する必要がある。
関連論文リスト
- KQ-SVD: Compressing the KV Cache with Provable Guarantees on Attention Fidelity [6.542188603141656]
キーバリューキャッシュは、大きな言語モデルの効率の中心である。
シーケンスの長さとバッチサイズが大きくなると、キャッシュは大きなメモリボトルネックとなる。
我々は,注目行列の最適低ランク分解を直接行う,単純で効率的なKQ-SVDを提案する。
論文 参考訳(メタデータ) (2025-12-05T17:51:10Z) - KVCompose: Efficient Structured KV Cache Compression with Composite Tokens [7.922206020386125]
大規模言語モデル(LLM)は、効率的な自己回帰復号化のためにキー値(KV)キャッシュに依存している。
我々は,注意誘導型,層適応型複合トークンに基づく,シンプルで効果的なKVキャッシュ圧縮フレームワークを提案する。
本手法は精度を保ちながらメモリの大幅な削減を実現し,従来手法と半構造化手法を一貫して上回っている。
論文 参考訳(メタデータ) (2025-09-05T14:58:24Z) - CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing [54.34080239841088]
CommonKVは、隣接パラメータ共有による層間KVキャッシュ圧縮のトレーニング不要な方法である。
提案手法は,様々な圧縮比で既存の低ランクおよびクロスレイヤーの手法より一貫して優れていることを示す。
論文 参考訳(メタデータ) (2025-08-22T06:55:45Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - DBudgetKV: Dynamic Budget in KV Cache Compression for Ensuring Optimal Performance [125.81664663201282]
我々はDBudgetKVと呼ばれる新しいKVキャッシュ圧縮手法を提案する。
残りのKVキャッシュがフルキャッシュのパフォーマンスにマッチしない場合、注意ベースのメトリクスが特徴である。
提案手法は, 平均圧縮率25%を超え, 無損失KVプルーニングを効果的かつ堅牢に実現している。
論文 参考訳(メタデータ) (2025-02-24T06:33:39Z) - CORM: Cache Optimization with Recent Message for Large Language Model Inference [57.109354287786154]
メモリフットプリントを大幅に最小化するKVキャッシュを最適化する革新的な手法を提案する。
KVキャッシュ消去ポリシーであるCORMは、モデル微調整を必要とせずに、推論に必要なキーと値のペアを動的に保持する。
検証の結果,CORMはKVキャッシュの推論メモリ使用量を最大70%削減し,LongBenchの6つのタスクで性能劣化を無視できることがわかった。
論文 参考訳(メタデータ) (2024-04-24T16:11:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。