論文の概要: The risk of KV cache compression
- arxiv url: http://arxiv.org/abs/2607.01520v1
- Date: Wed, 01 Jul 2026 22:36:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.609365
- Title: The risk of KV cache compression
- Title(参考訳): KVキャッシュ圧縮のリスク
- Abstract要約: ロングシーケンスのトランスフォーマー推論は、大規模なKVキャッシュからソフトマックスアテンションが繰り返し読み取るため、コストがかかる。
このボトルネックに対する一般的なアプローチは、完全なキャッシュをコンパクトなサマリで置き換えるKVキャッシュ圧縮である。
キャッシュの本質的な圧縮可能性の観点から,KVキャッシュ圧縮のミニマックスリスクを特徴付けることにより,このギャップを埋める。
- 参考スコア(独自算出の注目度): 27.1081027038941
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformer inference on long sequences is expensive because softmax attention repeatedly reads from a large KV cache. The prevalent approach to this bottleneck is KV cache compression, which replaces the full cache with a compact summary. Despite its practical importance, the design of such summaries is largely driven by empirical experimentation. On the theoretical side, existing results show that KV cache compression can be impossible in the worst case, but offer little systematic guidance for designing algorithms in regimes where accurate compression is possible. We bridge this gap by characterizing the minimax risk of KV cache compression in terms of the intrinsic compressibility of a cache, revealing when and how accurate compression is possible. These results yield novel design principles for KV cache compression under causal masking that map efficiently to prefill and autoregressive decoding while achieving minimax-optimal risk. We instantiate these principles in a practical algorithm and report promising performance on LongBench in targeted experiments. Overall, our results provide a principled avenue for practical KV cache compression with theoretical guarantees.
- Abstract(参考訳): ロングシーケンスのトランスフォーマー推論は、大規模なKVキャッシュからソフトマックスアテンションが繰り返し読み取るため、コストがかかる。
このボトルネックに対する一般的なアプローチは、完全なキャッシュをコンパクトなサマリで置き換えるKVキャッシュ圧縮である。
現実的な重要性にもかかわらず、このような要約のデザインは経験的な実験によって大きく左右される。
理論的には、KVキャッシュ圧縮は最悪の場合では不可能であるが、正確な圧縮が可能な状況下でアルゴリズムを設計するための体系的なガイダンスはほとんど提供されない。
キャッシュの本質的な圧縮可能性の観点から,KVキャッシュ圧縮のミニマックスリスクを特徴付けることにより,このギャップを埋める。
これらの結果から, 因果マスキングによるKVキャッシュ圧縮の新たな設計原理が得られた。
我々はこれらの原理を実用的なアルゴリズムでインスタンス化し、ターゲット実験におけるLongBenchの性能を報告する。
以上の結果から,KVキャッシュ圧縮を理論的に保証する手法が提案されている。
関連論文リスト
- EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction [55.026048429595384]
EchoKVは、標準と圧縮された推論間のオンデマンド移行を可能にする柔軟なKVキャッシュ圧縮スキームである。
高速で低コストなトレーニングを可能にする2段階の微調整戦略を導入する。
論文 参考訳(メタデータ) (2026-03-24T07:58:42Z) - One Size Does Not Fit All: Token-Wise Adaptive Compression for KV Cache [38.49582847975703]
低ランクKVキャッシュ圧縮のための新しいポストトレーニングフレームワークDynaKVを提案する。
我々の手法は既存の最先端圧縮技術より一貫して優れています。
SnapKVと統合した場合、DynaKVはKVキャッシュの6%しか保持せず、LongBenchベンチマークのベースラインパフォーマンスの94%を維持している。
論文 参考訳(メタデータ) (2026-02-03T13:20:36Z) - More Than a Quick Glance: Overcoming the Greedy Bias in KV-Cache Compression [0.0]
LASER-KVは、厳格な累積予算政策の下でKV圧縮の限界をテストするために設計されたフレームワークである。
Babilongベンチマークの実験では、様々な長期タスクにおいて、従来の圧縮手法のパフォーマンスが15~30%向上した。
論文 参考訳(メタデータ) (2026-02-02T15:05:03Z) - The Pitfalls of KV Cache Compression [52.196873305708955]
圧縮により、特定の命令がより高速に劣化することを示します。
本稿では, 圧縮法, 命令順序, KV消去バイアスなど, 即時漏洩に果たすいくつかの要因について述べる。
論文 参考訳(メタデータ) (2025-09-30T19:55:26Z) - KVComp: A High-Performance, LLM-Aware, Lossy Compression Framework for KV Cache [7.019967158501771]
長文生成に最適化された汎用的で効率的なKVキャッシュ管理フレームワークであるKVCompを提案する。
KVCompは、KVキャッシュデータ特性に特化して設計された新しい損失圧縮技術を採用している。
KVCompは,従来の手法に比べて最大83%のメモリ削減率で,平均47%,最大83%の高速化を実現している。
論文 参考訳(メタデータ) (2025-08-30T18:25:19Z) - CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing [54.34080239841088]
CommonKVは、隣接パラメータ共有による層間KVキャッシュ圧縮のトレーニング不要な方法である。
提案手法は,様々な圧縮比で既存の低ランクおよびクロスレイヤーの手法より一貫して優れていることを示す。
論文 参考訳(メタデータ) (2025-08-22T06:55:45Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - DBudgetKV: Dynamic Budget in KV Cache Compression for Ensuring Optimal Performance [125.81664663201282]
我々はDBudgetKVと呼ばれる新しいKVキャッシュ圧縮手法を提案する。
残りのKVキャッシュがフルキャッシュのパフォーマンスにマッチしない場合、注意ベースのメトリクスが特徴である。
提案手法は, 平均圧縮率25%を超え, 無損失KVプルーニングを効果的かつ堅牢に実現している。
論文 参考訳(メタデータ) (2025-02-24T06:33:39Z) - KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing [58.29726147780976]
我々は,層間をKVキャッシュで共有し,層間圧縮を実現する,textit KVSharerと呼ばれるプラグアンドプレイ方式を提案する。
実験の結果、textit KVSharerはKVキャッシュの計算を30%削減し、メモリ消費を削減できることがわかった。
我々は,textit KVSharerが既存の層内KVキャッシュ圧縮手法と互換性があることを検証する。
論文 参考訳(メタデータ) (2024-10-24T08:06:41Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。