論文の概要: GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs
- arxiv url: http://arxiv.org/abs/2605.31105v1
- Date: Fri, 29 May 2026 10:16:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.532223
- Title: GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs
- Title(参考訳): GRKV:長期LLMにおけるトレーニング不要KVキャッシュ圧縮のグローバル回帰
- Authors: Junjie Peng, You Wu, Haoyi Wu, Jialong Han, Xiaohua Xie, Kewei Tu, Jianhuang Lai,
- Abstract要約: コンテキスト長が拡張された大規模言語モデル(LLM)は、キー値(KV)キャッシュに依存して、以前のトークンに対する注意をサポートする。
KVキャッシュを維持することは、KVキャッシュ圧縮メソッドを動機付け、かなりのメモリオーバーヘッドを引き起こす。
GRKVは,圧縮キャッシュとフルキャッシュのアテンション出力の差を直接最小化する,トレーニング不要なKV-cacheマージ手法である。
- 参考スコア(独自算出の注目度): 97.36238579001544
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) with extended context lengths rely on the key-value (KV) cache to support attention over prior tokens. However, maintaining the KV cache incurs substantial memory overhead, motivating KV-cache compression methods that enforce a fixed budget through eviction and merging. Modern eviction methods increasingly adopt span-based retention because preserving contiguous spans is empirically effective and better preserves semantic coherence. Yet, when combined with post-eviction merging, span-based retention concentrates merges onto a small set of span-boundary carrier tokens, producing a highly imbalanced merge pattern that exacerbates over-merging and increases information loss. To address this imbalance, we propose GRKV (Global Regression for KV Cache), a training-free KV-cache merging method that directly minimizes the discrepancy between compressed-cache and full-cache attention outputs. GRKV uses ridge-regression-based merge steps to distribute information from evicted tokens across retained tokens, while regularizing the updates to prevent over-smoothing. Across the LongBench and RULER long-context benchmarks, GRKV is the only merging method that improves overall performance with minimal overhead.
- Abstract(参考訳): コンテキスト長が拡張された大規模言語モデル(LLM)は、キー値(KV)キャッシュに依存して、以前のトークンに対する注意をサポートする。
しかし、KVキャッシュの維持はメモリオーバーヘッドを大幅に増加させ、KVキャッシュ圧縮手法を動機付け、消去とマージによって固定予算を強制する。
現代の消去法は、連続したスパンを保存することは経験的に効果的であり、セマンティック・コヒーレンスをよりよく保存するため、スパンベースの保持をますます取り入れている。
しかし、解放後のマージと組み合わせると、スパンベースのリテンションは小さなスパンバウンダリキャリアトークンにマージを集中させ、過剰マージを悪化させ、情報損失を増加させる高度に不均衡なマージパターンを生成する。
この不均衡に対処するために, GRKV (Global Regression for KV Cache) を提案する。
GRKVはリッジレグレッションベースのマージステップを使用して、削除されたトークンから保持されたトークンに情報を分散し、アップデートを正規化し過度なスムーシングを防ぐ。
LongBench と RULER の長いコンテキストのベンチマークでは、GRKV は最小限のオーバーヘッドで全体的なパフォーマンスを改善する唯一のマージ手法である。
関連論文リスト
- IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference [33.37463192332294]
我々は、KVの重要性を予測し、クリティカルトークンのより正確な保持を可能にする学習可能なインデクサを導入する。
本稿では,トークンをコンパクトでオンライン更新された状態に圧縮する軽量潜在メモリモジュールを提案する。
提案手法は,境界KV予算下での高精度な長文推論を可能にする。
論文 参考訳(メタデータ) (2026-05-25T06:29:43Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity [50.52392445266824]
そこで本稿では,KV表現における長距離間類似性と高共有遅延成分を動機とする残差ベースのKVキャッシュ圧縮フレームワークを提案する。
DeltaKVはトークンを捨てる代わりに、検索した履歴参照に対するセマンティックな残基をエンコードし、保存を著しく削減する。
実験によると、DeltaKVは、LongBench、SCBench、AIMEでほぼロスレスの精度を維持しながら、KVキャッシュメモリを元の29%に削減している。
論文 参考訳(メタデータ) (2026-02-08T15:14:36Z) - FlowKV: Enhancing Multi-Turn Conversational Coherence in LLMs via Isolated Key-Value Cache Management [48.904743679691414]
FlowKVはKVキャッシュ管理のための新しいマルチターン分離機構である。
蓄積された圧縮KVキャッシュを過去のターンから保存する。
古い文脈の再圧縮を防ぎ、破滅的な忘れを和らげる。
論文 参考訳(メタデータ) (2025-05-21T10:20:46Z) - KeepKV: Eliminating Output Perturbation in KV Cache Compression for Efficient LLMs Inference [16.53643930310808]
KeepKVは、厳しいメモリ制約下で性能を保ちながら出力摂動を排除するために設計された、新しい適応KVキャッシュマージ手法である。
KeepKVはメモリ使用量を大幅に削減し、推論スループットを2倍以上に向上し、10%のKVキャッシュ予算でも優れた生成品質を維持している。
論文 参考訳(メタデータ) (2025-04-14T06:58:00Z) - ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference [61.412894960600205]
大きな言語モデル(LLM)は、長いテキストを処理する際に大きなGPUメモリを必要とする。
ChunkKVは、セマンティックチャンクを基本的な圧縮単位として扱うことで、KVキャッシュ圧縮を再定義する。
結果: ChunkKVは最先端の手法を最大8.7%精度で上回る。
論文 参考訳(メタデータ) (2025-02-01T03:49:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。