論文の概要: RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Cache Eviction
- arxiv url: http://arxiv.org/abs/2608.01247v1
- Date: Sun, 02 Aug 2026 13:58:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.130444
- Title: RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Cache Eviction
- Title(参考訳): RestoreKV: Aggressive Query-Agnostic KV Cache Evictionの下でのフルキャッシュ動作の回復
- Authors: Changwoo Baek, Seungjun Shin, Kyeongbo Kong,
- Abstract要約: KVキャッシュ消去はコンテキストを一度圧縮し、結果のキャッシュを任意の将来のクエリに再利用するが、パフォーマンスは厳しい予算の下で崩壊する可能性がある。
本稿では,この選択に基づく定式化を補完するRestoreKVを紹介する。
我々の重要な洞察は、排除によって失った情報は文脈固有であるが、そのコンパクトな補完を生成するメカニズムはコンテキスト間で共有できるということである。
- 参考スコア(独自算出の注目度): 10.668136973950453
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Query-agnostic KV cache eviction compresses a context once and reuses the resulting cache for arbitrary future queries, but performance can collapse under tight budgets. Existing methods primarily improve which original KV pairs are retained. We introduce RestoreKV, which complements this selection-based formulation with learned restoration under the same total KV budget. Our key insight is that, although the information lost through eviction is context-specific, the mechanism for generating its compact complement can be shared across contexts. After context prefill, a few restore tokens attend to the full KV cache in a single LoRA-adapted pass, generating a compact, context-conditioned restore cache. The base importance scorer and eviction rule remain unchanged, and the adapters are disabled for all subsequent queries and decoding. RestoreKV is trained through parameter-efficient self-distillation from the frozen full-cache model, optimizing only $0.4\%$ of the parameters and requiring no task-specific tuning. Across four backbones and four long-context benchmarks, RestoreKV substantially reduces compression-induced degradation. On Qwen3-4B, it improves 59 of 60 paired, budget-matched settings across five base eviction methods; at a $5\%$ budget, it raises KVzip from $38.2$ to $73.2$ on RULER-4K. Applied to KVzip+, RestoreKV reaches $86.4$ RULER accuracy at $16\times$ compression on the KVPress Benchmark, while adding less than $0.5\%$ one-time cache-construction overhead in a 32K-context evaluation. Our project page is available at https://paper.pnu-cvsp.com/RestoreKV/
- Abstract(参考訳): クエリに依存しないKVキャッシュ消去は、コンテキストを一度圧縮し、結果のキャッシュを任意の将来のクエリに再利用するが、パフォーマンスは厳しい予算の下で崩壊する可能性がある。
既存の方法は主に、元のKVペアが保持されているものを改善する。
本稿では,この選択に基づく定式化を補完するRestoreKVを紹介する。
我々の重要な洞察は、排除によって失った情報は文脈固有であるが、そのコンパクトな補完を生成するメカニズムはコンテキスト間で共有できるということである。
コンテクストプリフィルの後、いくつかの復元トークンが単一のLoRA適応パスの完全なKVキャッシュに付随し、コンパクトでコンテクスト条件の復元キャッシュを生成する。
基本重要スコアラと消去ルールは変わらず、アダプタはその後の全てのクエリやデコードで無効になる。
RestoreKVは、凍結されたフルキャッシュモデルからパラメータ効率のよい自己蒸留によって訓練され、パラメータの0.4\%を最適化し、タスク固有のチューニングを必要としない。
4つのバックボーンと4つの長期コンテキストベンチマークで、RestoreKVは圧縮による劣化を大幅に低減する。
Qwen3-4Bでは、59対の60の予算設定を5つの基準で改善し、予算5.%の予算で、KVzipをRULER-4Kで38.2ドルから7.3.2ドルに引き上げている。
KVzip+に適用されたRestoreKVのRULER精度は、KVPress Benchmarkの16\times$圧縮で86.4ドル、32Kコンテキスト評価では0.5\%以下である。
私たちのプロジェクトページはhttps://paper.pnu-cvsp.com/RestoreKV/で公開されている。
関連論文リスト
- S$^4$R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching [38.29032214906932]
S$4$Rを提案し、選択されたサンプルトークンから低ランクな部分空間を構築し、わずかに再構成されたKV表現に注意を向ける。
LlamaとQwenモデルファミリを用いたLongBenchとRULERの実験では、S$4$Rが最大5$times$KV圧縮をほぼフルキャッシュ精度で達成している。
論文 参考訳(メタデータ) (2026-08-01T08:41:29Z) - C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference [31.428047145437773]
長文推論は、検索拡張生成やマルチドキュメント推論といった現代の大規模言語モデル(LLM)アプリケーションの中心である。
推論コストの増大を軽減するため、最近の研究では、余分なプリフィル計算を減らすためにキー値(KV)キャッシュの再利用を検討した。
既存の再利用手法は主に保存に重点を置いており、KVキャッシュの保存とアクセスのコストという長期的サービスにおける重要なボトルネックを見落としている。
論文 参考訳(メタデータ) (2026-07-20T09:09:23Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - The Residual Stream Is All You Need: On the Redundancy of the KV Cache in Transformer Inference [3.378773775514883]
キー値(KV)キャッシュは、トランスフォーマー推論において必須の状態として広く扱われる。
各層におけるキーと値が残留ストリームの決定論的射影であることを証明する。
我々は、境界メモリ推論スキームであるKV-Directを用いて、この結果に基づいて構築する。
論文 参考訳(メタデータ) (2026-03-20T05:59:50Z) - R-KV: Redundancy-aware KV Cache Compression for Reasoning Models [77.84539432982307]
共振モデル(R-KV)のための冗長性を考慮したKVキャッシュ圧縮を提案する。
R-KVはKVキャッシュの10%しか使用せず、完全なKVキャッシュ性能のほぼ100%を保っている。
驚くべきことに、R-KVは完全なKVキャッシュ性能の105%を達成し、KVキャッシュの16%を達成している。
論文 参考訳(メタデータ) (2025-05-30T02:03:24Z) - KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction [37.97434606840326]
トランスフォーマーベースの大規模言語モデル(LLM)は、推論中にキー値(KV)ペアとしてキャッシュコンテキストを持つ。
コンテキストの長さが大きくなると、KVキャッシュのサイズが拡大し、メモリオーバーヘッドが大きくなり、注意の遅延が増大する。
本稿では,クエリに依存しないKVキャッシュ消去手法であるKVzipを紹介する。
論文 参考訳(メタデータ) (2025-05-29T13:05:47Z) - FlowKV: Enhancing Multi-Turn Conversational Coherence in LLMs via Isolated Key-Value Cache Management [48.904743679691414]
FlowKVはKVキャッシュ管理のための新しいマルチターン分離機構である。
蓄積された圧縮KVキャッシュを過去のターンから保存する。
古い文脈の再圧縮を防ぎ、破滅的な忘れを和らげる。
論文 参考訳(メタデータ) (2025-05-21T10:20:46Z) - DBudgetKV: Dynamic Budget in KV Cache Compression for Ensuring Optimal Performance [125.81664663201282]
我々はDBudgetKVと呼ばれる新しいKVキャッシュ圧縮手法を提案する。
残りのKVキャッシュがフルキャッシュのパフォーマンスにマッチしない場合、注意ベースのメトリクスが特徴である。
提案手法は, 平均圧縮率25%を超え, 無損失KVプルーニングを効果的かつ堅牢に実現している。
論文 参考訳(メタデータ) (2025-02-24T06:33:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。