論文の概要: iS-KV: Online Low-Rank KV Cache Compression via Block-Incremental SVD
- arxiv url: http://arxiv.org/abs/2610.02815v1
- Date: Fri, 02 Oct 2026 05:03:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.213866
- Title: iS-KV: Online Low-Rank KV Cache Compression via Block-Incremental SVD
- Title(参考訳): iS-KV: ブロックインクリメンタルSVDによるオンライン低ランクKVキャッシュ圧縮
- Abstract要約: ロングチェーン・オブ・シント推論は自己回帰復号時のKVキャッシュメモリを大幅に増加させる。
既存のKV-cache圧縮法は、トークンの消去によってこの成長を制御するのが一般的である。
長軸推論のためのオンライン低ランクKVキャッシュ圧縮手法iS-KVを提案する。
- 参考スコア(独自算出の注目度): 39.912356113196196
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long chain-of-thought reasoning substantially increases KV-cache memory during autoregressive decoding, as every generated token introduces new key and value states and causes the cache to grow linearly with decoding length. Existing KV-cache compression methods typically control this growth through token eviction, but irreversible deletion can remove historical states that later reasoning may need to revisit. SVD-based low-rank compression provides an alternative by retaining all positions with a more compact representation. However, extending it from a fixed prompt cache to online decoding is non-trivial. Through our investigation, we find that if the basis is updated for new tokens while old tokens keep their coordinates in the old basis, the stored history drifts substantially. Based on this observation, we propose iS-KV, an online low-rank KV-cache compression method for long-horizon reasoning. iS-KV keeps a recent window exact while incrementally folding older states into bounded-rank representations. As the low-rank basis evolves, it synchronizes historical coordinates with the updated basis to maintain representation consistency. On DeepSeek-R1-Distill-Llama-8B, iS-KV achieves 82.6% accuracy at 4.06-fold persistent-KV compression, close to the original model's 83.6%. On Qwen3-8B, it achieves 89.2% accuracy at 5.64-fold compression. Under matched memory budgets, iS-KV consistently outperforms token-eviction baselines.
- Abstract(参考訳): すべての生成されたトークンが新しいキーと値状態を導入し、キャッシュがデコード長とともに線形に成長する。
既存のKV-cache圧縮法は、トークンの排除によってこの成長を制御するが、不可逆的な削除は、後続の推論が再検討する必要があるという歴史的な状態を取り除くことができる。
SVDベースの低ランク圧縮は、よりコンパクトな表現で全ての位置を保持するという代替手段を提供する。
しかし、それを固定プロンプトキャッシュからオンラインデコードに拡張するのは簡単ではない。
調査の結果,新しいトークンの基底が更新され,古いトークンが座標を古めかに保っている場合,保存された履歴は著しくドリフトすることがわかった。
そこで本研究では,オンライン低ランクKVキャッシュ圧縮手法iS-KVを提案する。
iS-KVは最近のウィンドウを正確に保ちながら、古い状態を境界ランクの表現に徐々に折り畳む。
低ランク基底が進化するにつれて、歴史的な座標と更新された基底を同期させ、表現整合性を維持する。
DeepSeek-R1-Distill-Llama-8Bでは、iS-KVは4.06倍の持続KV圧縮で82.6%の精度を達成した。
Qwen3-8Bでは、89.2%の精度で5.64倍の圧縮を実現している。
一致したメモリ予算の下では、iS-KVは一貫してトークン消去ベースラインを上回っている。
関連論文リスト
- SlimKV: Joint Token-Feature KV Cache Compression with Reconstruction-Free Beacon Attention [5.878850231726241]
SlimKV はトークン機能を持つ KV-cache 圧縮方式である。
遅延KV表現を用いて、長いコンテキストをビーコンメモリ状態に圧縮できることを示す。
LongBenchでは、SlimKVは16x/32x圧縮でベースラインを上回り、4x/8xでリードしている。
論文 参考訳(メタデータ) (2026-10-02T07:45:42Z) - SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference [37.37437232987781]
SeKVは、コンテキストをエントロピー誘導セマンティックスパンに整理する、解像度適応型セマンティックKVキャッシュである。
本研究では,SeKVが最強のセマンティック圧縮ベースラインよりも平均5.9%向上していることを示す。
128KコンテキストでのフルKVキャッシュに対して、GPUメモリを53.3%削減する。
論文 参考訳(メタデータ) (2026-06-30T05:18:02Z) - GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs [97.36238579001544]
コンテキスト長が拡張された大規模言語モデル(LLM)は、キー値(KV)キャッシュに依存して、以前のトークンに対する注意をサポートする。
KVキャッシュを維持することは、KVキャッシュ圧縮メソッドを動機付け、かなりのメモリオーバーヘッドを引き起こす。
GRKVは,圧縮キャッシュとフルキャッシュのアテンション出力の差を直接最小化する,トレーニング不要なKV-cacheマージ手法である。
論文 参考訳(メタデータ) (2026-05-29T10:16:30Z) - DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity [50.52392445266824]
そこで本稿では,KV表現における長距離間類似性と高共有遅延成分を動機とする残差ベースのKVキャッシュ圧縮フレームワークを提案する。
DeltaKVはトークンを捨てる代わりに、検索した履歴参照に対するセマンティックな残基をエンコードし、保存を著しく削減する。
実験によると、DeltaKVは、LongBench、SCBench、AIMEでほぼロスレスの精度を維持しながら、KVキャッシュメモリを元の29%に削減している。
論文 参考訳(メタデータ) (2026-02-08T15:14:36Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference [61.412894960600205]
大きな言語モデル(LLM)は、長いテキストを処理する際に大きなGPUメモリを必要とする。
ChunkKVは、セマンティックチャンクを基本的な圧縮単位として扱うことで、KVキャッシュ圧縮を再定義する。
結果: ChunkKVは最先端の手法を最大8.7%精度で上回る。
論文 参考訳(メタデータ) (2025-02-01T03:49:47Z) - KV-Compress: Paged KV-Cache Compression with Variable Compression Rates per Attention Head [0.8158530638728501]
そこで我々は,PagedAttentionフレームワーク内で連続KVブロックを除去する新しい圧縮手法であるKV-Compressを紹介する。
本手法は,Mistral-7B-Instruct-v0.2およびLlama-3.1-8B-InstructのLongBenchにおける圧縮KVの総数を4倍に減らしながら,最先端の性能を実現する。
Llama-3.1-8B-InstructとLlama-3.1-70B-Instruct-FP8の評価は、圧縮速度を最大8倍まで達成し、性能に悪影響を及ぼすことなく、フルキャッシュ性能の90%以上を維持しながら、最大64倍まで向上する。
論文 参考訳(メタデータ) (2024-09-30T19:09:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。