論文の概要: S$^4$R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching
- arxiv url: http://arxiv.org/abs/2608.00528v1
- Date: Sat, 01 Aug 2026 08:41:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.744918
- Title: S$^4$R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching
- Title(参考訳): S$4$R:Selective Smpling, Subspaces and Sparse Reconstruction for Compressed Long-Context KV Caching
- Authors: Jialong Han, You Wu, Kewei Tu,
- Abstract要約: S$4$Rを提案し、選択されたサンプルトークンから低ランクな部分空間を構築し、わずかに再構成されたKV表現に注意を向ける。
LlamaとQwenモデルファミリを用いたLongBenchとRULERの実験では、S$4$Rが最大5$times$KV圧縮をほぼフルキャッシュ精度で達成している。
- 参考スコア(独自算出の注目度): 38.29032214906932
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The growth of context window lengths in Large Language Models (LLMs) significantly enhances their long-context capabilities but incurs prohibitive memory costs due to the Key-Value (KV) cache. Although low-rank compression of KV cache is a promising remedy, existing methods face a dilemma: offline approaches depend on external calibration data, whereas online approaches incur substantial compute for full-prompt decomposition and reconstruction. In this paper, we propose S$^4$R, which builds low-rank subspaces from selectively sampled tokens and computes attention over a sparsely reconstructed KV representation. S$^4$R uses prompt-aware initialization to build initial key/value bases from a representative prompt subset, trading off calibration-data dependence against prefilling cost. Because fully reconstructing the cache at every decoding step is prohibitively expensive and hurts throughput, we further adopt sparse reconstruction to retain only informative positions during decoding. Extensive experiments on LongBench and RULER with Llama and Qwen model families show that S$^4$R achieves up to 5$\times$ KV compression with near full-cache accuracy, combining the efficiency of fixed compression with the adaptability of prompt-dependent methods.
- Abstract(参考訳): LLM(Large Language Models)におけるコンテキストウィンドウ長の増大は、長いコンテキスト能力を著しく向上させるが、キーバリュー(KV)キャッシュによる禁止的なメモリコストを発生させる。
オフラインアプローチは外部のキャリブレーションデータに依存するが、オンラインアプローチはフルプロンプトの分解と再構築に相当な計算を必要とする。
本稿では,S$^4$Rを提案する。S$^4$Rは,選択的にサンプリングされたトークンから低ランクな部分空間を構築し,わずかに再構成されたKV表現に注意を向ける。
S$4$Rは、プリフィルコストに対するキャリブレーションデータ依存を排除し、代表プロンプトサブセットから初期キー/バリューベースを構築するために、プロンプト対応初期化を使用する。
復号処理毎にキャッシュを完全に再構築することは違法に高価であり、スループットを損なうため、復号処理時にのみ情報的位置を保持するためにスパース再構成を採用する。
Llama と Qwen モデルファミリを用いたLongBench と RULER の大規模な実験により、S$^4$R は最大 5$\times$ KV 圧縮をほぼフルキャッシュ精度で達成し、固定圧縮の効率とプロンプト依存法の適応性を組み合わせた。
関連論文リスト
- RestoreKV: Recovering Full-Cache Behavior Under Aggressive Query-Agnostic KV Cache Eviction [10.668136973950453]
KVキャッシュ消去はコンテキストを一度圧縮し、結果のキャッシュを任意の将来のクエリに再利用するが、パフォーマンスは厳しい予算の下で崩壊する可能性がある。
本稿では,この選択に基づく定式化を補完するRestoreKVを紹介する。
我々の重要な洞察は、排除によって失った情報は文脈固有であるが、そのコンパクトな補完を生成するメカニズムはコンテキスト間で共有できるということである。
論文 参考訳(メタデータ) (2026-08-02T13:58:42Z) - C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference [31.428047145437773]
長文推論は、検索拡張生成やマルチドキュメント推論といった現代の大規模言語モデル(LLM)アプリケーションの中心である。
推論コストの増大を軽減するため、最近の研究では、余分なプリフィル計算を減らすためにキー値(KV)キャッシュの再利用を検討した。
既存の再利用手法は主に保存に重点を置いており、KVキャッシュの保存とアクセスのコストという長期的サービスにおける重要なボトルネックを見落としている。
論文 参考訳(メタデータ) (2026-07-20T09:09:23Z) - DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity [50.52392445266824]
そこで本稿では,KV表現における長距離間類似性と高共有遅延成分を動機とする残差ベースのKVキャッシュ圧縮フレームワークを提案する。
DeltaKVはトークンを捨てる代わりに、検索した履歴参照に対するセマンティックな残基をエンコードし、保存を著しく削減する。
実験によると、DeltaKVは、LongBench、SCBench、AIMEでほぼロスレスの精度を維持しながら、KVキャッシュメモリを元の29%に削減している。
論文 参考訳(メタデータ) (2026-02-08T15:14:36Z) - KVReviver: Reversible KV Cache Compression with Sketch-Based Token Reconstruction [20.53279247581787]
スケッチアルゴリズムに基づく可逆的なKVキャッシュ圧縮手法であるKVReviverを提案する。
2kのコンテキストでは、同じエンドツーエンドの推論精度を維持しながら、KVキャッシュの予算の10%しか必要としない。
32kのコンテキストでは、同等または同等の精度の2%の精度の損失を達成する。
論文 参考訳(メタデータ) (2025-12-01T03:59:20Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - FlowKV: Enhancing Multi-Turn Conversational Coherence in LLMs via Isolated Key-Value Cache Management [48.904743679691414]
FlowKVはKVキャッシュ管理のための新しいマルチターン分離機構である。
蓄積された圧縮KVキャッシュを過去のターンから保存する。
古い文脈の再圧縮を防ぎ、破滅的な忘れを和らげる。
論文 参考訳(メタデータ) (2025-05-21T10:20:46Z) - ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression [10.003118268356017]
ロングコンテキストは推論効率に重大な課題をもたらす。
本稿では,意味クラスタの粒度でトークンをリコールするClusterKVを紹介する。
実験結果から、ClusterKVは32kのコンテキスト長を持つ様々なタスクにおいて、無視可能な精度の損失が得られることがわかった。
論文 参考訳(メタデータ) (2024-12-04T10:58:27Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。