論文の概要: DeferKV: Rethinking Eviction Timing for One-Shot KV Cache Compression
- arxiv url: http://arxiv.org/abs/2610.06286v1
- Date: Mon, 05 Oct 2026 13:13:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 09:32:48.518756
- Title: DeferKV: Rethinking Eviction Timing for One-Shot KV Cache Compression
- Title(参考訳): DeferKV: ワンショットKVキャッシュ圧縮の有効期限の再考
- Abstract要約: プリフィルの終了から最初の実復号ステップに移行するデファKVを提案する。
LongBench、RULER、Needle-in-a-Haystackの実験では、DeferKVはKVキャッシュ圧縮下でのモデルパフォーマンスを一貫して改善することを示した。
- 参考スコア(独自算出の注目度): 9.272744913886472
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-context large language models (LLMs) have demonstrated strong capabilities across a wide range of tasks, but the growing KV cache introduces substantial memory and inference overhead. Existing one-shot KV cache compression methods typically commit to irreversible eviction immediately after prefill, before any signal from actual generation becomes available. Our quantitative analysis shows that early queries from the actual generation stage provide attention signals that are more consistent with subsequent decode attention, with the largest single-step gain occurring at the prefill-decode boundary. Based on this observation, we propose DeferKV, which moves the eviction decision from the end of prefill to the first real decoding step and temporally combines prompt-side and decode-side observations, thereby better aligning KV importance estimation with subsequent generation requirements. DeferKV requires no additional training, draft model, or future-query prediction module, making it simple and easy to deploy. Experiments on LongBench, RULER, and Needle-in-a-Haystack demonstrate that DeferKV consistently improves model performance under KV cache compression while maintaining low inference latency.
- Abstract(参考訳): LLM(Long-context Large Language Model)は、幅広いタスクにまたがる強力な機能を示しているが、KVキャッシュの増大により、メモリと推論のオーバーヘッドが大幅に増大する。
既存の1ショットのKVキャッシュ圧縮手法は、通常、プリフィルの直後に、実際の世代からの信号が利用可能になる前に、不可逆的な消去をコミットする。
我々の定量的分析により、実際の生成段階からの早期クエリは、後続のデコードアテンションとより整合したアテンション信号を提供し、プリフィル・デコードバウンダリで最大のシングルステップゲインが生じることが示された。
この観測に基づいて,プリフィルの終了から第1の実復号ステップに消去決定を移動させ,プロンプト側とデコード側を時間的に組み合わせて,KVの重要度推定とその後の生成要求との整合性を向上するDederKVを提案する。
DeferKVは、追加のトレーニングやドラフトモデル、将来のクエリ予測モジュールを必要としないため、デプロイが簡単で簡単である。
LongBench、RULER、Needle-in-a-Haystackの実験では、DeferKVは低推論レイテンシを維持しながら、KVキャッシュ圧縮下でのモデルパフォーマンスを一貫して改善することを示した。
関連論文リスト
- BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference [20.58039191111583]
大型共振モデル (LRM) は拡張型チェイン・オブ・ソート (CoT) 生成により優れた問題解決を実現する。
その結果、キー値(KV)キャッシュはシーケンス長とともに線形に成長し、深刻なメモリボトルネックを発生させる。
本研究では,各グローバルなクエリクラスタに対して,Beaconクエリ,コンパクトな表現を格納する,トレーニング不要なKVキャッシュ圧縮手法であるBeaconKVを提案する。
論文 参考訳(メタデータ) (2026-09-04T10:23:16Z) - IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference [33.37463192332294]
我々は、KVの重要性を予測し、クリティカルトークンのより正確な保持を可能にする学習可能なインデクサを導入する。
本稿では,トークンをコンパクトでオンライン更新された状態に圧縮する軽量潜在メモリモジュールを提案する。
提案手法は,境界KV予算下での高精度な長文推論を可能にする。
論文 参考訳(メタデータ) (2026-05-25T06:29:43Z) - When Hidden States Drift: Can KV Caches Rescue Long-Range Speculative Decoding? [19.77569541429818]
投機的復号化はLLM推論を加速させるが、SOTAの隠れ状態に基づく起草者は長距離減衰に悩まされる。
我々はコンテキスト情報保存の観点から長距離減衰を再考する。
KVShotは3つの再利用パラダイムを比較する診断フレームワークである。
論文 参考訳(メタデータ) (2026-04-29T08:25:01Z) - ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution [84.41751286055909]
我々は、長文世代におけるどのKVペアを退避させるかを予測する訓練ベースのKVキャッシュ消去フレームワークを開発した。
我々は、マルコフ決定過程としてキャッシュ消去を定式化し、GRPOアルゴリズムを適用し、低エントロピートークンにおける言語モデリング損失の増加を緩和する。
論文 参考訳(メタデータ) (2026-02-03T07:16:51Z) - FAEDKV: Infinite-Window Fourier Transform for Unbiased KV Cache Compression [18.12657364501536]
FAEDKVは、トレーニング不要のKVキャッシュ圧縮フレームワークである。
初期の情報と最近の情報の両方を保存している。
LongBenchベンチマークの実験では、FAEDKVは既存のメソッドよりも最大22%優れていた。
論文 参考訳(メタデータ) (2025-07-26T18:20:25Z) - AttentionPredictor: Temporal Patterns Matter for KV Cache Compression [64.75459635661562]
我々は,KVキャッシュ圧縮とクリティカルトークン識別のための注意パターンを直接予測する,学習に基づく最初の手法であるAttentionPredictorを提案する。
AttentionPredictorは、注意スコアを正確に予測し、無視可能なメモリを消費する統一予測モデルを共有する。
注意情報の大半を保持することで、AttentionPredictorは、キャッシュオフロードシナリオで13$times$KVキャッシュ圧縮と5.6$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2025-02-06T13:41:46Z) - More Tokens, Lower Precision: Towards the Optimal Token-Precision Trade-off in KV Cache Compression [71.42818367729573]
大規模言語モデル(LLM)では、KVキャッシュのメモリ使用量は推論において重大なボトルネックとなっている。
KVプルーニングやKV量子化を含む主流のKV圧縮法は、主にトークンまたは精度寸法を別々に扱う。
本稿では,KVキャッシュ圧縮におけるトークン精度トレードオフを包括的に検討する。
論文 参考訳(メタデータ) (2024-12-17T09:20:31Z) - PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation [97.41972925670508]
大規模視覚言語モデル(LVLM)は、推論中に重要な計算とメモリオーバーヘッドを引き起こす。
ここでは、PrefixKVについて述べる。ここでは、Prefixは、元のシーケンスの位置ではなく、重要度に基づいて、上位ランクのKVを意味する。
本手法は他の手法と比較して最先端の性能を実現する。
論文 参考訳(メタデータ) (2024-12-04T15:48:59Z) - No Token Left Behind: Reliable KV Cache Compression via Importance-Aware
Mixed Precision Quantization [31.806112535762367]
キーバリューキャッシングは、生成型大規模言語モデル(LLM)の推論速度とスループットを加速する重要な技術となっている。
論文 参考訳(メタデータ) (2024-02-28T06:34:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。