論文の概要: When to Evict, Not What to Keep: Draft-Guided Eviction for Training-Free KV-Cache Compression
- arxiv url: http://arxiv.org/abs/2609.33334v1
- Date: Sun, 27 Sep 2026 08:04:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 01:05:25.891801
- Title: When to Evict, Not What to Keep: Draft-Guided Eviction for Training-Free KV-Cache Compression
- Title(参考訳): Evict, not to keep what: Draft-Guided Eviction for Training-free KV-Cache Compression
- Abstract要約: SnapKV、H2O、PraamidKVといったKVキャッシュ圧縮手法は、プリフィルの終了時にトークンを除去する。
この目的が2つの異なる方法で失敗することを示します。
Draft-Guided Eviction は、完全なキャッシュを使用して最初の k=2 の応答トークンをドラフトした後まで、eviction をデフレする。
- 参考スコア(独自算出の注目度): 38.049805308598806
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training-free KV-cache compression methods such as SnapKV, H2O, and PyramidKV evict tokens at the end of prefill, aiming to preserve the attention mass that future queries are expected to use -optimizing what to keep. We show that this objective fails in two distinct ways. (1) Compensation: restoring the evicted attention mass can recover the attention-level target without recovering task quality. (2) Selection: covering more of the true decode-query mass can hurt quality when the recovered mass is fragmented rather than concentrated in coherent spans. These failures share a common cause: eviction occurs before the queries that determine the answer trajectory exist. We propose Draft-Guided Eviction (DGE), which defers eviction until after drafting the first k=2 answer tokens using the full cache - just one decode step beyond prefill. Because the draft is generated from the answer's own prefix, no cache entries are discarded before this trajectory signal becomes available. The per-head cache budget remains unchanged, and DGE can be applied directly to SnapKV, PyramidKV, H2O, and StreamingLLM without modifying their eviction scores. Unlike extra-pass methods, DGE changes when eviction occurs rather than what cache entries are selected. Extensive experiments demonstrate that DGE outperforms prior methods at every evaluated budget on five of six instruct-tuned backbones, achieving 44.2 on LongBench, nearly matching FullKV at 44.3. The timing-only control DGE-W achieves the same score, demonstrating that the gain comes from when eviction occurs rather than what is selected - an effect we term trajectory anchoring.
- Abstract(参考訳): SnapKV、H2O、PraamidKVなどのトレーニング不要なKVキャッシュ圧縮メソッドは、プリフィルの終了時にトークンを削除し、将来のクエリが使用するであろう注意質量を保存することを目的としている。
この目的が2つの異なる方法で失敗することを示します。
1)補償:失明した注意質量を回復させることで,タスク品質を回復させることなく,注目レベルの目標を回復することができる。
2) 選択: 真のデコード・クエリの質量を多く覆うことは, コヒーレント・スパンに集中するのではなく, 回収した質量が断片化されたときに品質を損なう可能性がある。
これらの失敗は共通の原因を共有している: 解答軌跡を決定するクエリの前に、解答が生じる。
そこで我々はDraft-Guided Eviction (DGE)を提案する。これは、完全なキャッシュを使用して最初のk=2の応答トークンをドラフトした後で、プリフィル以上のステップでデコードする。
ドラフトは、回答自身のプレフィックスから生成されるため、このトラジェクトリ信号が利用可能になる前にキャッシュエントリは破棄されない。
DGEはSnapKV、PraamidKV、H2O、StreamingLLMに直接適用することができる。
エクストラパスメソッドとは異なり、DGEはキャッシュエントリが選択されるのではなく、エビテーションが発生すると変更する。
大規模な実験により、DGEは6つのインストラクションで調整されたバックボーンのうち5つで評価された予算で先行手法を上回り、LongBenchでは44.2を達成し、FullKVは44.3とほぼ一致した。
タイミングのみの制御DGE-Wは同じスコアを達成し、その利得は、選択されるものではなく、排除が発生したときに生じるものであることを示す。
関連論文リスト
- Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning [78.75986976062454]
大規模言語モデルは、拡張推論を必要とするタスクにおいて優れたパフォーマンスを達成する。
既存のKVキャッシュ圧縮メソッドは、1つのパラダイムを共有している。
選択信号はほとんど役に立たないことを示す。ランダム注意は各アテンションヘッド内でプロンプトと退避者をランダムに保ち、スコアを全く計算しない。
論文 参考訳(メタデータ) (2026-09-03T06:38:38Z) - QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding [13.920782070418246]
生成したクエリが進化するにつれてトークンとウィンドウの重要度が低下し、標準的な消去ポリシーが状態を恒久的に破棄することを示した。
本稿では、リカバリ可能なリカバリでリカバリ可能なリカバリを代替する3層KV-cache管理方式であるQEvictを提案する。
論文 参考訳(メタデータ) (2026-08-05T18:29:47Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference [12.316173390280609]
Transformerベースの言語モデルにおける自動回帰デコーディングは、KVキャッシュに依存している。
KVキャッシュ消去は、キーと値のペアの固定サイズのサブセットを保持し、残りを破棄することでこの問題に対処する。
本稿では, 除去トークン集合上のコンパクトで小型なモーメント統計量を維持するMomentKVを提案する。
論文 参考訳(メタデータ) (2026-06-01T02:08:40Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution [84.41751286055909]
我々は、長文世代におけるどのKVペアを退避させるかを予測する訓練ベースのKVキャッシュ消去フレームワークを開発した。
我々は、マルコフ決定過程としてキャッシュ消去を定式化し、GRPOアルゴリズムを適用し、低エントロピートークンにおける言語モデリング損失の増加を緩和する。
論文 参考訳(メタデータ) (2026-02-03T07:16:51Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long Reasoning [21.761205124793175]
拡張推論シーケンスでは、キー値(KV)キャッシュの増加によるGPUメモリオーバーヘッドが大幅に増加する。
既存のKVキャッシュ圧縮手法は、メモリボトルネックを軽減するが、長い推論タスクに苦労する。
トークンの繰り返しパターンに基づいた優先順位付けによる遅延繰り返しトークンを保持する観測窓ベースのラッチ消去フレームワークであるLazyEvictionを提案する。
論文 参考訳(メタデータ) (2025-06-19T02:25:04Z) - In-context KV-Cache Eviction for LLMs via Attention-Gate [12.732519329131392]
KVキャッシュ技術は、大規模言語モデル(LLM)の推論の標準となっている。
本稿では,Attention-Gateと呼ばれる軽量モジュールをモデルに注入することで,KVキャッシュの動的な消去ポリシーを実現する。
提案手法は複数のシナリオにまたがって実験的に評価され,冗長トークンの有効排除は効率を向上するだけでなく,性能も向上することを示した。
論文 参考訳(メタデータ) (2024-10-15T05:01:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。