論文の概要: PAGE: Partition-Aware Gated KV-Cache Eviction
- arxiv url: http://arxiv.org/abs/2609.22157v2
- Date: Tue, 22 Sep 2026 04:35:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.748338
- Title: PAGE: Partition-Aware Gated KV-Cache Eviction
- Title(参考訳): PAGE: パーティション対応のKVキャッシュ定義
- Abstract要約: KVキャッシュは圧縮以上のことができる。
キャッシュされたトークンを少しだけ保持することは、時にフルキャッシュの正確さにマッチまたは超える。
パーティション・アウェア・ゲーテッド・エヴィジョンは圧縮機ではなく安全機構である。
- 参考スコア(独自算出の注目度): 1.4055000065255678
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: KV-cache eviction can do more than compress. In long-context LLMs, keeping only some cached tokens sometimes matches or exceeds full-cache accuracy, because many redundant prefill tokens otherwise dilute attention away from the tokens that carry the answer. This benefit is not uniform, and evicting the wrong tokens can drop accuracy to zero on tasks that require precise retrieval, so the useful question is not only which tokens to keep but also whether to evict this input at all. We show that one label-free number computed from the prefill attention, the drop between early and late layers in how much attention heads agree on which tokens to read, predicts per input, before any decoding, which of the two cases an input falls under. We build this into PAGE (Partition-Aware Gated Eviction), a wrapper that runs any SnapKV-style evictor when the drop is large and keeps the full cache when it is small, with no training, labels, or fine-tuning. PAGE is a safety mechanism rather than a compressor, so we measure it by the failures it prevents. It cuts the harm rate on capacity-bound inputs from 0.75 to 0.026, and on multi-key retrieval with Mistral-7B plain SnapKV falls from 99\% to 0\% as the budget shrinks, while PAGE holds it at 89\%. Elsewhere, it passes the base evictor through unchanged, which is the intended behaviour and is what we observe in 8 of 16 cells. Code is available at https://anonymous.4open.science/r/PAGE-018239.
- Abstract(参考訳): KVキャッシュは圧縮以上のことができる。
長いコンテキストのLLMでは、キャッシュされたトークンだけを保持すると、多くの冗長なプリフィルトークンが答えを運ぶトークンから注意をそらすため、フルキャッシュの正確さにマッチすることがある。
この利点は均一ではなく、間違ったトークンを削除すれば、正確な検索を必要とするタスクで正確さをゼロにすることができる。
プリフィルアテンションから計算されたラベルのない1つの数値、どのトークンを読めばよいのか、どのデコードに先立って、どのトークンを読めばよいかという、初期層と後期層の間の減少が、入力が下降する2つのケースのどれかを示す。
私たちはこれをPAGE(Partition-Aware Gated Eviction)にビルドします。これは、ドロップが大きければSnapKVスタイルのエビクタを実行し、トレーニングやラベル、微調整なしで、小さくなったらフルキャッシュを保持するラッパーです。
PAGEは圧縮機ではなく安全機構なので、防止する障害によって測定します。
キャパシティバウンド入力のハーネスレートを0.75から0.026に削減し、Mistral-7BプレーンSnapKVによるマルチキー検索では、予算が縮小するにつれて99から0に低下し、PAGEでは89に低下する。
それは意図された振る舞いであり、16の細胞のうち8つの細胞で観察されるものである。
コードはhttps://anonymous.4open.science/r/PAGE-018239で公開されている。
関連論文リスト
- Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning [78.75986976062454]
大規模言語モデルは、拡張推論を必要とするタスクにおいて優れたパフォーマンスを達成する。
既存のKVキャッシュ圧縮メソッドは、1つのパラダイムを共有している。
選択信号はほとんど役に立たないことを示す。ランダム注意は各アテンションヘッド内でプロンプトと退避者をランダムに保ち、スコアを全く計算しない。
論文 参考訳(メタデータ) (2026-09-03T06:38:38Z) - AnchorKV: Anchor-Residual KV Cache Compression [11.048086031066623]
本稿では,AnchorKVを提案する。AnchorKVは,単一のトークンを捨てることなく,キャッシュを20倍に縮小する圧縮スキームである。
AnchorKVは、モデルとデータセット間の精度を一貫して維持し、70Bスケールでのフルキャッシュスコアの99%を保持します。
論文 参考訳(メタデータ) (2026-08-03T21:38:30Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference [78.65321721142624]
我々はキー値(KV)キャッシュによって課されるメモリボトルネックに焦点を当てる。
既存のKVキャッシュ手法は、比較的重要でないKVペアの大きなスワストを刈り取ったり、取り除いたりすることでこの問題に対処する。
本稿では,固定サイズキャッシュと退避型キャッシュを簡易に統合したLESSを提案する。
論文 参考訳(メタデータ) (2024-02-14T18:54:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。