論文の概要: AvoKV-E: Payload-Aware KV Cache Eviction for Long Reasoning
- arxiv url: http://arxiv.org/abs/2610.03007v1
- Date: Fri, 02 Oct 2026 08:37:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.286549
- Title: AvoKV-E: Payload-Aware KV Cache Eviction for Long Reasoning
- Title(参考訳): AvoKV-E:長期推論のためのペイロード対応KVキャッシュエミッション
- Abstract要約: AvoKV-E(AvoKV-E)は、候補正規化読み取り圧力、キー冗長性、およびバリューペイロード電位を用いて、資格項目のランク付けを行う。
AvoKV-Eは, 一致したアクティブKV予算において, 冗長性認識, 反復性ベースライン, 思考適応性ベースラインと一致するか, あるいは超えたかを示す。
- 参考スコア(独自算出の注目度): 25.40415277551637
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-output reasoning shifts the KV-cache bottleneck from the fixed prompt to the generated trace. Existing reasoning-cache eviction methods largely treat cached entries as routing objects, estimating whether an old key will still be read, will recur, or can be replaced. This routing-only view overlooks two effects: low-attention entries can carry large value payloads whose removal changes future predictions, and newly generated states can appear stale before later queries have had a chance to read them. We introduce AvoKV-E, a training-free eviction policy that first delays eligibility for recent states and then ranks eligible entries using candidate-normalized read pressure, key redundancy, and value-payload potential. According to empirical evaluation across different models and datasets, AvoKV-E matches or exceeds redundancy-aware, recurrence-based, and thought-adaptive eviction baselines at matched active-KV budgets, with its largest gains in the tightest-cache regime. Component and counterfactual analyses further connect these gains to delayed observation, payload-aware scoring, redundancy, and scale-robust normalization. Together, the results show that long-reasoning KV eviction should preserve not only keys that are likely to be read, but also the value payloads that sustain the reasoning trajectory.
- Abstract(参考訳): 長期出力推論は、KV-cacheボトルネックを固定プロンプトから生成されたトレースにシフトさせる。
既存の推論とキャッシュの排除メソッドは、キャッシュされたエントリをルーティングオブジェクトとして扱い、古いキーがまだ読み込まれるか、再帰されるか、あるいは置き換えられるかを推定する。
このルーティングのみのビューは2つの効果を見越す: 低アテンションのエントリは、削除が将来の予測を変える大きな価値ペイロードを運べる。
AvoKV-E(AvoKV-E)は、近年の国家の適格性を最初に遅らせ、次に候補正規化読解圧力、キー冗長性、および値負荷ポテンシャルを用いて適格エントリーをランク付けする、訓練不要のエミッションポリシーである。
AvoKV-Eは、さまざまなモデルやデータセットにわたる実証的な評価によると、一致したアクティブKV予算において、冗長性を認識し、反復性に基づいて、思考適応的退避ベースラインと一致し、最も厳しい状況下で最大の利益を上げている。
成分分析と反ファクト解析は、これらの利得を、遅延観測、ペイロード認識スコアリング、冗長性、スケールロバスト正規化にさらに結び付ける。
結果から,KVの長期消去は,読みやすい鍵だけでなく,推論軌道を維持できる値ペイロードも保存すべきであることが示された。
関連論文リスト
- A Probabilistic Interpretation of KV Cache Eviction [52.196873305708955]
キャッシュ消去は、KVキャッシュからいくつかのエントリを削除することで、より高いスループットを達成することができる。
本稿では,確率論的推論のレンズによるKV放出問題の定式化を行う。
この確率的バージョンのKV消去と復号時間補正は、異なるタスクに対してより堅牢であることを示す。
論文 参考訳(メタデータ) (2026-08-28T12:57:07Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - A Simple Plug-in for Improving Eviction-Based KV Cache Compression [45.534752680313886]
KVキャッシュの増大は、大規模言語モデルにおける長期コンテキスト推論の大きなボトルネックである。
本稿では,エビクションベースのパイプラインのためのプラグアンドプレイ拡張であるVECTORを提案する。
VECTORは中~高圧縮下でのメモリ品質のトレードオフを改善する。
論文 参考訳(メタデータ) (2026-05-22T06:00:15Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - Learning to Evict from Key-Value Cache [17.365511268829703]
我々はKV Policyを紹介した。KV Policyはトークンのランク付けを学習するためのフレームワークであり、将来的な復号化に役立つと予測されている。
長文ベンチマークRULERとマルチターンダイアログベンチマークOASST2-4kの2種類のモデルファミリで評価した。
その結果、将来のトークンユーティリティを予測する学習は、適応的なKVキャッシュ管理のための強力でスケーラブルなパラダイムであることが示されている。
論文 参考訳(メタデータ) (2026-02-10T19:34:15Z) - ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution [84.41751286055909]
我々は、長文世代におけるどのKVペアを退避させるかを予測する訓練ベースのKVキャッシュ消去フレームワークを開発した。
我々は、マルコフ決定過程としてキャッシュ消去を定式化し、GRPOアルゴリズムを適用し、低エントロピートークンにおける言語モデリング損失の増加を緩和する。
論文 参考訳(メタデータ) (2026-02-03T07:16:51Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long Reasoning [21.761205124793175]
拡張推論シーケンスでは、キー値(KV)キャッシュの増加によるGPUメモリオーバーヘッドが大幅に増加する。
既存のKVキャッシュ圧縮手法は、メモリボトルネックを軽減するが、長い推論タスクに苦労する。
トークンの繰り返しパターンに基づいた優先順位付けによる遅延繰り返しトークンを保持する観測窓ベースのラッチ消去フレームワークであるLazyEvictionを提案する。
論文 参考訳(メタデータ) (2025-06-19T02:25:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。