論文の概要: CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM
- arxiv url: http://arxiv.org/abs/2605.24786v1
- Date: Sun, 24 May 2026 00:15:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.439224
- Title: CONF-KV: Confidence-Aware KV Cache Eviction with Mixed-Precision Storage for Long-Horizon LLM
- Title(参考訳): CONF-KV:長期LLM用混合精度記憶型信頼性対応KVキャッシュエミッション
- Authors: Yubo Li, Yidi Miao,
- Abstract要約: ステップごとのキャッシュ予算を選択するKVキャッシュマネージャであるConF-KVを紹介する。
トークンは、蓄積された注目質量と相対性の複合物によってランク付けされます。
75のVisualWebArenaタスクでは、全KV成功の95.3%をピークメモリの2.8倍に維持する。
- 参考スコア(独自算出の注目度): 8.82843279804122
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon LLM inference turns the key--value (KV) cache into the dominant GPU memory consumer and makes per-token attention increasingly expensive. Many common eviction policies use static recency windows or historical attention, leaving unused a signal computed on every decoding step: the model's current uncertainty. We introduce CONF-KV, a KV-cache manager that converts the next-token distribution into a scalar confidence score and uses it to choose the per-step cache budget, retaining more context when the model is uncertain and pruning aggressively when it is confident. Within each budget, tokens are ranked by a composite of accumulated attention mass and recency, while a protected recent window preserves local coherence. We combine the policy with blockwise online-softmax attention, mixed FP16/INT8 storage, and a pyramidal per-layer budget variant. Across four model families and generated lengths up to 4K, CONF-KV stays near the footprint of a fixed 512-token sliding window while remaining within 1.5--2.1 perplexity points of full KV. On Needle-in-a-Haystack up to 32K tokens, CONF-KV reaches 91.4% retrieval accuracy versus 53.8% for sliding windows and 80.6% for H2O; on 75 VisualWebArena tasks it retains 95.3% of full-KV success at 2.8 times lower peak memory.
- Abstract(参考訳): Long-Horizon LLM推論はキー値(KV)キャッシュを支配的なGPUメモリコンシューマに変換する。
多くの一般的な消去ポリシーでは、静的な遅延ウィンドウや歴史的な注意が使われ、未使用の信号はデコードステップ毎に計算される:現在の不確実性である。
本研究では,次点分布をスカラー信頼スコアに変換するKV-CacheマネージャであるConF-KVを導入し,モデルが不確かで,自信のある場合には積極的にプルーニングを行う場合に,ステップごとのキャッシュ予算を選択する。
各予算内では、トークンは蓄積された注目質量と電流の合成によってランク付けされ、保護された最近の窓は局所的なコヒーレンスを保存する。
ポリシには,ブロックワイズなオンライン-ソフトマックスアテンション,混合FP16/INT8ストレージ,ピラミッド単位の予算バリエーションが組み合わさっている。
4つのモデルファミリと最大4Kまでの長さで、CONF-KVは固定された512トンのスライドウィンドウのフットプリントの近くに留まり、フルKVの1.5--2.1パープレキシティポイント内に留まる。
Needle-in-a-Haystackの32Kトークンでは、ConF-KVは91.4%、スライディングウィンドウは53.8%、H2Oは80.6%に達し、75のVisualWebArenaタスクでは、フルKVの成功の95.3%を2.8倍のピークメモリで保持している。
関連論文リスト
- TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference [11.997332729897899]
キーバリュー(KV)キャッシングは、大規模言語モデル(LLM)における効率的な推論に重要である
我々は,人間のメモリシステムをKVキャッシュにマッピングするKVキャッシュ管理フレームワークであるTTKVを提案する。
実験の結果、TTKVは128Kのコンテキストタスクにおいて、層間トラフィックを5.94倍削減し、最大で76%のレイテンシ削減と2倍のスループット向上を実現している。
論文 参考訳(メタデータ) (2026-03-27T09:01:23Z) - Beyond Token Eviction: Mixed-Dimension Budget Allocation for Efficient KV Cache Compression [16.495900730787955]
キー値キャッシュ(KV)はトランスフォーマー推論の高速化に広く用いられているが、メモリコストは入力長とともに線形に増加する。
より粒度の細かいトークンに次元を割り当てる混合次元KVキャッシュ圧縮法であるMixedDimKVを提案する。
私たちのソリューションは、キャッシュの0.26%をわずかに使用しながら、50Kのコンテキスト長で100%の精度を維持します。
論文 参考訳(メタデータ) (2026-03-21T03:21:43Z) - Selective KV-Cache Sharing to Mitigate Timing Side-Channels in LLM Inference [6.864810630905683]
ユーザ単位のアイソレーションなどの既存の防御は、リークをなくすが、TTFT(Time-to-first-token)で最大38.9%性能を低下させる。
プライバシーに配慮したKV-cache管理フレームワークであるSafeKVを紹介した。
評価の結果,SafeKVは時間ベースのサイドチャネル攻撃の94%~97%を軽減していることがわかった。
論文 参考訳(メタデータ) (2025-08-11T19:55:44Z) - HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs [13.013668526921778]
既存のKVキャッシュ圧縮手法は、メモリが85%以上削減されたときに顕著な性能劣化を示す。
我々は、鍵量子化、値オフロード、動的KV消去を統合した異種アテンションフレームワークであるHCAttentionを提案する。
また,LongBenchベンチマークを用いて,KVキャッシュメモリのフットプリントを25%に縮めながら,本手法が完全アテンションモデルの精度を維持することを示した。
論文 参考訳(メタデータ) (2025-07-26T06:43:14Z) - R-KV: Redundancy-aware KV Cache Compression for Reasoning Models [77.84539432982307]
共振モデル(R-KV)のための冗長性を考慮したKVキャッシュ圧縮を提案する。
R-KVはKVキャッシュの10%しか使用せず、完全なKVキャッシュ性能のほぼ100%を保っている。
驚くべきことに、R-KVは完全なKVキャッシュ性能の105%を達成し、KVキャッシュの16%を達成している。
論文 参考訳(メタデータ) (2025-05-30T02:03:24Z) - KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing [58.29726147780976]
我々は,層間をKVキャッシュで共有し,層間圧縮を実現する,textit KVSharerと呼ばれるプラグアンドプレイ方式を提案する。
実験の結果、textit KVSharerはKVキャッシュの計算を30%削減し、メモリ消費を削減できることがわかった。
我々は,textit KVSharerが既存の層内KVキャッシュ圧縮手法と互換性があることを検証する。
論文 参考訳(メタデータ) (2024-10-24T08:06:41Z) - PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling [38.732413451399]
ピラミッドKVは新規かつ効果的なKVキャッシュ圧縮法である。
提案手法は,KVキャッシュの12%しか保持せず,完全なKVキャッシュでモデルの性能と一致していることを示す。
Needle-in-a-Haystack実験では、Praamid KVは長文理解の維持において競合する手法より優れている。
論文 参考訳(メタデータ) (2024-06-04T07:51:30Z) - SqueezeAttention: 2D Management of KV-Cache in LLM Inference via Layer-wise Optimal Budget [29.208289711639853]
LLM(Large Language Model)のキーバリューキャッシュを最適化することは、推論コストの削減に不可欠であると考えられている。
既存のKV-cache圧縮アルゴリズムのほとんどは全ての層を等しく扱い、各層に同じKV予算を割り当てている。
注意層の重要性を同定することにより、KV-cacheを2次元から共同で最適化できることが判明した。
論文 参考訳(メタデータ) (2024-04-07T03:08:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。