論文の概要: Back from the Future: Key-Value Cache Management by Counter-Causal Surprise
- arxiv url: http://arxiv.org/abs/2607.27600v1
- Date: Thu, 30 Jul 2026 02:42:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.367913
- Title: Back from the Future: Key-Value Cache Management by Counter-Causal Surprise
- Title(参考訳): バック・ザ・フューチャー:カウンタカウンザリによるキーバリューキャッシュ管理が注目される
- Authors: Stephen Gould, Anton van den Hengel,
- Abstract要約: 近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
- 参考スコア(独自算出の注目度): 67.1056509495879
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Key-value (KV) cache management through compression and eviction strategies has emerged as an important research direction in recent years. Computational demands of large language models (LLMs) and their multi-modal variants during output generation can be partially alleviated by caching previous key and value calculations needed by subsequent scaled dot-product attention operations. However, this leads to another problem: the size of the resulting KV cache grows linearly with context length and quickly consumes all available GPU memory when either the prompt or the generated output are long. KV cache management periodically prunes entries from the cache thereby reducing its memory footprint while attempting to retain sufficient information for accurate generation. A by-product is faster inference speed. We propose a simple yet effective KV eviction scheme motivated by the insight that past tokens which can be well-predicted from more recent tokens are redundant and their associated keys and values can be removed from the cache. To score entries for eviction we run the model on the tokens in their original order, reusing the key and value representations already stored in the KV cache, and applying a counter-causal attention mask so that each position attends only to its future context. This is in-distribution, tied directly to the actual cache contents, and requires no additional training. To further reduce cost, we additionally propose a fast single-layer approximation that restricts the counter-causal pass to the last transformer layer, achieving a significant speedup per refresh cycle at marginal accuracy cost. We evaluate our strategy on various open-source LLMs and benchmark datasets showing competitive or improved performance over other state-of-the-art methods. Reference code is available at https://github.com/metacognitionai/counter_causal.
- Abstract(参考訳): 近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
大きな言語モデル(LLM)と出力生成時のマルチモーダルな変形の計算要求は、その後のスケールされたドット積アテンション操作で必要とされる以前のキーと値の計算をキャッシュすることで部分的に軽減することができる。
結果のKVキャッシュのサイズはコンテキスト長とともに線形に増加し、プロンプトまたは生成された出力が長いときにすぐに利用可能なGPUメモリを消費する。
KVキャッシュ管理は、キャッシュからのエントリを定期的にプーンし、正確な生成に十分な情報を保持しながらメモリフットプリントを減少させる。
副産物は推論速度が速い。
より最近のトークンからよく予測できる過去のトークンは冗長であり、関連するキーや値がキャッシュから取り除かれるという知見から、単純で効果的なKV消去スキームを提案する。
KVキャッシュに格納されているキーと値表現を再利用し、各位置が将来の状況にのみ対応できるように、カジュアルアテンションマスクを適用します。
これは分散状態であり、実際のキャッシュ内容に直接結び付けられ、追加のトレーニングを必要としない。
さらにコスト削減のために,最後の変圧器層への反因果パスを制限する高速単層近似を提案し,限界精度でリフレッシュサイクルあたりの大幅な高速化を実現した。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
リファレンスコードはhttps://github.com/metacognitionai/counter_causal.comで公開されている。
関連論文リスト
- Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility [31.124813359673073]
我々は,将来のKVユーティリティを予測するメカニズムであるSP-KV(Self-Pruned Key-Value Attention)を導入する。
軽量ユーティリティ予測器は各キーと値のペアをスコアし、最近のKVは常にローカルウィンドウ経由で利用できるが、古いペアはキャッシュに書き込まれる。
このメカニズムは入力に適応し、典型的にはKVキャッシュサイズを3ドルから10ドルに削減する。
論文 参考訳(メタデータ) (2026-05-13T18:58:16Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing [29.913403615975174]
高いスループットでトランスフォーマー言語モデルを実行するには、冗長な計算を避けるためにキーバリュー(KV)をキャッシュする必要がある。
KVキャッシュのメモリフットプリントは著しく、サービスコストに大きな影響を与えます。
本稿では,ランダムな層間注意(ランダムな層間注意,ランダムな層間注意,ランダムな層間注意)を提案する。
論文 参考訳(メタデータ) (2026-04-03T14:56:17Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference [78.65321721142624]
我々はキー値(KV)キャッシュによって課されるメモリボトルネックに焦点を当てる。
既存のKVキャッシュ手法は、比較的重要でないKVペアの大きなスワストを刈り取ったり、取り除いたりすることでこの問題に対処する。
本稿では,固定サイズキャッシュと退避型キャッシュを簡易に統合したLESSを提案する。
論文 参考訳(メタデータ) (2024-02-14T18:54:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。