論文の概要: TwinKV: A Composable Repair Pass for KV Cache Eviction via Pairwise Key Redundancy
- arxiv url: http://arxiv.org/abs/2608.27128v2
- Date: Mon, 31 Aug 2026 03:59:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 15:47:04.307449
- Title: TwinKV: A Composable Repair Pass for KV Cache Eviction via Pairwise Key Redundancy
- Title(参考訳): TwinKV: ペアワイズキー冗長性によるKVキャッシュ消去のための構成可能な修復パス
- Abstract要約: ロングコンテキスト推論はキー値(KV)キャッシュのメモリフットプリントによってボトルネックとなる。
我々はTwinKVを紹介した。これはトレーニング不要で注意のない冗長性信号で、トークンのキーがコンテキスト内でほぼ重複しているかどうかを検出する。
我々はTwinKVを、LongBench、LooGLE、RULERの4つの最近の消去ポリシーと、圧縮比0.3,0.5,0.7$の短文MMLU-Proノハーム制御で構成する。
- 参考スコア(独自算出の注目度): 32.29092613421357
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context inference is bottlenecked by the memory footprint of the key-value (KV) cache, especially for small models under tight resource budgets. Existing KV cache eviction methods score tokens using the model's attention distribution or, in attention-free variants, each key's distance from a global reference point. Using a controlled leave-one-out probe, we find that attention magnitude is unrelated to a token's causal contribution to the answer (Spearman $ρ=-0.004$), challenging the premise behind dominant eviction methods. We introduce TwinKV, a training-free, attention-free redundancy signal that detects whether a token's key has a near-duplicate elsewhere in context. Rather than replacing existing policies, TwinKV acts as a composable repair pass: given a policy's fixed retained set, it identifies evicted tokens with no surviving duplicate (\emph{orphans}) and retained tokens whose information is duplicated elsewhere (\emph{redundant donors}), then swaps them while preserving the original budget and scoring rule. We compose TwinKV with four recent eviction policies across LongBench, LooGLE, RULER, and a short-context MMLU-Pro no-harm control at compression ratios ${0.3,0.5,0.7}$. On Qwen3-4B, TwinKV improves a majority of configurations for two policies, is near-even for a third, and helps only a minority for a fourth adaptive baseline already near a performance ceiling; gains across the three non-ceiling policies are smallest at the loosest ratio. On RULER with Llama-3.2-1B, however, that fourth policy improves in every evaluated cell because its Alone score leaves substantial room to improve. More broadly, Llama-3.2-1B shows a smaller average LongBench gain but a higher fraction of improved cells on LongBench and LooGLE than Qwen3-4B, plus a clean RULER win. We also identify few-shot classification exemplars as a task structure where TwinKV does not help on either model.
- Abstract(参考訳): ロングコンテキスト推論はキー値(KV)キャッシュのメモリフットプリントによってボトルネックとなる。
既存のKVキャッシュ消去法は、モデルのアテンション分布またはアテンションフリーな変種を用いてトークンをスコアリングする。
制御されたLeft-one-outプローブを用いて、注目度はトークンの応答への因果的寄与とは無関係である(Spearman $ρ=-0.004$)。
我々はTwinKVを紹介した。これはトレーニング不要で注意のない冗長性信号で、トークンのキーがコンテキスト内でほぼ重複しているかどうかを検出する。
既存のポリシーを置き換えるのではなく、TwinKVは、構成可能な修復パスとして機能する: ポリシーの固定された保持セットが与えられた場合、削除されたトークンを残りの重複(\emph{orphans})なしで識別し、情報を他の場所で複製したトークン(\emph{redundant donors})を保持し、元の予算とスコアリングルールを維持しながら交換する。
我々はTwinKVを、LongBench, LooGLE, RULERの4つの最近の退行ポリシーと、圧縮比${0.3,0.5,0.7}$の短文MMLU-Proのノーハーム制御で構成する。
Qwen3-4Bでは、TwinKVは2つのポリシーの大多数を改良し、3分の1に近づき、パフォーマンス天井に近い4番目の適応ベースラインでは少数に過ぎません。
しかし、Llama-3.2-1BのRULERでは、Aloneのスコアが改善の余地を残しているため、評価された細胞で4番目のポリシーが改善される。
より広くは、Llama-3.2-1BはQwen3-4BよりもLongBenchとLooGLEのセルが改善され、RULERがクリーンに勝利した。
また、TwinKVがどちらのモデルにも役に立たないタスク構造として、少数ショット分類の例を挙げる。
関連論文リスト
- VarRate: Training-Free Variable-Rate KV Cache Compression for Long-Context LLMs [7.825137277264239]
キーバリューキャッシュは、Long-context Large Language Model(LLM)推論における主要なメモリボトルネックである。
VarRateはトレーニング不要のKVで、クエリサリエンスによって各トークンに可変低ランクの予算を割り当て、すべてのトークンを非ゼロランクに保つ。
VarRateは4つの設定のうち3つで精度が同等で、全体の1ポイント以内で、プリフィルオーバーヘッドの約8分の1である。
論文 参考訳(メタデータ) (2026-07-16T23:03:14Z) - MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference [12.316173390280609]
Transformerベースの言語モデルにおける自動回帰デコーディングは、KVキャッシュに依存している。
KVキャッシュ消去は、キーと値のペアの固定サイズのサブセットを保持し、残りを破棄することでこの問題に対処する。
本稿では, 除去トークン集合上のコンパクトで小型なモーメント統計量を維持するMomentKVを提案する。
論文 参考訳(メタデータ) (2026-06-01T02:08:40Z) - GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs [97.36238579001544]
コンテキスト長が拡張された大規模言語モデル(LLM)は、キー値(KV)キャッシュに依存して、以前のトークンに対する注意をサポートする。
KVキャッシュを維持することは、KVキャッシュ圧縮メソッドを動機付け、かなりのメモリオーバーヘッドを引き起こす。
GRKVは,圧縮キャッシュとフルキャッシュのアテンション出力の差を直接最小化する,トレーニング不要なKV-cacheマージ手法である。
論文 参考訳(メタデータ) (2026-05-29T10:16:30Z) - NestedKV: Nested Memory Routing for Long-Context KV Cache Compression [35.62789874560166]
NestedKVは、Nested LearningのContinuum Memory SystemにインスパイアされたキーのみのKVキャッシュ圧縮方式である。
マルチタイムスケールのコサイン異常によってトークンをスコアし、その結果のランキングとトレーニング不要な外部学習者を組み合わせる。
論文 参考訳(メタデータ) (2026-05-26T08:14:39Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - KVSculpt: KV Cache Compression as Distillation [7.085426079187912]
KVキャッシュ圧縮は、効率的なLLM推論に重要である。
既存のメソッドは、純粋な消去 -- どのKVペアを保持するかを選択する -- から、類似のペアをより少ないものに組み合わせたマージまで、さまざまです。
我々は、このスペクトルの反対側に移動するKVSculptを提案する。
鍵はL-BFGSで最適化され、最小二乗で閉形式で解かれる。
論文 参考訳(メタデータ) (2026-03-29T19:14:25Z) - ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution [84.41751286055909]
我々は、長文世代におけるどのKVペアを退避させるかを予測する訓練ベースのKVキャッシュ消去フレームワークを開発した。
我々は、マルコフ決定過程としてキャッシュ消去を定式化し、GRPOアルゴリズムを適用し、低エントロピートークンにおける言語モデリング損失の増加を緩和する。
論文 参考訳(メタデータ) (2026-02-03T07:16:51Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large
Language Models [110.06476624089679]
メモリフットプリントを大幅に削減する新しいKVキャッシュの実装手法を提案する。
我々のアプローチは、トークンのごく一部が、注意点の計算において、ほとんどの価値に寄与する、という観察に基づいている。
我々は,最近のトークンとH$のバランスを動的に保持するKVキャッシュ消去ポリシーであるヘビーヒッター(H$O)を提案する。
論文 参考訳(メタデータ) (2023-06-24T20:11:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。