論文の概要: How Query Visibility Changes KV-Cache Compression Rankings: A Matched-Budget Audit
- arxiv url: http://arxiv.org/abs/2607.11942v1
- Date: Sat, 11 Jul 2026 09:30:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:29.889052
- Title: How Query Visibility Changes KV-Cache Compression Rankings: A Matched-Budget Audit
- Title(参考訳): クエリビジュアビリティがKVキャッシュ圧縮ランキングをどう変えるか:一致予算監査
- Authors: Daming Luo, Christy Liang, Junyu Xuan,
- Abstract要約: KV-cache圧縮法は、圧縮前にコンテキストに付加されたクエリで主に評価される。
本稿では,3つの自明なベースラインに対する6つの圧縮手法の一致した予算監査について述べる。
- 参考スコア(独自算出の注目度): 5.366718741784969
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: KV-cache compression methods are predominantly evaluated with the query appended to the context before compression -- a query-aware protocol. Yet the economic case for a compressed KV cache is reuse: compress a document once, answer many future questions against it. In that deployment, compression must happen query-agnostic -- before any question is seen. We present a matched-budget audit of six published compression methods against three trivial baselines on three open 7-9B models (144,300 paired evaluations on RULER-8192; 40,800 on LongBench; 50,000-resample paired bootstrap throughout). Everything is held fixed -- model, compression ratio, instances, decoding -- except the scoring rule. Three findings. (1) Query visibility changes the rankings: under the agnostic protocol, of the five audited methods that share a common attention backend, only KeyDiff beats a best-of-3 trivial baseline consistently (31 of 36 cells), and the most widely deployed method, SnapKV, loses to "keep the start and the recent window" on average (-0.066). (2) The per-method drop between the two protocols is ordered consistently with how visible the question is to each method's scoring signal, legible in its source code: from Delta=+0.198 for SnapKV (the question sits inside its 64-token observation window) down to Delta=+0.011 for KeyDiff (its score contains no query term at all).
- Abstract(参考訳): KV-cache圧縮メソッドは、主に、クエリ対応プロトコルである圧縮の前にコンテキストに付加されたクエリで評価される。
しかし、圧縮されたKVキャッシュの経済的なケースは再利用されている。
そのデプロイメントでは、何らかの疑問が現れる前に、圧縮はクエリ非依存でなければならない。
オープン7-9Bモデル上での3つの自明なベースラインに対する6つの圧縮手法のマッチング予算監査を行った(RULER-8192の144,300対,LongBenchの40,800対,全5万対)。
スコアリングルールを除いて、すべてが固定された -- モデル、圧縮比、インスタンス、デコード -- 保持されます。
3つの発見。
1) 問合せの可視性は, 共通注意バックエンドを共有する5つの監査手法のうち, KeyDiff が常に 3 個の自明なベースライン(36 セル中31 個)を破り,最も広くデプロイされている SnapKV が平均 (-0.066 ) で "スタートと最近のウィンドウをキープする" ために失われる。
2) 2つのプロトコル間のメソッドごとのドロップは、各メソッドのスコアリング信号の可視性に一貫して順序付けられ、ソースコードでは、SnapKVのDelta=+0.198からKeyDiffのDelta=+0.011まで(スコアにはクエリ項が全く含まれていない)。
関連論文リスト
- FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference [0.0]
FreqDepthKVは、隣接層KV状態を共有低周波深さ成分とスパース高周波残差に分解する推論時キャッシュ圧縮法である。
軽量なオンラインプローブは、リコンストラクションに敏感なアテンションログへの貢献に応じて、アテンションヘッドを共有深度、残留深度、または正確なキャッシュモードに割り当てる。
FreqDepthKVは、長いコンテキストの質問応答、針の検索、要約、コード生成ベンチマークを通じて、かなり小さなキャッシュ予算の下でタスクの正確性を保持する。
論文 参考訳(メタデータ) (2026-07-07T17:26:28Z) - Fixed RAG Compression Collapses Measured Reader Scaling [2.9089118242427627]
固定圧縮は、読者のアップグレードを隠蔽し、モデルランキングを逆転させながら平均精度を高めることができることを示す。
これは177,000行の行レベルの圧縮トランジションに基づいて構築されたツールキットで、1日で3人の読者と監査読者のスケーリングを行います。
論文 参考訳(メタデータ) (2026-06-20T00:04:31Z) - Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - ManifoldKV: Training-Free KV Cache Compression via Euclidean Outlier Detection [8.362927764080203]
キーセントロイドにユークリッド距離でトークンをランク付けする学習自由スコアラを提案する。
ManifoldKVは4K-16Kコンテキストで95.7%の精度を実現し、圧縮率は20%である。
WindowedManifoldKV は 25% 圧縮で 84.3% まで精度を回復し、グローバル L2 では 49 点、キーディフでは +3.2 点を回復する。
論文 参考訳(メタデータ) (2026-02-09T07:28:55Z) - Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods [54.4711434793961]
単純な画像ダウンサンプリングは、複数の広く使用されているベンチマークにおいて、多くの高度な圧縮方法より一貫して優れていることを示す。
これらの結果に触発され,既存のベンチマークを識別するデータフィルタリング機構を組み込んだ評価フレームワークであるVTC-Benchを導入する。
論文 参考訳(メタデータ) (2025-10-08T15:44:28Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search [61.4807238517108]
CoT(Chain-of-Thought)推論は、ステップバイステップの問題解決を可能にすることで、大きな言語モデル(LLM)を強化する。
CoTのLong-CoTへの拡張はトークン長の増加による計算オーバーヘッドを大幅に増加させる。
ローカル情報とコヒーレンスの両方を保存する2段階のチャンクレベル圧縮フレームワークであるR1-Compressを提案する。
論文 参考訳(メタデータ) (2025-05-22T16:06:59Z) - ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference [61.412894960600205]
大きな言語モデル(LLM)は、長いテキストを処理する際に大きなGPUメモリを必要とする。
ChunkKVは、セマンティックチャンクを基本的な圧縮単位として扱うことで、KVキャッシュ圧縮を再定義する。
結果: ChunkKVは最先端の手法を最大8.7%精度で上回る。
論文 参考訳(メタデータ) (2025-02-01T03:49:47Z) - LeCo: Lightweight Compression via Learning Serial Correlations [9.108815508920882]
軽量データ圧縮は、カラムストアが分析クエリのパフォーマンスを向上する鍵となる技術である。
本稿では,機械学習を用いて値列内のシリアル冗長性を自動的に除去するフレームワークであるLeCo(Learned Compression)を提案する。
我々は、Arrow列実行エンジンのデータ解析クエリで最大5.2倍のスピードで、RocksDBのスループットが16%向上するのを観察した。
論文 参考訳(メタデータ) (2023-06-27T10:46:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。