論文の概要: Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms
- arxiv url: http://arxiv.org/abs/2608.04074v1
- Date: Tue, 04 Aug 2026 16:10:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.542441
- Title: Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms
- Title(参考訳): KVキャッシュベクタ量子化とアテンション保存変換
- Authors: Samuel Fernández-Menduiña, Amir Ziashahabi, Eduardo Pavez, Antonio Ortega, Salman Avestimehr,
- Abstract要約: 長文LLMデコーディングは、各ステップでキー値(KV)キャッシュを読み取る。読み込むのに、コンピューティングの注意より時間がかかるため、スループットは帯域幅にバウンドする。
課題は、アテンション製品を保持しながらキャッシュサイズを小さくし、再構築を安価に保ち、トークン当たりの固定ビット数を使用することである。
本稿では,KVキャッシュの量子化を,注意産物の歪みが誤差となる変換符号化問題として定式化する。
- 参考スコア(独自算出の注目度): 40.94986644010638
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Long-context LLM decoding reads the key-value (KV) cache at every step. Loading it takes longer than computing attention over it, so throughput is bandwidth-bound. Hence, reducing the cache size can raise both decoding speed and serving capacity. The challenge is to reduce cache size while preserving the attention products, keeping reconstruction cheap, and using a fixed per-token bit count. At two bits per element, the most competitive methods rely on orthogonal transforms. However, existing techniques are either data-oblivious or use the query statistics without deriving the transform from a distortion criterion. Moreover, they rely on transforms built on top of random or Hadamard rotations, which equalize variances across entries rather than compacting energy, and fixed-width scalar quantizers, which are suboptimal at low rates. In this paper, we formulate KV cache quantization as a transform coding problem in which distortion is the error in the attention products. We derive closed-form optimal transforms for keys and values from calibration statistics, under a high-resolution model. We show that the optimal key transform is not orthogonal and satisfies a generalized Parseval relation: the attention-aware distortion becomes mean-squared error (MSE) in the transform domain. Thus, we can use MSE-optimal vector quantizers applied directly to the transformed key coefficients. To meet the fixed-width layout requirement, we show that grouping coefficients into equal-volume partitions makes equal-size codebooks attain the variable-rate optimum under the same high-resolution model. At two bits per element, our method, termed NOVA-KV, recovers most of the long-context retrieval accuracy lost by scalar quantization methods at comparable throughput.
- Abstract(参考訳): 長文LLMデコードでは、各ステップでキー値(KV)キャッシュを読み取る。
負荷はコンピューティングの注意より長くかかるため、スループットは帯域幅に縛られる。
したがって、キャッシュサイズの削減はデコード速度とサービス容量の両方を増大させる可能性がある。
課題は、アテンション製品を保持しながらキャッシュサイズを小さくし、再構築を安価に保ち、トークン当たりの固定ビット数を使用することである。
要素あたりの2ビットでは、最も競合的な方法は直交変換に依存する。
しかし、既存の手法は、歪み基準から変換を引き出すことなく、データ公開またはクエリ統計を使用する。
さらに、コンパクトエネルギーではなくエントリ間の分散を等しくするランダム回転やアダマール回転の上に構築された変換と、低速度で最適である固定幅スカラー量子化器に依存している。
本稿では,KVキャッシュの量子化を,注意産物の歪みが誤差となる変換符号化問題として定式化する。
高分解能モデルを用いて鍵と値の閉形式最適変換をキャリブレーション統計から導出する。
最適鍵変換は直交ではなく、一般化されたParseval関係を満たすことを示し、この歪みは変換領域における平均二乗誤差(MSE)となる。
したがって、変換された鍵係数に直接適用されるMSE最適ベクトル量化器を用いることができる。
固定幅レイアウトの要求を満たすため、等量分割に係数をグループ化することで、同じ高分解能モデルの下で可変レートの最適値を得ることができることを示す。
NOVA-KVと呼ばれる1要素あたりの2ビットでは、スカラー量子化法で失われる長文検索の精度のほとんどを同等のスループットで回復する。
関連論文リスト
- Structured Multidimensional Representation Learning for Large Language Models [0.0]
トランスフォーマーアーキテクチャは、幅広いパターン認識と自然言語処理タスクで最先端のパフォーマンスを達成する。
三次元テンソルのL-積に基づく埋め込み空間の構造的スペクトル分解を導入する。
提案するL-Transformerは,少ない埋め込みで動作するp並列変換器とスペクトル的に等価であることを示す。
論文 参考訳(メタデータ) (2026-03-05T22:34:45Z) - WUSH: Near-Optimal Adaptive Transforms for LLM Quantization [52.77441224845925]
低ビット幅への量子化は、大きな言語モデルをデプロイするための標準的なアプローチである。
いくつかの極端な重みと活性化は、ダイナミックレンジを拡張し、量子化器の有効分解能を減少させる。
結合重みアクティベーション量子化のための閉形式最適線形ブロックワイズ変換を初めて導出する。
論文 参考訳(メタデータ) (2025-11-30T16:17:34Z) - KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding [72.12756830560217]
Transformer Decodersをベースとした大規模言語モデル(LLM)が、会話生成AIの選択肢として好まれている。
デコーダアーキテクチャの全体的な優位性にもかかわらず、推論中にキーバリューキャッシュが徐々に増加し、主要な効率ボトルネックとなっている。
キーバリューベクトル次元を潜在空間にダウンサンプリングすることで、KVキャッシュのフットプリントを大幅に削減し、推論速度を向上させることができる。
論文 参考訳(メタデータ) (2025-07-15T12:52:12Z) - TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate [13.14434628836727]
ベクトル量子化は、その幾何学構造における歪みを最小限にしながら、高次元ユークリッドベクトルを定量化することを目的としている。
平均二乗誤差(MSE)と内積歪みに対処するTurboQuantを提案する。
オンラインアプリケーションに適したデータ公開アルゴリズムは、ほぼ最適な歪み率を達成する。
論文 参考訳(メタデータ) (2025-04-28T15:05:35Z) - Quantize What Counts: More for Keys, Less for Values [63.51476878610841]
大規模言語モデル(LLM)は、キーバリュー(KV)キャッシュに支配される推論時のメモリボトルネックに悩まされる。
本稿ではトランスフォーマーモデルの内在幾何学における混合精度KV量子化を固定する2つの定理を提案する。
論文 参考訳(メタデータ) (2025-02-20T22:24:27Z) - Variable-size Symmetry-based Graph Fourier Transforms for image compression [65.7352685872625]
可変サイズのグラフフーリエ変換を符号化フレームワークに導入する。
提案アルゴリズムは,ノード間の特定の対称接続を追加することにより,グリッド上の対称グラフを生成する。
実験により、SBGFTは、明示的な多重変換選択に統合された一次変換よりも優れていることが示された。
論文 参考訳(メタデータ) (2024-11-24T13:00:44Z) - Residual vector quantization for KV cache compression in large language model [2.3094645821058735]
KVキャッシュ圧縮法は主にデコード時のメモリ要求を減らすスカラー量子化技術に依存している。
本研究では,大規模言語モデル(LLM)におけるKVキャッシュの圧縮に,高忠実度音声圧縮に広く用いられている残差ベクトル量子化を適用した。
我々は指数移動平均を用いてコードブックを学習し、ベクトル量子化設定に通常使用される入力と出力のプロジェクションを含む他の学習可能なパラメータは存在しない。
論文 参考訳(メタデータ) (2024-10-21T07:20:41Z) - Unlocking Data-free Low-bit Quantization with Matrix Decomposition for KV Cache Compression [87.5604418100301]
キー値(KV)キャッシングは,大規模言語モデルの推論を高速化する重要な手法である。
既存の手法はしばしば精度を損なうか、キャリブレーションのために余分なデータを必要とする。
テンソル分解法に基づく新しいデータフリー低ビット量子化手法である textbfDecoQuant を導入する。
論文 参考訳(メタデータ) (2024-05-21T08:35:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。