論文の概要: Output-Aware Rotation for INT2 KV-Cache Quantization
- arxiv url: http://arxiv.org/abs/2608.02691v2
- Date: Wed, 05 Aug 2026 18:00:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.616965
- Title: Output-Aware Rotation for INT2 KV-Cache Quantization
- Title(参考訳): INT2 KV-Cache量子化のための出力対応ローテーション
- Abstract要約: 我々は,W_O$後の注目出力誤差を最小限に抑える出力対応回転法であるtextitOptRを提案する。
OptRはQuaRotとOSCARの両方を一貫して改善し、長文検索を強化し、ページ化されたKV-cacheフォーマットを無視可能な推論オーバーヘッドで保存する。
- 参考スコア(独自算出の注目度): 21.398916187295992
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: The key-value (KV) cache has become a major memory and bandwidth bottleneck in long-context large language model inference, making ultra-low-bit quantization increasingly important. However, existing rotation-based INT2 methods optimize cache statistics or proxy errors before the complete attention readout, even though the model is ultimately affected by the error propagated through attention and the output projection $W_O$. To address this mismatch, we propose \textit{OptR}, an output-aware rotation method that minimizes post-$W_O$ attention-output error. OptR decomposes the post-$W_O$ attention-output error into key- and value-induced terms and learns per-head orthogonal corrections through the full INT2 quantization and attention path. OptR further applies an attention-equivalent key reparameterization to reduce large channel-wise offsets without changing the softmax distribution. Across three models and five reasoning and coding benchmarks, OptR consistently improves both QuaRot and OSCAR and strengthens long-context retrieval, while preserving the paged KV-cache format with negligible inference overhead.
- Abstract(参考訳): キー値(KV)キャッシュは、長文大言語モデル推論において主要なメモリと帯域幅のボトルネックとなり、超低ビット量子化がますます重要になっている。
しかしながら、既存のローテーションベースのINT2メソッドは、完全なアテンション読み込みの前にキャッシュ統計やプロキシエラーを最適化する。
このミスマッチに対処するために,W_O$後の注意出力誤差を最小限に抑える出力対応回転法である \textit{OptR} を提案する。
OptRは、$$W_O$後の注意出力エラーをキーと値によって引き起こされる用語に分解し、INT2量子化とアテンションパス全体を通して、頭ごとの直交補正を学習する。
OptRはさらに、ソフトマックス分布を変更することなく、大きなチャネル単位のオフセットを減らすために、注目等価なキーパラメータ化を適用している。
3つのモデルと5つの推論およびコーディングベンチマークで、OptRはQuaRotとOSCARの両方を一貫して改善し、長文検索を強化し、ページ付きKV-cacheフォーマットを無視できない推論オーバーヘッドで保存する。
関連論文リスト
- KV Cache Compression Through the Lens of Transform Coding [9.884224071643606]
本稿では,アテンション・アウェア・トランスフォーメーション・コーディング(AATC)を紹介し,アテンション・アウェア・トランスフォーメーションの歪みを最小限に抑えるために,キャリブレーション・セット上のビットを割り当てる。
提案手法は, ほぼロスレスの精度を約5.8倍の圧縮で達成する一方, 各ベースラインは少なくともいくつかの設定で劣化する。
論文 参考訳(メタデータ) (2026-08-14T11:08:01Z) - OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond [50.440302567029654]
マルチモーダルインテリジェンスにより、Key-Valueキャッシュは効率的なデプロイメントのための主要なメモリボトルネックとなった。
本研究では、チャネルごとの量子化パラダイムの本質的な限界を再考する。
X-LLMのための高精度かつ軽量なKVキャッシュ圧縮フレームワークOScaRを提案する。
論文 参考訳(メタデータ) (2026-05-19T10:53:03Z) - XQuant: Achieving Ultra-Low Bit KV Cache Quantization with Cross-Layer Compression [54.28208936996186]
大規模言語モデル(LLM)は、様々な自然言語処理タスクにまたがる顕著な機能を示している。
量子化は、歴史的情報を保持しながらメモリ消費を減らすための有望な解決策として現れてきた。
超低等価ビット幅KVキャッシュ量子化を実現するトレーニングフリーでプラグアンドプレイのフレームワークであるXQuantを提案する。
論文 参考訳(メタデータ) (2025-10-13T10:17:21Z) - KVLinC : KV Cache Quantization with Hadamard Rotation and Linear Correction [8.486713415198968]
我々は,KVキャッシュ量子化による注意欠陥を軽減するフレームワークKVLinCを提案する。
KVLinCは、値の量子化誤差を低減するアダマール回転と、軽量な線形補正アダプタを組み合わせたものである。
KVLinC は高い KV-cache 圧縮を達成しつつ, 高いベースラインを一貫して一致または超えることを示す。
論文 参考訳(メタデータ) (2025-10-06T21:08:11Z) - KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding [72.12756830560217]
Transformer Decodersをベースとした大規模言語モデル(LLM)が、会話生成AIの選択肢として好まれている。
デコーダアーキテクチャの全体的な優位性にもかかわらず、推論中にキーバリューキャッシュが徐々に増加し、主要な効率ボトルネックとなっている。
キーバリューベクトル次元を潜在空間にダウンサンプリングすることで、KVキャッシュのフットプリントを大幅に削減し、推論速度を向上させることができる。
論文 参考訳(メタデータ) (2025-07-15T12:52:12Z) - Quantize What Counts: More for Keys, Less for Values [63.51476878610841]
大規模言語モデル(LLM)は、キーバリュー(KV)キャッシュに支配される推論時のメモリボトルネックに悩まされる。
本稿ではトランスフォーマーモデルの内在幾何学における混合精度KV量子化を固定する2つの定理を提案する。
論文 参考訳(メタデータ) (2025-02-20T22:24:27Z) - Identify Critical KV Cache in LLM Inference from an Output Perturbation Perspective [19.447729423696096]
重要なKVキャッシュエントリを識別するための摂動制約付き選択アルゴリズムを提案する。
提案アルゴリズムは,Llamaモデルにおいて,92%以上のアテンションヘッドにおける低出力摂動を実現する。
論文 参考訳(メタデータ) (2025-02-06T06:31:47Z) - RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations [4.794762861776729]
キーバリュー(KV)キャッシュは、過去のKVの再計算を避けることにより、効率的な大言語モデル(LLM)推論を容易にする。
既存のKV量子化は、微細な量子化や高ビット幅キャッシュのかなりの部分の保持に依存している。
本稿では,以下の技術革新を通じて正確で堅牢な性能を実現するRotateKVを提案する。
論文 参考訳(メタデータ) (2025-01-25T01:45:29Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z) - Unlocking Data-free Low-bit Quantization with Matrix Decomposition for KV Cache Compression [87.5604418100301]
キー値(KV)キャッシングは,大規模言語モデルの推論を高速化する重要な手法である。
既存の手法はしばしば精度を損なうか、キャリブレーションのために余分なデータを必要とする。
テンソル分解法に基づく新しいデータフリー低ビット量子化手法である textbfDecoQuant を導入する。
論文 参考訳(メタデータ) (2024-05-21T08:35:10Z) - Keyformer: KV Cache Reduction through Key Tokens Selection for Efficient Generative Inference [2.8241099113277666]
キーフォーマー」は、KVキャッシュサイズとメモリ帯域幅利用に関する課題を軽減する革新的な推論時アプローチである。
我々はKeyformerの性能を,GPT-J,Cerebras-GPT,MPTの3つの基礎モデルで評価した。
論文 参考訳(メタデータ) (2024-03-14T02:42:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。