論文の概要: WUSH-KV: KV Cache Quantization with Data-Adaptive Transforms
- arxiv url: http://arxiv.org/abs/2609.38121v1
- Date: Tue, 29 Sep 2026 17:50:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.811868
- Title: WUSH-KV: KV Cache Quantization with Data-Adaptive Transforms
- Title(参考訳): WUSH-KV: データ適応型変換を用いたKVキャッシュ量子化
- Abstract要約: 低ビット KV-cache 量子化のための WUSH-KV を導入する。
WUSHは行列生成物の両方の因子の2次統計からデータ認識変換を構築し、量子化誤差を低減する。
WUSH-KVをOSCAR型パーセンタイルクラッピングアフィン量子化によりSGLangに統合する。
- 参考スコア(独自算出の注目度): 49.191043733828856
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: KV cache memory and bandwidth costs grow with context length and batch size, which limits efficient long-context inference. To address this bottleneck, we introduce WUSH-KV for low-bit KV-cache quantization. It adapts WUSH, which constructs a data-aware transform from the second-order statistics of both factors in a matrix product to reduce quantization error. WUSH-KV uses calibration data to construct separate key and value transforms, with the value transform folded into the model weights and the key transform applied after RoPE. The transforms can be paired with clipped quantizers. For one such quantizer, QuEST INT, we show that, under mild assumptions, the WUSH transform is near-optimal. With this quantizer, WUSH-KV reduces layerwise reconstruction error and achieves the lowest end-to-end perplexity among other tested transforms. For end-to-end evaluation, we integrate WUSH-KV into SGLang using OSCAR-style percentile-clipped affine quantization. At 2-bit, WUSH-KV performs comparably to or outperforms the OSCAR transform across all evaluated models and downstream tasks.
- Abstract(参考訳): KVキャッシュメモリと帯域幅のコストは、コンテキスト長とバッチサイズによって増大する。
このボトルネックに対処するために、低ビットKV-cache量子化のためのWUSH-KVを導入する。
WUSHは行列生成物の両方の因子の2次統計からデータ認識変換を構築し、量子化誤差を低減する。
WUSH-KVはキャリブレーションデータを用いて、値がモデルの重みに折り畳み、キー変換がRoPE後に適用される。
変換はクリッピング量子化器と組み合わせることができる。
そのような量化器である QuEST INT に対して、弱い仮定の下では、WUSH 変換がほぼ最適であることを示す。
この量子化器により、WUSH-KVは階層的再構成誤差を低減し、他の試験された変換のうち、最小のエンドツーエンドのパープレキシティを実現する。
WUSH-KVをOSCAR型パーセンタイルクラッピングアフィン量子化によりSGLangに統合する。
2ビットでは、WUSH-KVはOSCAR変換を全ての評価されたモデルと下流タスクで比較または上回る性能を発揮する。
関連論文リスト
- KV Cache Compression Through the Lens of Transform Coding [9.884224071643606]
本稿では,アテンション・アウェア・トランスフォーメーション・コーディング(AATC)を紹介し,アテンション・アウェア・トランスフォーメーションの歪みを最小限に抑えるために,キャリブレーション・セット上のビットを割り当てる。
提案手法は, ほぼロスレスの精度を約5.8倍の圧縮で達成する一方, 各ベースラインは少なくともいくつかの設定で劣化する。
論文 参考訳(メタデータ) (2026-08-14T11:08:01Z) - Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms [40.94986644010638]
長文LLMデコーディングは、各ステップでキー値(KV)キャッシュを読み取る。読み込むのに、コンピューティングの注意より時間がかかるため、スループットは帯域幅にバウンドする。
課題は、アテンション製品を保持しながらキャッシュサイズを小さくし、再構築を安価に保ち、トークン当たりの固定ビット数を使用することである。
本稿では,KVキャッシュの量子化を,注意産物の歪みが誤差となる変換符号化問題として定式化する。
論文 参考訳(メタデータ) (2026-08-04T16:10:59Z) - Codec-Gauge: Learning Compression-Friendly Gauges for Transformer KV Caches [25.55174329283001]
長文トランスフォーマー推論は、KVキャッシュ圧縮や量子化にますます依存している。
我々は,キャッシュ調整後のレイヤであるCodec-Gaugeを紹介した。
論文 参考訳(メタデータ) (2026-07-10T17:18:25Z) - KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding [72.12756830560217]
Transformer Decodersをベースとした大規模言語モデル(LLM)が、会話生成AIの選択肢として好まれている。
デコーダアーキテクチャの全体的な優位性にもかかわらず、推論中にキーバリューキャッシュが徐々に増加し、主要な効率ボトルネックとなっている。
キーバリューベクトル次元を潜在空間にダウンサンプリングすることで、KVキャッシュのフットプリントを大幅に削減し、推論速度を向上させることができる。
論文 参考訳(メタデータ) (2025-07-15T12:52:12Z) - More Tokens, Lower Precision: Towards the Optimal Token-Precision Trade-off in KV Cache Compression [71.42818367729573]
大規模言語モデル(LLM)では、KVキャッシュのメモリ使用量は推論において重大なボトルネックとなっている。
KVプルーニングやKV量子化を含む主流のKV圧縮法は、主にトークンまたは精度寸法を別々に扱う。
本稿では,KVキャッシュ圧縮におけるトークン精度トレードオフを包括的に検討する。
論文 参考訳(メタデータ) (2024-12-17T09:20:31Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - Unlocking Data-free Low-bit Quantization with Matrix Decomposition for KV Cache Compression [87.5604418100301]
キー値(KV)キャッシングは,大規模言語モデルの推論を高速化する重要な手法である。
既存の手法はしばしば精度を損なうか、キャリブレーションのために余分なデータを必要とする。
テンソル分解法に基づく新しいデータフリー低ビット量子化手法である textbfDecoQuant を導入する。
論文 参考訳(メタデータ) (2024-05-21T08:35:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。