論文の概要: GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache
- arxiv url: http://arxiv.org/abs/2607.01065v1
- Date: Wed, 01 Jul 2026 15:25:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.961738
- Title: GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache
- Title(参考訳): GSRQ: Sub-1ビットKVキャッシュのためのゲイン形状残差量子化
- Authors: Soosung Kim, Minjae Park, Eui-Young Chung, Jaeyong Chung,
- Abstract要約: ベクトル量子化(VQ)は、KVキャッシュストレージをサブ-1ビットレシエーションにプッシュするための有望なアプローチである。
ほとんどのVQメソッドは、コアコードブック学習プリミティブとして標準$ell$K$-meansに依存している。
提案するGain-Shape $K$-means (GSKM) は$K$-meansの代替品で、マッチング中に方向の忠実度を改善する。
- 参考スコア(独自算出の注目度): 1.6471056713523724
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The deployment of Large Language Models (LLMs) with extended context windows is increasingly constrained by the linear growth of Key-Value (KV) cache memory. Vector Quantization (VQ), particularly Residual Quantization (RQ), is a promising approach for pushing KV cache storage toward the sub-1-bit regime by progressively encoding residuals with small codebooks. However, most VQ methods still rely on standard $\ell_2$ $K$-means as the core codebook-learning primitive. We identify a subtle high-dimensional issue of this primitive: Euclidean centroid averaging can induce centroid shrinkage, which weakens the angular alignment term in the $\ell_2$ distortion and makes directional preservation harder. To address this issue, we propose Gain-Shape $K$-means (GSKM), a drop-in replacement for $K$-means that improves directional fidelity while matching, and in some regimes improving, $\ell_2$ distortion. We then build Gain-Shape Residual Quantization (GSRQ) by incorporating a weighted extension of GSKM into an RQ pipeline. On LLaMA-3-8B, GSRQ substantially improves over strong KV cache quantization baselines across bit rates. At 1-bit, it improves the average accuracy across LongBench tasks from 11.34 to 33.54, a gain of 22.20 percentage points over VQLLM.
- Abstract(参考訳): 拡張コンテキストウィンドウによるLLM(Large Language Models)のデプロイメントは、キーバリュー(KV)キャッシュメモリの線形成長によって、ますます制限されている。
ベクトル量子化(VQ)、特に残留量子化(Residual Quantization、RQ)は、KVキャッシュストレージを小さなコードブックで段階的にエンコードすることで、サブ-1ビットレジームへプッシュするための有望なアプローチである。
しかしながら、ほとんどのVQメソッドは、コアコードブック学習プリミティブとして標準の$\ell_2$$K$-meansに依存している。
Euclidean centroid averaging can induce centroid shrinkage, which could weaks the angular alignment term in the $\ell_2$ distortion and makes directional storage。
この問題に対処するため、Gain-Shape $K$-means (GSKM)を提案する。
次に、GSKMの重み付き拡張をRQパイプラインに組み込むことで、ゲイン形状残留量子化(GSRQ)を構築する。
LLaMA-3-8Bでは、GSRQはビットレートの強いKVキャッシュ量子化ベースラインを大幅に改善する。
1ビットでは、LongBenchタスクの平均精度を11.34から33.54に改善し、VQLLMよりも22.20ポイント向上した。
関連論文リスト
- GPTQ-intrinsic LoRA: A Near-optimal Algorithm for Low-precision Quantization with Low-rank Adaptation [5.886065213861507]
一般的な治療法は、量子化された重みを低ランクの補正で増大させ、$Wapprox Q+LR$という形の近似を与えることである。
低ランク補正を直接GPTQ型量子化パスに組み込む訓練不要アルゴリズムであるGPTQ-inrinsic LoRAを提案する。
Qwen3言語モデルとDeiTビジョントランスフォーマーの実験により、GPTQ固有のLoRAはGPTQとGPTQよりも改善され、低ランクの補償が得られた。
論文 参考訳(メタデータ) (2026-05-31T19:17:39Z) - LAQuant: A Simple Overhead-free Large Reasoning Model Quantization by Layer-wise Lookahead Loss [8.481133435038839]
大規模な推論モデルは、長い自己回帰復号によって競合レベルの数学と符号化精度に達する。
ウェイト量子化はアクセラレーションの標準ツールであるが、長復号推論ベンチマークでは、代表的なレシピが正確さを失う。
そこで我々はLookAhead Quantization (LAQuant) を提案する。
論文 参考訳(メタデータ) (2026-05-09T07:35:38Z) - Kaczmarz Linear Attention [11.650692583508663]
リニアリカレントモデルはコンテキストを固定サイズの状態に圧縮し、情報を忘れ、書き、編集するルールを中心的な設計問題とする。
Gated DeltaNet (GDN) は、ゲート状態崩壊とデルタルール残差書き込みを結合し、学習可能な係数を用いて、忘れと更新の規模をバランスさせる。
状態形状,ゲート,リニアリカレンス,チャンクワイズ並列アルゴリズムを保存するGDNの1スカラー修正であるKaczmarz Linear (KLA)を提案する。
論文 参考訳(メタデータ) (2026-05-09T01:07:01Z) - HAS-VQ: Hessian-Adaptive Sparse Vector Quantization for High-Fidelity LLM Compression [0.0]
HAS-VQ (Hessian-Adaptive Sparse Vec-tor Quantization) は,高感度のアウトレーヤをバルク重量分布から厳密に分離する圧縮フレームワークである。
我々は, SmolLM2-1.7B上のHAS-VQを評価し, 2つの異なる優越性を証明した。
論文 参考訳(メタデータ) (2026-01-11T15:35:10Z) - R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning [80.104336426172]
CoT(Chain-of- Thought)は、大規模言語モデルの問題解決能力を高める。
CoTは長い自己回帰軌道のためにかなりの推論コストを発生させる。
トレーニング不要なハイブリッドデコーディングフレームワークであるR-Stitchを紹介する。
論文 参考訳(メタデータ) (2025-07-23T08:14:36Z) - PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs [18.315998135174652]
トレーニング後のKVキャッシュ量子化は、有望な圧縮技術として登場した。
既存のメソッドは、利用可能なメモリを適切に活用できない。
短いコンテキストのキャリブレーションでは、キーキャッシュ内の頻度の低いチャネルの分散を考慮できません。
論文 参考訳(メタデータ) (2025-05-24T09:18:11Z) - KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization [67.74400574357472]
LLMは、大きなコンテキストウィンドウを必要とするアプリケーションでの利用が増えており、この大きなコンテキストウィンドウでは、KVキャッシュのアクティベーションが推論時のメモリ消費の主要な要因として表面化している。
量子化はKVキャッシュのアクティベーションを圧縮する上で有望な手法であるが、既存のソリューションは4ビット以下の精度でアクティベーションを正確に表現できない。
我々の研究であるKVQuantは、いくつかの新しい手法を取り入れることで、低精度のKVキャッシュ量子化を容易にする。
論文 参考訳(メタデータ) (2024-01-31T18:58:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。