論文の概要: Few Bits, One Law: Toward W2A4KV2
- arxiv url: http://arxiv.org/abs/2610.09202v1
- Date: Tue, 06 Oct 2026 22:55:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.641473
- Title: Few Bits, One Law: Toward W2A4KV2
- Title(参考訳): W2A4KV2への道のり
- Abstract要約: CanonQは、統一的な量子化対応トレーニングフレームワークである。
固定回転とエネルギー正規化を用いて、異質テンソル源を正準座標にマッピングする。
共同トレーニングは、重み、アクティベーション、キャッシュ量子化の結合エラーにネットワークを適応させる。
- 参考スコア(独自算出の注目度): 7.784544533041246
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Extreme low-bit LLM compression is most challenging when weights, activations, and KV caches are quantized together: their distributions differ, and quantization errors interact throughout the network. We introduce CanonQ, a unified quantization-aware training framework that addresses these challenges by separating source canonicalization from task-aware adaptation. Fixed rotations and energy normalization map heterogeneous tensor sources to canonical coordinates, enabling frozen Gaussian-reference codebooks to be reused across layers and models. Joint training then adapts the network to the coupled errors of weight, activation, and cache quantization within a common scalar/vector interface. We bound frozen-codebook transfer error and local task loss, and derive an exact normalization-aware straight-through Jacobian that links quantization distortion to gradient bias. The strongest gains arise under joint W2A4KV2 compression: across LLaMA3-1B/3B/8B, CanonQ-Omni achieves up to 14.28x lower WikiText-2 perplexity and up to 57.9% higher mean zero-shot accuracy than prior state-of-the-art and representative quantization baselines. The benefits extend to Qwen3-1.7B, code generation, and mathematical reasoning: on instruction-tuned MobileLLM-Pro-1B at W2A16KV16, CanonQ achieves relative improvements of 41.7% in HumanEval pass@1 and 39.1% in GSM8K exact match over the strongest evaluated quantization baseline.
- Abstract(参考訳): 重み、アクティベーション、KVキャッシュが一緒に量子化される場合、その分布は異なり、量子化エラーはネットワーク全体で相互作用する。
CanonQは、タスク認識適応からソース正準化を分離することで、これらの課題に対処する統合量子化対応トレーニングフレームワークである。
固定回転とエネルギー正規化はヘテロジニアステンソル源を標準座標にマッピングし、凍結したガウス参照符号ブックを層やモデル間で再利用することができる。
共同トレーニングは、共通のスカラー/ベクターインタフェース内の重み、アクティベーション、キャッシュ量子化の結合エラーにネットワークを適応させる。
我々は、凍結符号ブックの転送誤差と局所的なタスク損失を束縛し、量子化歪みと勾配バイアスをリンクする正確な正規化を意識したストレートスルージャコビアンを導出する。
LLaMA3-1B/3B/8Bで、CanonQ-Omniは最大14.28倍のWikiText-2パープレキシティ、57.9%の平均ゼロショット精度を達成している。
命令チューニングされたMobileLLM-Pro-1B at W2A16KV16において、CanonQはHumanEval pass@1で41.7%、GSM8Kで39.1%の相対的な改善を実現した。
関連論文リスト
- Align, Then Correct: Training-Free Two-Stage Low-Rank Compensation for Extremely Quantized Large Language Models [9.974090237284312]
低ランク量子化誤差補償(LQEC)は、攻撃的な重み量子化の下で失われた精度を回復する。
既存の補償器は2つの共有単純化によって制限されていることを示す。
本稿では,2段階のクローズドフォームフレームワークを提案する。
論文 参考訳(メタデータ) (2026-10-06T11:16:37Z) - Learning Functional Subspaces for Neural Network Compression [79.78451551969097]
Learnable Subspace Projections (LSP) は、エンドツーエンドを捨てるためにサブスペースを学習する。
LSPは、小さなバッチサイズで高密度モデルよりも1.6倍高速にデコードする。
論文 参考訳(メタデータ) (2026-09-30T16:47:35Z) - Cross-Layer Error Compensation and Finite-Sample Feature-Statistics Matching for Extreme Low-Bit Quantization of Large Language Models [0.0]
すべてのレイヤの離散コードとスケールに対する共同最適化として量子化を定式化する。
FP16教師に対して,誤差補償のみのパープレキシティ比が9.56+/-0.15に達することを示す。
Qwen2.5-1.5B で 1.125 ビットのグループバイナリの重みを持つ場合、誤差補償だけで FP16 の教師に対して 9.56 +/- 0.15 のパープレキシティ比に達する。
論文 参考訳(メタデータ) (2026-07-16T06:47:52Z) - LAQuant: A Simple Overhead-free Large Reasoning Model Quantization by Layer-wise Lookahead Loss [8.481133435038839]
大規模な推論モデルは、長い自己回帰復号によって競合レベルの数学と符号化精度に達する。
ウェイト量子化はアクセラレーションの標準ツールであるが、長復号推論ベンチマークでは、代表的なレシピが正確さを失う。
そこで我々はLookAhead Quantization (LAQuant) を提案する。
論文 参考訳(メタデータ) (2026-05-09T07:35:38Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - HAS-VQ: Hessian-Adaptive Sparse Vector Quantization for High-Fidelity LLM Compression [0.0]
HAS-VQ (Hessian-Adaptive Sparse Vec-tor Quantization) は,高感度のアウトレーヤをバルク重量分布から厳密に分離する圧縮フレームワークである。
我々は, SmolLM2-1.7B上のHAS-VQを評価し, 2つの異なる優越性を証明した。
論文 参考訳(メタデータ) (2026-01-11T15:35:10Z) - ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals [10.860081994662645]
大規模言語モデル(LLM)の学習後の量子化は、推論時の計算コストを抑えるという約束を果たす。
本稿では,最先端技術をさらに推し進めるPTQ手法であるResQを提案する。
ResQは、様々なベンチマークにおいて、最近の一様および混合精度のPTQ法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-12-18T22:01:55Z) - SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models [61.474101404805545]
拡散モデルは高品質なイメージを生成することができるが、スケールするにつれて、メモリ要求が増加し、より高いレイテンシがデプロイメント上の課題を引き起こす。
この制限を克服する新しい4ビット量子化パラダイムであるSVDQuantを提案する。
We reduce the memory usage for the 12B FLUX.1 models by 3.5$times$, achieved 3.0$times$ speedup over the 4-bit weight-only Quantization (W4A16) baseline。
論文 参考訳(メタデータ) (2024-11-07T18:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。