論文の概要: KronQ: LLM Quantization via Kronecker-Factored Hessian
- arxiv url: http://arxiv.org/abs/2607.07964v1
- Date: Wed, 08 Jul 2026 22:34:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.355529
- Title: KronQ: LLM Quantization via Kronecker-Factored Hessian
- Title(参考訳): KronQ: Kronecker-Factored HessianによるLLM量子化
- Abstract要約: 後学習量子化(PTQ)は、大規模言語モデル(LLM)を再学習せずに圧縮する手法として広く採用されている。
我々は、量子化パイプラインに勾配共分散を導入することで仮定に挑戦するPTQフレームワークであるKronQを提案する。
- 参考スコア(独自算出の注目度): 19.710403142085102
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training quantization (PTQ) is a widely adopted technique for compressing large language models (LLMs) without retraining. Existing second-order PTQ methods, including GPTQ, construct quantization objectives exclusively from input activation statistics, effectively assuming that all output channels contribute equally to the layer-wise reconstruction objective. We propose KronQ, a PTQ framework that challenges this assumption by introducing the gradient covariance into the quantization pipeline. Under the Kronecker-factored Hessian approximation, the quantization loss depends jointly on both the activation and gradient covariances, and KronQ exploits this at two complementary levels. (1) KronQ introduces bidirectional incoherence processing, extending the existing input-side random rotation to the output dimension using the gradient covariance, reducing weight magnitude variance across both input and output dimensions. (2) KronQ derives a new sensitivity metric for inter-layer mixed-precision allocation, driven by the gradient and activation Hessian traces. Notably, in the case of 2-bit weight-only quantization on LLaMA-3-70B, while GPTQ and GPTAQ diverge or produce degenerate quantizations (>2000 perplexity on WikiText-2), KronQ achieves 7.93 perplexity.
- Abstract(参考訳): 後学習量子化(PTQ)は、大規模言語モデル(LLM)を再学習せずに圧縮する手法として広く採用されている。
GPTQを含む既存の2次PTQ法は、入力アクティベーション統計からのみ量子化の目的を構築し、全ての出力チャネルが階層的な再構成の目的に等しく寄与することを効果的に仮定する。
我々は、量子化パイプラインに勾配共分散を導入することで、この仮定に挑戦するPTQフレームワークであるKronQを提案する。
Kronecker-factored Hessian近似の下では、量子化損失は活性化と勾配の共分散の両方に共同で依存し、KronQはこれを2つの相補的なレベルで利用している。
1) KronQは双方向の非コヒーレンス処理を導入し,既存の入力側ランダム回転を勾配共分散を用いて出力次元に拡張し,入力次元と出力次元の重み寸法のばらつきを低減する。
2) KronQは、勾配と活性化ヘッセントレースによって駆動される層間混合精度割当のための新しい感度指標を導出した。
特に、LLaMA-3-70B上の2ビットの重みのみの量子化の場合、GPTQとGPTAQは分岐または退化量子化(WikiText-2における2000パープレキシティ)し、KronQは7.93パープレキシティを達成する。
関連論文リスト
- UniSVQ: 2-bit Unified Scalar-Vector Quantization [48.190936990215384]
2ビットレベルのトレーニング後の量子化により、大規模言語モデルに対する低コストなデプロイメントと推論アクセラレーションが可能になる。
整数格子のアフィン変換としてコードワードをパラメータ化することでスカラーおよびベクトル量子化をブリッジする2ビット統一量子化フレームワークUniSVQを提案する。
論文 参考訳(メタデータ) (2026-06-09T07:50:52Z) - LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs [52.1276403258812]
ブロックワイドPTQの簡易かつ効果的な拡張であるLFQ(Logit-aware Final-block Quantization)を導入する。
LFQは、最先端のブロックワイドPTQよりも複雑な生成タスクの精度を一貫して改善する。
論文 参考訳(メタデータ) (2026-05-28T11:02:23Z) - GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling [36.47926569464477]
GSQ(Gumbel-Softmax Quantization)は,グループ単位のグリッド割り当てとグループ単位のスケールを協調的に学習する,学習後のスカラー量子化手法である。
標準のLlama-3.1-8B/70B-Instructモデルでは、GSQはスカラー量子化とQTIPフロンティアの差の大部分を2ビットと3ビットで閉じている。
GSQは,ベクトル量子化法の適用が困難なKim-K2.5のような1兆倍スケールのMixture-of-Expertsモデルにスケールすることを示す。
論文 参考訳(メタデータ) (2026-04-20T17:45:47Z) - Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models [11.411411301593011]
トレーニング後の量子化(PTQ)は、微調整なしで大規模言語モデルをデプロイするための主要なアプローチである。
token-level Importance-aware Layer-wise Quantization framework (TLQ)を提案する。
TLQは2つのモデル、3つのモデルスケール、および2つの量子化設定で評価され、すべての設定で一貫してパフォーマンス改善が達成される。
論文 参考訳(メタデータ) (2026-02-08T10:19:25Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - Cat: Post-Training Quantization Error Reduction via Cluster-based Affine Transformation [47.791962198275066]
Post-Training Quantization (PTQ)は、フル精度(FP)値を量子化および圧縮データタイプに変換することにより、ディープニューラルネットワークのメモリフットプリントと計算オーバーヘッドを低減する。
PTQはQAT(Quantization-Aware Training)よりもコスト効率が高いが、低ビット量子化条件下での精度劣化に非常に敏感である。
本稿ではクラスタベースのアフィン変換(CAT)を提案する。クラスタ固有のパラメータを用いて,LQ出力をFP出力と整合させる。
論文 参考訳(メタデータ) (2025-09-30T14:00:28Z) - SINQ: Sinkhorn-Normalized Quantization for Calibration-Free Low-Precision LLM Weights [8.95245917088986]
訓練後の量子化は、大規模言語モデルを低精度で展開するための最も広く使われている戦略として現れてきた。
現在の手法では、ビット幅が4以下でパープレキシティ劣化を示す。
本稿では,2軸スケール係数と高速シンクホーン-ノック方式のアルゴリズムにより,既存の学習後量子化器を増強するSINQを紹介する。
論文 参考訳(メタデータ) (2025-09-26T21:22:54Z) - LRQ-DiT: Log-Rotation Post-Training Quantization of Diffusion Transformers for Image and Video Generation [41.66473889057111]
Diffusion Transformer (DiTs) は、テキスト・ツー・イメージとテキスト・ツー・ビデオ生成において、優れたパフォーマンスを実現している。
DiTsの高計算コストと大きなパラメータサイズは、リソース制約のあるシナリオでの利用に重大な課題をもたらす。
本稿では,映像・映像生成のための学習後量子化フレームワークLRQ-DiTを提案する。
論文 参考訳(メタデータ) (2025-08-05T14:16:11Z) - PTQ1.61: Push the Real Limit of Extremely Low-Bit Post-Training Quantization Methods for Large Language Models [64.84734437930362]
大規模言語モデル(LLM)は、非常に低ビット(2ビット未満)の量子化に直面した場合、性能が著しく低下する。
我々はPTQ1.61と呼ばれる極低ビットのPTQ法を提案し、これによって初めて1.61ビットの重み量子化が可能となる。
実験により、PTQ1.61は極低ビット量子化において最先端の性能を達成することが示された。
論文 参考訳(メタデータ) (2025-02-18T08:04:58Z) - Extending Quantum Perceptrons: Rydberg Devices, Multi-Class Classification, and Error Tolerance [67.77677387243135]
量子ニューロモーフィックコンピューティング(QNC)は、量子計算とニューラルネットワークを融合して、量子機械学習(QML)のためのスケーラブルで耐雑音性のあるアルゴリズムを作成する
QNCの中核は量子パーセプトロン(QP)であり、相互作用する量子ビットのアナログダイナミクスを利用して普遍的な量子計算を可能にする。
論文 参考訳(メタデータ) (2024-11-13T23:56:20Z) - Towards Accurate Post-Training Quantization of Vision Transformers via Error Reduction [48.740630807085566]
ビジョントランスフォーマー(ViT)のPTQ(Post-training Quantization)は,学術的,産業的にも注目されている。
現在の方法は、量子化された重みとアクティベーションの間の複雑な相互作用を考慮できないため、量子化エラーと準最適性能をもたらす。
本稿では,活性化と重み量子化による量子化誤差を逐次低減する2段階PTQ法であるERQを提案する。
論文 参考訳(メタデータ) (2024-07-09T12:06:03Z) - OAC: Output-adaptive Calibration for Accurate Post-training Quantization [28.67781845829386]
大規模言語モデル(LLM)を圧縮するPTQ(Post-training Quantization)技術が開発されている。
ほとんどのPTQは、モデル出力を無視した層ワイドユークリッド損失に基づいて量子化誤差を定式化する。
キャリブレーションプロセスにモデル出力を組み込むために,出力適応量子化(OAC)を提案する。
論文 参考訳(メタデータ) (2024-05-23T20:01:17Z) - CBQ: Cross-Block Quantization for Large Language Models [66.82132832702895]
ポストトレーニング量子化(PTQ)は、超低コストで大規模言語モデル(LLM)を圧縮する上で重要な役割を果たしている。
LLMのためのクロスブロック再構成に基づくPTQ手法CBQを提案する。
CBQはリコンストラクションスキームを使用してクロスブロック依存関係を採用し、エラーの蓄積を最小限に抑えるために複数のブロックにまたがる長距離依存関係を確立する。
論文 参考訳(メタデータ) (2023-12-13T07:56:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。