論文の概要: QTEA: Ternary LLMs with Sparse Residual Salient Weight and By-Column Optimization
- arxiv url: http://arxiv.org/abs/2609.00224v2
- Date: Wed, 02 Sep 2026 07:12:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 15:35:44.748162
- Title: QTEA: Ternary LLMs with Sparse Residual Salient Weight and By-Column Optimization
- Title(参考訳): QTEA: 疎残量残量重み付き3次LLMとバイコロン最適化
- Authors: Yipin Guo, Arun M George, Jie Fu, Tareq Mahmoud, Sixue Xing, Siddharth Joshi,
- Abstract要約: 3次値に重みを量子化し,残差補償器として正重みを用いるサブ2ビットPTQフレームワークQTEAを提案する。
Qwen3-14Bでは、QTEAは全ての重量を1重量あたり1.7ビットに圧縮し、最強の3次PTQベースラインの平均精度を16.7%向上させた。
また、WikiTextとC4では、それぞれ1.40$times$と2.61$times$低いパープレキシティを達成している。
- 参考スコア(独自算出の注目度): 9.778816613621848
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Weight-only post-training quantization (PTQ) can alleviate the computational burden of serving large language models (LLMs) at scale. However, existing PTQ methods often fail to generalize across models and suffer severe accuracy loss below 2 bits. Many leverage unstructured sparsity to mitigate this loss, but at the cost of regularity and GPU-friendly execution. We present QTEA, a sub-2-bit PTQ framework that quantizes weights into ternary values and uses salient weights as residual error compensators. To maintain hardware efficiency, residuals are assigned to selected columns with semi-structured $1:4$ sparsity within the salient columns. We further add column-wise rescale refinement to GPTQ-style column-by-column quantization, alternately updating per-column scales and ternary assignments to reduce reconstruction error. We also identify order-dependent error propagation in GPTQ and introduce error decay to attenuate late-stage error accumulation. On Qwen3-14B, QTEA compresses all weights to an effective 1.7 bits per weight while improving average accuracy over the strongest ternary PTQ baseline by 16.7%. It also achieves 1.40$\times$ and 2.61$\times$ lower perplexity on WikiText and C4 respectively. This trend holds on Llama3-8B, where QTEA obtains a 6.6% accuracy gain and 1.34$\times$ / 1.95$\times$ lower perplexity on the same datasets. Finally, we develop a lookup-table based kernel that achieves 7.2$\times$ faster per-token generation over an FP16 baseline. Code is available at https://github.com/Intelligent-Microsystems-Lab/QTEA.
- Abstract(参考訳): 重みのみのポストトレーニング量子化(PTQ)は、大規模言語モデル(LLM)を大規模に提供する際の計算負担を軽減することができる。
しかし、既存のPTQ法はモデル全体の一般化に失敗し、2ビット未満の精度の損失を被ることが多い。
多くの人は、この損失を軽減するために非構造化のスパーシリティを利用するが、正規性とGPUフレンドリな実行のコストがかかる。
3次値に重みを量子化し,残差補償器として正重みを用いるサブ2ビットPTQフレームワークQTEAを提案する。
ハードウェア効率を維持するため、残余は選択されたカラムに割り当てられ、半構造化された1:4$の空間がサリアントカラム内に割り当てられる。
さらに, GPTQ方式のカラム・バイ・カラム量子化にカラム・ワイド・リスケールの改良を加え, カラム単位のスケールと3次割り当てを交互に更新し, 再構成誤差を低減する。
また、GPTQにおける順序依存誤差の伝播を同定し、後期誤差の蓄積を減衰させるために誤差減衰を導入する。
Qwen3-14Bでは、QTEAは全ての重量を1重量あたり1.7ビットに圧縮し、最強の3次PTQベースラインの平均精度を16.7%向上させた。
また、WikiTextとC4では、それぞれ1.40$\times$と2.61$\times$低いパープレキシティを達成している。
この傾向は、QTEAが6.6%の精度向上と1.34$\times$ / 1.95$\times$低いパープレキシティを得るLlama3-8Bに当てはまる。
最後に、FP16ベースライン上で7.2$\times$高速なトーケン生成を実現するルックアップテーブルベースのカーネルを開発する。
コードはhttps://github.com/Intelligent-Microsystems-Lab/QTEAで入手できる。
関連論文リスト
- Minimizing the Hidden Cost of Scales: Graph-Guided Ultra-Low-Bit Quantization for Large Language Models [50.16014098038291]
学習後量子化(PTQ)は,大規模言語モデル(LLM)の効率的な展開に重要である
隠れスケーリングコストを最小限に抑えるLLMのための超低ビット量子化フレームワークであるSAGE-PTQを提案する。
LLaMA-3B では、SAGE-PTQ は BiLLM の 55.8 と比較して 6.74 WikiText2 のパープレキシティを実現している。
論文 参考訳(メタデータ) (2026-06-03T20:51:52Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - PTQ1.61: Push the Real Limit of Extremely Low-Bit Post-Training Quantization Methods for Large Language Models [64.84734437930362]
大規模言語モデル(LLM)は、非常に低ビット(2ビット未満)の量子化に直面した場合、性能が著しく低下する。
我々はPTQ1.61と呼ばれる極低ビットのPTQ法を提案し、これによって初めて1.61ビットの重み量子化が可能となる。
実験により、PTQ1.61は極低ビット量子化において最先端の性能を達成することが示された。
論文 参考訳(メタデータ) (2025-02-18T08:04:58Z) - ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals [10.860081994662645]
大規模言語モデル(LLM)の学習後の量子化は、推論時の計算コストを抑えるという約束を果たす。
本稿では,最先端技術をさらに推し進めるPTQ手法であるResQを提案する。
ResQは、様々なベンチマークにおいて、最近の一様および混合精度のPTQ法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-12-18T22:01:55Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z) - OAC: Output-adaptive Calibration for Accurate Post-training Quantization [28.67781845829386]
大規模言語モデル(LLM)を圧縮するPTQ(Post-training Quantization)技術が開発されている。
ほとんどのPTQは、モデル出力を無視した層ワイドユークリッド損失に基づいて量子化誤差を定式化する。
キャリブレーションプロセスにモデル出力を組み込むために,出力適応量子化(OAC)を提案する。
論文 参考訳(メタデータ) (2024-05-23T20:01:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。