論文の概要: CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs
- arxiv url: http://arxiv.org/abs/2606.26650v1
- Date: Thu, 25 Jun 2026 06:24:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.184601
- Title: CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs
- Title(参考訳): CAT-Q:LLMのコスト効率と高精度3次量子化
- Authors: Shigeng Wang, Chao Li, Yangyuxuan Kang, Jiawei Fan, Anbang Yao,
- Abstract要約: 本稿では,LCMの圧縮と高速化を目的としたCAT-Q,コスト効率,高精度な3次量子化について述べる。
1.7B から 8B のパラメータを持つ事前訓練された LLM では、CAT-Q は512 の校正サンプルのみを使用して3次モデルに効率よく定量化できる。
CAT-Qは,14Bから235Bのパラメータを持つ事前学習LLMを,わずか8時間から60時間で第3次モデルに定量化できることを示す。
- 参考スコア(独自算出の注目度): 13.903045659324187
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this paper, we present CAT-Q, Cost-efficient and Accurate Ternary Quantization, for compressing and accelerating LLMs. Unlike existing state-of-the-art ternary quantization methods that rely on data-intensive and costly quantization-aware training to mitigate severe performance degradation, CAT-Q is a simple yet effective post-training quantization scheme that is readily applicable to LLMs with diverse architectures and model sizes. It has two key components, learnable modulation (LM) and softened ternarization (ST), which are coupled from an optimization perspective. LM leverages a composition of learnable factors to modulate the distribution of pre-trained high-precision weights and the ternary threshold, making them less sensitive to ternarization. ST further introduces a differentiable transition function to guide the ternarization process toward stable convergence. We show that, for pre-trained LLMs with 1.7B to 8B parameters, CAT-Q can efficiently quantize them into ternary models using only 512 calibration samples, while achieving superior performance than the seminal BitNet 1.58-bit v1 and v2 families (with 1.3B to 7B parameters) trained with 100B tokens, yielding about a 100,000X reduction in training tokens. Moreover, we show for the first time that CAT-Q can quantize much larger pre-trained LLMs having 14B to 235B parameters into leading ternary models within just 8 to 60 hours on 8 A100-80GB GPUs. Code is available at https://github.com/IntelChina-AI/BitTern.
- Abstract(参考訳): 本稿では,LCMの圧縮・高速化を目的としたCAT-Q,コスト効率,高精度3次量子化について述べる。
データ集約的でコストがかかる量子化対応のトレーニングを頼りにしている既存の3次量子化手法とは異なり、CAT-Qは、多種多様なアーキテクチャとモデルサイズを持つLLMに容易に適用可能な、単純で効果的なポストトレーニング量子化スキームである。
学習可能変調(LM)と軟化三元化(ST)という2つの重要なコンポーネントが最適化の観点から結合されている。
LMは学習可能な因子の組成を利用して、事前訓練された高精度な重みと三次閾値の分布を調節し、三次化への敏感さを減らす。
さらに ST は三元化過程を安定収束へと導く微分可能遷移関数を導入する。
CAT-Q は,1.7B から 8B のパラメータを持つ事前学習 LLM に対して,512 のキャリブレーションサンプルのみを用いて3次モデルに効率よく定量化できるとともに,100B のトークンで訓練されたセミナー BitNet 1.58-bit v1 および v2 ファミリー (1.3B から 7B のパラメータを持つ) よりも優れた性能を実現し,トレーニングトークンの約 10 万倍の削減を達成できることを示した。
さらに、CAT-Qは、14Bから235Bのパラメータを持つより大きな事前学習LLMを8A100-80GBのGPU上でわずか8から60時間以内の3次モデルに量子化できることを示す。
コードはhttps://github.com/Intel China-AI/BitTern.comで入手できる。
関連論文リスト
- TernaryLM: Memory-Efficient Language Modeling via Native 1-Bit Quantization with Adaptive Layer-wise Scaling [0.39287497907611874]
本稿では, ネイティブな1ビット3次量子化 -1, 0, +1 を用いた 132M パラメータトランスフォーマアーキテクチャである TernaryLM を提案する。
この結果から,ネイティブな1ビットトレーニングが,効率的なニューラルネットワークモデルにとって有望な方向であることが示唆された。
論文 参考訳(メタデータ) (2026-02-07T05:35:17Z) - EfficientQAT: Efficient Quantization-Aware Training for Large Language Models [50.525259103219256]
量子化対応トレーニング(QAT)は、低ビット表現によるメモリ消費を最小限の精度で削減することで、ソリューションを提供する。
より有効なQATアルゴリズムであるEfficient QAT(Efficient Quantization-Aware Training)を提案する。
効率的なQATは、全てのパラメータのブロックワイドトレーニング(Block-AP)と量子化パラメータのエンドツーエンドトレーニング(E2E-QP)の2つのフェーズを含む。
論文 参考訳(メタデータ) (2024-07-10T17:53:30Z) - OneBit: Towards Extremely Low-bit Large Language Models [66.29839811207617]
本稿では, LLMの重量行列を1ビットに大胆に定量化し, LLMの極低ビット幅展開への道を開く。
実験によると、OneBitは(LLaMAモデルの非量子化性能の少なくとも81%)優れたパフォーマンスを、堅牢なトレーニングプロセスで達成している。
論文 参考訳(メタデータ) (2024-02-17T14:26:57Z) - BiLLM: Pushing the Limit of Post-Training Quantization for LLMs [53.31402059062365]
BiLLMは、事前訓練された大規模言語モデルに適した1ビット後のトレーニング後の量子化スキームである。
LLaMA2-70Bの8.41パープレキシティは、様々なLLMファミリーで1.08ビットの重みしか持たない。
論文 参考訳(メタデータ) (2024-02-06T09:26:34Z) - TEQ: Trainable Equivalent Transformation for Quantization of LLMs [1.0376648762140632]
TEQは、低精度量子化を生かしながら、モデル出力のFP32精度を保存する訓練可能な等価変換である。
トレーニングプロセスは軽量で、1Kステップしか必要とせず、オリジナルのモデルのトレーニング可能なパラメータの0.1%未満である。
論文 参考訳(メタデータ) (2023-10-17T02:42:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。