論文の概要: GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries
- arxiv url: http://arxiv.org/abs/2607.20757v2
- Date: Fri, 24 Jul 2026 12:57:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 14:08:30.963922
- Title: GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries
- Title(参考訳): GaugeQuant: LLM対称性による量子化最適基底のオンライン学習
- Authors: Miguel P. Bento, João F. Seabra,
- Abstract要約: GaugeQuantは、対称性を損なう損失にLogSumExpという用語を導入し、アクティベーションアウトリーを最小化するベースを選択する。
特定のキャリブレーションデータや量子化シミュレーションは必要ありません。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformers are known to have internal continuous symmetries that leave outputs invariant, while modifying quantization. GaugeQuant leverages this in-training by introducing a LogSumExp term to the loss that breaks the symmetries, thus selecting a basis that minimizes activation outliers. A stop-gradient operator ensures that only rotation matrices are updated, yielding the language modeling objective completely unaltered. Our requires no specific calibration data, no quantization simulation, and adds negligible training overhead. With the LLaMA-2 7B model under W4A4 quantization with group size 128, perplexity drops from 8.22 to 6.73, competing with post-training methods that require frozen models and calibration datasets. Under W4A16, perplexity drops from 11.16 to 5.45. Code is available at https://github.com/MPedraBento/gauge-quant.
- Abstract(参考訳): 変換器は内部的な連続対称性を持ち、出力を不変にし、量子化を変更することが知られている。
GaugeQuantは、このトレーニングにおいて、対称性を損なう損失にLogSumExpという用語を導入することで、アクティベーションアウトリーを最小化するベースを選択する。
停止段階演算子により、回転行列のみが更新されることが保証され、言語モデリングの目的は完全に変更されない。
特定のキャリブレーションデータや量子化シミュレーションは必要ありません。
グループサイズ128のW4A4量子化の下でのLLaMA-2 7Bモデルでは、パープレキシティは8.22から6.73に低下し、凍結モデルとキャリブレーションデータセットを必要とするポストトレーニング手法と競合する。
W4A16では、パープレキシティは11.16から5.45に低下する。
コードはhttps://github.com/MPedraBento/gauge-quant.comで入手できる。
関連論文リスト
- Quantization-Robust LLM Unlearning via Low-Rank Adaptation [1.9261138876072244]
大規模言語モデル(LLM)アンラーニングは、訓練されたモデルから対象とする知識を取り除くことを目的としている。
低ランク適応(LoRA)を用いた量子化ロバストアンラーニングを提案する。
LoRAは4ビットユーティリティを最大7.93ポイント(BOOKSではNPO+GDR 50.17から58.10)改善し、GA+GDR(40.06から44.82、4.76の増加)のNEWSでは高い4ビットユーティリティを提供する。
論文 参考訳(メタデータ) (2026-02-13T18:01:40Z) - Fine-tuning Quantized Neural Networks with Zeroth-order Optimization [21.0540879091664]
我々は、勾配推定のために連続量子化スケールを摂動する単純で効果的な方法である量子化ゼロ階最適化(QZO)を提案する。
QZOは4ビットLLMの合計メモリコストを18ドル以上削減でき、24GBのGPUでLlama-2-13Bを微調整できる。
論文 参考訳(メタデータ) (2025-05-19T17:55:15Z) - QUAD: Quantization and Parameter-Efficient Tuning of LLM with Activation Decomposition [21.13478769431063]
QUID(Quantization with Activation Decomposition)は、Singular Value Decomposition(SVD)を利用して、有効4ビット量子化のためのアクティベーションアウトリアを抑制するフレームワークである。
W4A4の量子化では94パーセントの精度、W4A4/A8では98%の精度、Llama-3およびQwen-2.5モデルのパラメータ効率の微調整を実現している。
論文 参考訳(メタデータ) (2025-03-25T05:03:56Z) - BCQ: Block Clustered Quantization for 4-bit (W4A4) LLM Inference [8.136601122570347]
後学習量子化(PTQ)は、より大きな言語モデル(LLM)のストレージと計算要求を、追加のトレーニングコストなしで削減するための有望なアプローチである。
最近のPTQ研究は、主に8ビット以上の活性化を維持しながら、重量のみを8ビット未満に定量化することに焦点を当てている。
論文 参考訳(メタデータ) (2025-02-07T23:06:03Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z) - EfficientQAT: Efficient Quantization-Aware Training for Large Language Models [50.525259103219256]
量子化対応トレーニング(QAT)は、低ビット表現によるメモリ消費を最小限の精度で削減することで、ソリューションを提供する。
より有効なQATアルゴリズムであるEfficient QAT(Efficient Quantization-Aware Training)を提案する。
効率的なQATは、全てのパラメータのブロックワイドトレーニング(Block-AP)と量子化パラメータのエンドツーエンドトレーニング(E2E-QP)の2つのフェーズを含む。
論文 参考訳(メタデータ) (2024-07-10T17:53:30Z) - LQ-LoRA: Low-rank Plus Quantized Matrix Decomposition for Efficient Language Model Finetuning [66.85589263870702]
提案手法では,事前学習した行列を高精度の低ランク成分とメモリ効率の量子化成分に分解するために反復アルゴリズムを用いる。
微調整されたRoBERTaとLLaMA-2の実験は、我々の低ランク+量子化行列分解法(LQ-LoRA)が強いQLoRAおよびGPTQ-LoRAベースラインより優れていることを示した。
論文 参考訳(メタデータ) (2023-11-20T18:57:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。