論文の概要: JacQuant: STE-Free Quantization-Aware Training via Learned Jacobian Surrogates
- arxiv url: http://arxiv.org/abs/2605.25469v1
- Date: Mon, 25 May 2026 06:19:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:19.348857
- Title: JacQuant: STE-Free Quantization-Aware Training via Learned Jacobian Surrogates
- Title(参考訳): JacQuant: 学習したジャコビアンサロゲートによるSTEフリー量子化アウェアトレーニング
- Abstract要約: QAT(quantization-aware training)は広く展開されているが、通常はSTE(Straight-Through Estimator)に依存している。
これにより、ビン付近でトレーニングを行ない、実際の低精度モデルと弱く整合することが多い。
JacQuantは軽量な代理モデルのパラメータ変化に対する局所感度を学習するフレームワークである。
- 参考スコア(独自算出の注目度): 9.03449876943648
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Quantization-aware training (QAT) is widely deployed but typically relies on the Straight-Through Estimator (STE), which passes gradients through non-differentiable quantizers by fiat. This often makes training brittle near bin boundaries and weakly aligned with the actual behavior of the low-precision model. We introduce JacQuant, a QAT framework that learns a lightweight surrogate of the model's local sensitivity to parameter changes and uses it to stabilize and accelerate training within standard variance-reduced optimizers. The surrogate is inexpensive (diagonal or block-diagonal), data-driven, and compatible with common weight and activation quantizers. On code-preserving training phases, we prove convergence for non-convex objectives and obtain linear rates under a PL condition, and we relate the learned sensitivity to end-to-end output fidelity via a simple calibration argument. Across LLM benchmarks at $\leq 2$ bits, JacQuant consistently reaches higher accuracy than STE-based QAT, and the runtime analyses on various models show that the added cost remains negligible under practical group sizes. The method is drop-in and requires no changes to the forward quantizers; our empirical claims are scoped to ultra-low-bit LLM QAT.
- Abstract(参考訳): QAT(quantization-aware training)は広く展開されているが、通常はSTE(Straight-Through Estimator)に依存している。
これはしばしばビン境界付近での訓練を不安定にし、低精度モデルの実際の振る舞いに弱く一致する。
本稿では,パラメータ変化に対するモデルの局所感度の軽量なサロゲートを学習するQATフレームワークであるJacQuantを紹介する。
サロゲートは安価(対角線またはブロック対角線)で、データ駆動で、共通の重量と活性化量化器と互換性がある。
コード保存学習フェーズでは,非凸目標に対する収束性を証明し,PL条件下での線形レートを求める。
LLMベンチマークは$\leq 2$ bitsで、JacQuantはSTEベースのQATよりも常に高い精度を達成し、様々なモデルのランタイム解析により、実用的なグループサイズでは追加コストは無視できないことが示された。
我々の経験的主張は超低ビット LLM QAT の範囲内である。
関連論文リスト
- Sensitivity-Aware Thresholding and Token Routing for Activation Sparsification in Large Language Models [2.593510481959727]
大規模言語モデル(LLM)における効率的な推論は、モデルの品質を維持しながら、どこで計算を削減できるかを決定する必要がある。
本稿では,多層パーセプトロン(MLP)アクティベーションスペーシフィケーションとトークンレベルの条件付きルーティングを用いてこの問題について検討する。
論文 参考訳(メタデータ) (2026-07-09T23:40:36Z) - LC-QAT: Data-Efficient 2-Bit QAT for LLMs via Linear-Constrained Vector Quantization [9.37026660976194]
極低ビット大言語モデル(LLM)には量子化対応トレーニング(QAT)が不可欠である
本稿では,離散ベクトル上のアフィンマッピングを学習することにより,量子化重みを表す2ビットのVQ-QATフレームワークであるLC-QATを提案する。
LC-QATは、トレーニングデータの0.1%-10%しか使用せず、最先端のQAT手法よりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-06-09T08:02:56Z) - LSGQuant: Layer-Sensitivity Guided Quantization for One-Step Diffusion Real-World Video Super-Resolution [52.627063566555194]
本稿では,一段階拡散に基づく実世界VSRのための層感度誘導量子化手法LSGQuantを紹介する。
本手法は,ビデオトークンのアクティベーションに適合する動的レンジ適応量子化器 (DRAQ) を備える。
提案手法は,完全精度のオリジンモデルに対してほぼ性能が良く,既存の量子化手法をはるかに上回っている。
論文 参考訳(メタデータ) (2026-02-03T06:53:19Z) - StableQAT: Stable Quantization-Aware Training at Ultra-Low Bitwidths [49.94623294999562]
量子化対応トレーニング(QAT)は、厳格なメモリとレイテンシの制約の下で大規模モデルをデプロイするために不可欠である。
ストレートスルー推定器(STE)やソフト量子化器に基づく一般的な手法は、しばしばミスマッチ、不安定、高い計算オーバーヘッドに悩まされる。
超低ビット環境でのトレーニングを安定化する統合的で効率的なQATフレームワークであるStableQATを提案する。
論文 参考訳(メタデータ) (2026-01-27T08:00:57Z) - What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study [59.44848132298657]
ポストトレーニング量子化(PTQ)は通常、特に低ビット設定でのタスクの推論において、大きな精度低下のコストが伴う。
本研究では,推論モデルに対する量子化認識学習(QAT)の体系的研究について述べる。
論文 参考訳(メタデータ) (2026-01-21T11:22:29Z) - CAGE: Curvature-Aware Gradient Estimation For Accurate Quantization-Aware Training [73.46600457802693]
本稿では,量子化による損失に対応する新しい手法を提案する。
CAGEは、同様の計算コストで、精度の観点から最先端の手法を大幅に改善する。
LlamaモデルのQAT事前トレーニングでは、CAGEは4ビット(W4A4)で達成された精度と事前のベストメソッドとを一致させる。
論文 参考訳(メタデータ) (2025-10-21T16:33:57Z) - End-to-End On-Device Quantization-Aware Training for LLMs at Inference Cost [53.25965863436039]
量子化対応トレーニング(QAT)は、より原則化されたソリューションを提供するが、バックプロパゲーションに依存しているため、メモリコストは禁じられている。
重み付けとアクティベーション量子化の両方をサポートするゼロオーダー最適化ベースのQATフレームワークであるZeroQATを提案する。
実験の結果、ZeroQATはPTQとQATのベースラインを一貫して上回り、メモリは大幅に削減された。
論文 参考訳(メタデータ) (2025-08-21T01:18:27Z) - RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models [53.571195477043496]
本稿では,RoSTE (Rotated Straight-Through-Estimator) というアルゴリズムを提案する。
RoSTEは、量子化を意識した微調整(QA-SFT)と適応的な回転戦略を組み合わせることで、アクティベーションアウトリーを減少させる。
その結果, 予測誤差は収束重みの量子化誤差と直接比例し, 最適化された回転構成により効果的に管理できることが判明した。
論文 参考訳(メタデータ) (2025-02-13T06:44:33Z) - LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit [55.73370804397226]
鍵圧縮技術である量子化は、大きな言語モデルを圧縮し、加速することにより、これらの要求を効果的に軽減することができる。
本稿では,プラグアンドプレイ圧縮ツールキットであるLLMCについて,量子化の影響を公平かつ体系的に検討する。
この汎用ツールキットによって、我々のベンチマークはキャリブレーションデータ、アルゴリズム(3つの戦略)、データフォーマットの3つの重要な側面をカバーしています。
論文 参考訳(メタデータ) (2024-05-09T11:49:05Z) - Norm Tweaking: High-performance Low-bit Quantization of Large Language
Models [21.855106896725598]
そこで本研究では,現在のPTQ手法のプラグインとして利用できるノルム調整手法を提案する。
本手法は,重量のみの量子化と重みとアクティベーションの連成量子化の両面で有意な改善を示す。
私たちのシンプルで効果的なアプローチは、現実世界のアプリケーションにとってより実用的です。
論文 参考訳(メタデータ) (2023-09-06T06:51:15Z) - Gradient $\ell_1$ Regularization for Quantization Robustness [70.39776106458858]
トレーニング後の量子化に対するロバスト性を改善するための単純な正規化スキームを導出する。
量子化対応ネットワークをトレーニングすることにより、異なるビット幅にオンデマンドで量子化できる1組の重みを格納できる。
論文 参考訳(メタデータ) (2020-02-18T12:31:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。