論文の概要: Efficient Tuning Before Low-Bit Post-Training Quantization for Stochastic Gradient Descent-optimized Models
- arxiv url: http://arxiv.org/abs/2607.11359v1
- Date: Mon, 13 Jul 2026 10:24:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.42946
- Title: Efficient Tuning Before Low-Bit Post-Training Quantization for Stochastic Gradient Descent-optimized Models
- Title(参考訳): 確率的勾配最適化モデルに対する低ビット後トレーニング量子化前の効率的なチューニング
- Abstract要約: 後トレーニング量子化(PTQ)は、限られたメモリと計算予算の下で、デプロイのためのディープニューラルネットワークを圧縮する。
既存のPTQ手法の多くは、制約のないフル精度(FP)モデルで動作し、主にポストホック再構成による量子化誤差に対処する。
我々は、低ビットPTQ精度は、量子化後の誤差最小化だけでなく、FPモデル自体の量子化エラー耐性にも制限されていると論じる。
- 参考スコア(独自算出の注目度): 8.779009700879982
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Post-training quantization (PTQ) compresses deep neural networks for deployment under limited memory and computational budgets. However, low-bit (i.e., 2-bit or 4-bit) PTQ often suffers from substantial performance degradation. Most existing PTQ methods operate on an unconstrained full-precision (FP) model and primarily address quantization errors through post-hoc reconstruction. We argue that low-bit PTQ accuracy is limited not only by post-quantization error minimization, but also by the quantization-error tolerance of a FP model itself. In this paper, we propose Efficient Tuning Before Quantization (ETBQ), a pre-conditioning tuning stage for Stochastic Gradient Descent (SGD)-optimized models before PTQ. During tuning, the FP model is optimized under perturbations sampled from the error distributions of weight and activation quantization, guiding the model toward a loss-landscape region that is less sensitive to the subsequent PTQ. Unlike QAT, ETBQ does not train a fake-quantized deployment model, which is computationally and memory intensive. Instead, ETBQ outputs a FP model that can be used by any PTQ backend. Experiments on CIFAR-100, Tiny-ImageNet, ImageNet, and Cityscapes provide consistent evidence that ETBQ improves low-bit PTQ across diverse tasks. Under W2A4 settings, e.g., ETBQ improves over naive PTQ by 2.14\% top-1 accuracy on Tiny-ImageNet and by 5.80\% mIoU on Cityscapes. Code is available at https://github.com/xpxpxp2001xpxpxp/ETBQ.
- Abstract(参考訳): 後トレーニング量子化(PTQ)は、限られたメモリと計算予算の下で、デプロイのためのディープニューラルネットワークを圧縮する。
しかし、低ビット(すなわち2ビットまたは4ビット)のPTQはしばしば性能劣化に悩まされる。
既存のPTQ手法の多くは、制約のないフル精度(FP)モデルで動作し、主にポストホック再構成による量子化誤差に対処する。
我々は、低ビットPTQ精度は、量子化後の誤差最小化だけでなく、FPモデル自体の量子化エラー耐性にも制限されていると論じる。
本稿では,PTQ 以前の確率勾配 Descent (SGD) 最適化モデルに対する事前条件付きチューニングステージである,ETBQ の効率的なチューニング前量子化(ETBQ)を提案する。
チューニング中、FPモデルは、ウェイトとアクティベーションの量子化の誤差分布からサンプリングされた摂動の下で最適化され、その後のPTQに敏感でない損失ランドスケープ領域へ誘導される。
QATとは異なり、ETBQは計算的かつメモリ集約的なフェイク量子化デプロイメントモデルをトレーニングしていない。
代わりに、ETBQは任意のPTQバックエンドで使用できるFPモデルを出力する。
CIFAR-100、Tiny-ImageNet、ImageNet、Cityscapesの実験は、ETBQが様々なタスクで低ビットPTQを改善するという一貫した証拠を提供する。
W2A4設定では、例えば、ETBQはTiny-ImageNetでは2.14\%、Cityscapesでは5.80\%のPTQよりも改善されている。
コードはhttps://github.com/xpxp2001xpxp/ETBQで入手できる。
関連論文リスト
- ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization [10.647335642551193]
後学習量子化(PTQ)は、大規模言語モデルの計算コストを削減するために広く用いられている。
本稿では,この段階でのバックプロパゲーションフリーな固定グリッド精錬法ReQuantを紹介する。
ReQuantは不均一PTQイニシャライザから量子化モデルを一貫して改善することを示す。
論文 参考訳(メタデータ) (2026-08-07T09:27:14Z) - LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs [52.1276403258812]
ブロックワイドPTQの簡易かつ効果的な拡張であるLFQ(Logit-aware Final-block Quantization)を導入する。
LFQは、最先端のブロックワイドPTQよりも複雑な生成タスクの精度を一貫して改善する。
論文 参考訳(メタデータ) (2026-05-28T11:02:23Z) - Efficiently Training A Flat Neural Network Before It has been Quantizated [7.236012064192816]
視覚変換器(ViT)のPTQ(Post-training Quantization)は,圧縮モデルの効率性から注目されている。
事前定義された精度の低ビットモデルに適したモデルに依存しないニューラルネットワークを効率的にトレーニングする方法は不明である。
本稿では,エラー源の測定とアンタングによってモデルを積極的に事前条件付けするフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-03T11:21:45Z) - Cat: Post-Training Quantization Error Reduction via Cluster-based Affine Transformation [47.791962198275066]
Post-Training Quantization (PTQ)は、フル精度(FP)値を量子化および圧縮データタイプに変換することにより、ディープニューラルネットワークのメモリフットプリントと計算オーバーヘッドを低減する。
PTQはQAT(Quantization-Aware Training)よりもコスト効率が高いが、低ビット量子化条件下での精度劣化に非常に敏感である。
本稿ではクラスタベースのアフィン変換(CAT)を提案する。クラスタ固有のパラメータを用いて,LQ出力をFP出力と整合させる。
論文 参考訳(メタデータ) (2025-09-30T14:00:28Z) - Beyond Outliers: A Study of Optimizers Under Quantization [82.75879062804955]
量子化下でのモデルロバスト性に対する選択の影響について検討する。
モデルの性能が、異なるベースラインでトレーニングした場合にどのように低下するかを評価する。
異なるパラメータによる量子化対応トレーニングのスケーリング法則を導出する。
論文 参考訳(メタデータ) (2025-09-27T21:15:22Z) - End-to-End On-Device Quantization-Aware Training for LLMs at Inference Cost [53.25965863436039]
量子化対応トレーニング(QAT)は、より原則化されたソリューションを提供するが、バックプロパゲーションに依存しているため、メモリコストは禁じられている。
重み付けとアクティベーション量子化の両方をサポートするゼロオーダー最適化ベースのQATフレームワークであるZeroQATを提案する。
実験の結果、ZeroQATはPTQとQATのベースラインを一貫して上回り、メモリは大幅に削減された。
論文 参考訳(メタデータ) (2025-08-21T01:18:27Z) - PTQAT: A Hybrid Parameter-Efficient Quantization Algorithm for 3D Perception Tasks [9.463776523295303]
ポストトレーニング量子化(PTQ)と量子アウェアトレーニング(QAT)は、2つの主流モデル量子化アプローチを表す。
本稿では,3次元知覚ネットワークの効率的な展開のための新しいハイブリッド量子化アルゴリズムPTQATを提案する。
論文 参考訳(メタデータ) (2025-08-14T11:55:21Z) - PTQ1.61: Push the Real Limit of Extremely Low-Bit Post-Training Quantization Methods for Large Language Models [64.84734437930362]
大規模言語モデル(LLM)は、非常に低ビット(2ビット未満)の量子化に直面した場合、性能が著しく低下する。
我々はPTQ1.61と呼ばれる極低ビットのPTQ法を提案し、これによって初めて1.61ビットの重み量子化が可能となる。
実験により、PTQ1.61は極低ビット量子化において最先端の性能を達成することが示された。
論文 参考訳(メタデータ) (2025-02-18T08:04:58Z) - QDrop: Randomly Dropping Quantization for Extremely Low-bit
Post-Training Quantization [54.44028700760694]
ポストトレーニング量子化(PTQ)は、長時間のリトレーニングなしに効率的なニューラルネットワークを生成するために多くの注目を集めている。
本研究では,PTQ再構成にアクティベーション量子化を適切に組み込むことで,最終的な精度が向上することを先駆的に確認する。
結論に基づき、QDROPと呼ばれる単純な効果的なアプローチが提案され、PTQ中のアクティベーションの量子化をランダムに減少させる。
論文 参考訳(メタデータ) (2022-03-11T04:01:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。