論文の概要: DAQ: Delta-Aware Quantization for Post-Training LLM Weight Compression
- arxiv url: http://arxiv.org/abs/2603.22324v1
- Date: Fri, 20 Mar 2026 12:30:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.061639
- Title: DAQ: Delta-Aware Quantization for Post-Training LLM Weight Compression
- Title(参考訳): DAQ:Delta-Aware Quantization for Post-Training LLM Weight Compression
- Abstract要約: 本稿では,データフリーのポストトレーニング量子化フレームワークであるDelta-Aware Quantization (DAQ)を紹介する。
標準的な量子化の目的は、再構成エラーを最小限に抑えるが、ベースモデルには依存しない。
DAQはリコンストラクションベースの目的を2つのデルタ対応メトリクスに置き換える。
- 参考スコア(独自算出の注目度): 9.077639107911734
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Delta-Aware Quantization (DAQ), a data-free post-training quantization framework that preserves the knowledge acquired during post-training. Standard quantization objectives minimize reconstruction error but are agnostic to the base model, allowing quantization noise to disproportionately corrupt the small-magnitude parameter deltas ($ΔW$) that encode post-training behavior -- an effect we analyze through the lens of quantization as implicit regularization. DAQ replaces reconstruction-based objectives with two delta-aware metrics -- Sign Preservation Rate and Cosine Similarity -- that directly optimize for directional fidelity of $ΔW$, requiring only the base and post-trained weight matrices. In a pilot FP8 study, DAQ recovers style-specific capabilities lost under standard quantization while maintaining general performance.
- Abstract(参考訳): 本稿では,データフリーなポストトレーニング量子化フレームワークであるDelta-Aware Quantization (DAQ)を紹介する。
標準的な量子化目的は、再構成誤差を最小限に抑えるが、ベースモデルに非依存であり、量子化ノイズは、学習後の振る舞いを符号化する小振幅パラメータデルタ(ΔW$)を不均等に破壊することができる。
DAQは、再構築をベースとした目的を2つのデルタ対応メトリクス – Sign Preservation RateとCosine similarity – に置き換える。
FP8のパイロット研究では、DAQは一般的な性能を維持しながら、標準的な量子化の下で失われたスタイル固有の能力を回復する。
関連論文リスト
- ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization [10.647335642551193]
後学習量子化(PTQ)は、大規模言語モデルの計算コストを削減するために広く用いられている。
本稿では,この段階でのバックプロパゲーションフリーな固定グリッド精錬法ReQuantを紹介する。
ReQuantは不均一PTQイニシャライザから量子化モデルを一貫して改善することを示す。
論文 参考訳(メタデータ) (2026-08-07T09:27:14Z) - Value-and-Structure Alignment for Routing-Consistent Quantization of Mixture-of-Experts Models [6.871645384293096]
Mixture-of-Experts (MoE)モデルは、トークンごとに専門家のサブセットだけを活性化することで、ファンデーションモデルを効率的にスケールする。
MoEモデルはルーティングの不安定性に敏感で、小さな量子化によって引き起こされる摂動は、トップ$kのエキスパート選択を変えることができる。
我々は、量子化の下でのエキスパート選択行動を維持するために、量子化のための値と構造のルーティングアライメント(VSRAQ)を提案する。
論文 参考訳(メタデータ) (2026-06-04T04:13:05Z) - Saliency-Aware Regularized Quantization Calibration for Large Language Models [12.382772717031772]
トレーニング後の量子化(PTQ)は、大きな言語モデル(LLM)をメモリとレイテンシの制約下でデプロイするための効果的なアプローチである。
既存のPTQ手法の多くは、所定のキャリブレーションデータセット上の層次再構成誤差を最小限に抑えて量子化パラメータを決定する。
提案された正則化は、キャリブレーションの間、量子化された重みが元の重みに近づき続けることを奨励し、推論時の一般化を改善させる。
論文 参考訳(メタデータ) (2026-05-07T05:33:26Z) - Enhancing Post-Training Quantization via Future Activation Awareness [84.76726857601753]
ポストトレーニング量子化(PTQ)は、大規模言語モデル(LLM)を微調整なしで圧縮する方法として広く用いられている。
本稿では、将来の層活性化を利用して量子化を導出するFuture-Aware Quantization (FAQ)を提案する。
FAQは、後方パス、データ再構成、チューニングを必要とせず、無視できる余分なコストで、従来手法よりも一貫してパフォーマンスを向上する。
論文 参考訳(メタデータ) (2026-01-28T12:03:30Z) - End-to-End On-Device Quantization-Aware Training for LLMs at Inference Cost [53.25965863436039]
量子化対応トレーニング(QAT)は、より原則化されたソリューションを提供するが、バックプロパゲーションに依存しているため、メモリコストは禁じられている。
重み付けとアクティベーション量子化の両方をサポートするゼロオーダー最適化ベースのQATフレームワークであるZeroQATを提案する。
実験の結果、ZeroQATはPTQとQATのベースラインを一貫して上回り、メモリは大幅に削減された。
論文 参考訳(メタデータ) (2025-08-21T01:18:27Z) - MPQ-DMv2: Flexible Residual Mixed Precision Quantization for Low-Bit Diffusion Models with Temporal Distillation [74.34220141721231]
我々は,textbfMixed textbfPrecision textbfQuantizationフレームワークを改良したMPQ-DMv2を提案する。
論文 参考訳(メタデータ) (2025-07-06T08:16:50Z) - FIMA-Q: Post-Training Quantization for Vision Transformers by Fisher Information Matrix Approximation [55.12070409045766]
ポストトレーニング量子化(PTQ)は近年,費用対効果と有望なモデル圧縮パラダイムとして注目されている。
ビジョン変換器(ViT)の現在のPTQ法は、特に低ビット量子化において、精度が著しく低下している。
論文 参考訳(メタデータ) (2025-06-13T07:57:38Z) - GuidedQuant: Large Language Model Quantization via Exploiting End Loss Guidance [20.85642850555899]
トレーニング後の量子化は、大規模言語モデルのメモリと推論遅延を低減するための重要なテクニックである。
本稿では,エンドロスからの勾配情報を量子化対象に組み込む新しい量子化手法である GuidedQuant を提案する。
GuidedQuantは、ウェイトオンリーのスカラー、ウェイトオンリーのベクトル、ウェイト・アンド・アクティベーションの量子化にまたがる最先端の量子化手法の性能を一貫して向上させる。
論文 参考訳(メタデータ) (2025-05-11T14:55:09Z) - Quantization Error Propagation: Revisiting Layer-Wise Post-Training Quantization [0.0]
層ワイドPTQは大規模言語モデル(LLM)を圧縮するための有望な手法である
この領域の最近の進歩は飽和しており、中核的な制限を再検討し、さらなる改善を検討する必要性を浮き彫りにしている。
本稿では,量子化エラーを明示的に伝播し,蓄積したエラーを補償することにより,レイヤワイズPTQを向上させる,汎用的で軽量でスケーラブルなフレームワークである量子化エラー伝播(QEP)を提案する。
論文 参考訳(メタデータ) (2025-04-13T15:56:00Z) - Robust Machine Unlearning for Quantized Neural Networks via Adaptive Gradient Reweighting with Similar Labels [5.868949328814509]
モデル量子化は、低ビットパラメータ表現によるエッジデバイスへのディープニューラルネットワークの効率的な展開を可能にする。
既存のマシン・アンラーニング(MU)手法は量子化されたネットワークにおける2つの基本的な制限に対処できない。
本稿では,量子化モデルのための学習フレームワークQ-MULを提案する。
論文 参考訳(メタデータ) (2025-03-18T05:22:13Z) - RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models [53.571195477043496]
本稿では,RoSTE (Rotated Straight-Through-Estimator) というアルゴリズムを提案する。
RoSTEは、量子化を意識した微調整(QA-SFT)と適応的な回転戦略を組み合わせることで、アクティベーションアウトリーを減少させる。
その結果, 予測誤差は収束重みの量子化誤差と直接比例し, 最適化された回転構成により効果的に管理できることが判明した。
論文 参考訳(メタデータ) (2025-02-13T06:44:33Z) - QT-DoG: Quantization-aware Training for Domain Generalization [58.439816306817306]
領域一般化のための量子化アウェアトレーニング(QT-DoG)を提案する。
我々は、減量量化が損失景観におけるより平坦なミニマムを効果的に導くことを実証した。
QT-DoGは、モデル重みのノイズを誘導することで暗黙の正則化器として量子化を利用する。
論文 参考訳(メタデータ) (2024-10-08T13:21:48Z) - Gradient $\ell_1$ Regularization for Quantization Robustness [70.39776106458858]
トレーニング後の量子化に対するロバスト性を改善するための単純な正規化スキームを導出する。
量子化対応ネットワークをトレーニングすることにより、異なるビット幅にオンデマンドで量子化できる1組の重みを格納できる。
論文 参考訳(メタデータ) (2020-02-18T12:31:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。