論文の概要: OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization
- arxiv url: http://arxiv.org/abs/2605.04738v2
- Date: Sat, 09 May 2026 08:06:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 16:21:29.369756
- Title: OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization
- Title(参考訳): OSAQ: 高精度低ビットLDM量子化のための外部自己吸収
- Abstract要約: トレーニング後の重量限定量子化は、モデルサイズを減らし、トークン生成を加速することで、有望なソリューションを提供する。
重量に固有の体系的なアウトリーチが存在することは、依然として大きな障害である。
本稿では,2次低ランク特性によって誘導される付加的な重み抑制を行うOutlier Self-Absorption Quantization (OSAQ)を提案する。
- 参考スコア(独自算出の注目度): 25.000917754189178
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) have demonstrated remarkable capabilities. However, their massive parameter scale leads to significant resource consumption and latency during inference. Post-training weight-only quantization offers a promising solution by reducing model size and accelerating token generation through alleviating the memory-bound issue. Nevertheless, the presence of inherent systematic outliers in weights continues to be a major obstacle. While existing methods, such as scaling and rotation, attempt to address this issue, the performance remains unsatisfactory. In this paper, we propose Outlier Self-Absorption Quantization (OSAQ), which performs additive weight suppression guided by the second-order low-rank property for low-bit weight-only quantization of LLMs. Specifically, we observe that the Hessian exhibits low-rank consistency across different inputs, with certain directions consistently showing vanishing curvature. Leveraging this property, we identify a stable null space of the Hessian and then construct an additive weight transformation by linearly combining the vectors within this null space, thereby suppressing weight outliers without affecting the task loss. This additive transformation can be absorbed into the weights offline, requiring no inter-layer transformations and introducing no inference overhead. Moreover, the construction is efficiently achieved by a closed-form solution, without resource-intensive training or iterative procedures. Extensive experiments demonstrate that OSAQ effectively suppresses outliers and enhances low-bit quantization performance. For instance, in 2-bit quantization, OSAQ, when integrated with GPTQ, achieves over 40% lower perplexity compared to vanilla GPTQ.
- Abstract(参考訳): 大規模言語モデル(LLM)は目覚ましい能力を示している。
しかし、その膨大なパラメータスケールは、推論中にかなりのリソース消費と遅延をもたらす。
トレーニング後の重みのみの量子化は、メモリバウンド問題を軽減することでモデルサイズを減らし、トークン生成を加速することで、有望なソリューションを提供する。
それでも、重量に固有の体系的なアウトリーチが存在することは大きな障害であり続けている。
スケーリングやローテーションといった既存の手法はこの問題に対処しようとするが、パフォーマンスは相変わらず満足できない。
本稿では,低ビット量のみのLLMの量子化のための2次低ランク特性によって導かれる付加的な重み抑制を行う,Outlier Self-Absorption Quantization (OSAQ)を提案する。
具体的には、ヘッセンは異なる入力にまたがって低階の整合性を示し、一定の方向が一貫した曲率を示すことを観察する。
この性質を活用して、ヘシアンの安定なヌル空間を特定し、このヌル空間内のベクトルを線形に結合することで加法重変換を構築し、これにより、タスク損失に影響を与えずに重み外れを抑制する。
この加法変換は重み付けをオフラインに吸収することができ、層間変換を必要とせず、推論オーバーヘッドも発生しない。
さらに、資源集約的なトレーニングや反復的な手順を使わずに、クローズドフォームのソリューションで効率的に構築することができる。
大規模な実験により、OSAQはアウトレイラを効果的に抑制し、低ビット量子化性能を向上させることが示されている。
例えば、2ビット量子化では、OSAQは、GPTQと統合されると、バニラGPTQに比べて40%以上低いパープレキシティを実現する。
関連論文リスト
- Technical Report: Activation Residual Hessian Quantization (ARHQ) for Low-Bit LLM Quantization [21.244110575269723]
Activation Residual Hessian Quantization (ARHQ) は、低ビットの活性化重み量子化における誤差伝播を緩和する訓練後の重み分割法である。
ARHQは、エラーに敏感な重み方向を解析的に識別し、高精度の低ランク分岐に分離する。
論文 参考訳(メタデータ) (2026-04-30T18:55:22Z) - Astro: Activation-guided Structured Regularization for Outlier-Robust LLM Post-Training Quantization [56.5199302532159]
本稿では, アクティベーション誘導型構造正規化フレームワークを提案する。
Astroは内在的に頑丈な重量を積極的に再構成し、高マグニチュードの活性化に対応する重量の降圧を積極的に抑制する。
Astroは競争力が高く、特にLLaMA-2-7Bでは、量子化時間の1/3近くを持つ複雑な学習ベースの回転法よりも優れた性能を達成している。
論文 参考訳(メタデータ) (2026-02-07T15:50:18Z) - D$^2$Quant: Accurate Low-bit Post-Training Weight Quantization for LLMs [33.883527341335856]
軽量後トレーニング量子化(PTQ)は、メモリ使用量を減らし、低ビット演算子や専用ハードウェアを使わずに実用的なスピードアップを可能にするため、魅力的である。
精度は、重量のみのPTQにおいて、サブ-4ビットの精度で著しく低下する。
D$2$Quantは、ウェイトとアクティベーションの両方の観点から量子化を改善する新しいウェイトオンリーのPTQフレームワークである。
論文 参考訳(メタデータ) (2026-01-30T05:49:48Z) - LoTA-QAF: Lossless Ternary Adaptation for Quantization-Aware Fine-Tuning [50.89500210372827]
リソース制約のあるエッジデバイスに大規模言語モデル(LLM)をデプロイするには、量子化と微調整が不可欠である。
LoTA-QAFは量子化LDM用に特別に設計された新しい微調整法である。
MMLUベンチマークでは,16ビットLORAを最大5.14%越えて,量子化モデルの性能を効果的に回復する。
論文 参考訳(メタデータ) (2025-05-24T14:47:28Z) - Taming Sensitive Weights : Noise Perturbation Fine-tuning for Robust LLM Quantization [5.718172547021947]
量子化誤差に対する感度重みの影響を抑えるため,NPFT(Noth Perturbation Fine-tuning)を提案する。
NPFTは、外周重量を同定し、外周重量のランダムな摂動を、PEFT最適化によるモデルとして追加する。
OPTおよびLLaMAモデルに適用すると、NPFT法は均一および非一様量子化器の安定な性能向上を実現する。
論文 参考訳(メタデータ) (2024-12-08T21:46:22Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z) - Compensate Quantization Errors+: Quantized Models Are Inquisitive Learners [51.32182730502002]
重み分布を改良し、量子化アライメントを改善するために、特異値対角展開を導入する。
我々のプラグアンドプレイウェイト量子化法は、最先端のアプローチよりも大幅に性能が向上したことを示す。
論文 参考訳(メタデータ) (2024-07-22T09:45:16Z) - Towards Accurate Post-Training Quantization of Vision Transformers via Error Reduction [48.740630807085566]
ビジョントランスフォーマー(ViT)のPTQ(Post-training Quantization)は,学術的,産業的にも注目されている。
現在の方法は、量子化された重みとアクティベーションの間の複雑な相互作用を考慮できないため、量子化エラーと準最適性能をもたらす。
本稿では,活性化と重み量子化による量子化誤差を逐次低減する2段階PTQ法であるERQを提案する。
論文 参考訳(メタデータ) (2024-07-09T12:06:03Z) - BoA: Attention-aware Post-training Quantization without Backpropagation [11.096116957844014]
トレーニング後の量子化は、リソース制約のあるデバイスに大規模言語モデルをデプロイするための有望なソリューションである。
層間依存関係を考慮し、量子化重みを最適化する新しいバックプロパゲーションフリーPTQアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-06-19T11:53:21Z) - Outlier Suppression: Pushing the Limit of Low-bit Transformer Language
Models [57.933500846742234]
最近の研究は、構造化された外れ値が量子化性能の重要なボトルネックであることを認識している。
本稿では,Gamma Migration と Token-Wise Clipping の2つのコンポーネントを含む外部抑制フレームワークを提案する。
このフレームワークは、アウトレイラを効果的に抑制し、プラグアンドプレイモードで使用することができる。
論文 参考訳(メタデータ) (2022-09-27T12:05:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。