論文の概要: ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization
- arxiv url: http://arxiv.org/abs/2608.11045v1
- Date: Tue, 11 Aug 2026 15:18:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:46.100766
- Title: ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization
- Title(参考訳): ReRound: キャリブレーションフリーLLM量子化における中点曖昧性解消のための再構成ラウンド
- Abstract要約: ReRoundは、標準的なラウンド・トゥ・アレスト・スキームに固有の中間点のあいまいさに対処する訓練後の量子化手法である。
ReRoundは完全にオフラインで動作し、低ビット推論時に追加のオーバーヘッドは発生しない。
3ビットおよび4ビットの重み量子化において標準RTNよりも一貫して優れる。
- 参考スコア(独自算出の注目度): 3.974175960216863
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: ReRound (Reconstructive Rounding) is a post-training quantization method that addresses the midpoint ambiguity inherent in standard round-to-nearest (RTN) schemes when quantizing weights near the centers of quantization intervals. Starting from a pretrained LLM, ReRound trains a conditional diffusion model to produce continuous reconstructions of low-bit weights for the LLM. These reconstructed weights act as a guidance signal to disambiguate the rounding direction of weights located close to interval midpoints. To integrate this reconstruction-guided rounding with conventional RTN, ReRound introduces a tolerance metric measuring how far the quantized weight (not the final quantized integer) is away from the midpoint: quantized weights within a tolerance region around midpoints are quantized using diffusion-based reconstructions, whereas weights closer to quantization boundaries are quantized with RTN. By sweeping the tolerance parameter, ReRound generates multiple candidate quantized integer weight matrices and selects the de-quantized weight matrix candidate whose leading singular values most closely match those of the original full-precision weights. This selected candidate determines the tolerance parameter ReRound uses. ReRound is particularly effective for smaller LLMs. Across a range of such models, it consistently outperforms standard RTN for 3-bit and 4-bit weight quantization. ReRound achieves superior accuracy compared to an extensive set of calibration-free methods, remains competitive with calibration-dependent approaches, and operates entirely offline, introducing no additional overhead during low-bit inference. The ReRound strategy represents a new approach for low-bit quantization. The method applies to AI models beyond LLMs. This paper focuses on its applications to small LLMs.
- Abstract(参考訳): ReRound (Reconstructive Rounding) は、量子化間隔の中心付近の重みを定量化する際に、標準的なラウンド・トゥ・アレスト(RTN)方式に固有の中間点のあいまいさに対処するポストトレーニング量子化法である。
事前訓練されたLLMから始まり、ReRoundは条件付き拡散モデルを訓練し、LLMのために低ビット重量の連続的な再構成を生成する。
これらの再構成された重みは、中間点の間隔近くに位置する重みの丸い方向を曖昧にするための誘導信号として機能する。
この再構成誘導ラウンドリングを従来のRTNと統合するために、ReRound氏は、量子化されたウェイト(最終量子化された整数ではない)が中間点からどれくらい離れているかを測定するトレランス計量を紹介した。
トレランスパラメータを網羅することにより、ReRoundは複数の候補量子化整数重み行列を生成し、主要な特異値が元の完全精度重みのものと最もよく一致する非量子化重み行列候補を選択する。
この選択された候補は、ReRoundが使用する許容パラメータを決定する。
ReRound はより小さな LLM に特に有効である。
このようなモデルの範囲で、3ビットおよび4ビットの重み量子化において標準RTNよりも一貫して優れる。
ReRoundはキャリブレーションフリーの手法に比べて精度が優れており、キャリブレーションに依存したアプローチと競合し続けている。
ReRound戦略は、低ビット量子化の新しいアプローチである。
この方法はLLM以外のAIモデルにも適用される。
本稿では,LLMの小型化に焦点をあてる。
関連論文リスト
- Saliency-Aware Regularized Quantization Calibration for Large Language Models [12.382772717031772]
トレーニング後の量子化(PTQ)は、大きな言語モデル(LLM)をメモリとレイテンシの制約下でデプロイするための効果的なアプローチである。
既存のPTQ手法の多くは、所定のキャリブレーションデータセット上の層次再構成誤差を最小限に抑えて量子化パラメータを決定する。
提案された正則化は、キャリブレーションの間、量子化された重みが元の重みに近づき続けることを奨励し、推論時の一般化を改善させる。
論文 参考訳(メタデータ) (2026-05-07T05:33:26Z) - Revisiting Adaptive Rounding with Vectorized Reparameterization for LLM Quantization [23.4275219098363]
VQRoundは適応的なラウンドリングのためのパラメータ効率の最適化フレームワークである。
VQRoundは、従来の適応型ラウンドリングよりも、同じステップ数でよりよく収束することを示す。
以上の結果から,適応型ラウンドリングは,スケーラブルかつ高速に実現可能であることが示唆された。
論文 参考訳(メタデータ) (2026-02-02T14:27:12Z) - Preserve-Then-Quantize: Balancing Rank Budgets for Quantization Error Reconstruction in LLMs [6.571619511143774]
量子化エラー再構成(QER)は、量子化エラーを再現するためにランク=$r$の補正を用いて、重量を$mathbfW approx mathbfQ + mathbfLmathbfR$と近似することで、PTQ(Post-Training Quantization)の精度損失を低減する。
SRR(Structured Residual Residual Restruction)は、量子化前のアクティベーションスケールウェイトのトップ$k$特異部分空間を保存し、残余のみを量子化し、残余を$rとするランク割り当てフレームワークである。
論文 参考訳(メタデータ) (2026-02-02T12:02:21Z) - ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference [13.283581083797484]
後学習量子化(PTQ)は、Large Language Models(LLM)の重みを低精度表現に圧縮し、メモリフットプリントを減らし、推論を加速する。
重みとアクティベーションにおける外れ値の存在は、しばしば大きな量子化誤差と深刻な精度低下をもたらす。
Pairwise Rotation Quantization (ParoQuant) を提案する。
ParoQuantは平均2.4%の精度向上を実現している。
論文 参考訳(メタデータ) (2025-11-13T18:59:24Z) - LoTA-QAF: Lossless Ternary Adaptation for Quantization-Aware Fine-Tuning [50.89500210372827]
リソース制約のあるエッジデバイスに大規模言語モデル(LLM)をデプロイするには、量子化と微調整が不可欠である。
LoTA-QAFは量子化LDM用に特別に設計された新しい微調整法である。
MMLUベンチマークでは,16ビットLORAを最大5.14%越えて,量子化モデルの性能を効果的に回復する。
論文 参考訳(メタデータ) (2025-05-24T14:47:28Z) - RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models [53.571195477043496]
本稿では,RoSTE (Rotated Straight-Through-Estimator) というアルゴリズムを提案する。
RoSTEは、量子化を意識した微調整(QA-SFT)と適応的な回転戦略を組み合わせることで、アクティベーションアウトリーを減少させる。
その結果, 予測誤差は収束重みの量子化誤差と直接比例し, 最適化された回転構成により効果的に管理できることが判明した。
論文 参考訳(メタデータ) (2025-02-13T06:44:33Z) - FlatQuant: Flatness Matters for LLM Quantization [58.28221892035609]
重みとアクティベーションの平坦性を高める新しいポストトレーニング量子化手法であるFlatQuantを提案する。
本手法では, 線形層毎の最適アフィン変換を, 軽量な目的により数時間で調整する。
LLaMA-3-70BモデルでのW4A4量子化の精度は1%以下で、SpinQuantを7.5%上回る。
論文 参考訳(メタデータ) (2024-10-12T08:10:28Z) - Compensate Quantization Errors+: Quantized Models Are Inquisitive Learners [51.32182730502002]
重み分布を改良し、量子化アライメントを改善するために、特異値対角展開を導入する。
我々のプラグアンドプレイウェイト量子化法は、最先端のアプローチよりも大幅に性能が向上したことを示す。
論文 参考訳(メタデータ) (2024-07-22T09:45:16Z) - Towards Accurate Post-Training Quantization of Vision Transformers via Error Reduction [48.740630807085566]
ビジョントランスフォーマー(ViT)のPTQ(Post-training Quantization)は,学術的,産業的にも注目されている。
現在の方法は、量子化された重みとアクティベーションの間の複雑な相互作用を考慮できないため、量子化エラーと準最適性能をもたらす。
本稿では,活性化と重み量子化による量子化誤差を逐次低減する2段階PTQ法であるERQを提案する。
論文 参考訳(メタデータ) (2024-07-09T12:06:03Z) - SpinQuant: LLM quantization with learned rotations [49.07335692298487]
重み、アクティベーション、KVキャッシュに適用された後トレーニング量子化(PTQ)技術は、大規模言語モデル(LLM)のメモリ使用量、レイテンシ、消費電力を大幅に削減する。
我々は、量子化精度を高めつつ、完全精度のトランスフォーマーアーキテクチャにおいて同一の出力をもたらす、適用可能な回転パラメータ化の集合を同定する。
本研究では,学習した回転行列を最適な量子化ネットワーク精度に組み込む新しい手法であるSpinQuantを提案する。
論文 参考訳(メタデータ) (2024-05-26T02:15:49Z) - Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMs [16.596819845726625]
SignRoundは、符号付き勾配降下(SignSGD)を利用して、200ステップで丸め値とウェイトクリッピングを最適化する手法である。
2ビットから4ビットにわたって例外的な結果を提供すると同時に、チューニングコストを最小化し、追加の推論オーバーヘッドを回避する。
また、近年のモデルでは強力な一般化が示され、ほとんどのシナリオでほぼロスレスな4ビット量子化が達成されている。
論文 参考訳(メタデータ) (2023-09-11T14:58:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。