論文の概要: The Structure of Quantization Damage in LLMs: Why the Next Bit Should Be Spent Globally
- arxiv url: http://arxiv.org/abs/2609.01587v1
- Date: Tue, 01 Sep 2026 17:53:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.922315
- Title: The Structure of Quantization Damage in LLMs: Why the Next Bit Should Be Spent Globally
- Title(参考訳): LLMにおける量子化損傷の構造 : 次世代ビットがグローバルに分散すべき理由
- Authors: Jundong Hu, Shekar Ramachandran,
- Abstract要約: 後学習量子化(PTQ)は、大規模言語モデル(LLM)を提供するコストを削減するために広く用いられている。
我々は、量子化の損傷の発生源と、小さな追加の精度予算の配分方法について検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Post-training quantization (PTQ) is widely used to reduce the cost of serving large language models (LLMs), but its accuracy cost is uneven and is often tuned per model. We study where quantization damage occurs and how to allocate a small additional precision budget. Using causal mixed-precision intervention as ground truth (raise each layer to 8-bit in turn and measure the accuracy it recovers) across 9 open-weight models in 4 architecture families, we test 3 intuitive hypotheses: that quantization damage lives in task circuits, where the model computes, or in weight statistics. None of them predicts which layers benefit from restored precision. Recovery is instead diffuse: for 8 of 9 models, recovering 75% of the gap takes roughly half the layers; the lone exception, Qwen3-8B, is sharply concentrated. At a matched precision budget, spending it globally on finer quantization granularity beats locally repairing the most recoverable layers for all 8 group-128-compatible models (all but OpenLLaMA, whose width rules out group-128), by 21-52 points, including the concentrated Qwen3-8B. We report 2 secondary findings: the residual is budget-limited (8-bit is near-lossless in our evaluation across RTN, GPTQ, and AWQ), and the location of peak recovery correlates with architecture within a family, though not across families. Within this budget setting, global granularity is a better default than selectively protecting critical layers. More broadly, cheap signals that correlate with quantization damage do not necessarily identify where restoring precision improves accuracy; this must be tested with causal intervention.
- Abstract(参考訳): 後学習量子化(PTQ)は、大きな言語モデル(LLM)を提供するコストを削減するために広く用いられているが、その精度は不均一であり、モデルごとに調整されることが多い。
我々は、量子化の損傷の発生源と、小さな追加の精度予算の配分方法について検討する。
因果的混合精度介入を基底真理(各層を8ビットに評価し、それが回復する精度を計測する)として、4つのアーキテクチャファミリの9つのオープンウェイトモデルを用いて、直感的な3つの仮説を検証した。
いずれも、どのレイヤが復元された精度の恩恵を受けるかを予測していない。
9モデル中8モデルでは、ギャップの75%を回復するには約半分の層が必要であり、孤立した例外であるQwen3-8Bは鋭く集中している。
一致した精度の予算では、世界規模で量子化の粒度が8つのグループ-128互換モデル(全てはOpenLLaMAがグループ-128を規定している)の最も回復可能なレイヤを、集中したQwen3-8Bを含む21-52ポイントで局所的に修復する。
2つの二次的な知見として,残余は予算に制限されている(RTN, GPTQ, AWQ)が,ピーク回復位置は家族内アーキテクチャと相関するが,家族内アーキテクチャと相関する。
この予算設定では、グローバルな粒度は、重要なレイヤを選択的に保護するよりも、より優れたデフォルトになります。
より広義には、量子化損傷と相関する安価な信号は、復元精度の精度が向上する場所を必ずしも特定しない。
関連論文リスト
- Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts [0.0]
学習後の量子化は,タスク精度が保存されている場合でも,大きな言語モデルがどのように推論するかを静かに変更できることを示す。
3つの量子化精度で5つの命令調整LDMから3万のチェーン・オブ・シント出力を分類する。
精度は精度で高いが,Hollow Convergence は NF4 で大きく依存的な変化を示す。
論文 参考訳(メタデータ) (2026-07-10T21:55:05Z) - Heteroskedastic Signals in Budgeted LLM Verification: Structural Heterogeneity Limits Optimization Gains [4.560961083890857]
大規模言語モデル(LLM)システムは、検証、テストタイムのスケーリング、ツールの実行、その他の選択的な計算処理に限定的な計算を割り当てるために不確実性信号を使用するようになっている。
我々は,不確実性の品質がコスト層全体で不均一であることを示し,多くのエラーが集中しているにもかかわらず,ほぼランダムな差別性を示す地域もあることを示した。
論文 参考訳(メタデータ) (2026-06-14T14:45:57Z) - Recover-LoRA for Aggressive Quantization: Reclaiming Accuracy in 2-Bit Language Models via Low-Rank Adaptation with Knowledge Distillation on Synthetic Data [3.056033670271077]
Recover-LoRAはデータフリーの精度回復法で、もともとは一般モデルの重み劣化のために開発された。
Recover-LoRAはゲートとアップ層の2ビット量子化から失われる精度を回復できることを示す。
この結果から,Recover-LoRAは,運用環境におけるアグレッシブ・ウェイト・圧縮のための実用的ポスト量子化精度回復ツールであることがわかった。
論文 参考訳(メタデータ) (2026-06-02T21:37:56Z) - Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation [6.129872931808218]
キー値(KV)キャッシュの量子化は、Large Language Model(LLM)推論メモリの削減に広く利用されている。
本研究では,KVキャッシュ量子化下でのアライメント保存について検討する。
低ビット量子化は安全アライメントを静かに破壊することができる。
論文 参考訳(メタデータ) (2026-06-01T02:02:20Z) - Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models [31.422773877490613]
推論 LLM (Reasoning LLMs) はチェーン・オブ・ソート・ジェネレーションを通じて強力な多段階推論を実現する。
RLMの大きなモデルサイズと長いデコードタイムのアウトプットは、リソース制約のある設定にデプロイするのにコストがかかり、不適当である。
我々は、構造化されたプルーニングフレームワークであるRESPを紹介し、プルーニング決定とモデルの推論力学を一致させる。
論文 参考訳(メタデータ) (2025-12-01T20:27:05Z) - "Give Me BF16 or Give Me Death"? Accuracy-Performance Trade-Offs in LLM Quantization [67.3213104337679]
量子化は大規模言語モデル(LLM)推論を高速化するための強力なツールであるが、異なるフォーマット間での精度と性能のトレードオフは依然として不明である。
FP8,INT8,INT4の量子化を学術ベンチマークや実世界のタスクで評価し,これまでで最も包括的な実証的研究を行った。
論文 参考訳(メタデータ) (2024-11-04T18:21:59Z) - Orthogonal Causal Calibration [55.28164682911196]
我々は、因果校正作業を標準(非因果予測モデル)の校正作業に還元する一般的なアルゴリズムを開発する。
以上の結果から,既存のキャリブレーションアルゴリズムを因果的設定に応用できることが示唆された。
論文 参考訳(メタデータ) (2024-06-04T03:35:25Z) - Beyond calibration: estimating the grouping loss of modern neural
networks [68.8204255655161]
適切なスコアリングルール理論は、キャリブレーション損失が与えられた場合、個々のエラーを特徴づける欠片がグループ化損失であることを示している。
視覚およびNLPにおける現代のニューラルネットワークアーキテクチャは、特に分散シフト設定においてグループ化損失を示す。
論文 参考訳(メタデータ) (2022-10-28T07:04:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。