論文の概要: Accuracy is Not Enough: A Divergence-Based Approach to Evaluate Fidelity Loss in Quantized LLMs
- arxiv url: http://arxiv.org/abs/2609.07664v2
- Date: Wed, 09 Sep 2026 08:50:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.46214
- Title: Accuracy is Not Enough: A Divergence-Based Approach to Evaluate Fidelity Loss in Quantized LLMs
- Title(参考訳): 量子化LDMにおけるフィデリティ損失評価のためのダイバージェンスに基づくアプローチ
- Abstract要約: メモリ制約エッジデバイスへのLLM(Large Language Models)の展開は、攻撃的なポストトレーニング量子化に大きく依存する。
本稿では,LLMにおける情報損失を定量化する分散感性評価フレームワークを提案する。
我々は、BF16基準に対する確率質量変位と分布のドリフトを定量化し、トップ1の精度に反映されない予測分布の変化を捉える。
- 参考スコア(独自算出の注目度): 13.897073114465094
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deployment of Large Language Models (LLMs) on memory-constrained edge devices relies heavily on aggressive post-training quantization. However, evaluating these models is largely based on zero-shot task accuracy, which depends solely on argmax predictions and is insensitive to changes in the underlying predictive distribution. Consequently, accuracy can exhibit unstable, non-monotonic behavior under progressive quantization, masking substantial fidelity loss relative to the BFloat16 (BF16) uncompressed base model and providing misleading deployment signals. We introduce a distribution-sensitive evaluation framework quantifying information loss in quantized LLMs as the divergence between full-vocabulary predictive distributions at the token decision boundary. We compute statistical distances, including Jensen-Shannon Divergence and Total Variation Distance, between outputs of full-precision and quantized models, enabling a fine-grained analysis of distributional shift. Using this framework, we quantify probability mass displacement and distributional drift relative to the BF16 reference, capturing predictive distribution changes not reflected in top-1 accuracy. We conduct a 120-run experimental matrix across five foundation architectures and four reasoning benchmarks under progressive quantization regimes, from uncompressed BF16 to Q2_K, providing a systematic fidelity analysis. Our results show divergence metrics generally increase under stronger quantization, complementing task accuracy with a fidelity signal. Across tested llama-cpp schemes, mixed-precision Q4_K generally yields lower divergence than uniform Q4_0 at similar memory footprints. These findings motivate distribution-aware evaluation as a practical diagnostic complement to task accuracy; they do not directly establish correctness, calibration, safety, or user-perceived quality.
- Abstract(参考訳): メモリ制約エッジデバイスへのLLM(Large Language Models)の展開は、攻撃的なポストトレーニング量子化に大きく依存する。
しかし、これらのモデルの評価は、主にゼロショットタスクの精度に基づいており、これはargmax予測にのみ依存し、基礎となる予測分布の変化には敏感である。
これにより、プログレッシブ量子化の下で不安定な非単調な挙動を示し、BFloat16 (BF16) の圧縮されていないベースモデルに対してかなりの忠実さの損失を隠蔽し、誤解を招く展開信号を提供する。
本稿では,トークン決定境界における全語彙予測分布のばらつきとして,量化LDMにおける情報損失を定量化する分布依存性評価フレームワークを提案する。
我々は,全精度モデルと量子化モデルの出力間のJensen-Shannon DivergenceやTotal Variation Distanceなどの統計距離を計算し,分布シフトのきめ細かい解析を可能にする。
この枠組みを用いて,BF16参照に対する確率質量変位と分布のドリフトを定量化し,トップ1の精度に反映されない予測分布の変化を捉える。
提案手法は,BF16からQ2_Kまで,5つの基礎アーキテクチャと4つの推論ベンチマークで120ランの実験行列を実行し,系統的忠実度解析を行う。
本研究の結果は,高次量子化の下では分散度が一般的に増加し,タスク精度を忠実度信号で補完することを示した。
試験されたラマcppスキーム全体では、混合精度のQ4_Kは、同じメモリフットプリントにおける均一なQ4_0よりも低いばらつきをもたらす。
これらの知見は,作業の正確性,校正,安全性,ユーザ認識品質を直接的に確立するものではないため,作業の正確性に対する実践的な診断的補完として分布認識評価を動機付けている。
関連論文リスト
- SPARC: Single-Pass Scaling for Motion Forecasting with Conformal Bayesian Last Layers [1.4452289368758382]
シングルパス適応リスク(英: Single-Pass Adaptive Risk)は、人間の動き予測器に対する構造的、校正的、効率的な不確実性推定である。
決定論的バックボーンは将来の平均を予測し、共役ベイズ最後の層は時間領域の特徴レバレッジを解析的地平線スケールに変換する。
NLLと組み合わせたMPJPE+NLLの基準では、競争点の精度と効率的な校正管を維持している。
論文 参考訳(メタデータ) (2026-08-21T07:20:22Z) - The Illusion of Equivalency: Statistical Characterization of Quantization Effects in LLMs [5.849736173068869]
トレーニング後の量子化は、リソース制約のある設定で大規模言語モデルをデプロイするために広く利用されている。
これらの指標は量子化によって引き起こされる行動変化を捉えるのに失敗することを示す。
ベースモデルとその量子化変量の間の正確な予測の重なりを計測する決定レベルの尺度である正当性合意を導入する。
論文 参考訳(メタデータ) (2026-07-09T17:35:02Z) - Distributionally Faithful Imputation via Positive Semi-Definite Kernel Density Estimation [55.47411235954028]
マスク観測による密度推定では,不規則に不規則に不規則な計算を行う。
我々は,ニュートン内点法で解ける閉じた形状の辺縁を持つ凸型経験的リスク問題を得る。
結果のPSDインプットモデルでは、同一の入射密度から単一および多重インプットが得られる。
論文 参考訳(メタデータ) (2026-07-08T15:51:05Z) - Bayesian 3D Steerable CNNs: Enabling Equivariance and Uncertainty Quantification Simultaneously [1.2234742322758416]
ステアブル畳み込みニューラルネットワーク(ステアブルCNN)は、カーネルをステアブル基底関数の線形結合としてパラメータ化することでSE(3)-等分散を保証する。
本稿では, 基底係数上に後続分布を配置し, 均一性を正確に保ちつつ, カーネルを生成できるベイズステアブルCNNを提案する。
実験的に、このモデルは0.0263のキャリブレーション誤差と競合する分類精度を達成し、加法ガウス雑音によって誘導される分布シフトの下では最大6.17%まで決定論的に優れている。
論文 参考訳(メタデータ) (2026-06-13T21:28:04Z) - Quantization of Spiking Neural Networks Beyond Accuracy [3.43677310385818]
本研究では,SNNにおける有効空間,状態記憶,イベント処理負荷を,射撃活動が制御していることを示す。
本研究では, 分布のばらつきを診断する指標として, アースモーバー距離を提案する。
均一な量子化は精度を保った場合でも分布のドリフトを引き起こすが、LQ-Netスタイルの学習した量子化は全精度ベースラインに近い発火挙動を維持する。
論文 参考訳(メタデータ) (2026-04-15T23:55:11Z) - Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning [32.32593439144886]
振舞い校正された強化学習により、小さなモデルは不確実な定量化においてフロンティアモデルを超えることができる。
当社のモデルでは,GPT-5の0.207を超える精度向上率(0.806)を挑戦的なドメイン内評価において達成している。
論文 参考訳(メタデータ) (2025-12-22T22:51:48Z) - Semiparametric conformal prediction [79.6147286161434]
ベクトル値の非整合性スコアの結合相関構造を考慮した共形予測セットを構築する。
スコアの累積分布関数(CDF)を柔軟に推定する。
提案手法は,現実の回帰問題に対して,所望のカバレッジと競争効率をもたらす。
論文 参考訳(メタデータ) (2024-11-04T14:29:02Z) - Regularized Vector Quantization for Tokenized Image Synthesis [126.96880843754066]
画像の離散表現への量子化は、統合生成モデリングにおける根本的な問題である。
決定論的量子化は、厳しいコードブックの崩壊と推論段階の誤調整に悩まされ、一方、量子化は、コードブックの利用率の低下と再構築の目的に悩まされる。
本稿では、2つの視点から正規化を適用することにより、上記の問題を効果的に緩和できる正規化ベクトル量子化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-11T15:20:54Z) - Amortized Conditional Normalized Maximum Likelihood: Reliable Out of
Distribution Uncertainty Estimation [99.92568326314667]
本研究では,不確実性推定のための拡張性のある汎用的アプローチとして,償却条件正規化最大値(ACNML)法を提案する。
提案アルゴリズムは条件付き正規化最大度(CNML)符号化方式に基づいており、最小記述長の原理に従って最小値の最適特性を持つ。
我々は、ACNMLが、分布外入力のキャリブレーションの観点から、不確実性推定のための多くの手法と好意的に比較することを示した。
論文 参考訳(メタデータ) (2020-11-05T08:04:34Z) - Unlabelled Data Improves Bayesian Uncertainty Calibration under
Covariate Shift [100.52588638477862]
後続正則化に基づく近似ベイズ推定法を開発した。
前立腺癌の予後モデルを世界規模で導入する上で,本手法の有用性を実証する。
論文 参考訳(メタデータ) (2020-06-26T13:50:19Z) - Uncertainty Estimation Using a Single Deep Deterministic Neural Network [66.26231423824089]
本稿では,1回のフォワードパスで,テスト時に分布データポイントの発見と拒否が可能な決定論的ディープモデルを訓練する手法を提案する。
我々は,新しい損失関数とセントロイド更新方式を用いて,これらをスケールトレーニングし,ソフトマックスモデルの精度に適合させる。
論文 参考訳(メタデータ) (2020-03-04T12:27:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。