論文の概要: Reliability Scaling Laws for Quantized Large Language Models
- arxiv url: http://arxiv.org/abs/2607.10855v1
- Date: Sun, 12 Jul 2026 17:39:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.555833
- Title: Reliability Scaling Laws for Quantized Large Language Models
- Title(参考訳): 量子化大言語モデルの信頼性スケーリング法則
- Authors: Sirine Ayadi, Sándor Daróczi, Stephan Günnemann, Bertrand Charpentier,
- Abstract要約: 量子化は、パラメータのビット幅を小さくすることで、有能でリソース効率のよい大規模言語モデル(LLM)を構築するための戦略である。
まず,3つの鍵成分からなる量子化LDMの総合的信頼性評価を行う。
信頼性ピークは4ビットの量子化モデルに対して発生し、適度なサイズのモデルの量子化が最良の信頼性と効率のトレードオフをもたらすことを示す。
- 参考スコア(独自算出の注目度): 68.39028482878265
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Quantization is a powerful strategy to build capable and resource-efficient large language models (LLMs) by reducing the bitwidth of the parameters. While quantized LLMs achieve state-of-the-art performance on unperturbed inputs using standard predictive metrics, their performance on perturbed inputs, measured using reliability metrics, remains underexplored, despite its importance for reliable deployment. To address this gap, we first conduct a comprehensive reliability evaluation of quantized LLMs consisting of three key components: (1) Uncertainty: We assess the trustworthiness of LLMs quantized to 2, 3, 4, and 8 bits using six different quantization methods, employing established uncertainty metrics. (2) Calibration: We assess how well-calibrated the uncertainty estimates of quantized models are across model scales and bit precisions. (3) Robustness: We design character-level and word-level input perturbations to evaluate the reliability of quantized models under semantically-preserving variations in the inputs that arise in real-world applications. Second, we characterize how reliability scales with the total number of model bits. Our study reveals that while the performance scales monotonically with the total number of bits, the reliability scalings are nonlinear. A reliability peak occurs for 4-bit quantized models, indicating that quantizing moderately sized models offers the best reliability-efficiency trade-off. Additionally, our empirical findings reveal that quantization enhances the robustness of LLMs to natural input perturbations.
- Abstract(参考訳): 量子化は、パラメータのビット幅を小さくすることで、有能でリソース効率のよい大規模言語モデル(LLM)を構築するための強力な戦略である。
量子化LDMは、標準的な予測指標を用いて、非摂動入力の最先端のパフォーマンスを達成するが、信頼性メトリクスを用いて測定された摂動入力のパフォーマンスは、信頼性の高いデプロイメントにおいて重要であるにもかかわらず、未調査のままである。
このギャップに対処するために、まず、(1)不確実性: 確立された不確実性指標を用いて、6つの異なる量子化手法を用いて、LLMの信頼性を2, 3, 4, 8ビットに評価する。
2)キャリブレーション: 量子化モデルの不確実性推定がモデルスケールとビット精度でどの程度うまく校正されているかを評価する。
(3)ロバスト性: 実世界のアプリケーションで発生する入力のセマンティック保存変化の下で, 量子化モデルの信頼性を評価するために, 文字レベルおよび単語レベルの入力摂動を設計する。
第2に、モデルビットの総数で、信頼性がどのようにスケールするかを特徴付ける。
本研究により, 性能は全ビット数で単調にスケールするが, 信頼性のスケーリングは非線形であることがわかった。
信頼性ピークは4ビットの量子化モデルに対して発生し、適度なサイズのモデルの量子化が最良の信頼性と効率のトレードオフをもたらすことを示す。
さらに, 量子化は自然入力摂動に対するLDMの堅牢性を高めることが実証された。
関連論文リスト
- Measuring Five-Nines Reliability: Sample-Efficient LLM Evaluation in Saturated Benchmarks [45.86413490112477]
大規模言語モデル(LLM)は信頼性に敏感なアプリケーションで使用される。
厳密な信頼境界を持つ稀な失敗確率を推定するには、違法に大きなLSM推論サイズが必要である。
そこで本研究では,クロスエントロピー手法を用いて,故障確率入力に集中したサンプリング分布を学習する。
論文 参考訳(メタデータ) (2026-05-11T20:23:44Z) - Enhancing Trustworthiness with Mixed Precision: Benchmarks, Opportunities, and Challenges [12.438306093697]
大規模言語モデル(LLM)は、様々なタスクで有望なパフォーマンスを示している。
LLMの自己回帰デコーディングプロセスは、既存のAIハードウェアへの効率的なデプロイに重大な課題をもたらす。
論文 参考訳(メタデータ) (2025-11-27T14:17:43Z) - Simple Yet Effective: An Information-Theoretic Approach to Multi-LLM Uncertainty Quantification [9.397157329808254]
MUSEは、大規模言語モデルのよく校正されたサブセットを特定し、集約するための単純な情報理論手法である。
二分予測タスクの実験では、単一モデルとナイーブアンサンブルベースラインと比較してキャリブレーションと予測性能が改善された。
論文 参考訳(メタデータ) (2025-07-09T19:13:25Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Calibrating Large Language Models with Sample Consistency [76.23956851098598]
本稿では,複数サンプルモデル生成系の分布から信頼度を導出する可能性について,一貫性の3つの尺度を用いて検討する。
その結果、一貫性に基づくキャリブレーション手法は、既存のポストホック手法よりも優れていることがわかった。
種々のLMの特性に合わせて,キャリブレーションに適した整合性指標を選択するための実用的なガイダンスを提供する。
論文 参考訳(メタデータ) (2024-02-21T16:15:20Z) - Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling [69.83976050879318]
大規模言語モデル(LLM)では、不確実性の原因を特定することが、信頼性、信頼性、解釈可能性を改善するための重要なステップである。
本稿では,LLMのための不確実性分解フレームワークについて述べる。
提案手法は,入力に対する一連の明確化を生成し,それらをLLMに入力し,対応する予測をアンサンブルする。
論文 参考訳(メタデータ) (2023-11-15T05:58:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。