論文の概要: A Calibrated Instrument for Measuring How Inference Optimizations Affect Output Quality
- arxiv url: http://arxiv.org/abs/2609.18005v1
- Date: Wed, 16 Sep 2026 01:49:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.595235
- Title: A Calibrated Instrument for Measuring How Inference Optimizations Affect Output Quality
- Title(参考訳): 推論最適化が出力品質に与える影響を計測する校正装置
- Abstract要約: 大規模言語モデルの最適化は活発な研究領域であり、モデルの重みの量子化、層をスキップする早期排他法、投機的復号化にまたがる。
本稿では,クロスシステムおよびクロス技術比較に適した出力品質測定のための厳密な手法を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model optimization is an active research area, spanning quantization of model weights, early-exit methods for skipping layers, and speculative decoding. Each track uses its own quality measures, typically an idiosyncratic benchmark score. Few approach the measurement precision required by other scientific disciplines. We propose a rigorous methodology for measuring output quality, suitable for cross-system and cross-technique comparison. We score outputs with an LLM as a judge, but calibrate the judge formally: we compare its scores on two ordinary runs of a model given the same prompts, verifying that it shows no systematic preference between statistically equivalent outputs and measuring its per-sample noise. Each design also includes a 'null' condition, provably identical in distribution to the unmodified model, whose measured difference must be zero. With this one instrument we measure several acceleration techniques on the same prompts, so their quality costs can be compared. Perceived quality proves highly dependent on the domain of discourse. A 4-bit model was indistinguishable from its 16-bit original down to our design's +/-0.3-point resolution, in English prose and Chinese alike. At 3-bit precision the same prompts lost 0.5 points in English prose, 0.9 in Chinese, and 1.1 on multi-step math; early exit that cost 0.7 points on prose cost 2.5 on math, cutting correctly solved problems from 19 of 27 to 6. The pattern held for models from Alibaba and from Meta, but not its magnitude: the same quantizer cost Meta's model 1.8 points where it cost Alibaba's 0.7. A model's certainty about a token predicts how likely it is to differ from the full model's choice, but not how much that difference affects judged quality, so acceptance rules relying on certainty cannot distinguish errors that matter from errors that don't.
- Abstract(参考訳): 大規模言語モデルの最適化は活発な研究領域であり、モデルの重みの量子化、層をスキップする早期排他法、投機的復号化にまたがる。
各トラックは、通常、慣用的なベンチマークスコアという、独自の品質基準を使用する。
他の科学分野で必要とされる測定精度に近づくことは少ない。
本稿では,クロスシステムおよびクロス技術比較に適した出力品質測定のための厳密な手法を提案する。
同じプロンプトを与えられたモデルの2つの通常の実行時のスコアを比較し、統計的に等価な出力間の体系的な選好を示さず、サンプルごとのノイズを測定することを検証する。
それぞれの設計には「ヌル」条件も含まれており、これは無修正モデルと同値であり、測定された差はゼロでなければならない。
この計器を用いて、同じプロンプト上で複数の加速度技術を測定することにより、その品質コストを比較することができる。
知覚された品質は、会話の領域に大きく依存している。
4ビットモデルは16ビットのオリジナルモデルから、私たちのデザインの+/-0.3ポイントの解像度まで、英語の散文や中国語でも区別できないものでした。
3ビット精度では、同じプロンプトが英語の散文の0.5ポイント、中国語の0.9ポイント、マルチステップの数学の1.1ポイントを失った。
AlibabaとMetaのモデルのパターンは、その大きさではない。同じ定量化器のモデルでは、Alibabaの0.7のコストでMetaの1.8ポイントが費やされた。
トークンに対するモデルの確実性は、それが完全なモデルの選択とどの程度異なるかを予測するが、その差が判断された品質にどの程度影響するかは予測できないため、確実性に依存する受け入れルールは、重要でないエラーと区別できない。
関連論文リスト
- Grouping the Stochastic Machine: Precision, Not Capability, as the Frontier Metric for AI Systems [0.0]
私は、フロンティア言語モデルは、最高の、平均的なアウトプットが達成できる能力で比較され、市場化され、ベンチマークされていると論じます。
現在あるシステムと別のシステムを分離しているのは、精度です。
私は、グループ化基準を定義し、ハーネスを指定し、時間とともに人間とAIのペアのグルーピングを追跡することで、Paper 1のフィールドスタディが必要とする合成信号がどのように得られるかを示す。
論文 参考訳(メタデータ) (2026-08-19T17:29:47Z) - Which Decisions Low-Bit Quantization Breaks, and How to Predict Them [0.713496583173065]
我々は、選択されたオプションのスコアであるマージンを測定し、量子化の前と後、最良の選択肢のスコアを減らします。
損傷は比例し、大きさは固定されていない。
マージンとともにノイズが大きくなるものを含む追加のアカウントは、コール・ツー・コールかセーフティ・セルかに関わらず、単一のダメージを受ける。
論文 参考訳(メタデータ) (2026-08-06T20:22:21Z) - Bigger or Cheaper? Scale and Quantization Effects on Uncertainty Signals in Vision-Language Models Under Image Degradation [0.0]
モデルスケールと4ビット量子化がQwen2-VLファミリーの2つの信頼信号にどのように影響するかを同一の入力で測定する。
スケールはモデルの内部不確実性信号を大幅に改善する。
誤差検出AUROCは校正誤差ではなく、2つの信号の差を露呈する計量であると主張する。
論文 参考訳(メタデータ) (2026-07-27T13:47:44Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Evaluating Small Language Models for Front-Door Routing: A Harmonized Benchmark and Synthetic-Traffic Experiment [0.05586191108738562]
小型言語モデル(SLM)は、サブ秒、ゼロマージナルコスト、セルフホストタスクの分類に十分な推論能力を持つ。
Study 1はPhi-3.5-mini、Qwen2.5-1.5B、Qwen-2.5-3Bを同一のAzure T4ハードウェア、サービススタック、量子化、固定60ケースコーパスで同期したオフラインベンチマークである。
研究2は、合成トラフィック下で事前登録された4本腕ランダム化実験であり、有効サンプルサイズは腕あたり60ケースである。
論文 参考訳(メタデータ) (2026-03-26T15:57:46Z) - Entropy-Guided Loop: Achieving Reasoning through Uncertainty-Aware Generation [0.0]
entropy-guided refinementは、トークンレベルの不確実性を使用して、1つのターゲットのリファインメントパスをトリガーする軽量なテスト時間ループである。
この不確実性認識ループは,シングルパス推論と高価な推論チェーンの中間点として有効であることを示す。
論文 参考訳(メタデータ) (2025-08-26T22:29:12Z) - Uncertainty in Language Models: Assessment through Rank-Calibration [65.10149293133846]
言語モデル(LM)は、自然言語生成において有望な性能を示している。
与えられた入力に応答する際の不確実性を正確に定量化することは重要である。
我々は、LMの確実性と信頼性を評価するために、Rank$-$Calibration$と呼ばれる斬新で実用的なフレームワークを開発する。
論文 参考訳(メタデータ) (2024-04-04T02:31:05Z) - Differentiable Model Compression via Pseudo Quantization Noise [99.89011673907814]
本稿では,モデルパラメータに独立な擬似量子化雑音を加えて量子化演算子の効果を近似する。
本手法が,画像分類,言語モデリング,音声ソース分離などのベンチマークやアーキテクチャにおいて,最先端の量子化技術を上回ることを実験的に検証した。
論文 参考訳(メタデータ) (2021-04-20T14:14:03Z) - How Can We Know When Language Models Know? On the Calibration of
Language Models for Question Answering [80.82194311274694]
言語モデルがいつ、自信を持って、特定のクエリに対する答えを知っているか、どのように知ることができるか?
我々は,T5,BART,GPT-2の3つの強力な生成モデルを検討した。
次に、そのようなモデルの校正方法を検討し、その信頼性スコアを正しさの確率と相関させる。
論文 参考訳(メタデータ) (2020-12-02T03:53:13Z) - Fast Uncertainty Quantification for Deep Object Pose Estimation [91.09217713805337]
深層学習に基づくオブジェクトポーズ推定は、しばしば信頼できない、自信過剰である。
本研究では,6-DoFオブジェクトのポーズ推定のための,シンプルで効率的かつプラグアンドプレイなUQ手法を提案する。
論文 参考訳(メタデータ) (2020-11-16T06:51:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。