論文の概要: Provable Limits and Certified Deferral for Verbalized Uncertainty in Small Language Models
- arxiv url: http://arxiv.org/abs/2608.05064v1
- Date: Wed, 05 Aug 2026 17:11:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.039854
- Title: Provable Limits and Certified Deferral for Verbalized Uncertainty in Small Language Models
- Title(参考訳): 小言語モデルにおける動詞不確かさの確率的限界と証明されたデフェラル
- Authors: Jianru Shen,
- Abstract要約: 小さなオープンウェイト言語モデルは、プライベート、オフライン、コストに敏感な設定でますます動作します。
我々は,言語的信頼度がリスク制御された推論を支援することができるか検討した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Small open-weight language models increasingly run in private, offline, and cost-sensitive settings, where the key deployment question is not only what a model answers but when it should defer to a human. We study whether verbalized confidence can support risk-controlled deferral, evaluating eleven instruction-tuned models from three families, 0.5B to 14B parameters, on ARC-Challenge and TruthfulQA with 25,168 local predictions. Three theoretical results delimit what calibration can provide: strictly monotone calibration preserves the risk-coverage frontier and error-detection AUROC; temperature scaling cannot calibrate models whose confidence stays above one half while accuracy falls below it; and a Clopper-Pearson procedure converts a 200-question calibration set into a finite-sample risk certificate under an i.i.d. deployment assumption. Empirically, eight of 22 model-task pairs hit the temperature-scaling infeasibility floor within one percentage point of the predicted bound. Platt scaling reduces ECE to as low as 0.02, yet certified autonomy at a 20% risk budget is granted to only three model-task pairs and to none at 10%. We also identify and repair an answer-ordering artifact in the multiple-choice form of TruthfulQA. Calibration gives confidence semantics; certified deferral determines when small models are safe to use.
- Abstract(参考訳): 小さなオープンウェイトな言語モデルは、プライベート、オフライン、そしてコストに敏感な設定でますます動作します。
25,168の局所予測でARC-Challenge と TruthfulQA を用いて, 0.5B から 14B の3家系の指導訓練モデルの評価を行った。
厳密なモノトンキャリブレーションはリスクカバーフロンティアとエラー検出AUROCを保ち、温度スケーリングは信頼性が半分以上のモデルのキャリブレーションはできない。
実験では、22組のモデルタスクペアのうち8組が、予測された境界の1ポイント以内の温度スケーリング不可能なフロアにぶつかった。
プラットスケーリングは、ECEを0.02まで下げるが、20%のリスク予算で認定された自律性は、3組のモデルタスクペアにしか与えられず、10%にも満たない。
また、TruthfulQAの複数選択形式の回答順序付けアーティファクトを同定し、修復する。
認定された推論は、小さなモデルの使用が安全かどうかを決定する。
関連論文リスト
- ConfidenceBench: Evaluating Confidence Calibration in Large Language Models [14.831793255747181]
ConfidenceBenchは、大規模言語モデルのキャリブレーションベンチマークである。
15のフロンティア大言語モデルにおいて、言語化された信頼度の評価を行う。
信頼性はプロンプトを通じて引き起こされ、モデルロジットへのアクセスは不要である。
論文 参考訳(メタデータ) (2026-07-10T01:56:30Z) - When Can Conformal Risk Control Certify LLM Outputs? Bounds, Impossibility, and Adaptation for Structured Generation [0.11280931253550518]
構造化世代 (NER, 抽出, QA, 分類) にデプロイされる大規模言語モデル (LLM) には、正式な信頼性保証がない。
我々は、共形リスク制御(CRC)が構造化LLM出力を証明でき、かつ、それが証明不可能な場合に特徴付ける。
論文 参考訳(メタデータ) (2026-06-27T19:25:07Z) - Calibration vs Decision Making: Revisiting the Reliability Paradox in Unlearned Language Models [15.63775421273161]
本研究では,TOFUベンチマークを用いた複数選択質問応答評価プロトコルを用いて,生成言語モデルのギャップについて検討する。
微調整モデルでは,事前学習モデルと比較してキャリブレーション誤差が低い(ECE 0.04)。
未学習後のモデルも同様に低いキャリブレーションを保ちながら、忘れ分割の精度は低下する。
論文 参考訳(メタデータ) (2026-05-20T08:59:23Z) - Discovery of Hidden Miscalibration Regimes [52.452902154360565]
モデルは何らかの入力を体系的に過信し、他人を過信することがある。
対応する誤校正分野を定義し,それを推定するための診断フレームワークを提案する。
提案手法は,入力空間のキャリブレーションを意識した表現を学習し,学習幾何学におけるカーネルの平滑化による符号付き局所的誤校正を推定する。
論文 参考訳(メタデータ) (2026-05-13T13:07:50Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - Geometric Calibration and Neutral Zones for Uncertainty-Aware Multi-Class Classification [0.0]
この研究は情報幾何学と統計的学習を橋渡しし、厳密な検証を必要とするアプリケーションにおいて不確実性を認識した分類の正式な保証を提供する。
アデノ関連ウイルスの分類に関する実証的な検証は、2段階のフレームワークが72.5%のエラーをキャプチャし、34.5%のサンプルを遅延させ、自動決定エラー率を16.8%から6.9%に下げていることを示している。
論文 参考訳(メタデータ) (2025-11-26T01:29:49Z) - Calibrated Uncertainty Quantification for Operator Learning via
Conformal Prediction [95.75771195913046]
本稿では, リスク制御型量子ニューラル演算子, 分布のない有限サンプル機能キャリブレーション等式予測法を提案する。
関数領域上の点の期待値として定義されるカバレッジ率に関する理論的キャリブレーションを保証する。
2次元ダーシー流と3次元自動車表面圧力予測タスクに関する実験結果から,我々の理論的結果が検証された。
論文 参考訳(メタデータ) (2024-02-02T23:43:28Z) - Instant Uncertainty Calibration of NeRFs Using a Meta-calibrator [60.47106421809998]
我々は,1つの前方パスを持つNeRFに対して不確実な校正を行うメタ校正器の概念を導入する。
メタキャリブレータは、見えないシーンを一般化し、NeRFの良好な校正と最先端の不確実性を実現できることを示す。
論文 参考訳(メタデータ) (2023-12-04T21:29:31Z) - T-Cal: An optimal test for the calibration of predictive models [49.11538724574202]
有限検証データセットを用いた予測モデルの誤校正を仮説検証問題として検討する。
誤校正の検出は、クラスの条件付き確率が予測の十分滑らかな関数である場合にのみ可能である。
我々は、$ell$-Expected Error(ECE)のデバイアスドプラグイン推定器に基づくキャリブレーションのためのミニマックステストであるT-Calを提案する。
論文 参考訳(メタデータ) (2022-03-03T16:58:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。