論文の概要: ConfidenceBench: Evaluating Confidence Calibration in Large Language Models
- arxiv url: http://arxiv.org/abs/2607.20526v1
- Date: Fri, 10 Jul 2026 01:56:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.217969
- Title: ConfidenceBench: Evaluating Confidence Calibration in Large Language Models
- Title(参考訳): ConfidenceBench: 大規模言語モデルにおける信頼性校正の評価
- Abstract要約: ConfidenceBenchは、大規模言語モデルのキャリブレーションベンチマークである。
15のフロンティア大言語モデルにおいて、言語化された信頼度の評価を行う。
信頼性はプロンプトを通じて引き起こされ、モデルロジットへのアクセスは不要である。
- 参考スコア(独自算出の注目度): 14.831793255747181
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly deployed in settings where fluent but incorrect answers can be costly. In these settings, accuracy alone is insufficient: models must also know when they are likely to be wrong. We present ConfidenceBench, a calibration benchmark that evaluates verbalized confidence estimates in 15 frontier LLMs using the Brier score, a proper scoring rule that incentivises truthful probability reporting. Confidence is elicited via prompting, requiring no access to model logits and making the framework applicable to both closed-source and open-source systems. The benchmark comprises 200 private multiple-choice questions across four categories: spatial reasoning, high-precision mathematics, word lookup, and unknowable questions. Across three independent runs, Claude Opus 4.6 and Gemini 3.1 Pro Preview achieve the lowest Brier scores, both reported as 0.103. Both substantially outperform the calibrated-random baseline of 0.1875, while Gemini 3.1 Flash-Lite scores 0.367, indicating severe miscalibration. Accuracy and calibration diverge substantially across model families: the most accurate model is not the best-calibrated, and several models perform worse than the calibrated-random Brier baseline despite reasonable accuracy. These results show that verbalized confidence calibration is a distinct and practically important axis of LLM reliability, complementary to standard accuracy-based evaluation.
- Abstract(参考訳): 大きな言語モデル(LLM)は、流動性があるが誤った回答がコストがかかるような設定で、ますますデプロイされている。
これらの設定では、正確性だけでは不十分です。
We present ConfidenceBench, a calibration benchmark that a verbalized confidence estimates in 15 frontier LLMs using the Brier score, a proper score rule that incentivations truthful probability reporting。
信頼性は、プロンプトによって引き起こされ、モデルロジットへのアクセスを必要とせず、フレームワークをクローズドソースシステムとオープンソースシステムの両方に適用できるようにする。
このベンチマークは、空間推論、高精度数学、単語検索、無知質問の4つのカテゴリにまたがる200のプライベートな多重選択質問で構成されている。
クロード・オプス4.6とジェミニ3.1 プロ・プレビューは3つの独立したレースで最下位のブリア・スコアを達成し、どちらも0.103と報告された。
どちらも0.1875のキャリブレーションされたランダムベースラインより大幅に上回り、ジェミニ3.1のフラッシュライトスコアは0.367であり、深刻な誤校正を示している。
モデルファミリ間で精度とキャリブレーションは著しくばらつき、最も正確なモデルは最良のキャリブレーションではなく、いくつかのモデルは妥当な精度にもかかわらずキャリブレーションされたランダムのブライアベースラインよりも性能が劣る。
これらの結果から, 言語的信頼度校正は, 標準精度に基づく評価と相まって, LLMの信頼性の明瞭かつ実践的に重要な軸であることが示唆された。
関連論文リスト
- Provable Limits and Certified Deferral for Verbalized Uncertainty in Small Language Models [0.0]
小さなオープンウェイト言語モデルは、プライベート、オフライン、コストに敏感な設定でますます動作します。
我々は,言語的信頼度がリスク制御された推論を支援することができるか検討した。
論文 参考訳(メタデータ) (2026-08-05T17:11:04Z) - Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction [13.176724997257802]
既存のドキュメントベンチマークはクリーンで高品質なサンプルによって支配されています。
鍵情報抽出のための最初のキャリブレーション特化ベンチマークであるConfBenchを紹介する。
我々は,言語的および対数確率的信頼度推定法により,プロプライエタリな4つのVLMとオープンウェイトな3つのVLMを評価した。
論文 参考訳(メタデータ) (2026-08-03T07:03:51Z) - The ACUTE Protocol: Operationalizing Language Model Activations for Better Calibration, Utility, and Trust [39.08747366439304]
キャリブレーションと情報伝達のバランスをとるために, オーラクル (EURO) によって再正規化される新しい計量式を開発した。
また,不確実性を適切に判断するための汎用信頼度,実用性,信頼度推定プロトコル(ACUTE)を提案する。
論文 参考訳(メタデータ) (2026-06-05T20:15:50Z) - CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction [51.56484100374058]
既存のLLM(Large Language Models)のキャリブレーション手法は、しばしば信頼性の重要な次元、すなわちモデルの振舞いの堅牢性を見落としている。
我々は,モデルが注意をそらす可能性を直接測定し,罰する,新しいポストホックキャリブレーション手法であるtextscCaliDistを紹介した。
textscCaliDistは、強いベースラインと比較して、期待の低いエラー(ECE)とBrier Scoreを一貫して達成します。
論文 参考訳(メタデータ) (2026-06-04T07:27:53Z) - Calibration vs Decision Making: Revisiting the Reliability Paradox in Unlearned Language Models [15.63775421273161]
本研究では,TOFUベンチマークを用いた複数選択質問応答評価プロトコルを用いて,生成言語モデルのギャップについて検討する。
微調整モデルでは,事前学習モデルと比較してキャリブレーション誤差が低い(ECE 0.04)。
未学習後のモデルも同様に低いキャリブレーションを保ちながら、忘れ分割の精度は低下する。
論文 参考訳(メタデータ) (2026-05-20T08:59:23Z) - Discovery of Hidden Miscalibration Regimes [52.452902154360565]
モデルは何らかの入力を体系的に過信し、他人を過信することがある。
対応する誤校正分野を定義し,それを推定するための診断フレームワークを提案する。
提案手法は,入力空間のキャリブレーションを意識した表現を学習し,学習幾何学におけるカーネルの平滑化による符号付き局所的誤校正を推定する。
論文 参考訳(メタデータ) (2026-05-13T13:07:50Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - When Can We Trust LLM Graders? Calibrating Confidence for Automated Assessment [1.896929753246251]
大規模言語モデル(LLM)は自動階調の保証を示すが、その出力は信頼できない。
これにより、信頼性の高い予測が自動的に処理され、不確実なケースが人間のレビューにフラグ付けされる選択的な自動化が可能になる。
論文 参考訳(メタデータ) (2026-03-31T10:38:22Z) - On Calibration of Large Language Models: From Response To Capability [66.59139960234326]
大規模言語モデル(LLM)は汎用的な問題解決手段として広くデプロイされている。
本稿では,クエリ上でモデルが期待する精度を目標とするキャリブレーションを提案する。
我々の結果は、キャパシティ校正された信頼度がpass@$k$予測と推論予算割り当てを改善することを示している。
論文 参考訳(メタデータ) (2026-02-14T01:07:45Z) - Do Large Language Models Know What They Don't Know? Kalshibench: A New Benchmark for Evaluating Epistemic Calibration via Prediction Markets [0.0]
十分に校正されたモデルは、実際の正確さと一致した信頼を表現するべきです -- 80%の信頼性を主張する場合には、80%の時間を正すべきです。
我々はCFTCが規制する取引所であるKalshiから300の予測市場質問のベンチマークであるtextbfKalshiBenchを紹介した。
我々は、Claude Opus 4.5, GPT-5.2, DeepSeek-V3.2, Qwen3-235B, Kimi-K2 の5つのフロンティアモデルを評価し、全モデルにまたがるテキストの過信を求める。
論文 参考訳(メタデータ) (2025-12-17T23:23:06Z) - Annotation-Efficient Universal Honesty Alignment [70.05453324928955]
既存の手法では、トレーニングなしの信頼度推定や、正当性アノテーションによるトレーニングベースキャリブレーションに頼っている。
Elicitation-Then-Calibration (EliCal) は、まず安価な自己整合性監視を用いて内部信頼を引き出す2段階のフレームワークである。
EliCalは1kの正当性アノテーション(全監督の0.18%)でほぼ最適アライメントを実現し、キャリブレーションのみのベースラインよりも目立たないMMLUタスクでのアライメント性能が向上した。
論文 参考訳(メタデータ) (2025-10-20T13:05:22Z) - ConfTuner: Training Large Language Models to Express Their Confidence Verbally [58.63318088243125]
大規模言語モデル(LLM)は、科学、法律、医療といった高度な領域にますます展開されている。
LLMは、しばしば「過信」(overconfidence)として知られる、高い信頼で誤った答えを生成するために観察される。
論文 参考訳(メタデータ) (2025-08-26T09:25:32Z) - Calibrating Large Language Models with Sample Consistency [76.23956851098598]
本稿では,複数サンプルモデル生成系の分布から信頼度を導出する可能性について,一貫性の3つの尺度を用いて検討する。
その結果、一貫性に基づくキャリブレーション手法は、既存のポストホック手法よりも優れていることがわかった。
種々のLMの特性に合わせて,キャリブレーションに適した整合性指標を選択するための実用的なガイダンスを提供する。
論文 参考訳(メタデータ) (2024-02-21T16:15:20Z) - Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence
Scores from Language Models Fine-Tuned with Human Feedback [91.22679548111127]
信頼できる現実世界の予測システムは、よく校正された信頼スコアを生成するべきである。
出力トークンとして出力される言語的信頼度は、通常、モデルの条件付き確率よりも良く校正されていることを示す。
論文 参考訳(メタデータ) (2023-05-24T10:12:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。