論文の概要: Calibration as a First-Class Criterion in LLM Evaluation
- arxiv url: http://arxiv.org/abs/2609.26489v1
- Date: Tue, 22 Sep 2026 14:28:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.697106
- Title: Calibration as a First-Class Criterion in LLM Evaluation
- Title(参考訳): LLM評価における第一級基準としての校正
- Abstract要約: 我々は、この採用ギャップが信頼性の高いLCM評価の大きな障害であると主張している。
標準校正基準は、信頼度スコアと正当性判定の2つの入力しか必要としない。
各NLPサブフィールドは、主性能指標と校正スコアを組み合わせるべきである。
- 参考スコア(独自算出の注目度): 16.378998802160375
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Calibration of language models -- the alignment between expressed or implicit confidence and empirical correctness -- is a well-studied subfield within NLP. Methods to measure it already exist. The problem is adoption: outside this subfield, NLP research regularly introduces new models, datasets, and benchmarks without checking whether the model's confidence scores are meaningful. We argue that this adoption gap is a major obstacle to trustworthy LLM evaluation. Miscalibration causes problems in two distinct areas: at deployment, where overconfident mistakes cause real harm, and inside the research pipeline, where methods like LLM-as-a-judge, synthetic data generation, and active learning rely on calibrated confidence without verifying it. Standard calibration metrics only require two inputs per example: a confidence score and a correctness judgment. Most benchmarks in use today already provide both, meaning calibration can be reported immediately. For open-ended generation, however, defining these two inputs is still an open challenge. We argue that each NLP subfield should pair its main performance metric with a calibration score and call for treating calibration as an essential property of every model rather than a niche topic.
- Abstract(参考訳): 言語モデルの校正 -- 表現的あるいは暗黙的な自信と経験的正しさの一致 -- は、NLP内のよく研究されているサブフィールドである。
測定方法はすでに存在する。
このサブフィールド以外では、NLPリサーチでは、モデルの信頼性スコアが意味のあるものであるかどうかを確認することなく、新しいモデル、データセット、ベンチマークを定期的に導入している。
我々は、この採用ギャップが信頼性の高いLCM評価の大きな障害であると主張している。
LLM-as-a-judge、合成データ生成、アクティブラーニングといった手法は、検証することなく、校正された信頼性に依存している。
標準校正基準は、信頼度スコアと正当性判定の2つの入力しか必要としない。
現在使われているほとんどのベンチマークは両方を提供しており、キャリブレーションはすぐに報告できる。
しかし、オープンエンド世代にとって、これらの2つの入力を定義することは依然としてオープンな課題である。
各NLPサブフィールドは、その主性能指標と校正スコアを組み合わせて、ニッチなトピックではなく、すべてのモデルの不可欠な特性として校正を取り扱うべきであると論じる。
関連論文リスト
- CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction [51.56484100374058]
既存のLLM(Large Language Models)のキャリブレーション手法は、しばしば信頼性の重要な次元、すなわちモデルの振舞いの堅牢性を見落としている。
我々は,モデルが注意をそらす可能性を直接測定し,罰する,新しいポストホックキャリブレーション手法であるtextscCaliDistを紹介した。
textscCaliDistは、強いベースラインと比較して、期待の低いエラー(ECE)とBrier Scoreを一貫して達成します。
論文 参考訳(メタデータ) (2026-06-04T07:27:53Z) - Discovery of Hidden Miscalibration Regimes [52.452902154360565]
モデルは何らかの入力を体系的に過信し、他人を過信することがある。
対応する誤校正分野を定義し,それを推定するための診断フレームワークを提案する。
提案手法は,入力空間のキャリブレーションを意識した表現を学習し,学習幾何学におけるカーネルの平滑化による符号付き局所的誤校正を推定する。
論文 参考訳(メタデータ) (2026-05-13T13:07:50Z) - Assessing and Mitigating Miscalibration in LLM-Based Social Science Measurement [10.552494876804511]
大規模言語モデル(LLM)は、スケーラブルな測定ツールとして社会科学でますます使われている。
本稿では, LLMを用いた社会科学測定におけるモデル誤校正について検討する。
論文 参考訳(メタデータ) (2026-05-12T11:06:33Z) - A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering [19.55210880950831]
予測されたモデルの信頼度がその経験的精度と一致しているかを測り、大規模言語モデル(LLM)の信頼性デプロイメントの中心となる。
オープンエンド質問応答(QA)のための校正評価フレームワークSem-ECEを紹介する。
フレームワーク内の2つの推定器について検討する。同じサンプルの自己整合性スコアであるSem$-ECEと、自信評価から回答の選択を分離する保留変数であるSem$-ECEである。
論文 参考訳(メタデータ) (2026-05-08T19:53:49Z) - On Calibration of Large Language Models: From Response To Capability [66.59139960234326]
大規模言語モデル(LLM)は汎用的な問題解決手段として広くデプロイされている。
本稿では,クエリ上でモデルが期待する精度を目標とするキャリブレーションを提案する。
我々の結果は、キャパシティ校正された信頼度がpass@$k$予測と推論予算割り当てを改善することを示している。
論文 参考訳(メタデータ) (2026-02-14T01:07:45Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Generalized Correctness Models: Learning Calibrated and Model-Agnostic Correctness Predictors from Historical Patterns [67.24756301536617]
本稿では,正確で校正された信頼度を推定する一般化精度モデル(GCM)を提案する。
まず,多くのLCMの正当性データに基づいてGCMをトレーニングできることを示す。
次に,CMをレンズとして,補正予測能力の源泉とその一般化について検討する。
論文 参考訳(メタデータ) (2025-09-29T16:19:01Z) - Calibrating Long-form Generations from Large Language Models [34.72041258464477]
大きな言語モデル(LLM)の信頼性スコアは、その応答が正しいという実際の可能性と一致すべきである。
現在の信頼性評価手法とキャリブレーション基準は、応答の正しさを2値の真/偽評価に頼っている。
本稿では,LLMの応答の正しさと関連する信頼度の両方を,様々なスコアの分布として扱う統一校正フレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-09T17:00:32Z) - A Close Look into the Calibration of Pre-trained Language Models [56.998539510508515]
事前訓練された言語モデル(PLM)は、予測の不確かさを確実に見積もることに失敗する可能性がある。
トレーニングにおけるPLMの校正性能の動的変化について検討する。
最近提案された2つの学習可能な手法を拡張して、モデルを直接収集し、合理的な信頼度を推定する。
論文 参考訳(メタデータ) (2022-10-31T21:31:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。