論文の概要: Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction
- arxiv url: http://arxiv.org/abs/2608.01792v1
- Date: Mon, 03 Aug 2026 07:03:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.366373
- Title: Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction
- Title(参考訳): 信頼性を信頼できるか? 文書抽出における視覚言語モデルConfBench
- Abstract要約: 既存のドキュメントベンチマークはクリーンで高品質なサンプルによって支配されています。
鍵情報抽出のための最初のキャリブレーション特化ベンチマークであるConfBenchを紹介する。
我々は,言語的および対数確率的信頼度推定法により,プロプライエタリな4つのVLMとオープンウェイトな3つのVLMを評価した。
- 参考スコア(独自算出の注目度): 13.176724997257802
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Intelligent document processing (IDP) with vision-language models (VLMs) hinges on confidence scores trustworthy enough to route extractions between automation and human review. Existing document benchmarks are dominated by clean, high-quality samples, leaving low accuracy regions too sparse for calibration assessment. We introduce ConfBench, the first calibration-specific benchmark for key information extraction (KIE), built by applying 20 controlled degradation pipelines to a diverse document set, yielding 1,346 variants and 70K+ entity-level evaluations spanning the full accuracy spectrum. We evaluate four proprietary and three open-weight VLMs under verbalized and log-probability confidence estimation methods across three input modalities, and find: (i) OCR+Image modality results in more accurate confidence estimates; (ii) model capability is the dominant factor: within the Claude family confidence quality scales monotonically with capability, while across families parameter count is a poor predictor; (iii) calibration quality varies widely across models, from near-perfect to severely overconfident, and per-model post-hoc correction rescales these absolute confidence values for threshold-based routing without altering ranking-based operational metrics; and (iv) log-probability with first-token aggregation consistently outperforms mean-token and margin aggregations. We also introduce ECARB, a review-budget metric translating discriminative gains into operational savings. We release ConfBench publicly to enable systematic study of confidence estimators and calibration methods for trustworthy IDP application deployment.
- Abstract(参考訳): 視覚言語モデル(VLM)を備えたインテリジェントドキュメント処理(IDP)は、自動化と人的レビューの間の抽出をルーティングするのに十分な信頼性のスコアに依存している。
既存の文書ベンチマークはクリーンで高品質なサンプルによって支配されており、キャリブレーション評価には低い精度の領域が不足している。
鍵情報抽出(KIE)のための最初のキャリブレーション特異的ベンチマークであるConfBenchを導入し、20個の制御された劣化パイプラインを多種多様な文書集合に適用し、全精度スペクトルにまたがる1,346の変種と70K以上の実体レベルの評価を出力する。
我々は,3つの入力モダリティにまたがる言語的および対数的確率的信頼度推定法により,プロプライエタリな4つのVLMと3つのオープンウェイトなVLMを評価し,以下の結果を得た。
(i)OCR+画像のモダリティは、より正確な信頼度推定をもたらす。
(ii)モデルの能力が支配的な要因である。クロード家の信頼性の品質は能力と一律にスケールするが、家族間のパラメータカウントは予測に乏しい。
三 キャリブレーションの品質は、ほぼ完全から過信まで、モデルごとに大きく変化し、各モデルのポストホック補正は、ランキングベースの運用指標を変更することなく、しきい値ベースのルーティングに対する絶対信頼値を再スケールする。
(4) ファースト・ツーケン・アグリゲーションによるログ確率は平均・ツーケン・マージン・アグリゲーションより一貫して優れていた。
我々はまた、差別的利益を運用上の貯蓄に変換するレビュー予算の計量ECARBについても紹介する。
我々はConfBenchを公開し、信頼できるIPPアプリケーションのデプロイのための信頼度推定と校正方法の体系的な研究を可能にする。
関連論文リスト
- ConfidenceBench: Evaluating Confidence Calibration in Large Language Models [14.831793255747181]
ConfidenceBenchは、大規模言語モデルのキャリブレーションベンチマークである。
15のフロンティア大言語モデルにおいて、言語化された信頼度の評価を行う。
信頼性はプロンプトを通じて引き起こされ、モデルロジットへのアクセスは不要である。
論文 参考訳(メタデータ) (2026-07-10T01:56:30Z) - Discovery of Hidden Miscalibration Regimes [52.452902154360565]
モデルは何らかの入力を体系的に過信し、他人を過信することがある。
対応する誤校正分野を定義し,それを推定するための診断フレームワークを提案する。
提案手法は,入力空間のキャリブレーションを意識した表現を学習し,学習幾何学におけるカーネルの平滑化による符号付き局所的誤校正を推定する。
論文 参考訳(メタデータ) (2026-05-13T13:07:50Z) - A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering [19.55210880950831]
予測されたモデルの信頼度がその経験的精度と一致しているかを測り、大規模言語モデル(LLM)の信頼性デプロイメントの中心となる。
オープンエンド質問応答(QA)のための校正評価フレームワークSem-ECEを紹介する。
フレームワーク内の2つの推定器について検討する。同じサンプルの自己整合性スコアであるSem$-ECEと、自信評価から回答の選択を分離する保留変数であるSem$-ECEである。
論文 参考訳(メタデータ) (2026-05-08T19:53:49Z) - Confidence-Aware Alignment Makes Reasoning LLMs More Reliable [65.44962502963378]
CASPOは、トークンレベルの信頼度とステップワイドな論理的正しさを、個別の報酬モデルをトレーニングせずに整合させるフレームワークである。
推論中、信頼を意識した思考(CaT)を提案し、不確実な推論枝を無視可能なO(V)レイテンシで動的に生成する。
10のベンチマークと複数のモデルファミリでの実験では、CASPOは推論の信頼性と推論効率を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-08T07:08:25Z) - Process Supervision of Confidence Margin for Calibrated LLM Reasoning [52.373121066425455]
強化学習(RL)によるテスト時間計算のスケーリングは,大規模言語モデル(LLM)推論能力を向上させるための信頼性の高い経路として登場した。
しかし、結果に基づく報酬は、しばしばモデルに過信感を与え、幻覚、信頼できない信頼ベースの制御、不要な計算割り当てをもたらす。
本稿では,信頼性と信頼性を両立させるキャリブレーションを意識したRLフレームワークであるReinforcement Learning with Confidence Margin(textbfRLCM)を紹介する。
論文 参考訳(メタデータ) (2026-04-25T14:40:13Z) - BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence [22.382291859991472]
本稿では,大言語モデルが抑止力を考慮した意思決定を支援するかを評価するための決定論的指標である行動アライメントスコア(BAS)を紹介する。
BASは、明示的な回答または持続可能なユーティリティモデルから派生し、リスク閾値の連続体にわたって実現されたユーティリティを集約する。
理論的には、真理信頼度推定は期待されるBASユーティリティを一意に最大化し、キャリブレーションと決定-最適行動のリンクを示す。
論文 参考訳(メタデータ) (2026-04-03T17:44:32Z) - Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection [0.0]
大規模言語モデル(LLM)は、ますます重要な意思決定システムにデプロイされている。
出力アンカートークン確率に基づく正規化信頼スコアを導入する。
これにより、最小限のオーバーヘッドでエラーや幻覚を直接検出できる。
論文 参考訳(メタデータ) (2026-02-18T07:05:12Z) - On Calibration of Large Language Models: From Response To Capability [66.59139960234326]
大規模言語モデル(LLM)は汎用的な問題解決手段として広くデプロイされている。
本稿では,クエリ上でモデルが期待する精度を目標とするキャリブレーションを提案する。
我々の結果は、キャパシティ校正された信頼度がpass@$k$予測と推論予算割り当てを改善することを示している。
論文 参考訳(メタデータ) (2026-02-14T01:07:45Z) - Annotation-Efficient Universal Honesty Alignment [70.05453324928955]
既存の手法では、トレーニングなしの信頼度推定や、正当性アノテーションによるトレーニングベースキャリブレーションに頼っている。
Elicitation-Then-Calibration (EliCal) は、まず安価な自己整合性監視を用いて内部信頼を引き出す2段階のフレームワークである。
EliCalは1kの正当性アノテーション(全監督の0.18%)でほぼ最適アライメントを実現し、キャリブレーションのみのベースラインよりも目立たないMMLUタスクでのアライメント性能が向上した。
論文 参考訳(メタデータ) (2025-10-20T13:05:22Z) - Mind the Generation Process: Fine-Grained Confidence Estimation During LLM Generation [63.49409574310576]
大規模言語モデル(LLM)は自信過剰を示し、信頼度の高いスコアを誤った予測に割り当てる。
本研究では,テキスト生成中に高精度できめ細かな信頼スコアを提供する信頼度推定手法であるFineCEを紹介する。
論文で使用されたコードとすべてのベースラインはGitHubで公開されている。
論文 参考訳(メタデータ) (2025-08-16T13:29:35Z) - A Context-Aware Dual-Metric Framework for Confidence Estimation in Large Language Models [6.62851757612838]
大規模言語モデル(LLM)に対する現在の信頼度推定法は,応答と文脈情報の関連性を無視する。
本稿では,2つの新しい指標を用いた信頼度推定のためのコンテキスト忠実度と一貫性を統合したCRUXを提案する。
3つのベンチマークデータセットに対する実験は、CRUXの有効性を示し、既存のベースラインよりも高いAUROCを達成した。
論文 参考訳(メタデータ) (2025-08-01T12:58:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。