論文の概要: Perception, Layout, and Validation: Calibrated Confidence for Reliable Straight-Through Processing of Financial Documents
- arxiv url: http://arxiv.org/abs/2609.20110v1
- Date: Thu, 17 Sep 2026 12:09:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.254862
- Title: Perception, Layout, and Validation: Calibrated Confidence for Reliable Straight-Through Processing of Financial Documents
- Title(参考訳): 受理・レイアウト・検証:金融文書の信頼性・ストレートスルー処理に対する信頼性の校正
- Abstract要約: 抽出されたキー値フィールドのストレートスルー処理は、自動承認階層の残差の保証とともに、キャリブレーションされた確率を必要とする。
現代の視覚言語モデル(VLM)は、キー値に対するアウト・オブ・ボックス機能を提供するが、その言語化された信頼信号は信頼性が低く、フィールドの正確性を弱く追跡する。
本稿では、認識、レイアウト、最終的な共形リスク制御を含む3つの解釈可能なチャネルに沿った信頼層を導入し、信頼性の高い財務文書の抽出に使用することができる。
- 参考スコア(独自算出の注目度): 6.95911126044123
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Straight-through processing (STP) on extracted key-value fields from financial documents without human review requires a calibrated probability together with a bounded guarantee on the residual error of the auto-approved tier. The emergence of modern Vision Language Models (VLMs) provides an out-of-the-box capability for extracting the key-values, but their verbalized confidence signals are unreliable and weakly track field correctness. This paper introduces a decomposed confidence layer along three interpretable channels, including perception, layout, and validation. Together with a final conformal risk control, the score can be used for reliable STP of financial documents. The method is validated on three public datasets covering real invoices, synthetic invoices, and ad-buy forms, using two different VLM families (Qwen3.6-27B and Gemini-3.1-Flash-Lite). Our decomposed score consistently improves the separation of correct from incorrect extractions, substantially raising the AUROC from 0.54-0.74 for VLM verbalized signals to 0.90-0.99 with contributions from all three designed channels. Crucially for industrial deployment, this enables usable STP. The native VLM confidence signals could clear only 0.1%-7.0% of fields under risk control at a target error of <10%. In contrast, the proposed method auto-approves 49-72% of fields while holding the empirical error of the accepted tier at or below the target.
- Abstract(参考訳): 人間のレビューを伴わない金融文書から抽出されたキー値フィールドのストレートスルー処理(STP)は、自動承認階層の残差に対する有界保証とともに、キャリブレーションされた確率を必要とする。
現代のビジョン言語モデル(VLM)の出現は、キー値を抽出するアウト・オブ・ボックス機能を提供するが、それらの言語化された信頼信号は信頼性が低く、フィールドの正確性を弱く追跡する。
本稿では、認識、レイアウト、検証を含む3つの解釈可能なチャネルに沿って、分解された信頼層を導入する。
最終的な共形リスクコントロールとともに、スコアは財務文書の信頼できるSTPに使用することができる。
この方法は、2つの異なるVLMファミリー(Qwen3.6-27BとGemini-3.1-Flash-Lite)を使用して、実際の請求書、合成請求書、アドバイフォームをカバーする3つの公開データセットで検証されている。
その結果,VLM音声信号のAUROCは0.54-0.74から0.90-0.99に大幅に向上した。
産業展開において重要なのは、使用可能なSTPを可能にすることだ。
ネイティブなVLM信頼信号は、ターゲットエラーの10%でリスクコントロール対象のフィールドの0.1%-7.0%しかクリアできない。
これとは対照的に,提案手法は,対象値以下で許容階層の実証誤差を保ちながら,49~72%のフィールドを自動承認する。
関連論文リスト
- Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction [13.176724997257802]
既存のドキュメントベンチマークはクリーンで高品質なサンプルによって支配されています。
鍵情報抽出のための最初のキャリブレーション特化ベンチマークであるConfBenchを紹介する。
我々は,言語的および対数確率的信頼度推定法により,プロプライエタリな4つのVLMとオープンウェイトな3つのVLMを評価した。
論文 参考訳(メタデータ) (2026-08-03T07:03:51Z) - Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation [0.0]
エージェントAI評価パイプラインは、デプロイメント決定、安全認定、規制コンプライアンス要求を正当化するベンチマークスコアを生成する。
正式なフレームワークはまだ、これらのパイプラインのステージにおける妥当性の低下を特徴付けていない。
本稿では,タスク生成,人間シミュレーションキャリブレーション,自動判定の3層合成妥当性モデルを提案する。
論文 参考訳(メタデータ) (2026-08-01T17:50:12Z) - Beyond Logprobs: A Multi-Signal Confidence Engine for LLM-Based Document Field Extraction [2.1997815944423516]
ExtractConfはクロスドメインでフィールドに依存しない信頼性エンジンである。
同じ文書の2つの構造的に異なる読影において、信頼度を推定する。
0.928ROC AUCを達成し、logprob-meanよりも選択的な予測リスクを70%削減する。
論文 参考訳(メタデータ) (2026-06-23T10:58:08Z) - Discovery of Hidden Miscalibration Regimes [52.452902154360565]
モデルは何らかの入力を体系的に過信し、他人を過信することがある。
対応する誤校正分野を定義し,それを推定するための診断フレームワークを提案する。
提案手法は,入力空間のキャリブレーションを意識した表現を学習し,学習幾何学におけるカーネルの平滑化による符号付き局所的誤校正を推定する。
論文 参考訳(メタデータ) (2026-05-13T13:07:50Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection [0.0]
大規模言語モデル(LLM)は、ますます重要な意思決定システムにデプロイされている。
出力アンカートークン確率に基づく正規化信頼スコアを導入する。
これにより、最小限のオーバーヘッドでエラーや幻覚を直接検出できる。
論文 参考訳(メタデータ) (2026-02-18T07:05:12Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - FinVet: A Collaborative Framework of RAG and External Fact-Checking Agents for Financial Misinformation Detection [0.0]
FinVetは2つのRetrieval-Augmented Generationパイプラインと外部ファクトチェックを統合する新しいフレームワークである。
証拠に裏付けられた評決、情報源の属性、信頼度スコア、証拠が不十分な場合に明確な不確実性フラグを提供する。
論文 参考訳(メタデータ) (2025-10-13T17:31:49Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - LLMs Can Patch Up Missing Relevance Judgments in Evaluation [56.51461892988846]
我々は、大きな言語モデル(LLM)を使って、不確定な文書を自動的にラベル付けします。
TREC DLトラックの関連性判定から関連文書をランダムにドロップすることで,穴の度合いの異なるシナリオをシミュレートする。
Vicuna-7B と GPT-3.5 Turbo の平均値に対して,Kendall tau の0.87 と 0.92 の相関式が得られた。
論文 参考訳(メタデータ) (2024-05-08T00:32:19Z) - Sparse Conditional Hidden Markov Model for Weakly Supervised Named
Entity Recognition [68.68300358332156]
雑音ラベリング機能を評価するために,スパース条件付き隠れマルコフモデル(Sparse-CHMM)を提案する。
Sparse-CHMMは、3段階のトレーニングパイプラインで教師なし学習によって最適化される。
5つの包括的なデータセットで平均F1スコアが3.01向上する。
論文 参考訳(メタデータ) (2022-05-27T20:47:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。