論文の概要: Reliable Financial Named Entity Recognition under Domain Shift
- arxiv url: http://arxiv.org/abs/2608.19558v1
- Date: Thu, 20 Aug 2026 01:55:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.434283
- Title: Reliable Financial Named Entity Recognition under Domain Shift
- Title(参考訳): ドメインシフト下における信頼度の高いファイナンシャルネームエンティティ認識
- Abstract要約: ファイナンシャルネームエンティティ認識(NER)における信頼度推定と選択予測について検討する。
BERTタグとLoRAで調整したQwen2.5-0.5B/1.5Bモデルを,5つの推論時間信頼信号,3つの訓練種,ブートストラップ間隔を用いて評価した。
- 参考スコア(独自算出の注目度): 4.287745257410248
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Financial AI systems often train information extractors on one textual register and deploy them across filings, news, and user-generated content, while standard F1 scores do not indicate which predictions remain safe to automate when the input distribution changes. We study confidence estimation and selective prediction for financial named entity recognition (NER) on a three-tier stress test spanning SEC filings, financial news, and general-topic social media as an extreme out-of-domain condition. We evaluate a BERT tagger and LoRA-tuned Qwen2.5-0.5B/1.5B models using five inference-time confidence signals, three training seeds, and bootstrap intervals. Confidence rankings themselves change under distribution shift: whole-output probability is the strongest in-domain error detector but deteriorates out of domain, whereas entity-span probability and self-consistency are more robust; self-consistency is also better calibrated without post-hoc fitting. Abstention reduces sentence error from 34.3% to below 2% on the highest-confidence 40% of in-domain inputs and remains useful on financial news, but recovers no usefully large clean subset under the extreme social-media shift. These results motivate a staged deployment strategy that detects severe distribution shift upstream before applying prediction-level confidence gating.
- Abstract(参考訳): 金融AIシステムは、あるテキストレジスタ上の情報抽出器をトレーニングし、それをファイリング、ニュース、ユーザー生成コンテンツにデプロイすることが多いが、標準的なF1スコアは、入力分布が変更されても、どの予測が自動化されるかを示すものではない。
証券取引委員会(SEC)の提出書類、金融ニュース、一般トピック・ソーシャルメディアを対象とする3段階のストレステストにおいて、ファイナンシャル・ネーム・エンティティ・認識(NER)の信頼性推定と選択予測を極端にアウト・オブ・ドメインの状態として検討した。
BERTタグとLoRAで調整したQwen2.5-0.5B/1.5Bモデルを,5つの推論時間信頼信号,3つの訓練種,ブートストラップ間隔を用いて評価した。
完全出力確率はドメイン内エラー検出において最強だが、ドメインが劣化するのに対して、エンティティスパン確率と自己整合性はより堅牢である。
欠落によって文の誤りは34.3%から2%以下に減少し、ドメイン内入力の40%は信頼度が高く、金融ニュースに役立ち続けるが、ソーシャルメディアの過度なシフトの下で有用な大規模なクリーンサブセットを回復することはない。
これらの結果は、予測レベルの信頼性ゲーティングを適用する前に、上流での高度分布シフトを検出する段階的なデプロイメント戦略を動機付けている。
関連論文リスト
- $TCP_α$: Margin-Controlled Confidence estimation for reliable Music Information Retrieval [7.679660052685777]
ディープニューラルネットワークは、しばしば過信であり、誤った予測にも高い信頼を割り当てる。
既存のターゲットは、重複する信頼値を正しい予測と間違った予測に割り当てる一方、決定境界付近のエラーは正しい予測と区別できない信頼スコアを受け取る。
提案するTCP_$は,不特定サンプルに対してマージン制御されたペナルティを導入することで,これらの制限を解消する新しい信頼度ターゲットである。
論文 参考訳(メタデータ) (2026-08-20T17:58:50Z) - Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction [13.176724997257802]
既存のドキュメントベンチマークはクリーンで高品質なサンプルによって支配されています。
鍵情報抽出のための最初のキャリブレーション特化ベンチマークであるConfBenchを紹介する。
我々は,言語的および対数確率的信頼度推定法により,プロプライエタリな4つのVLMとオープンウェイトな3つのVLMを評価した。
論文 参考訳(メタデータ) (2026-08-03T07:03:51Z) - FinBench: Time-Gated Calibration and Uncertainty Benchmarking for Agentic Financial Forecasting [0.0]
FinBenchは、財務予測のためのキャリブレーションと不確実性の品質を評価するために設計されたベンチマークである。
本稿では,ベンチマークの仕様を記述し,パイプラインの健全性チェックとして小さなパイロット走行を報告する。
論文 参考訳(メタデータ) (2026-06-24T01:27:30Z) - Unveiling the Entropy Dynamics of Chain-of-Thought Reasoning [81.57028614960576]
1)信頼性の高い -- 信頼性の高い -- 信頼性の高い領域での回答は高度に正確で安定したものになり、2)高冗長性 -- モデルは正しい回答に達した後ずっと経ってから不必要なトークンを生成する。
これらの特性はより効率的で信頼性の高い推論戦略を解き放つ。
論文 参考訳(メタデータ) (2026-06-01T10:11:14Z) - Confidence-Based Response Abstinence: Improving LLM Trustworthiness via Activation-Based Uncertainty Estimation [7.3923284353934875]
本稿では,大規模言語モデル(LLM)出力の正しさと密接に一致したRAGシステムにおける信頼度推定手法を提案する。
提案手法は、生のフィードフォワードネットワーク(FFN)を自己回帰信号として活用することにより、事前の不確実性定量化手法を拡張した。
我々の結果は、アクティベーションに基づく信頼度モデリングが、信頼性の高いRAGデプロイメントへのスケーラブルでアーキテクチャを意識したパスを提供することを示した。
論文 参考訳(メタデータ) (2025-10-15T16:55:56Z) - Network Inversion for Generating Confidently Classified Counterfeits [11.599035626374409]
視覚分類において、自信のある予測をもたらす入力を生成することは、モデルの振る舞いと信頼性を理解するための鍵となる。
我々はネットワーク・インバージョン・テクニックを拡張してCCC(Confidently Classified Counterfeits)を生成する。
CCCは信頼性に関するモデル中心の視点を提供し、モデルが完全に合成されたアウト・オブ・ディストリビューション・インプットに高い信頼を割り当てることを明らかにする。
論文 参考訳(メタデータ) (2025-03-26T03:26:49Z) - Revisiting Confidence Estimation: Towards Reliable Failure Prediction [53.79160907725975]
多くの信頼度推定法は誤分類誤りを検出するのに有害である。
本稿では, 最先端の故障予測性能を示す平坦な最小値を求めることにより, 信頼性ギャップを拡大することを提案する。
論文 参考訳(メタデータ) (2024-03-05T11:44:14Z) - Cal-SFDA: Source-Free Domain-adaptive Semantic Segmentation with
Differentiable Expected Calibration Error [50.86671887712424]
ドメイン適応型セマンティックセグメンテーションの流行は、ソースドメインデータの漏洩に関する懸念を引き起こしている。
ソースデータの要求を回避するため、ソースフリーなドメイン適応が実現可能なソリューションとして登場した。
校正誘導型ソースフリーなドメイン適応型セマンティックセマンティックセマンティクスフレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-06T03:28:34Z) - When Does Confidence-Based Cascade Deferral Suffice? [69.28314307469381]
カスケードは、推論コストをサンプル毎に適応的に変化させる古典的な戦略である。
deferralルールは、シーケンス内の次の分類子を呼び出すか、または予測を終了するかを決定する。
カスケードの構造に執着しているにもかかわらず、信頼に基づく推論は実際は極めてうまく機能することが多い。
論文 参考訳(メタデータ) (2023-07-06T04:13:57Z) - An evaluation of word-level confidence estimation for end-to-end
automatic speech recognition [70.61280174637913]
エンドツーエンド自動音声認識(ASR)における信頼度推定の検討
4つのよく知られた音声データセットにおける信頼度手法の広範なベンチマークを提供する。
以上の結果から,ロジットを学習温度でスケーリングすることで,強いベースラインが得られることが示唆された。
論文 参考訳(メタデータ) (2021-01-14T09:51:59Z) - Unlabelled Data Improves Bayesian Uncertainty Calibration under
Covariate Shift [100.52588638477862]
後続正則化に基づく近似ベイズ推定法を開発した。
前立腺癌の予後モデルを世界規模で導入する上で,本手法の有用性を実証する。
論文 参考訳(メタデータ) (2020-06-26T13:50:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。