論文の概要: FinRank: An Evidence-Grounded Benchmark for Financial Question Answering and Retrieval over SEC Filings
- arxiv url: http://arxiv.org/abs/2608.07400v1
- Date: Fri, 07 Aug 2026 16:45:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.566931
- Title: FinRank: An Evidence-Grounded Benchmark for Financial Question Answering and Retrieval over SEC Filings
- Title(参考訳): FinRank:SEC(証券取引委員会)のファイナンス調査と検索のベンチマーク
- Abstract要約: FinRankは、意図した実体、報告期間、開示コンテキストの証拠をシステムに特定することを要求することによって、証明に敏感な検索問題をターゲットにしている。
このベンチマークには、22社の10-Kと10-Qに関する質問応答記録が1185件含まれている。
FinRankは、パス検索、再ランク付け、ハードネガティブな識別を別々に測定したタスクとして評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Financial question answering is typically evaluated by answer correctness, yet in SEC filings a plausible and even numerically correct answer can be grounded in the wrong evidence. Similar facts and disclosures recur across sections of a filing, across reporting periods of the same firm, and across comparable firms. FinRank targets this provenance-sensitive retrieval problem by requiring systems to identify evidence for the intended entity, reporting period, and disclosure context. The benchmark contains 1185 manually authored question-answer records over the 10-K and 10-Q filings of 22 companies. Each record includes a reference answer, gold supporting passages, and hand-curated hard negatives drawn from confusable passages within filings, across reporting periods, and across comparable firms. FinRank evaluates passage retrieval, reranking, and hard-negative discrimination as separately measured tasks. Baseline results demonstrate the difficulty of this setting: among the evaluated systems, even a 7B instruction-tuned embedder reaches only 44.8% Recall@10 on the pooled evidence corpus; sub-billion-parameter encoders gain at most 3.5 points over BM25, a finance-adapted embedder trails BM25 by 9.7 points, and pairwise accuracy falls by 13.0-20.5 percentage points when random negatives are replaced with the curated hard negatives. FinRank provides an evidence-first benchmark for developing financial question answering systems that are not only accurate but also grounded in the correct disclosure.
- Abstract(参考訳): 財務的な質問応答は典型的には回答の正当性によって評価されるが、SECの提出書類では、正確な数値的正解さえも間違った証拠に根拠を付けることができる。
同様の事実や開示は、申請書のセクション、同一企業の報告期間、および同等の企業間で繰り返される。
FinRankは、意図した実体、報告期間、開示コンテキストの証拠をシステムに特定することを要求することで、この証明に敏感な検索問題をターゲットにしている。
このベンチマークには、22社の10-Kと10-Qに関する質問応答記録が1185件含まれている。
それぞれの記録には、基準回答、金の支持パス、手書きのハード・ネガが記載されている。
FinRankは、パス検索、再ランク付け、ハードネガティブな識別を別々に測定したタスクとして評価する。
評価システムでは、7B命令で調整された埋め込み機でさえ、プールされたエビデンスコーパス上で44.8%しかリコール@10に到達せず、サブビリオンパラメータエンコーダは、BM25よりも3.5ポイント以上上昇し、財務に適応した埋め込み機トレイルBM25は9.7ポイント、ランダムな負がキュレートされたハードネガに置き換えられた場合、ペアの精度は13.0-20.5ポイント低下する。
FinRankは、正確なだけでなく、正しい開示にも根ざした金融質問応答システムを開発するためのエビデンスファーストのベンチマークを提供している。
関連論文リスト
- Enhancing Financial Question Answering: A Novel Benchmark Dataset of Banks' financial statements [6.625637186756314]
金融質問応答のための新しいベンチマークデータセットであるFinRAG-QAを紹介する。
FinRAG-QAは、平均198kワードのドキュメントを横断的に検索する。
コンテキストチャンク濃縮と検索最適化埋め込みモデルを組み合わせると、NDCG@10は0.322から0.710に上昇する。
論文 参考訳(メタデータ) (2026-09-03T10:52:56Z) - Auditable by Construction: An Ontology-Driven Framework for Trustworthy LLM Analytics in Enterprise Finance [0.0]
本稿では, 企業財務における検索強化世代を, 精度とともに監査可能性に基づいて評価すべきである,と論じる。
オントロジー駆動の知識システムを構築するKDAF(Knowledge-Driven Analytics Framework)を6つの反復的な段階を通じて紹介する。
FinanceBench (145 質問) の評価では、KDAF をゼロコンテキスト推論、BM25、概念重み付き語彙検索、非接地グラフトラバーサルと比較する。
論文 参考訳(メタデータ) (2026-08-21T01:35:34Z) - FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI Systems [0.0]
FinRCA-Benchは、14の運用テーブルにまたがる2250の口座支払い可能な銀行間和解ケースのベンチマークである。
その結果,構造的検索の失敗は,95~15の精度で推理的検索の失敗をはるかに上回っていることがわかった。
FinRCA-Benchでは、検索アーキテクチャがAIシステムの性能を強く観察し、ルート原因ラベルは聴覚診断の弱いプロキシである。
論文 参考訳(メタデータ) (2026-08-19T04:36:01Z) - Can Language Models Identify Shadow Trading Targets? An NLP Evaluation of SEC Enforcement Theory [1.1599570446840544]
我々は、NLPがSECの理論が既に知っていると想定していることをできるかどうか尋ねる。
我々は5つの業界にまたがる30のM&Aイベントのセマンティックな類似点と、発表日の異常な株価リターンとを関連づける。
しかし、完全なデータセット全体では、関連性は見つからない。
論文 参考訳(メタデータ) (2026-08-02T15:42:14Z) - AWARE-FX: An Auditable Knowledge-Guided AI System for Measuring Corporate Foreign-Exchange Hedging Disclosure [5.667104793245957]
企業年次報告書には、外国為替リスク管理、デリバティブ・ユース、ナチュラル・ヘッジ、明示的な非使用に関する弱い構造化された証拠が含まれている。
本研究では,AI/NLP意思決定支援システムであるAWARE-FXを開発した。
論文 参考訳(メタデータ) (2026-07-30T02:58:46Z) - Overview of FinMMEval 2026 Task 2: Multilingual Financial Short-Answer Question Answering [59.6753725406784]
FinMMEval 2026 Task 2は、多言語的証拠に対して答える短時間の財務問題を評価する。
最終テストセットには256項目が含まれており、易度と熟練度を均等に分けている。
最強のシステムは密集しており、上位4つはROUGE-1 F1の1ポイント未満で分離されている。
論文 参考訳(メタデータ) (2026-07-22T07:54:17Z) - Confidently Wrong: Detecting Hallucinations in Financial Question Answering from LLM Internal States [0.0]
厳密で不確実な回答は精査を招待する一方、自信のあるエラーは警告なしで下流の判断を静かに低下させる。
モデルの内部アクティベーションから、どれほど確実にそのような自信ある答え、あるいは自信ある幻覚が検出できるかを問う。
残差ストリーム上で線形プローブを訓練し、2つの確立された質問応答ベンチマークで評価する。
論文 参考訳(メタデータ) (2026-07-13T11:22:25Z) - MoCA-Agent: A Market-of-Claims Code Agent for Financial and Numerical Reasoning [47.751319722749116]
textscMOCA-Agentは、フリーフォームのマルチエージェントの議論をクレームレベルの検証に置き換える、有望なコードエージェントである。
このシステムは、各質問をタイプされた原子的クレームに分解し、専門家のトレーダーにそれらのクレームの売買を依頼し、信頼度の高い受け入れ/拒絶決定へと命令をクリアする。
コード認識検証器は、実行、構造整合性、一般的な金銭的推論エラーのプログラムをチェックする。
論文 参考訳(メタデータ) (2026-06-10T00:45:39Z) - Measurement Risk in Supervised Financial NLP: Rubric and Metric Sensitivity on JF-ICR [1.7107991816118835]
我が国の金融インシシデント・コミット認識における測定リスクについて検討する。
ルーブリックな単語は、モデル指定ラベルを根本的に変えることが判明した。
すべての計量は、JF-ICRクラス分布の下では情報的ではない。
論文 参考訳(メタデータ) (2026-04-30T03:39:14Z) - FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim Verification [13.891522069967507]
FinGroundは、ファイナンシャルドキュメントQAのための検証済みの地上パイプラインである。
ステージ1は、テキストとテーブル上でファイナンス対応のハイブリッド検索を行う。
ステージ2は6種類の財政分類で分類された原子的主張に答えを分解する。
ステージ3は、段落とテーブルセルレベルの引用で、サポートされたクレームを書き換える。
論文 参考訳(メタデータ) (2026-04-26T07:52:59Z) - Evaluating LLMs in Finance Requires Explicit Bias Consideration [88.38155218924999]
ファイナンス固有のバイアスは、パフォーマンスを低下させ、バックテストを汚染し、報告された結果をデプロイメントのクレームに役に立たないものにする。
一つのバイアスが28%以上の研究で議論されることはない。
本稿では,バイアス診断と将来のシステム設計のための最小限の要件を満たす構造的妥当性フレームワークと評価チェックリストを提案する。
論文 参考訳(メタデータ) (2026-02-15T17:02:01Z) - FinCARDS: Card-Based Analyst Reranking for Financial Document Question Answering [46.71622104797789]
FinCardsは、ファイナンシャル・アウェア・スキーマの下で、制約満足度として財務証拠の選択を再構成する構造化されたリグレード・フレームワークである。
証拠は、安定性を意識したアグリゲーションを備えたマルチステージトーナメントを通じて選択され、監査可能な決定トレースを生成する。
論文 参考訳(メタデータ) (2026-01-11T17:03:24Z) - All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection [67.89888669159899]
RFC Benchは、現実的なニュースの下で財務的な誤情報に関する大規模な言語モデルを評価するためのベンチマークである。
このベンチマークでは、2つの補完的なタスクが定義されている。
論文 参考訳(メタデータ) (2026-01-07T18:18:28Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。