論文の概要: FinExam-10K: When Retrieval Helps Financial Reasoning?
- arxiv url: http://arxiv.org/abs/2608.28155v1
- Date: Fri, 28 Aug 2026 10:16:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.271858
- Title: FinExam-10K: When Retrieval Helps Financial Reasoning?
- Title(参考訳): FinExam-10K:Retrievalが金銭的推論に役立ったのはいつ?
- Abstract要約: FinExam-10Kはイングランドで最大のベンチマークである。
5,110の質問と5,088のシークエンサーを四半期のリーダーボードとしてリリースします。
17モデルで最高の精度は85.29%である。
- 参考スコア(独自算出の注目度): 19.76339173724579
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Professional financial examinations require models to combine domain knowledge, calculation, and judgment, yet no benchmark covers the full CFA and FRM structure under one protocol. We introduce FinExam-10K, to our knowledge the largest reported English benchmark for this setting, with 10,198 expert-reannotated questions spanning CFA Levels I-III and FRM Parts I-II. We release 5,110 questions and sequester 5,088 for a quarterly maintained leaderboard. To separate coverage from local answerability, we report a 10,198-item Full-Coverage Track and a 7,625-item Context-Complete Reasoning Track, which is the primary basis for claims about reasoning from the supplied record. Across 17 models, the best accuracy is 85.29% overall. On the frozen Hard band, the best score is 34.68% on the Full-Coverage Track and 54.57% on the 372 context-complete items. All 17 models share 47 context-complete failures. Function-RAG and FunctionGraph-RAG rescue hundreds of errors but also overturn many correct answers, producing little or negative net gain. A gate trained only on public data decides from the question and initial response when FunctionGraph-RAG should run. On the 5,088 held-out items, the gate invokes FunctionGraph-RAG for 7.9% of questions and improves accuracy from 70.83% to 71.23% (p = .0446).
- Abstract(参考訳): 専門的な財務検査では、ドメイン知識、計算、判断を組み合わせたモデルが必要ですが、完全なCFAとFRM構造を1つのプロトコルでカバーするベンチマークはありません。
CFAレベルI-IIIとFRMパートI-IIにまたがる10,198のエキスパート関連質問が寄せられ、FinExam-10Kを紹介した。
四半期に5,110の質問とシークエンサー5,088のリーダーボードをリリースします。
本報告では, 局所解答可能性から, 10,198-item 完全乗算トラックと7,625-item Context-Complete Reasoning Trackについて報告する。
17モデルで最高の精度は85.29%である。
フリーズ・ハード・バンドでは34.68%がフル・カファージ・トラック、372のコンテクスト・コンプリート・アイテムで54.57%がベストスコアである。
17のモデルは全て、47のコンテキスト完全障害を共有している。
Function-RAGとFunctionGraph-RAGは、数百のエラーを救ったが、多くの正しい回答を覆し、ほとんどあるいは負の利益を生んだ。
公開データのみに基づいてトレーニングされたゲートは、FunctionGraph-RAGの実行時の質問と初期応答から決定する。
5,088項目において、ゲートは7.9%の質問に対してFunctionGraph-RAGを呼び出し、精度を70.83%から71.23%に改善する(p = .0446)。
関連論文リスト
- AgentFinVQA: A Deployable Multi-Agent Pipeline for Auditable Financial Chart QA [7.135926644099901]
我々はAgentFinVQAを提案する。AgentFinVQAはマルチエージェントパイプラインで、各クエリをプランニング、OCR、レジェンドグラウンド、ビジュアルインスペクション、検証に分解する。
FinMMEでは、AgentFinVQAはプロプライエタリなバックボーンを持つゼロショットベースラインにマッチするプライマリバックボーンよりも$+7.68$ ppを改善している。
誤り分析は、疑問の誤解、伝説の混乱、抽出誤りが失敗の3分の2近くを占めていることを示している。
論文 参考訳(メタデータ) (2026-06-18T04:33:07Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - FinRetrieval: A Benchmark for Financial Data Retrieval by AI Agents [3.5621895565039203]
FinRetrievalは、ファイナンシャル検索に関する500の質問と、根拠となる真実の回答のベンチマークである。
Claude Opusは構造化データAPIで90.8%の精度を達成しているが、Web検索だけでは19.8%に過ぎない。
論文 参考訳(メタデータ) (2026-01-02T17:51:37Z) - Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements [78.87065404966002]
既存のベンチマークは、主に質問レベルで質問をキュレートする。
ベンチマーク構築をゼロから再考するステートメントベースのベンチマークであるEncyclo-Kを提案する。
論文 参考訳(メタデータ) (2025-12-31T13:55:54Z) - LLM-as-a-Judge for Scalable Test Coverage Evaluation: Accuracy, Operational Reliability, and Cost [1.7133809948345597]
構造化評価を用いた受入テスト評価のための実運用対応フレームワークを提案する。
正確性、運用上の信頼性、コストにまたがる最初の包括的分析を提供する。
私たちは、データセット、フレームワーク、そしてデプロイをサポートするためのコードをリリースします。
論文 参考訳(メタデータ) (2025-12-01T03:19:33Z) - Shoot First, Ask Questions Later? Building Rational Agents that Explore and Act Like People [81.63702981397408]
限られたリソースを前提として、言語モデル(LM)に基づいたエージェントは、どの程度合理的に行動するのか?
エージェント情報探索をベンチマークし,強化する手法を開発し,人間の行動から洞察を抽出する。
Spotterエージェントでは、LMのみのベースラインよりも14.7%の精度で精度を向上し、Captainエージェントでは、期待情報ゲイン(EIG)を0.227ビット(達成可能なノイズ天井の94.2%)まで引き上げる。
論文 参考訳(メタデータ) (2025-10-23T17:57:28Z) - FinanceReasoning: Benchmarking Financial Numerical Reasoning More Credible, Comprehensive and Challenging [10.175739273593985]
FinanceReasoningは、金融数値推論問題における大きな推論モデル(LRM)の推論能力を評価するために設計された新しいベンチマークである。
4つの公開データセットからの質問の15.6%を更新し、詳細なPythonソリューションで908の新たな質問を注釈付けします。
我々は、3,133個のPython形式の関数を構築し、LEMの金銭的推論能力を高める。
論文 参考訳(メタデータ) (2025-06-06T07:53:58Z) - PRover: Proof Generation for Interpretable Reasoning over Rules [81.40404921232192]
本稿では,ルールベース上の二項質問に応答し,対応する証明を生成するトランスフォーマーモデルを提案する。
本モデルは,効率的な制約付き学習パラダイムを用いて,証明グラフに対応するノードやエッジを予測できることを学習する。
我々は、QAと証明生成のための有望な結果を示すために、合成、手書き、人文による規則ベースの実験を行う。
論文 参考訳(メタデータ) (2020-10-06T15:47:53Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。