論文の概要: Agentic Retrieval-Augmented Generation for Financial Document Question Answering
- arxiv url: http://arxiv.org/abs/2605.05409v1
- Date: Wed, 06 May 2026 19:59:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.400895
- Title: Agentic Retrieval-Augmented Generation for Financial Document Question Answering
- Title(参考訳): 財務文書質問応答のためのエージェント検索強化生成
- Abstract要約: FinAgent-RAGは、反復的な検索推論ループを自己組織化してオーケストレーションするエージェントRAGフレームワークである。
コントラシティブ・ファイナンシャル・レトリバー(Contrastive Financial Retriever)は、意味的には似ているが数値的に異なる金融パスを区別するために、厳しい負の採掘で訓練されたコントラシティブ・ファイナンシャル・レトリバーを統合している。
76.81%、78.46%、74.96%の精度で最強のベースラインを5.62-9.32ポイント上回っている。
- 参考スコア(独自算出の注目度): 7.56842616602779
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Financial document question answering (QA) demands complex multi-step numerical reasoning over heterogeneous evidence--structured tables, textual narratives, and footnotes--scattered across corporate filings. Existing retrieval-augmented generation (RAG) approaches adopt a single-pass retrieve-then-generate paradigm that struggles with the compositional reasoning chains prevalent in financial analysis. We propose FinAgent-RAG, an agentic RAG framework that orchestrates iterative retrieval-reasoning loops with self-verification, specifically engineered for the precision requirements of financial numerical reasoning. The framework integrates three domain-specific innovations: (1) a Contrastive Financial Retriever trained with hard negative mining to distinguish semantically similar but numerically distinct financial passages, (2) a Program-of-Thought reasoning module that generates executable Python code for precise arithmetic rather than relying on error-prone LLM-based mental computation, and (3) an Adaptive Strategy Router that dynamically allocates computational resources based on question complexity, reducing API costs by 41.3% on FinQA while preserving accuracy. Extensive experiments on three benchmark datasets--FinQA, ConvFinQA, and TAT-QA--demonstrate that FinAgent-RAG achieves 76.81%, 78.46%, and 74.96% execution accuracy respectively, outperforming the strongest baseline by 5.62--9.32 percentage points. Ablation studies, cross-backbone evaluation with four LLMs, and deployment cost analysis confirm the framework's robustness and practical viability for financial institutions.
- Abstract(参考訳): 財務文書質問応答(QA)は、異質な証拠(構造化された表、テキストの物語、脚注など)に対する複雑な多段階の数値推論を要求する。
既存の検索強化世代 (RAG) アプローチは、財務分析でよく見られる構成的推論連鎖に苦慮する単一パスの検索生成パラダイムを採用する。
本稿では,自己検証による反復的検索推論ループを編成するエージェントRAGフレームワークFinAgent-RAGを提案する。
このフレームワークは、3つのドメイン固有のイノベーションを統合している。(1) ハード・ネガティブ・マイニングで訓練されたコントラスト・ファイナンシャル・リトリバー(Contrastive Financial Retriever)は、セマンティックに類似しているが数値的に異なるファイナンシャル・パスを区別するため、(2) エラーを発生させるLCMベースのメンタル・コンピューティングではなく、正確な算術のために実行可能なPythonコードを生成するプログラム・オブ・ソーシング・モジュール(Program-of-Thought reasoning Module)、(3) 質問複雑性に基づいて計算リソースを動的に割り当てる適応戦略ルータ(Adaptive Strategy Router)は、精度を維持しながらFinQA上で41.3%削減する。
FinAgent-RAGが76.81%、78.46%、74.96%という3つのベンチマークデータセット(-FinQA, ConvFinQA, TAT-QA-demonstrate)の大規模な実験により、最強のベースラインを5.62-9.32ポイント上回った。
4つのLCMによる相互バックボーン評価,およびデプロイメントコスト分析により,金融機関における枠組みの堅牢性と実用性が確認された。
関連論文リスト
- V-FiLLM: Verified Financial LLM Reasoning Benchmark [0.37189423451031356]
V-FiLLMは,実テーブルに接地した計算木から金銭的推論ベンチマークを生成するフレームワークである。
V-FiLLMは計算深度、表現幅、財務概念の複雑さ、コンテキストサイズなど、独立に制御可能な4つの困難軸を公開する。
検証された連鎖トレースの軽量なLoRA微調整により、ホールドアウト問題において81.1%から85.6%の精度が向上することを示す。
論文 参考訳(メタデータ) (2026-08-11T15:18:47Z) - MimirRAG: A Multi-Agent RAG Framework for Financial Data Retrieval with Metadata Integration [0.29360071145551064]
Retrieval-augmented Generation (RAG) システムは、大型言語モデル(LLM)における幻覚の低減と解答精度の向上に有望なアプローチを提供する。
本稿では,これらの課題に対処するために反復的に開発されたマルチエージェントパイプラインシステムであるMimirRAGを紹介する。
MimicRAGは、PDFファイルの構造保存構文解析、テーブル対応チャンキング、メタデータ抽出、クエリ計画を伴うエージェントベースの検索、ハイブリッド検索、バリデーション、数値推論をサポートするコンテキスト認識生成を含むモジュラーパイプラインを備えている。
論文 参考訳(メタデータ) (2026-05-24T12:15:27Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains [79.14584837105808]
MC-Searchは5つの代表的推論構造にまたがる長いステップワイドなアノテート推論チェーンを持つエージェントMM-RAGの最初のベンチマークである。
回答精度以外にも、MC-Searchは、品質、段階的検索、計画精度を推論するための新しいプロセスレベルメトリクスを導入している。
エージェントMM-RAGパイプラインを統一的に開発することにより、6つのMLLMをベンチマークし、過剰検索や過度検索、モダリティミスアライメント計画などの体系的な問題を明らかにする。
論文 参考訳(メタデータ) (2026-03-01T02:25:57Z) - Bridging the Arithmetic Gap: The Cognitive Complexity Benchmark and Financial-PoT for Robust Financial Reasoning [11.522192050185568]
大規模言語モデルは,「認知的幻覚」と「認知的崩壊」というシステム的失敗モードに悩まされる
実世界95の中国Aシェア年次レポートから構築したデータセットをベースとした,堅牢な評価フレームワークであるCognitive Complexity Benchmark(CCB)を紹介する。
本稿では,これらの障害に対処するための反復的デュアル・パース・ファイナンシャル・PoTフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T01:33:33Z) - VERAFI: Verified Agentic Financial Intelligence through Neurosymbolic Policy Generation [2.43679682660038]
VERAFIは、検証された金融インテリジェンスのためのニューロシンボリックポリシー生成のためのエージェントフレームワークである。
VERAFIは最先端の高密度検索とクロスエンコーダを、金融ツール対応エージェントと自動推論ポリシーと組み合わせている。
論文 参考訳(メタデータ) (2025-12-12T17:17:43Z) - FinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering [57.43420753842626]
FinLFQAは、複雑な財務問題に対する長文の回答を生成するための大規模言語モデルの能力を評価するために設計されたベンチマークである。
回答品質と属性品質の両方をカバーする自動評価フレームワークを提供する。
論文 参考訳(メタデータ) (2025-10-07T20:06:15Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Enhancing Financial RAG with Agentic AI and Multi-HyDE: A Novel Approach to Knowledge Retrieval and Hallucination Reduction [0.5814806132299305]
我々は、金融レトリヴァル強化世代(RAG)のための枠組みを導入する。
RAGは、大規模で構造化された財務コーパスからの検索の有効性とカバレッジを高めるために、複数の無意味なクエリを生成する。
私たちのパイプラインはトークン効率と多段階の財務推論に最適化されています。
論文 参考訳(メタデータ) (2025-09-19T19:24:30Z) - FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering [57.18367828883773]
FinAgentBenchは、ファイナンスにおける多段階推論によるエージェント検索を評価するためのベンチマークである。
このベンチマークは、S&P-500上場企業に関する26Kのエキスパートアノテート例から成っている。
我々は,最先端モデルの集合を評価し,対象の微調整がエージェント検索性能を大幅に向上することを示す。
論文 参考訳(メタデータ) (2025-08-07T22:15:22Z) - FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning [82.7292329605713]
FinChainは、ファイナンスにおける検証可能なChain-of-Thought評価のために特別に設計された最初のベンチマークである。
12の金融ドメインに58のトピックがあり、それぞれがパラメータ化されたシンボリックテンプレートと実行可能なPythonトレースで表現されている。
FinChainは、多段階の財務推論における永続的な弱点を明らかにし、信頼できる、解釈可能な、検証可能な金融AIを開発するための基盤を提供する。
論文 参考訳(メタデータ) (2025-06-03T06:44:42Z) - DianJin-R1: Evaluating and Enhancing Financial Reasoning in Large Language Models [13.567516575993546]
金融分野における大規模言語モデル(LLM)の推論強化フレームワークであるDianJin-R1を提案する。
我々のアプローチの中心は、CFLUE、FinQA、および独自コンプライアンスコーパス(中国コンプライアンスチェック、CCC)から構築された高品質なデータセットであるDianJin-R1-Dataである。
我々のモデルであるDianJin-R1-7BとDianJin-R1-32Bは、Qwen2.5-7B-InstructとQwen2.5-32B-Instructから、推論ステップと最終回答の両方を生成する構造化形式を用いて微調整される。
論文 参考訳(メタデータ) (2025-04-22T09:01:04Z) - FinTextQA: A Dataset for Long-form Financial Question Answering [10.1084081290893]
FinTextQAは金融における長文質問応答(LFQA)のための新しいデータセットである。
我々のデータセット上で最も効果的なシステム構成は、組込み器、レトリバー、リランカー、ジェネレータをAda2、Automated Merged Retrieval、Bge-Reranker-Base、Baichuan2-7Bとして設定することであった。
論文 参考訳(メタデータ) (2024-05-16T10:53:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。