論文の概要: FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction
- arxiv url: http://arxiv.org/abs/2608.00764v1
- Date: Sat, 01 Aug 2026 16:54:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.888931
- Title: FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction
- Title(参考訳): FinDeepIndicator: エンドツーエンド金融指標構築におけるディープリサーチエージェントのベンチマーク
- Abstract要約: FinDeepIndicatorは、エンドツーエンドの金融指標構築においてDeep Research(DR)エージェントを評価するための最初のベンチマークである。
DRエージェントを、公式仕様、データ収集、インジケータ計算、回答生成の4段階にわたって評価する。
米国と中国の両方の市場から抽出された3350のキュレートされた質問応答ペア、10年間の歴史的財務データ、800の上場企業が含まれている。
- 参考スコア(独自算出の注目度): 57.909515451254855
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Financial indicators are essential tools for transforming raw financial data into interpretable measures for various downstream tasks, such as valuation, risk assessment, and economic analysis. However, existing financial benchmarks largely focus on answer-level accuracy and often assume that relevant data are already provided, leaving the assessment of the intermediate process of indicator construction underexplored. In this work, we propose FinDeepIndicator, the first benchmark dedicated to evaluating Deep Research (DR) agents in end-to-end financial indicator construction. Specifically, FinDeepIndicator evaluates DR agents across four stages in indicator construction: formula specification, data collection, indicator calculation, and answer generation, and covers fundamental, technical, and macroeconomic indicators organized into 21 fine-grained sub-categories. It contains 3,350 curated question-answer (QA) pairs derived from both U.S. and Chinese markets, 10 years of historical financial data, and 800 listed companies. Extensive experiments on search-equipped Large Language Models (LLMs) and DR agents show that, while LLMs generally perform well in formula specification, their accuracy drops substantially during data retrieval and numerical execution. DR agents consistently outperform search-equipped LLMs, yet remain unreliable in realistic financial analysis settings. These findings provide insights for developing more capable and trustworthy DR agents in finance.
- Abstract(参考訳): 財務指標は、生の財務データを、評価、リスクアセスメント、経済分析など、さまざまな下流業務の解釈可能な尺度に変換する上で不可欠な手段である。
しかし、既存の金融ベンチマークは主に回答レベルの正確さに重点を置いており、しばしば関連するデータが既に提供されていると仮定し、指標構築の中間過程の評価は未調査のままである。
本研究では、エンドツーエンドの金融指標構築において、Deep Research (DR) エージェントを評価するための最初のベンチマークであるFinDeepIndicatorを提案する。
具体的には、FinDeepIndicatorは、公式仕様、データ収集、指標計算、回答生成の4段階にわたるDRエージェントを評価し、21のきめ細かいサブカテゴリで構成された基本的、技術的、マクロ経済的な指標をカバーしている。
米国と中国の市場から派生した3,350のキュレートされた質問回答(QA)ペア、10年間の歴史的財務データ、800の上場企業が含まれている。
LLM(Large Language Models)とDRエージェント(DRエージェント)の広範囲な実験により、LLMは一般に公式仕様ではよく機能するが、データ検索や数値実行では精度が大幅に低下することが示された。
DRエージェントは検索装備のLLMより一貫して優れているが、現実的な財務分析では信頼性が低い。
これらの知見は、金融においてより有能で信頼性の高いDRエージェントを開発するための洞察を与える。
関連論文リスト
- FinanceHarness: Autonomous Financial Deep Research Framework [41.02718376252945]
FinanceHarnessは金融指向のツールと、実践者向けで自動化された金融深層調査をエンドツーエンドで実行している。
FinanceGymは、論文駆動の研究質問と、プレカットとポストカットの基準を組み合わせたルーリックで構成されている。
論文 参考訳(メタデータ) (2026-07-30T08:32:04Z) - FinSight: Towards Real-World Financial Deep Research [68.31086471310773]
FinSightは、高品質でマルチモーダルな財務報告を作成するための新しいフレームワークである。
プロフェッショナルグレードの可視化を確保するため,反復視覚強調機構を提案する。
2段階のBinging Frameworkは、簡潔な分析セグメントをコヒーレント、引用認識、マルチモーダルレポートに拡張する。
論文 参考訳(メタデータ) (2025-10-19T14:05:35Z) - FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search and Reasoning [30.252244345152956]
FinSearchCompは、現実的でオープンドメインの財務検索と推論のための、初めての完全なオープンソースベンチマークである。
このベンチマークには、世界および大中国市場にわたる635の質問が含まれている。
Grok 4(Web)は、専門家レベルの精度に近づき、グローバルサブセットのトップである。
論文 参考訳(メタデータ) (2025-09-16T15:13:13Z) - FutureX: An Advanced Live Benchmark for LLM Agents in Future Prediction [92.7392863957204]
FutureXは、将来の予測のための最大かつ最も多様なライブベンチマークである。
リアルタイムの日次更新をサポートし、質問収集と回答収集のための自動パイプラインを通じてデータの汚染を取り除く。
推論,検索機能,外部ツールの統合などを含む25のLLM/エージェントモデルを評価した。
論文 参考訳(メタデータ) (2025-08-16T08:54:08Z) - FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering [57.18367828883773]
FinAgentBenchは、ファイナンスにおける多段階推論によるエージェント検索を評価するためのベンチマークである。
このベンチマークは、S&P-500上場企業に関する26Kのエキスパートアノテート例から成っている。
我々は,最先端モデルの集合を評価し,対象の微調整がエージェント検索性能を大幅に向上することを示す。
論文 参考訳(メタデータ) (2025-08-07T22:15:22Z) - FinKario: Event-Enhanced Automated Construction of Financial Knowledge Graph [15.846545572924834]
大規模言語モデル(LLM)は投資家の意思決定能力を高め、財務分析を強化する。
金融知識グラフのイベント強化構築(FinKario)について紹介する。
FinKarioは、プロンプト駆動の抽出を通じて、リアルタイムの企業の基本と市場イベントを自動的に統合する。
大規模金融知識の進化を最適化するための2段階グラフ検索戦略(FinKario-RAG)を提案する。
論文 参考訳(メタデータ) (2025-08-01T13:27:35Z) - FinS-Pilot: A Benchmark for Online Financial RAG System [21.64301644235658]
FinS-Pilotはオンライン金融アプリケーションにおけるRAGシステム評価のための新しいベンチマークである。
我々のベンチマークでは、インテント分類フレームワークによって編成されたリアルタイムAPIデータとテキストデータの両方が組み込まれている。
本研究は,金融NLPシステムの研究を進めるための,実践的評価フレームワークとデータセットの両立に寄与する。
論文 参考訳(メタデータ) (2025-05-31T03:50:19Z) - FinDER: Financial Dataset for Question Answering and Evaluating Retrieval-Augmented Generation [65.04104723843264]
ファイナンスにおけるRetrieval-Augmented Generation(RAG)に適したエキスパート生成データセットであるFinDERを提案する。
FinDERは、ドメインの専門家による検索関連証拠の注釈付けに重点を置いており、5,703のクエリ・エビデンス・アンサー・トリプルを提供している。
大きなコーパスから関連する情報を取得するためにモデルに挑戦することで、FinDERはRAGシステムを評価するためのより現実的なベンチマークを提供する。
論文 参考訳(メタデータ) (2025-04-22T11:30:13Z) - FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models [0.0]
FinanceQAは、LLMのパフォーマンスを実世界の投資業務を反映した複雑な数値分析タスクで評価するテストスイートである。
現在のLLMは、金融機関の厳密な精度要件を満たすことができず、モデルは現実的なタスクの約60%を欠いている。
その結果、このようなタスクをサポートするためには高品質なトレーニングデータが必要であることが示され、OpenAIの微調整APIを使って実験した。
論文 参考訳(メタデータ) (2025-01-30T00:06:55Z) - FinRobot: AI Agent for Equity Research and Valuation with Large Language Models [6.2474959166074955]
本稿では、エクイティリサーチに特化したAIエージェントフレームワークであるFinRobotについて述べる。
FinRobotはマルチエージェント・チェーン・オブ・シント(CoT)システムを採用し、定量分析と定性的分析を統合し、人間のアナリストの包括的な推論をエミュレートする。
CapitalCubeやWright Reportsのような既存の自動研究ツールとは異なり、FinRobotは大手ブローカー会社や基礎研究ベンダーと同等の洞察を提供する。
論文 参考訳(メタデータ) (2024-11-13T17:38:07Z) - PIXIU: A Large Language Model, Instruction Data and Evaluation Benchmark
for Finance [63.51545277822702]
PIXIUは、命令データ付き微調整LLaMAに基づく最初の金融大規模言語モデル(LLM)を含む包括的なフレームワークである。
我々はLLaMAを細調整してFinMAを提案する。
我々は、FinMAと既存のLLMを詳細に分析し、重要な財政課題に対処する際の長所と短所を明らかにする。
論文 参考訳(メタデータ) (2023-06-08T14:20:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。