論文の概要: FinReportBench: Measuring and Improving Institution-Grade Financial Report Generation
- arxiv url: http://arxiv.org/abs/2608.04374v1
- Date: Wed, 05 Aug 2026 02:31:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.691318
- Title: FinReportBench: Measuring and Improving Institution-Grade Financial Report Generation
- Title(参考訳): FinReportBench:institution-Grade Financial Report Generationの測定と改善
- Authors: Yinghao Tang, Tan Zhenwei, Yiyao Wang, Wanli Gu, Xiaolu Zhang, Jun Zhou, Wei Chen,
- Abstract要約: FinReportBenchは、機関レベルの財務報告の生成を測定し改善するための専門家によるベンチマークである。
専門的な部分順序,マルチモーダルなエビデンス,意思決定境界の監査を通じて,35項目のルーリックを導出する。
3つの独立した裁判官ファミリーは、ほぼ収監率で専門家の部分的な秩序を再現する。
- 参考スコア(独自算出の注目度): 17.12638747836057
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models can produce fluent financial analysis, but fluency alone does not establish whether a report is suitable for institutional delivery. We introduce FinReportBench, an expert-grounded benchmark for measuring and improving institution-grade financial report generation. Expert review reveals recurring gaps in report identity, institutional components, source discipline, and visual delivery. We derive a 35-item rubric through expert partial orders, multimodal evidence, and audits of decision boundaries, covering deliverability, report identity, and institutional completeness. Starting from 10,000 balanced Chinese and English financial-research source records, we curate 244 bilingual tasks across three research objects and two input tiers. Each task separates the public query, reconstructed research trajectory, and hidden source packet. Three independent judge families reproduce the expert partial order at near-ceiling rates, showing that bounded, observable criteria support reliable evaluation. Across nine model families, basic deliverability is nearly saturated, while report identity and institutional completeness remain the primary bottlenecks. The largest cross-model gaps concern generation-trace control, information density, and data discipline rather than basic report framing. We then use benchmark-guided skill distillation to turn recurrent failures into reusable generation and self-review constraints. Across five model families, the evolved skill improves mean G1 by 33.85 points and mean G2 by 13.83 points over paired no-skill runs while preserving G0 for every pair. Code and benchmark artifacts are available at https://github.com/MisterBrookT/finreportbench.
- Abstract(参考訳): 大規模言語モデルでは、流動的な財務分析が可能であるが、報告書が制度的配信に適しているかは、流布だけでは定かではない。
我々はFinReportBenchを紹介した。FinReportBenchは、機関レベルの財務報告の生成を測定し改善するための専門家によるベンチマークである。
専門家のレビューでは、レポートのアイデンティティ、制度的なコンポーネント、ソースの規律、視覚的デリバリの欠如が繰り返し明らかになっている。
我々は,専門的な部分的注文,マルチモーダルな証拠,意思決定境界の監査,納品可能性,報告の同一性,制度的完全性などを通じて,35項目のルーリックを導出する。
1万のバランスのとれた中国語と英語の財務調査資料から始まり、3つの研究対象と2つの入力レベルにまたがる244のバイリンガルタスクをキュレートする。
各タスクは、公開クエリ、再構成された研究軌跡、および隠されたソースパケットを分離する。
3つの独立した裁判官ファミリーは,有界で観察可能な基準が信頼性の高い評価をサポートすることを示すため,準収率で専門家の半順序を再現する。
9つのモデルファミリー全体では、基本的な納品性がほぼ飽和しており、報告のアイデンティティと制度的完全性が主要なボトルネックとなっている。
最大のクロスモデルギャップは、基本的なレポートフレーミングよりも、生成トレース制御、情報密度、データ規律に関するものである。
次に、ベンチマーク誘導型スキル蒸留を用いて、繰り返し発生する障害を再利用可能な生成と自己レビューの制約に変換する。
5つのモデルファミリーで、進化したスキルは平均G1を33.85ポイント改善し、G2を13.83ポイント改善し、ペアごとにG0を保存する。
コードとベンチマークアーティファクトはhttps://github.com/MisterBrookT/finreportbench.comで入手できる。
関連論文リスト
- HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research [52.87128503345243]
我々は,Deep Researchにおける階層的エビデンス・アグリゲーションを評価するためのベンチマークであるHiEviDR-Benchを紹介する。
HiEviDR-Benchは、エビデンスの選択、クロスソースリンク、アグリゲーションをキャプチャする明示的なエビデンスグラフを持つ各インスタンスを表す。
報告品質,エビデンストレーサビリティ,引用精度,クレーム検証,回答正当性という5次元のトレーサビリティ指向評価フレームワークを開発した。
論文 参考訳(メタデータ) (2026-07-27T23:50:46Z) - DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation [2.0095457635839455]
最先端の研究製品は、既存のベンチマークで高いスコアを得ます。
現在のフロンティアの既存のベンチマークよりもはるかに難しいベンチマークであるDeepWeb-Benchを紹介します。
論文 参考訳(メタデータ) (2026-05-20T17:59:03Z) - From Comprehension to Reasoning: A Hierarchical Benchmark for Automated Financial Research Reporting [19.0993436440595]
FinReasoningは、中国のリサーチレポート生成を3段階に分解するベンチマークだ。
評価結果に基づいて、FinReasoningはほとんどのモデルが理解と実行のギャップを示すことを示した。
論文 参考訳(メタデータ) (2026-02-25T13:44:58Z) - Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings [31.87459935714186]
Fin-RATE(フィン・ラテ)は、米国証券取引委員会(SEC)の申請書類と財務アナリストを反映したベンチマークである。
我々は、オープンソース、クローズドソース、金融特化モデルにまたがって、Large Language Models(LLM)をリードする17のベンチマークを行った。
その結果、タスクが単一文書推論から縦断的、横断的分析へ移行するにつれて、精度が18.60%低下し、14.35%低下した。
論文 参考訳(メタデータ) (2026-02-07T00:54:37Z) - FactNet: A Billion-Scale Knowledge Graph for Multilingual Factual Grounding [81.2130536158575]
LLMは顕著な流布を示し、その効用は事実の幻覚と追跡可能な証明の欠如によってしばしば損なわれる。
私たちはFactNetを紹介します。FactNetは17億の原子的主張と、316のウィキペディア版から派生した37億の監査可能なエビデンスポインタを統合するために設計された、巨大なオープンソースリソースです。
論文 参考訳(メタデータ) (2026-02-03T11:44:11Z) - DEER: A Comprehensive and Reliable Benchmark for Deep-Research Expert Reports [49.217247659479476]
ディープリサーチシステムは、多段階の推論とエビデンスベースの合成を通じて専門家レベルのレポートを生成することができる。
既存のベンチマークは、エキスパートレポートの体系的な基準を欠いていることが多い。
専門家レベルのディープリサーチレポートを評価するためのベンチマークであるDEERを紹介する。
論文 参考訳(メタデータ) (2025-12-19T16:46:20Z) - FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs [40.216867348210265]
FinAuditingは、財務監査タスクを評価するための最初の分類基準であり、構造を意識したマルチドキュメントのベンチマークである。
本物のアメリカ製である。
FinAuditingは3つの補完的なサブタスク、セマンティック一貫性のためのFinSM、リレーショナル一貫性のためのFinRE、数値一貫性のためのFinMRを定義している。
13の最先端のLCMに関する大規模なゼロショット実験は、現在のモデルが意味論、関係論、数学的次元で矛盾なく機能することを明らかにする。
論文 参考訳(メタデータ) (2025-10-10T00:41:55Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering [57.18367828883773]
FinAgentBenchは、ファイナンスにおける多段階推論によるエージェント検索を評価するためのベンチマークである。
このベンチマークは、S&P-500上場企業に関する26Kのエキスパートアノテート例から成っている。
我々は,最先端モデルの集合を評価し,対象の微調整がエージェント検索性能を大幅に向上することを示す。
論文 参考訳(メタデータ) (2025-08-07T22:15:22Z) - MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application [118.63802040274999]
MultiFinBen は、現実的な財務状況下で LLM を評価するための、最初のエキスパートアノテーション付き多言語(5言語)およびマルチモーダルベンチマークである。
財務理由付けテストは、書類やニュースと統合された言語間のエビデンスと、スキャンされた文書から構造化されたテキストを抽出する財務OCRである。
21個のLLMを評価したところ、GPT-4oのようなフロンティアのマルチモーダルモデルでさえ、視力とオーディオが強く、多言語設定では急激に低下するが、全体の46.01%しか達成していないことが示されている。
論文 参考訳(メタデータ) (2025-06-16T22:01:49Z) - DeepTrust: A Reliable Financial Knowledge Retrieval Framework For
Explaining Extreme Pricing Anomalies [0.0]
DeepTrustは、Twitter上の信頼できる金融知識検索フレームワークで、極端な価格変動を高速で説明する。
提案するフレームワークは,異常検出,情報検索,信頼性評価のための3つのモジュールから構成される。
このフレームワークは2021年4月29日と30日の2つの自己注釈付き金融異常、すなわちTwitterとFacebookの株価で評価されている。
論文 参考訳(メタデータ) (2022-03-11T06:29:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。