論文の概要: Benchmarking Multi-Agent LLM Architectures for Financial Document Processing: A Comparative Study of Orchestration Patterns, Cost-Accuracy Tradeoffs and Production Scaling Strategies
- arxiv url: http://arxiv.org/abs/2603.22651v1
- Date: Tue, 24 Mar 2026 00:02:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.225889
- Title: Benchmarking Multi-Agent LLM Architectures for Financial Document Processing: A Comparative Study of Orchestration Patterns, Cost-Accuracy Tradeoffs and Production Scaling Strategies
- Title(参考訳): 財務文書処理のためのマルチエージェントLCMアーキテクチャのベンチマーク:オーケストレーションパターン,コスト-精度トレードオフ,生産スケーリング戦略の比較検討
- Authors: Siddhant Kulkarni, Yukta Kulkarni,
- Abstract要約: 財務文書から構造化情報を抽出するための4つのマルチエージェントオーケストレーションアーキテクチャを比較した。
反射的アーキテクチャは、最高フィールドレベルF1(0.943)を達成するが、シーケンシャルベースラインのコストは2.3倍である。
本稿では, セマンティックキャッシング, モデルルーティング, 適応再試行戦略に関するアブレーション研究を行い, ハイブリッド構成により, 反射型アーキテクチャの精度の89%を1.15倍のコストで回収できることを実証した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The adoption of large language models (LLMs) for structured information extraction from financial documents has accelerated rapidly, yet production deployments face fundamental architectural decisions with limited empirical guidance. We present a systematic benchmark comparing four multi-agent orchestration architectures: sequential pipeline, parallel fan-out with merge, hierarchical supervisor-worker and reflexive self-correcting loop. These are evaluated across five frontier and open-weight LLMs on a corpus of 10,000 SEC filings (10-K, 10-Q and 8-K forms). Our evaluation spans 25 extraction field types covering governance structures, executive compensation and financial metrics, measured along five axes: field-level F1, document-level accuracy, end-to-end latency, cost per document and token efficiency. We find that reflexive architectures achieve the highest field-level F1 (0.943) but at 2.3x the cost of sequential baselines, while hierarchical architectures occupy the most favorable position on the cost-accuracy Pareto frontier (F1 0.921 at 1.4x cost). We further present ablation studies on semantic caching, model routing and adaptive retry strategies, demonstrating that hybrid configurations can recover 89\% of the reflexive architecture's accuracy gains at only 1.15x baseline cost. Our scaling analysis from 1K to 100K documents per day reveals non-obvious throughput-accuracy degradation curves that inform capacity planning. These findings provide actionable guidance for practitioners deploying multi-agent LLM systems in regulated financial environments.
- Abstract(参考訳): 金融文書から構造化情報を取り出すための大規模言語モデル (LLM) の導入は急速に加速しているが、生産環境の配置は経験的ガイダンスに制限のある基本的なアーキテクチャ上の決定に直面している。
本稿では,4つのマルチエージェントオーケストレーションアーキテクチャ(シーケンシャルパイプライン,並列ファンアウト,マージ,階層的スーパーバイザ,反射的自己修正ループ)を比較する。
これらは、SECの1万件の申請(10-K、10-Q、8-K形式)に基づいて、5つのフロンティアおよびオープンウェイト LLM で評価される。
評価対象は, ガバナンス構造, 経営報酬, 財務指標を含む25種類の抽出フィールドタイプで, フィールドレベルF1, ドキュメントレベル精度, エンドツーエンドレイテンシ, ドキュメント毎のコスト, トークン効率の5つの軸に沿って測定された。
高いフィールドレベルF1(0.943)を達成するが、シーケンシャルベースラインのコストは2.3倍であり、階層型アーキテクチャはコスト精度のParetoフロンティア(F10.921は1.4倍)において最も有利な位置を占める。
さらに、セマンティックキャッシング、モデルルーティング、適応再試行戦略に関するアブレーション研究を行い、ハイブリッド構成が反射アーキテクチャの精度の99%を1.15倍のコストで回復できることを実証した。
1日あたり1Kから100Kのドキュメントへのスケーリング分析では、キャパシティプランニングを知らせる、予期せぬスループット-精度低下曲線が明らかになりました。
これらの知見は、規制された金融環境にマルチエージェントLLMシステムをデプロイする実践者に対して、実用的なガイダンスを提供する。
関連論文リスト
- How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains [7.845652284569666]
大規模推論モデルの誤校正は、高い領域における信頼性を損なう。
本稿では,6つの LRM から得られた347,496 個の推論トレースの公開リソースである Reasoning Model Confidence Estimation Benchmark (RMCB) を紹介する。
論文 参考訳(メタデータ) (2026-01-13T01:55:48Z) - Rethinking Retrieval: From Traditional Retrieval Augmented Generation to Agentic and Non-Vector Reasoning Systems in the Financial Domain for Large Language Models [0.0]
本稿では,ベクトルベースエージェントRAGをハイブリッド検索とメタデータフィルタリングを用いて比較した最初の体系的評価を行う。
検索指標(MRR, Recall@5), LLM-as-a-judgeのペア比較, レイテンシ, 前処理コストを計測する。
以上の結果から,金融Q&Aシステムに先進的なRAG技術を適用することにより,検索精度,回答品質が向上し,生産における費用対効果のトレードオフが考慮されることが明らかとなった。
論文 参考訳(メタデータ) (2025-11-22T20:06:25Z) - Self-Correction Distillation for Structured Data Question Answering [50.98882432829651]
小型言語モデル(LLM)は、構造化クエリの生成時にエラーを起こしやすい。
小型LCMの構造データQA能力を向上させるための自己補正蒸留(SCD)法を提案する。
論文 参考訳(メタデータ) (2025-11-11T09:01:51Z) - MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization [103.74675519953898]
ロングチェーンのリフレクティブ推論は、複雑な現実世界の問題を解決するための前提条件である。
我々は42の難解な合成タスクの1,260のサンプルからなるベンチマークを構築した。
トレーニング後のデータを生成し、そのようなデータを活用するための学習パラダイムを探索する。
論文 参考訳(メタデータ) (2025-10-09T17:53:58Z) - Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study [1.6770212301915661]
本研究は,CFAのレベルI-IIIにおける公式モック試験から得られた1,560件のマルチチョイス質問を用いて,最先端LCMの総合評価を行った最初の事例である。
主設計上の優先事項として,マルチモーダル・計算能力,推論・特殊化・高精度化,軽量な効率最適化といったモデルを比較した。
論文 参考訳(メタデータ) (2025-08-29T06:13:21Z) - FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering [57.18367828883773]
FinAgentBenchは、ファイナンスにおける多段階推論によるエージェント検索を評価するためのベンチマークである。
このベンチマークは、S&P-500上場企業に関する26Kのエキスパートアノテート例から成っている。
我々は,最先端モデルの集合を評価し,対象の微調整がエージェント検索性能を大幅に向上することを示す。
論文 参考訳(メタデータ) (2025-08-07T22:15:22Z) - Fine-Tuning Vision-Language Models for Markdown Conversion of Financial Tables in Malaysian Audited Financial Reports [0.0]
本稿ではQwen2.5-VL-7Bに基づく微調整視覚言語モデル(VLM)を提案する。
提案手法には,拡大した2,152枚の画像テキストペアをキュレートしたデータセットと,LoRAを用いた教師付き微調整戦略が含まれる。
基準に基づく評価では92.20%の精度と96.53%のTEDSスコアが得られた。
論文 参考訳(メタデータ) (2025-08-04T04:54:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。