論文の概要: BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows
- arxiv url: http://arxiv.org/abs/2604.11304v1
- Date: Mon, 13 Apr 2026 11:02:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.488496
- Title: BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows
- Title(参考訳): BankerToolBench: エンドツーエンドの投資銀行ワークフローにおけるAIエージェントの評価
- Authors: Elaine Lau, Markus Dücker, Ronak Chaudhary, Hui Wen Goh, Rosemary Wei, Vaibhav Kumar, Saed Qunbar, Guram Gogia, Yi Liu, Scott Millslagle, Nasim Borazjanizadeh, Ulyana Tkachenko, Samuel Eshun Danquah, Collin Schweiker, Vijay Karumathil, Asrith Devalaraju, Varsha Sandadi, Haemi Nam, Punit Arani, Ray Epps, Abdullah Arif, Sahil Bhaiwala, Curtis Northcutt, Skyler Wang, Anish Athalye, Jonas Mueller, Francisco Guzmán,
- Abstract要約: 既存のAIベンチマークには、プロフェッショナルに対して経済的に意味のある進歩を評価するための忠実さが欠けている。
高価値で労働集約的な職業におけるフロンティアAIエージェントを評価するために、BankerToolBench(BTB)を紹介する。
BTBは、ジュニア・インベストメント・バンカーが定期的に実施するエンドツーエンドの分析成果のオープンソースベンチマークである。
- 参考スコア(独自算出の注目度): 12.076413424824679
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing AI benchmarks lack the fidelity to assess economically meaningful progress on professional workflows. To evaluate frontier AI agents in a high-value, labor-intensive profession, we introduce BankerToolBench (BTB): an open-source benchmark of end-to-end analytical workflows routinely performed by junior investment bankers. To develop an ecologically valid benchmark grounded in representative work environments, we collaborated with 502 investment bankers from leading firms. BTB requires agents to execute senior banker requests by navigating data rooms, using industry tools (market data platform, SEC filings database), and generating multi-file deliverables--including Excel financial models, PowerPoint pitch decks, and PDF/Word reports. Completing a BTB task takes bankers up to 21 hours, underscoring the economic stakes of successfully delegating this work to AI. BTB enables automated evaluation of any LLM or agent, scoring deliverables against 100+ rubric criteria defined by veteran investment bankers to capture stakeholder utility. Testing 9 frontier models, we find that even the best-performing model (GPT-5.4) fails nearly half of the rubric criteria and bankers rate 0% of its outputs as client-ready. Our failure analysis reveals key obstacles (such as breakdowns in cross-artifact consistency) and improvement directions for agentic AI in high-stakes professional workflows.
- Abstract(参考訳): 既存のAIベンチマークには、プロフェッショナルワークフローにおける経済的に意味のある進歩を評価するための忠実さが欠けている。
高価値で労働集約的な専門職におけるフロンティアAIエージェントを評価するために、ジュニア投資銀行が日常的に実施するエンドツーエンド分析ワークフローのオープンソースベンチマークであるBankerToolBench(BTB)を紹介した。
代表的作業環境に根ざした生態学的に有効なベンチマークを開発するため,大手企業からの502人の投資銀行と共同研究を行った。
BTBは、データルームをナビゲートし、業界ツール(市場データプラットフォーム、SECの申請データベース)を使用し、Excelファイナンシャルモデル、PowerPointピッチデッキ、PDF/Wordレポートを含む複数ファイルの成果物を生成することで、上級バンカーの要求を実行する必要がある。
BTBタスクの完了には最大21時間を要する。
BTBは、LLMまたはエージェントの自動評価を可能にし、ベテラン投資銀行がステークホルダーの効用をつかむために定義した100以上のルーリック基準に対して、納品品を評価できる。
9つのフロンティアモデルをテストすると、最高のパフォーマンスモデル(GPT-5.4)でさえルーブリック基準のほぼ半分を失敗し、バンカーはその出力の0%をクライアント対応として評価することがわかった。
当社の障害分析では,クロスアーティファクトの一貫性の低下など)重要な障害と,高度なプロフェッショナルワークフローにおけるエージェントAIの改善方向を明らかにしています。
関連論文リスト
- OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language World Models [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces [65.11019654023978]
LongCLI-Benchは、長期にわたる現実的なタスクにまたがるエージェント能力を評価するために設計されたベンチマークである。
私たちは、1000以上のコンピュータサイエンスの課題と現実世界のタスクから、20の高品質で長い水平タスクをキュレートしました。
実験によると、最先端のエージェントでさえLongCLI-Benchの20%未満のパスレートを達成する。
論文 参考訳(メタデータ) (2026-02-15T23:12:57Z) - Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces [126.23612941699565]
Terminal-Bench 2.0は、現実世界の問題に触発されたコンピュータ端末環境における89のタスクからなるベンチマークである。
ベンチマークでは、フロンティアモデルとエージェントのスコアが65%未満であることが示されています。
将来的にはhttps://www.tbench.ai/で開発者や研究者を支援するために、データセットと評価ハーネスを公開しています。
論文 参考訳(メタデータ) (2026-01-17T01:29:30Z) - UpBench: A Dynamically Evolving Real-World Labor-Market Agentic Benchmark Framework Built for Human-Centric AI [2.0619484032730813]
UpBenchは、グローバルなUpworkの労働市場から引き出された実際の仕事に関するベンチマークだ。
各タスクは検証されたクライアントトランザクションに対応し、実際の作業活動と財務成果の評価をアンロックする。
UpBenchはルーリックベースの評価フレームワークを採用しており、専門家フリーランサーは各ジョブを詳細かつ検証可能な受け入れ基準に分解し、基準ごとのフィードバックでAI申請を評価する。
論文 参考訳(メタデータ) (2025-11-15T17:39:37Z) - Towards Outcome-Oriented, Task-Agnostic Evaluation of AI Agents [1.0305173936249623]
白書では、AIエージェントの成果に基づくタスク非依存のパフォーマンス指標11の新たなフレームワークを提案する。
本稿では、ゴール完了率(GCR)、自律度指数(AIx)、マルチステップタスクレジリエンス(MTR)、ビジネスインパクト効率(BIE)などの指標を紹介する。
この結果から, エージェント設計の相違が顕著であり, ハイブリットエージェントを一貫した高性能モデルとして強調した。
論文 参考訳(メタデータ) (2025-11-11T13:40:46Z) - Anti-Money Laundering Machine Learning Pipelines; A Technical Analysis on Identifying High-risk Bank Clients with Supervised Learning [1.149137041907724]
リスクの高い銀行クライアントを特定するために,機械学習パイプラインを開発するための包括的かつ体系的なアプローチを提案する。
データセットには195,789のIDが含まれており、16ステップの顧客設計と統計分析を採用しました。
パイプラインの動作特性曲線 (AUROC) は0.961であり, 標準偏差 (SD) は0.005であった。
論文 参考訳(メタデータ) (2025-09-11T03:53:10Z) - FinGAIA: A Chinese Benchmark for AI Agents in Real-World Financial Domain [17.682962451679312]
FinGAIAは7つの主要な金融サブドメインにまたがる、細心の注意を払って407のタスクで構成されている。
最高成績のエージェントであるChatGPTは48.9%の精度を達成し、非専門職よりも優れているが、財務の専門家を35パーセント以上遅れている。
論文 参考訳(メタデータ) (2025-07-23T04:19:16Z) - Establishing Best Practices for Building Rigorous Agentic Benchmarks [94.69724201080155]
多くのエージェントベンチマークがタスク設定や報酬設計に問題があることを示す。
このような問題は、エージェントのパフォーマンスを最大100%相対的に過小評価することにつながる可能性がある。
我々はベンチマーク構築経験から要約したガイドラインの集合であるAgentic Benchmark Checklist (ABC)を紹介した。
論文 参考訳(メタデータ) (2025-07-03T17:35:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。