論文の概要: FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables
- arxiv url: http://arxiv.org/abs/2608.04077v1
- Date: Tue, 04 Aug 2026 18:00:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.543595
- Title: FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables
- Title(参考訳): FinProBench: 専門的な成果物から派生した役割を取り巻くルーブリックによる金融AIエージェントの評価
- Abstract要約: 既存のメソッドは通常、タスクプロンプトやモデル出力から基準を導き出す。
本稿では、プロの金融業務のベンチマークであるFinProBenchと、再利用可能なルーリックであるRole-Grounded Construction(RGRC)を紹介する。
- 参考スコア(独自算出の注目度): 9.305912044747368
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating financial AI agents requires criteria aligned with real professional work. Existing rubric methods typically derive criteria from task prompts or model outputs, overlooking tacit standards visible only in practitioner deliverables. We introduce FinProBench, a benchmark for professional financial tasks, and Role-Grounded Rubric Construction (RGRC), a reusable pipeline that derives rubrics from deliverables produced by practitioners in the same role. RGRC comprises four stages: Deliverable Collection, Competency Extraction, Rubric Synthesis, and Validation. Its rubrics capture tacit standards, distinguish quality levels, and transfer across tasks within a role. Before analysis, we classified 57 occupations by deliverable genre into 30 prior-rich conventional roles and 27 prior-sparse role-specialized roles. Across all roles, Prompt-only nearly matches RGRC for conventional roles (89.2% vs. 90.7%), but RGRC substantially outperforms it for role-specialized roles (99.1% vs. 78.0%). This split indicates that prompt engineering can approximate rubrics when conventions are well represented in model priors, while professional grounding is essential for standards beyond those priors. FinProBench is built from 1,723 curated deliverables spanning 57 occupations, 8 financial sub-industries, and 161 deliverable types, and releases an initial evaluation set of 20 complete tasks covering 20 roles in 7 sub-industries. With heterogeneous LLM judges and role-level rubrics, human deliverables rank first on average (73.7 vs. 70.3, 70.2, and 69.6 out of 100), while all four systems show overlapping 95% confidence intervals and complementary strengths. Reusing rubrics at the role level reduces estimated per-task construction effort by 6.7 times relative to authoring each rubric from scratch.
- Abstract(参考訳): ファイナンシャルAIエージェントを評価するには、実際のプロフェッショナルな作業と整合した基準が必要である。
既存のルーブリックな手法は、通常、実践的な納品品でのみ見える暗黙の標準を見渡して、タスクプロンプトやモデルアウトプットから基準を導き出す。
我々は,プロの金融業務のベンチマークであるFinProBenchと,同じ役割で実践者が生産する配送物からルーブリックを引き出す再利用可能なパイプラインであるRole-Grounded Rubric Construction (RGRC)を紹介した。
RGRCは、Deliverable Collection、Competency extract、Rubric Synthesis、バリデーションの4つのステージで構成されている。
ルーブリックは暗黙の基準を捉え、品質レベルを区別し、役割の中のタスクを移動します。
分析の前には, 提供可能なジャンル別57職種を, 従来の30職種と27職種に分類した。
すべての役割において、プロンプトのみは従来の役割のRGRC(89.2%対90.7%)とほぼ一致しているが、ロール特殊化された役割のRGRC(99.1%対78.0%)は大幅に上回っている。
この分割は、急進的なエンジニアリングが、慣習がモデル事前で適切に表現されているときに、ルーリックを近似できることを示している。
FinProBenchは、57の職業、8の金融サブインダストリー、161の納品品からなる1,723のキュレートされた納品品から構築され、7のサブインダストリーで20のロールをカバーする20の完全なタスクの最初の評価セットをリリースしている。
ヘテロジニアスなLLM審査員とロールレベルのルーリックでは、人間による配達は平均で73.7 vs. 70.3, 70.2, 69.6であり、4つのシステムは全て95%の信頼区間と補完的な強度を重複している。
ロールレベルでのルーリックの再利用は、各ルーリックをスクラッチから作成するのと比較して、タスクごとの工数の推定を6.7倍削減する。
関連論文リスト
- Efficient Test-Time Adaptation through Human-AI Interaction [112.5131603022122]
我々は,ヒト-エージェント間相互作用(TAHI)によるテスト時間適応を提案する。
エージェントを2つの高ユーティリティドメイン(書き込みと視覚的創造)の30人に適応させ、合計600のタスクをこなします。
エージェントは10タスク以内の単独作業の成功率を4.5-20.9%向上させる。
論文 参考訳(メタデータ) (2026-09-03T17:33:18Z) - PaperGym: Rubric-Centered Evolution for Research-Plan Generation [69.5921878728483]
各研究論文を完全なトレーニング環境に変換する統合フレームワークであるPaperGymを紹介する。
PaperGymは論文の構造を利用しており、質問は研究目標と背景から合成され、基準は手法と実験から導かれる。
レシピが固定され、PaperGym-20kで訓練されたモデルが3方向比較の58.1%を獲得し、Hub Scienceの28.2%が勝利した。
論文 参考訳(メタデータ) (2026-08-31T17:31:18Z) - Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation [37.16322609017877]
Messierは、30のベンチマーク、714のエージェント、11,891のタスク、74,205の検証を含む957,253レコードの統一コーパスである。
M Messierは公開ベンチマークのスコアを集約し、6つの未表現の専門分野と科学分野にわたる5エージェントの実行を補完する。
論文 参考訳(メタデータ) (2026-07-28T15:50:19Z) - Cross-Architecture LLM Ensembles, Feature-Based Reranking and Retrieval-Augmented Prompting for Legal Information Processing [7.028604573959654]
我々は,チームDUがCOLIEE 2026の5つのタスクすべてに参加することを報告した。
我々は, 判例検索, 判例検索, 法令検索, 判例検索, 判例判断予測にオープンウェイトシステムを使用する。
論文 参考訳(メタデータ) (2026-07-13T11:07:57Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows? [150.84850629123287]
現実的な医療業務のエンドツーエンドの自動化は、現在のベンチマークで不足している3つの機能を強調します。
$-Benchは3つのドメインにわたる長期医療のベンチマークである。
30以上のエージェントハーネス/モデル構成で、最高のエージェントはタスクの28.0%しか解決せず、厳格なパス3では20%をクリアし、単一のセッションですべてのタスクを実行するとパフォーマンスは3.8%に低下する。
論文 参考訳(メタデータ) (2026-05-15T22:34:31Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - PHMForge: A Scenario-Driven Agentic Benchmark for Industrial Asset Lifecycle Maintenance [2.532228247215641]
PHMForge は Prognostics and Health Management (PHM) タスクの大規模言語モデル (LLM) エージェントを評価するために特別に設計されたベンチマークである。
当社のベンチマークでは、7つの産業資産クラス(ファンエンジン、ベアリング、電動モーター、ギアボックス、エアエンジン)にまたがる75のシナリオを5つのコアタスクカテゴリでカバーしています。
我々は,2つのMPPサーバに65の専門ツールを構築し,タスク・コメンシュレート・メトリクスを用いた実行ベースの評価器を実装した。
論文 参考訳(メタデータ) (2026-04-02T02:09:27Z) - Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation [32.5154721488471]
LLM(Large Language Models)は、従来のベンチマークで高い性能を示す。
既存のフレームワークは、狭いドメインカバレッジ、ジェネラリストのタスクへの依存、あるいは自己評価バイアスに悩まされている。
XpertBench(英語版)は、真の専門分野にわたるLSMを評価するために開発された高忠実度ベンチマークである。
論文 参考訳(メタデータ) (2026-03-27T11:28:15Z) - ResearchGym: Evaluating Language Model Agents on Real-World AI Research [48.46915933681714]
我々は、エンドツーエンドの研究においてAIエージェントを評価するためのベンチマークおよび実行環境であるResearchGymを紹介する。
これを実現するために,ICML,ICLR,ACLの5つの口頭およびスポットライト論文を再利用した。
GPT-5を動力とするエージェントの制御評価において、我々は鋭い能力-信頼性ギャップを観察する。
論文 参考訳(メタデータ) (2026-02-16T19:00:03Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - PRBench: Large-Scale Expert Rubrics for Evaluating High-Stakes Professional Reasoning [18.32501228579171]
Professional Reasoning Bench (PRBench) は、ファイナンス・アンド・ローにおける現実的な問題の現実的で、オープンで、困難なベンチマークである。
私たちは1,100人の専門家によるタスクと19,356人の専門家による基準をオープンソース化しました。
論文 参考訳(メタデータ) (2025-11-14T18:55:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。