論文の概要: Meta-Benchmarks for Financial-Services LLM Evaluation
- arxiv url: http://arxiv.org/abs/2607.01740v1
- Date: Thu, 02 Jul 2026 05:52:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.688526
- Title: Meta-Benchmarks for Financial-Services LLM Evaluation
- Title(参考訳): 金融サービスLLM評価のためのメタベンチマーク
- Authors: Blair Hudson,
- Abstract要約: 我々は、452の公開ベンチマークを41のO*NET Generalized Work Activityにまとめるメタベンチマークフレームワークを提案する。
乗法重み付けスキームは、まだ最高のモデルを分離し、広く報告され、アクティブな使用が続けられているベンチマークに報酬を与える。
2026年6月現在、25の組織で288のモデルをカバーしているポイントインタイムのパブリックスナップショットで、このフレームワークを実演しています。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Public LLM leaderboards optimise for global average performance and do not capture the specific cognitive demands of financial-services work: a model that leads on MMLU-Pro may underperform on document-grounded compliance reasoning, and a coding leader may handle multi-turn customer interactions poorly. We present a meta-benchmarking framework that organises 452 publicly reported benchmarks into 41 O*NET Generalized Work Activities and aggregates those into 38 BIAN banking business domains spanning sales, operations, risk, and support work. A multiplicative weighting scheme (discrimination x coverage x recency), computed over a rolling model window, rewards benchmarks that still separate the best models, are widely reported, and remain in active use, suppressing saturated legacy tests automatically. These weights scale the K-factor in a pairwise Elo tournament, producing cross-benchmark-comparable work-activity scores without raw score normalisation; business-domain scores are weighted averages of the constituent work-activity Elos. We demonstrate the framework on a point-in-time public snapshot covering 288 models across 25 organisations as of June 2026, and describe the methodology, full taxonomy, design decisions, and limitations with the aim of making the approach reproducible for institutions facing similar selection and governance challenges.
- Abstract(参考訳): MMLU-Proを導くモデルは、文書ベースのコンプライアンス推論ではパフォーマンスが低下し、コーディングリーダーは、マルチターン顧客のインタラクションをうまく処理できない可能性がある。
我々は、452のベンチマークを41のO*NET Generalized Work Activityにまとめ、販売、運用、リスク、サポート作業にまたがる38のBIAN銀行ビジネスドメインに集約するメタベンチマークフレームワークを提案する。
転がりモデルウィンドウ上で計算される乗算重み付けスキーム(判別xカバレッジxの精度)は、最高のモデルを分離したベンチマークを広く報告し、アクティブな使用を継続し、飽和レガシーテストを自動的に抑制する。
これらの重みはペアワイズエロトーナメントでK因子を拡大し、生のスコアを正規化せずにクロスベンチマーク互換のワークアクティビティスコアを生成し、ビジネスドメインスコアは構成されたワークアクティビティElosの平均重み付けされる。
2026年6月現在、25の組織にまたがる288のモデルをカバーするポイントインタイムのパブリックスナップショットでこのフレームワークを実演し、同様の選択とガバナンスの課題に直面している組織に対して、アプローチを再現可能にするための方法論、完全な分類、設計決定、制限について説明する。
関連論文リスト
- OpenCompass: A Universal Evaluation Platform for Large Language Models [62.59671563145442]
汎用大規模言語モデル (LLM) は, 技術の進歩において重要なリンクとなっている。
メインストリームベンチマークデータセットは、タスクタイプの多様性、一貫性のない評価基準、データと処理の断片化といった課題に直面している。
本稿では,ワンストップ,スケーラブル,高精度な汎用評価プラットフォームであるOpen LLMをオープンソースとして提案する。
論文 参考訳(メタデータ) (2026-05-19T02:50:11Z) - RankLLM: Weighted Ranking of LLMs by Quantifying Question Difficulty [102.02839046225468]
RankLLMは質問の難しさとモデルの能力の両方を定量化する新しいフレームワークである。
複数のドメインにまたがる35,550の質問に対して30のモデルを評価する。
論文 参考訳(メタデータ) (2026-02-12T21:28:46Z) - Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models [72.52332895840279]
GenClusterはテスト時の計算フレームワークで、オープンウェイトモデルを使用してIOIゴールドレベルのパフォーマンスを実現する。
GenClusterは、オープンウェイトモデルで、初めてIOI 2025で金メダルを獲得できることを示します。
論文 参考訳(メタデータ) (2025-10-16T02:19:25Z) - Alpha Excel Benchmark [0.0]
本研究では,FMWC(Financial Modeling World Cup)Excelコンペティションから得られた課題を用いて,LLM(Large Language Models)を評価するための新しいベンチマークを提案する。
本研究は,認識タスクの強みを示すが,複雑な数値推論に苦しむモデルを用いて,様々な課題カテゴリにおける性能の有意な変化を示した。
論文 参考訳(メタデータ) (2025-05-07T03:56:26Z) - BEATS: Bias Evaluation and Assessment Test Suite for Large Language Models [0.0]
我々は、大規模言語モデル(LLM)におけるバイアス、倫理、公平性、現実性を評価するための新しいフレームワークBEATSを紹介する。
LLMのバイアスベンチマークを行い、29の異なるメトリクスのパフォーマンスを計測する。
これらの指標は、人口統計学、認知学、社会的偏見、倫理的推論、グループフェアネス、事実に関する誤情報リスクなど、幅広い特徴に及びます。
論文 参考訳(メタデータ) (2025-03-31T16:56:52Z) - NeurIPS 2023 LLM Efficiency Fine-tuning Competition [8.327069446234088]
トップパフォーマンスモデルは、ベンチマークデータセットにかなりのオーバーフィットを示し、人気のあるリーダボードにベンチマークオーバーフィットするというより広い課題を反映している。
その結果, モデル生成における現在のベンチマークに基づく評価手法の限界が浮き彫りになった。
さらなる調査と促進のために、コンペのエントリ、Dockerファイル、インフラストラクチャをすべてリリースしています。
論文 参考訳(メタデータ) (2025-03-13T19:35:40Z) - Ranked from Within: Ranking Large Multimodal Models Without Labels [73.96543593298426]
ソフトマックス分布から導かれる不確実性スコアは,様々なタスクにまたがるランキングモデルに対して,ロバストな基礎となることを示す。
これにより、ラベルのないデータに対するLMMのランク付けが容易になり、手動のアノテーションを必要とせずに、多様なターゲットドメインのモデルを選択するための実践的なアプローチを提供する。
論文 参考訳(メタデータ) (2024-12-09T13:05:43Z) - Automate Strategy Finding with LLM in Quant Investment [32.74265532529821]
本稿では,大規模言語モデル(LLM)をリスク認識型マルチエージェントシステム内で活用し,定量的ファイナンスにおける戦略発見を自動化する新しい3段階フレームワークを提案する。
本手法は,金融分野における従来のディープラーニングモデルの脆さに対処するものである。
実験結果は、確立されたベンチマークと比較して、中国とアメリカの市場体制における戦略の堅牢な性能を示している。
論文 参考訳(メタデータ) (2024-09-10T07:42:28Z) - EFaR 2023: Efficient Face Recognition Competition [51.77649060180531]
バイオメトリックス国際会議(IJCB 2023)における効率的な顔認識コンペティション(EFaR)の概要について述べる。
この競技会は6つの異なるチームから17の応募を受けた。
提案したソリューションは、様々なベンチマークで達成された検証精度の重み付けスコアと、浮動小数点演算数とモデルサイズによって与えられるデプロイ可能性に基づいてランク付けされる。
論文 参考訳(メタデータ) (2023-08-08T09:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。