論文の概要: GAUGE: Grading Agent-Built Financial Models Without a Golden Answer
- arxiv url: http://arxiv.org/abs/2607.24889v1
- Date: Mon, 27 Jul 2026 13:03:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.572566
- Title: GAUGE: Grading Agent-Built Financial Models Without a Golden Answer
- Title(参考訳): GAUGE:ゴールデンアンサーなしのグレーディングエージェントビルトファイナンシャルモデル
- Abstract要約: 65社をカバーする108組のうち、中央値は0.33、92.6%は0.70以下であり、同じビンテージのペアは10%以内のインプリード価格に合意していない。
同じ企業の独立したアナリストモデルを用いて、65社をカバーする108組のうち、中央値のシングル参照スコアは0.33、92.6%が0.70未満であり、同じビンテージペアが10%以内のインリード価格で一致しないことが判明した。
本稿では,エージェント構築評価モデルを評価するベンチマークであるGAUGEを紹介する。
- 参考スコア(独自算出の注目度): 38.72982631250115
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Financial models combine public disclosures with analyst assumptions to produce forecasts and valuations. While some components can be checked mechanically, forecasts, discount rates, and target prices often admit multiple reasonable answers. Existing benchmarks nevertheless tend to grade such outputs against a single expert reference. Using independently built analyst models for the same companies, we find that across 108 directed pairs covering 65 companies, the median single-reference score is 0.33, 92.6% score below 0.70, and no same-vintage pair agrees on implied price within 10%. Point-tolerance grading can therefore penalize disagreement already present among professionals. We introduce GAUGE, a benchmark for evaluating agent-built valuation models against observed analyst practice rather than a single point answer. GAUGE uses 1,001 vendor-classified analyst workbooks and a 196-task evaluation set, with a three-layer observed-practice envelope, 56 auditable facets, eight validity gates, and deterministic structural checks. We validate the benchmark with a 55-participant known-groups study, company-grouped cross-fitting, and judge-stability audits. On the failure-aware score $φ_0$, senior analysts average 88.3, juniors 66.0, and finance students 43.2. Across 24 agents and 1,011 scored generations, the best agent scores 53.4, above the student mean but below every senior and most juniors. It passes 93% of mechanical facets and 78% of judgment facets, with a fleet-median gap of 26 points. Current agents are substantially stronger at model construction than valuation judgment. We release the methodology, a gated de-identified data tier, a controlled training split, a versioned 48-task evaluation core, and a withheld refresh pool.
- Abstract(参考訳): 金融モデルは、公開開示とアナリストの仮定を組み合わせて予測と評価を生み出している。
一部のコンポーネントは機械的にチェックできるが、予測、割引率、ターゲット価格はしばしば複数の合理的な答えを許容する。
既存のベンチマークは、そのような出力を単一の専門家参照と比較する傾向があります。
同じ企業の独立したアナリストモデルを用いて、65社をカバーする108組のうち、中央値のシングル参照スコアは0.33、92.6%が0.70未満であり、同じビンテージペアが10%以内のインリード価格で一致しないことが判明した。
したがって、ポイントトレランスグレーディングは、既にプロの間で存在している不一致を罰することができる。
本稿では,エージェント構築評価モデルを評価するベンチマークであるGAUGEを紹介する。
GAUGEは1,001のベンダー分類のアナリストワークブックと196のタスク評価セットを使用しており、3層の観察実践エンベロープ、56の監査可能なファセット、8つの妥当性ゲート、決定論的構造チェックを備えている。
本ベンチマークは,55名の既知グループを対象とした調査,企業グループ間クロスフィッティング,および審査安定監査を用いて検証した。
失敗を意識したスコアが$φ_0$の場合、アナリストの平均は88.3ドル、ジュニアは66.0ドル、ファイナンス学生は43.2ドルである。
24人のエージェントと1,011人の世代で、最高のエージェントは53.4点、生徒の平均よりも高いが、すべての年長者、最も年少者より低い。
93%のメカニカルフェイスと78%の判定フェイス、26ポイントのフリート中間ギャップを突破する。
現在のエージェントは、評価判定よりもモデル構築においてかなり強い。
方法論、ゲート付き非識別データ層、制御されたトレーニングスプリット、バージョン48タスク評価コア、保持不能なリフレッシュプールをリリースする。
関連論文リスト
- How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks [60.853503196898906]
主要な物理学ベンチマークに関する低報告のスコアは、フロンティア言語モデルが高度な物理学に苦しむことを示唆している。
我々は,6つの広く使用されている物理ベンチマークでフロンティアモデルを評価し,専門家と評価することで,これらの知見を再考する。
論文 参考訳(メタデータ) (2026-09-11T16:06:50Z) - Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation [141.29138788636013]
任意のエージェントを評価するために80以上のベンチマークを移植するベンチマークアダプタを開発した。
54のベンチマークで,機能レベルにまたがる8モデルの大規模評価を行う。
私たちは29のベンチマークにまたがる82の難易度、多様性、高品質なタスクをキュレートしたHarbor-Indexを紹介します。
論文 参考訳(メタデータ) (2026-09-03T16:26:20Z) - One Capability or Many? Testing the Economic Validity of Frontier AI Evaluation [0.0]
ベンチマークが一般的なテストテイクとは異なる能力を測定するかどうかをテストする。
経済ベンチマークは、主に日付駆動の一般的な要因に漸進的な予測情報を追加する。
リーダーボードは依然として全体的な進歩のための健全なガイドだが、数ヶ月後にリリースされたモデル間のギャップのほとんどはカレンダーである。
論文 参考訳(メタデータ) (2026-08-29T19:55:20Z) - FinRiskAtlas: Decision-Aligned Evaluation of Large Language Models for Financial Risk Review [25.300288794507377]
2つの相補的な次元に沿って財務LLMを評価する中国語のベンチマークであるFinRiskAtlasを紹介する。
このフレームワークは、104の特定されていないプロの軌跡から680のプレアクション状態のオフライン再生を通じて拡張する。
FinRisk-Askは、Askブランチをより頻繁に入力することは、要求ターゲティングやエンドツーエンドのエビデンス獲得を改善するとは限らないことを示している。
論文 参考訳(メタデータ) (2026-08-26T03:13:15Z) - Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI [2.2616066835313253]
7つのカテゴリと3つの難易度で86のPicoCTF課題を実行し、3つのツールアクセスレジームと3つのモデル/クライアント構成で実行します。
既存のツール,エージェント・ビヘイビアの変更,11の新たな機能ツールに修正を適用し,これまで未経験だったトライアルを再実行します。
全体の解決率は55.4%から72.0%に上昇し、全ての構成が大幅に改善される。
論文 参考訳(メタデータ) (2026-07-03T02:20:04Z) - Multi-Agent Framework for Audit Risk Assessment with Explicit Uncertainty and Evidence Conflict Modeling [6.05989830654114]
UMARはMD&Aテキストエージェント、ファイナンシャルレートエージェント、CAMエージェントの3つの特殊エージェントを使用するフレームワークである。
SEC10-Kの提出書類から3200件の年次観測データを用いてUMARを評価する。
論文 参考訳(メタデータ) (2026-06-14T07:06:03Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution [0.0]
予測市場は、不確実な出来事を予測するために集合的なインテリジェンスを集約する。
既存のオラクルシステムは、高速だが不安定な自動化と、正確だがコストのかかる人間の仲裁とをトレードオフする。
マルチエージェントLLMアーキテクチャが単一モデルベースラインよりもオラクル分解能を向上できるかどうかを評価する。
論文 参考訳(メタデータ) (2026-05-29T03:44:19Z) - Your AI, Not Your View: The Bias of LLMs in Investment Analysis [62.388554963415906]
金融において、Large Language Models (LLMs) は、事前訓練されたパラメトリック知識とリアルタイム市場データとの相違から生じる、頻繁な知識紛争に直面している。
これらの対立は、モデル固有のバイアスが制度的目的と誤認される現実世界の投資サービスにおいて特に問題となる。
本研究では,このような紛争シナリオにおける創発的行動を調べるための実験的枠組みを提案し,投資分析におけるバイアスの定量的分析を行う。
論文 参考訳(メタデータ) (2025-07-28T16:09:38Z) - Unearthing Skill-Level Insights for Understanding Trade-Offs of Foundation Models [61.467781476005435]
集約精度を検査する際には、スキルワイドのパフォーマンスが不明確になる。
モデル生成論理を検査することで,任意の評価事例に関連する基礎的スキルを復元する自動手法を提案する。
私たちのスキルスライスとフレームワークは、モデル評価の新しい道を開き、スキル固有の分析を活用して、よりきめ細やかで実用的なモデル機能の理解を解き放ちます。
論文 参考訳(メタデータ) (2024-10-17T17:51:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。