論文の概要: Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable
- arxiv url: http://arxiv.org/abs/2607.21340v1
- Date: Thu, 23 Jul 2026 14:10:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.428132
- Title: Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable
- Title(参考訳): 資本市場 LLM Reliability Score (CM-LRS) プラルーシブルからバンクブルへ
- Authors: Prerit Ahuja,
- Abstract要約: 本稿では,LCM信頼性スコアであるCM-LRSを紹介し,ワークフロー出力層における出力を評価する。
我々は、公開SEC EDGARの申請書、英国の買収リリース、架空の合成サプリメントに対して、5つのCM-LRS(DCMトランザクション終局抽出、前例検索、発行者プロファイル合成、M&Aトランザクション適合推論、ECMトランザクション終局抽出)を実証する。
まず、フロンティア・クローズソース・モデル・クラスタは4judgeの平均CM-LRS0.22点(Sonnet 4.6 = 4.31, Opus 4.7 = 4.30, GPT-5.5 = 4.09)である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In capital-markets workflows the question is rarely whether a large language model can produce a fluent draft, but whether the draft is bankable: defensible in front of a counter-party or a regulator, with the documents in hand. Existing methods address parts of that gap: open-domain QA benchmarks reward surface accuracy, and finance benchmarks (FinanceBench, FinQA, ConvFinQA) advance document-grounded and numerical QA but evaluate at the question-answer layer rather than the workflow outputs practitioners defend. We introduce CM-LRS, a Capital Markets LLM Reliability Score, evaluating outputs at the workflow-output layer across seven dimensions: factual accuracy, evidence traceability, numerical consistency, workflow completeness, source discipline, decision usefulness, and reviewability/auditability. Each is scored 0-5 against a rubric anchored on signals reviewers in regulated settings use; the aggregate is tunable to the workflow. We demonstrate CM-LRS on five workflows (DCM transaction-terms extraction, precedent retrieval, issuer profile synthesis, M&A transaction-comparable reasoning, ECM transaction-terms extraction) over public SEC EDGAR filings, a public UK takeover release, and fictional synthetic supplements, scoring four models against four independent LLM judges spanning three model families. Three findings. First, the frontier closed-source models cluster within 0.22 points on four-judge averaged CM-LRS (Sonnet 4.6 = 4.31, Opus 4.7 = 4.30, GPT-5.5 = 4.09); all four judges place the open-weights baseline (Llama 3.3 70B = 3.15) last. Second, that gap concentrates on retrieval (2.23) and synthesis (2.15), not extraction (0.84). Third, Decision Usefulness shows the widest cross-model dispersion of any dimension (4.0 points on issuer profiling) and top-tier inter-judge agreement (mean r = 0.52). Plausibility is cheap. Bankability is the bar.
- Abstract(参考訳): 資本市場ワークフローでは、大きな言語モデルが流動的なドラフトを作成できるかどうかという問題はほとんどありません。
オープンドメインのQAベンチマークは、表面の正確さを報奨し、ファイナンスベンチマーク(FinanceBench、FinQA、ConvFinQA)は、文書のグラウンド化と数値的なQAを行うが、ワークフローのアウトプットではなく、質問応答層で評価する。
CM-LRS(Capital Markets LLM Reliability Score)を導入し,実際の精度,エビデンストレーサビリティ,数値的整合性,ワークフロー完全性,ソースの規律,意思決定の有用性,可視性/聴取性といった7次元のワークフロー出力層におけるアウトプットの評価を行った。
それぞれが、規制された設定使用時に信号レビュアーに固定されたルーリックに対して0-5でスコアされ、アグリゲーションはワークフローに調整可能である。
本稿では,5つのワークフロー(DCMトランザクション終局抽出,前例検索,発行者プロファイル合成,M&Aトランザクション相補的推論,ECMトランザクション終局抽出)について,公開SEC EDGARの申請,英国の公的な買収リリース,架空の合成サプリメント)でCM-LRSを実証し,3つのモデルファミリーにまたがる4つの独立したLCM判事に対して4つのモデルの評価を行った。
3つの発見。
まず、4つのジャッジの平均CM-LRS(Sonnet 4.6 = 4.31, Opus 4.7 = 4.30, GPT-5.5 = 4.09)の0.22ポイント以内のフロンティアクローズソースモデルクラスタが、全ての審査員がオープンウェイトベースライン(Llama 3.3 70B = 3.15)を最後に配置する。
第二に、このギャップは抽出(2.23)と合成(2.15)に集中し、抽出(2.4)ではない。
第三に、決定的有用性は、任意の次元(発行者プロファイリングの4.0点)と最上位層間合意(平均 r = 0.52 )の最も広いクロスモデル分散を示す。
可塑性は安い。
銀行はバーです。
関連論文リスト
- Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models [20.61766907174782]
本稿では,動的境界評価(DBE)を提案する。これは各モデルの境界を積極的に把握し,グローバルに匹敵する難易度尺度に配置する。
DBEは、3つのアーティファクトを提供する: (i) 安全性、能力、真実性をカバーした校正項目銀行で、9ドルの基準LCMで検証された難易度ラベル付きで、 (ii) スキルガイド境界探索(SGBS)、 (ii) APIレベルクエリアクセスのみを使用して、所定のターゲットLSMの境界項目を見つける検索アルゴリズム、 (iii) 新しいLCMを統一能力尺度に配置し、ターゲットが外に落ちたときに適応的に評価セットを拡大する評価プロトコル。
論文 参考訳(メタデータ) (2026-05-07T13:15:31Z) - Task-Level AI Readiness Assessment for Business Process Management:The T-IPO Model and LARA Matrix in Financial-Services IT Operations [1.8200820102702586]
金融サービスIT環境で開発された2つのデザインアーティファクトについて述べる。
LLMエージェント準備度評価は、エージェント置換のためのタスクの準備度を評価する。
120タスクインスタンスのパイロットデプロイでは、自動補完はL1で95%ドルからL2で約70%ドルからL3で約40%ドルへと単調に崩壊する。
論文 参考訳(メタデータ) (2026-04-16T10:10:19Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - Benchmarking Multi-Agent LLM Architectures for Financial Document Processing: A Comparative Study of Orchestration Patterns, Cost-Accuracy Tradeoffs and Production Scaling Strategies [0.0]
財務文書から構造化情報を抽出するための4つのマルチエージェントオーケストレーションアーキテクチャを比較した。
反射的アーキテクチャは、最高フィールドレベルF1(0.943)を達成するが、シーケンシャルベースラインのコストは2.3倍である。
本稿では, セマンティックキャッシング, モデルルーティング, 適応再試行戦略に関するアブレーション研究を行い, ハイブリッド構成により, 反射型アーキテクチャの精度の89%を1.15倍のコストで回収できることを実証した。
論文 参考訳(メタデータ) (2026-03-24T00:02:47Z) - LLM Output Drift: Cross-Provider Validation & Mitigation for Financial Workflows [0.5798758080057375]
非決定論的出力(アウトプットドリフト)は監査性と信頼を損なう。
規制された金融業務に関する5つのモデルアーキテクチャ間のドリフトを定量化する。
この発見は、より大きなモデルがプロダクションデプロイメントに普遍的に優れているという従来の仮定に挑戦する。
論文 参考訳(メタデータ) (2025-11-10T19:54:00Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Accept or Deny? Evaluating LLM Fairness and Performance in Loan Approval across Table-to-Text Serialization Approaches [57.5863675268117]
大規模言語モデル(LLM)は、ローン承認などの高い意思決定タスクにますます採用されています。
我々は、ガーナ、ドイツ、アメリカ合衆国における融資承認データセットのシリアライズされたローン承認データセットにおけるLCMの性能と公正性を評価する。
論文 参考訳(メタデータ) (2025-08-29T10:51:41Z) - FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering [57.18367828883773]
FinAgentBenchは、ファイナンスにおける多段階推論によるエージェント検索を評価するためのベンチマークである。
このベンチマークは、S&P-500上場企業に関する26Kのエキスパートアノテート例から成っている。
我々は,最先端モデルの集合を評価し,対象の微調整がエージェント検索性能を大幅に向上することを示す。
論文 参考訳(メタデータ) (2025-08-07T22:15:22Z) - BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs [7.9458352414205295]
大規模な言語モデルは一般的なタスクでは優れていますが、ロジック重大で精度の高い、財務、法律、医療といった重要な領域での信頼性の評価は依然として難しいままです。
BizFinBenchは、実世界の金融アプリケーションにおけるLSMの評価に特化して設計された最初のベンチマークである。
BizFinBenchは中国語で6,781の注釈付きクエリで構成されており、数値計算、推論、情報抽出、予測認識、知識に基づく質問応答の5つの次元にまたがっている。
論文 参考訳(メタデータ) (2025-05-26T03:23:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。