論文の概要: A Citation-Grounded Benchmark for Trustworthy Earnings Call Transcript Analysis with Large Language Models
- arxiv url: http://arxiv.org/abs/2610.00969v1
- Date: Thu, 01 Oct 2026 02:59:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.855939
- Title: A Citation-Grounded Benchmark for Trustworthy Earnings Call Transcript Analysis with Large Language Models
- Title(参考訳): 大規模言語モデルを用いた音素解析による信頼度評価ベンチマーク
- Abstract要約: 大規模言語モデル (LLMs) は、決算報告書 (ECTs) を含む財務文書分析にますます使われている。
本稿では,専門家のアノテーションに頼らずに基礎性評価を可能にする数値的エビデンス評価手法を提案する。
また、自動データセット構築パイプラインを導入し、S&P 500のトップ100からECTs-100を構築し、基礎性と正確性の両方のベンチマークをサポートします。
- 参考スコア(独自算出の注目度): 16.906127947667255
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large language models (LLMs) have been increasingly used for financial document analysis, including earnings call transcripts (ECTs). Beyond generating standalone claims, users increasingly prefer grounded analyses that pair claims with verifiable citations from source documents to enable independent validation. However, evaluating such analytical claims typically requires extensive expert annotation, which is costly and difficult to scale, and real-world financial analysis commonly involves long context-question-answer triplets, further increasing task complexity. To address these challenges and benchmark the current landscape of grounded analysis by LLMs, we propose a numeric evidence evaluation method that enables groundedness assessment without reliance on expert annotation. We also introduce an automated dataset construction pipeline and construct ECTs-100 from the top 100 constituents of the S&P 500 to support benchmark of both groundedness and correctness. In addition, we examine conscious incompetence, a practical failure mode in financial analysis in which LLMs must detect when available evidence is insufficient and refrain from producing unsupported hallucinations. Empirical results show that LLMs perform well in groundedness but face notable limitations in correctness, with informational insufficiency presenting an additional challenge.
- Abstract(参考訳): 大規模言語モデル (LLMs) は、決算報告書 (ECTs) を含む財務文書分析にますます使われている。
スタンドアロンのクレームの生成以外にも、ユーザは、独立したバリデーションを可能にするために、ソースドキュメントからの検証可能な引用と組み合わせて主張する、根拠付き分析を好んでいる。
しかし、このような分析的クレームを評価するには、コストがかかり、スケールが難しい広範囲な専門家のアノテーションが必要である。
これらの課題に対処し、LLMによる基底解析の現在の展望をベンチマークするために、専門家のアノテーションに頼らずに基底性評価を可能にする数値的エビデンス評価手法を提案する。
また、自動データセット構築パイプラインを導入し、S&P 500のトップ100からECTs-100を構築し、基礎性と正確性の両方のベンチマークをサポートします。
また,LLMが有効な証拠が不十分であることを検知し,無症状の幻覚の発生を控える,意識的無能な財務分析の実践的失敗モードである意識的無能性について検討した。
実験の結果,LLMは基礎性では良好に機能するが,正確性には顕著な限界があることが明らかとなった。
関連論文リスト
- Evaluating LLMs in Finance Requires Explicit Bias Consideration [88.38155218924999]
ファイナンス固有のバイアスは、パフォーマンスを低下させ、バックテストを汚染し、報告された結果をデプロイメントのクレームに役に立たないものにする。
一つのバイアスが28%以上の研究で議論されることはない。
本稿では,バイアス診断と将来のシステム設計のための最小限の要件を満たす構造的妥当性フレームワークと評価チェックリストを提案する。
論文 参考訳(メタデータ) (2026-02-15T17:02:01Z) - Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings [31.87459935714186]
Fin-RATE(フィン・ラテ)は、米国証券取引委員会(SEC)の申請書類と財務アナリストを反映したベンチマークである。
我々は、オープンソース、クローズドソース、金融特化モデルにまたがって、Large Language Models(LLM)をリードする17のベンチマークを行った。
その結果、タスクが単一文書推論から縦断的、横断的分析へ移行するにつれて、精度が18.60%低下し、14.35%低下した。
論文 参考訳(メタデータ) (2026-02-07T00:54:37Z) - FinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering [57.43420753842626]
FinLFQAは、複雑な財務問題に対する長文の回答を生成するための大規模言語モデルの能力を評価するために設計されたベンチマークである。
回答品質と属性品質の両方をカバーする自動評価フレームワークを提供する。
論文 参考訳(メタデータ) (2025-10-07T20:06:15Z) - Evaluating Large Language Models for Financial Reasoning: A CFA-Based Benchmark Study [1.6770212301915661]
本研究は,CFAのレベルI-IIIにおける公式モック試験から得られた1,560件のマルチチョイス質問を用いて,最先端LCMの総合評価を行った最初の事例である。
主設計上の優先事項として,マルチモーダル・計算能力,推論・特殊化・高精度化,軽量な効率最適化といったモデルを比較した。
論文 参考訳(メタデータ) (2025-08-29T06:13:21Z) - Your AI, Not Your View: The Bias of LLMs in Investment Analysis [62.388554963415906]
金融において、Large Language Models (LLMs) は、事前訓練されたパラメトリック知識とリアルタイム市場データとの相違から生じる、頻繁な知識紛争に直面している。
これらの対立は、モデル固有のバイアスが制度的目的と誤認される現実世界の投資サービスにおいて特に問題となる。
本研究では,このような紛争シナリオにおける創発的行動を調べるための実験的枠組みを提案し,投資分析におけるバイアスの定量的分析を行う。
論文 参考訳(メタデータ) (2025-07-28T16:09:38Z) - Detecting LLM Hallucination Through Layer-wise Information Deficiency: Analysis of Ambiguous Prompts and Unanswerable Questions [60.31496362993982]
大規模言語モデル(LLM)は、自信を持って不正確な応答を頻繁に生成する。
本稿では,情報フローの系統的解析を通じて,モデル幻覚を検出する新しいテストタイム手法を提案する。
論文 参考訳(メタデータ) (2024-12-13T16:14:49Z) - FinDVer: Explainable Claim Verification over Long and Hybrid-Content Financial Documents [30.402524394183857]
FinDVerには2,400のエキスパートアノテート例があり、情報抽出、数値推論、知識集約推論という3つのサブセットに分けられている。
以上の結果から,現在の最高性能システムであるGPT-4oでさえ,まだ人間の専門家より遅れていることが明らかとなった。
論文 参考訳(メタデータ) (2024-11-08T18:26:17Z) - Advancing Anomaly Detection: Non-Semantic Financial Data Encoding with LLMs [49.57641083688934]
本稿では,Large Language Models (LLM) 埋め込みを用いた財務データにおける異常検出の新しい手法を提案する。
実験により,LLMが異常検出に有用な情報をもたらし,モデルがベースラインを上回っていることが確認された。
論文 参考訳(メタデータ) (2024-06-05T20:19:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。