論文の概要: Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements
- arxiv url: http://arxiv.org/abs/2607.28661v1
- Date: Wed, 22 Jul 2026 06:53:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-09 10:00:34.251169
- Title: Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements
- Title(参考訳): LLMのファイナンシャル・推論は信用可能か? 長期的ステートメントに対する実世界テスト
- Abstract要約: Finindicesは、不正な財務状況に対するデータ処理の忠実度を評価する大規模なベンチマークである。
評価の結果,2つの重篤なLSM脆弱性が明らかとなった。第一に,事前学習中に公式を記憶しているにもかかわらず,モデルが脆弱なパターンマッチングを示す「知識ボトルネック」である。
第二に、"Structure Bottleneck": マルチメトリックの多周期テーブルを生成するという、強い認知負荷は、推論能力を積極的に消費する。
- 参考スコア(独自算出の注目度): 33.97676862545625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Do Large Language Models (LLMs) possess genuine structural reasoning, or merely rely on surface-level pattern matching? The financial domain, demanding numerical precision and multi-step logic over long contexts, is an ideal testbed. Existing benchmarks fail to capture real-world industrial complexity, predominantly relying on multiple-choice questions or single-hop QA over cropped tables while ignoring intricate cross-statement dynamics and temporal de-cumulation. To bridge this gap, we introduce FinIndices, a large-scale benchmark evaluating data-processing fidelity over uncropped financial statements (up to 32K tokens). Utilizing an automated synthesis pipeline with adversarial traps, FinIndices encompasses Single-Index computation and Table-Index tabulation to test complex domain, temporal, and caliber reasoning. Our evaluation reveals two severe LLM vulnerabilities. First, a "Knowledge Bottleneck": despite memorizing formulas during pre-training, models demonstrate fragile pattern matching. Removing explicit formula hints causes performance to collapse (e.g., Gemini-3.1-Pro drops from 70.70% to 38.22% on table tasks), exposing fatal flaws in temporal de-cumulation and stock-flow caliber mismatch. Second, a "Structural Bottleneck": the intense cognitive load of generating multi-metric, multi-period tables actively drains reasoning capacity. Under structural pressure, LLMs that flawlessly execute isolated derivations regress to shallow heuristics, such as fetching incorrect adjacent columns or substituting deep accounting adjustments with lazy literal arithmetic. Finally, Supervised Fine-Tuning (SFT) yields substantial zero-hint gains (+8.54% Single, +3.82% Table), validating that structured logic can be partially restored via data-centric alignment.
- Abstract(参考訳): 大規模言語モデル(LLM)は真の構造的推論を持っているのか、それとも単に表面レベルのパターンマッチングに依存しているのか?
金融分野は、長期にわたる数値精度と多段階論理を必要とするが、理想的なテストベッドである。
既存のベンチマークでは、複雑なクロスステートメントのダイナミクスや時間的デ累積を無視しながら、複数の選択やシングルホップのQAに依存している。
このギャップを埋めるために、FinIndicesという大規模なベンチマークを導入します。
逆トラップを備えた自動合成パイプラインを利用することで、FinIndicesは、複雑なドメイン、時間、カリバー推論をテストするためのシングルインデックス計算とテーブルインデックスの集計を含む。
我々の評価では2つの重篤なLSM脆弱性が判明した。
第一に、"Knowledge Bottleneck": 事前トレーニング中に公式を記憶しているにもかかわらず、モデルは脆弱なパターンマッチングを示す。
明示的な公式のヒントを取り除いたことで、パフォーマンスが崩壊する(例えば、Gemini-3.1-Proはテーブルタスクで70.70%から38.22%に低下する)。
第二に、「構造ボトルネック(Structural Bottleneck)」は、多段階の多周期テーブルを生成するという強烈な認知負荷が、推論能力の低下を積極的に引き起こす。
構造的な圧力の下では、分離された導出を完璧に実行するLLMは、誤った隣接カラムをフェッチしたり、遅延リテラル演算で深い会計調整を代入したりといった、浅いヒューリスティックに回帰する。
最後に、Supervised Fine-Tuning (SFT) はゼロヒントゲイン(+8.54% Single, +3.82% Table)を獲得し、構造化ロジックがデータ中心のアライメントによって部分的に復元可能であることを検証した。
関連論文リスト
- Imbuing Large Language Models with Bidirectional Logic for Robust Chain Repair [44.80087038178069]
本稿では,デコーダのみのトランスフォーマーをネイティブに組み込んだトレーニングフレームワークであるTeleological Reasoning Infilling (TRI)を紹介する。
推測では、TRIは二重システムループ内の外科的修復モジュールとして動作する。
3つのベンチマークの実験では、TRIは全てのタスクで最先端のパフォーマンスを達成し、プロブレム当たりのトークン支出を31.2%削減した。
論文 参考訳(メタデータ) (2026-06-03T15:58:48Z) - A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation [59.98516959731531]
抽象推論能力は、抽象ルールを抽出し適用するためのLLMの知性と能力を反映する。
既存のベンチマークは、高価な手作業のアノテーション、そのスケールの制限、あるいは真の推論ではなく暗記のリスク測定に頼っている。
我々はA2RBenchという名の自動パイプラインを導入し、生成、拡張、評価、分析を行う。
論文 参考訳(メタデータ) (2026-05-17T06:14:20Z) - TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering [80.93487993878836]
現実世界のクエリの一般的なクラスは暗黙的に予測され、単に検索するのではなく、歴史的パターンから観測されていない回答を推測する必要がある。
これらのクエリには、潜在意図を認識することと、大規模テーブル上での信頼性の高い予測推論という2つの課題がある。
単点予測から意思決定,処理効果分析,複雑な推論に至るまで,4つのサブタスクにわたる779のサンプルからなるベンチマークであるTopBenchを紹介する。
論文 参考訳(メタデータ) (2026-04-30T16:22:51Z) - How LLMs Fail and Generalize in RTL Coding for Hardware Design? [56.361436215029045]
我々は,認知理論に触発された問題解決性に基づく新しい誤り分類法を導入する。
我々の分類学は、障害を構文、意味、解決可能な機能、解決不可能な機能タイプに分類する。
論文 参考訳(メタデータ) (2026-04-26T14:34:49Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - TableMind++: An Uncertainty-Aware Programmatic Agent for Tool-Augmented Table Reasoning [44.20336483508951]
テーブル推論は、意味的理解と正確な数値操作を共同で行うモデルを必要とする。
これらの制約に対処するため、我々は以前TableMindをチューニングベースの自律型プログラムエージェントとして提案した。
この基盤をTableMind++に拡張し、新しい不確実性を認識した推論フレームワークを導入しました。
論文 参考訳(メタデータ) (2026-03-08T08:31:33Z) - CMT-Bench: Cricket Multi-Table Generation Benchmark for Probing Robustness in Large Language Models [11.167804698594866]
我々は,ライブクリケットによる診断ベンチマークであるCMT-Benchを紹介する。
抽出サマリー,入力長による単調な劣化,実体形変化による一貫した精度低下を伴わない大きな滴が見つかる。
論文 参考訳(メタデータ) (2025-10-20T23:51:28Z) - seqBench: A Tunable Benchmark to Quantify Sequential Reasoning Limits of LLMs [1.0519693622157462]
我々は,Large Language Models (LLMs) における逐次推論限界を探索するベンチマークであるseqBenchを紹介する。
検索の複雑さが最小限であるにもかかわらず、セクベンチの構造的推論タスクでは、トップパフォーマンスモデルでさえ体系的に失敗することがわかった。
論文 参考訳(メタデータ) (2025-09-21T01:32:13Z) - LLM-Symbolic Integration for Robust Temporal Tabular Reasoning [69.27153114778748]
本研究では,システムおよび制御された評価のための合成データセットであるTempTabQA-Cを紹介する。
この構造化アプローチにより、LLM(Large Language Models)はsqlクエリの生成と実行を可能にし、一般化とバイアス軽減の強化を行う。
論文 参考訳(メタデータ) (2025-06-06T05:14:04Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z) - DCR: Divide-and-Conquer Reasoning for Multi-choice Question Answering with LLMs [9.561022942046279]
大規模言語モデル(LLM)の推論能力を高めるため,DCR(Divide and Conquer Reasoning)を提案する。
まず、信頼性スコア(mathcalCS$)に基づいて質問を2つのサブセットに分類する。
特に,質問を信頼性スコア(mathcalCS$)に基づいて2つのサブセットに分類する。
論文 参考訳(メタデータ) (2024-01-10T14:38:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。