論文の概要: FinBench: Time-Gated Calibration and Uncertainty Benchmarking for Agentic Financial Forecasting
- arxiv url: http://arxiv.org/abs/2607.16229v1
- Date: Wed, 24 Jun 2026 01:27:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.045563
- Title: FinBench: Time-Gated Calibration and Uncertainty Benchmarking for Agentic Financial Forecasting
- Title(参考訳): FinBench: エージェントファイナンシャル予測のための時間拡張キャリブレーションと不確実性ベンチマーク
- Authors: Rishab Ghosh, Vinay Devarakonda,
- Abstract要約: FinBenchは、財務予測のためのキャリブレーションと不確実性の品質を評価するために設計されたベンチマークである。
本稿では,ベンチマークの仕様を記述し,パイプラインの健全性チェックとして小さなパイロット走行を報告する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Large language models (LLMs) are increasingly used as components of agentic systems that observe, plan, and act. In finance, even "assistive" systems become decision-relevant once their outputs are used to size trades or allocate risk. A key failure mode is the confidence--competence gap: a model that is only slightly better than chance but consistently overconfident will, under typical bet-sizing rules, generate negative long-run growth. Existing benchmarks emphasize semantic understanding or point accuracy, but do not directly test probabilistic calibration under the temporal constraints and non-stationarity that define real markets. We introduce FinBench, a benchmark designed to evaluate calibration and uncertainty quality for financial forecasting in a setting that is (i) strictly time-gated to avoid look-ahead bias and (ii) evaluated with strictly proper scoring rules that penalize hallucinated confidence. FinBench tasks require models to output (a) a probability of positive return and (b) an 80% prediction interval for realized log return; evaluation uses the Brier score and the Winkler interval score, along with skill scores against hard baselines. This paper describes the benchmark specification and reports a small pilot run (one trading day; three liquid tickers; 33 forecasts) as a sanity check of the pipeline. The pilot illustrates how calibration-sensitive metrics distinguish between "confident but fragile" behavior and uncertainty-aware forecasting.
- Abstract(参考訳): 大規模言語モデル(LLM)は、観察、計画、行動を行うエージェントシステムのコンポーネントとして、ますます使われている。
金融において、「補助的」なシステムでさえ、取引を縮小したりリスクを割り当てるために生産物が使用されると、決定に関係する。
重要な失敗モードは、信頼-競合ギャップである: チャンスよりわずかに優れているが、常に自信過剰なモデルで、典型的なベットサイズルールの下では、負の長期的成長を生み出す。
既存のベンチマークでは意味的理解やポイント精度が重視されているが、実際の市場を定義する時間的制約と非定常性の下で確率的キャリブレーションを直接テストすることはできない。
金融予測のためのキャリブレーションと不確実性品質を評価するためのベンチマークであるFinBenchを紹介する。
(i)見落としバイアスを避けるために厳格にタイムゲートされた
(二) 幻覚的自信を罰する厳格な正当な採点規則で評価すること。
FinBenchタスクは出力するモデルを必要とする
a) 正のリターンの確率と
b) ログリターンを実現するための80%の予測区間; 評価は、ハードベースラインに対するスキルスコアとともに、ブライアスコアとウィンクラーインターバルスコアを使用する。
本稿では,ベンチマーク仕様を記述し,パイプラインの健全性チェックとして小型のパイロットラン(トレーディング日1日,液体チッカー3日,予測33日)を報告する。
パイロットは、キャリブレーションに敏感なメトリクスが、"信頼できるが脆弱"な振る舞いと不確実性を認識した予測をいかに区別するかを説明している。
関連論文リスト
- Expectations vs. Realities: The Cost of MSE-Optimal Forecasting Under Conditional Uncertainty [1.2489632787815885]
多段階時系列予測(MSF)は平均二乗誤差(MSE)などのポイントワイド誤差指標を用いて一般的に評価される。
これは条件的不確実性の下では誤解を招く可能性を示し、条件的期待はより長い地平線における典型的な実効値とは無関係となる。
これにより、MSF評価における点精度と限界リアリズムの基本的なモデルに依存しないトレードオフが確立される。
論文 参考訳(メタデータ) (2026-06-03T01:50:32Z) - Quantifying the Risk-Return Tradeoff in Forecasting [0.0]
平均予測精度は予測信頼性と同じではない。
私は、ベンチマークに対する予測損失差をリターンシリーズとして扱います。
次に、シャープ比、ソルティーノ比、オメガ比、ドローダウンベースの指標など、金融のリスク調整されたパフォーマンス指標を用いて、これらのリターンを評価する。
論文 参考訳(メタデータ) (2026-05-10T19:21:12Z) - Bi-Level Chaotic Fusion Based Graph Convolutional Network for Stock Market Prediction Interval [0.0]
金融市場の予測は本質的に不確実であるが、ほとんどのディープラーニングアプローチは不確実性のない単一見積もりに依存している。
この問題は予測間隔を用いて解くことができ、予測の不確実性と低い境界が得られる。
しかし、現在の手法は資産間の関係を無視したり、適切な校正シャープネスを確保することができない傾向にある。
論文 参考訳(メタデータ) (2026-05-05T05:06:42Z) - Statistical Inference for Score Decompositions [0.0]
本稿では,評価関数を3つの解釈可能な成分に分割するスコア分解法を提案する。
調査インフレ予測では,総合的な予測能力がない場合でも,識別能力は著しく異なることが判明した。
バックテストのパフォーマンスから予測精度を遠ざけることで、現在の銀行規制における重大な欠点を明らかにする。
論文 参考訳(メタデータ) (2026-03-04T16:57:08Z) - Predicting Mortgage Default with Machine Learning: AutoML, Class Imbalance, and Leakage Control [7.5947844798897535]
実世界のローンレベルのデータセットを用いて、住宅ローンのデフォルト予測に複数の機械学習アプローチを比較した。
我々は、発端と報告期間の両方を制約する厳格な時間分割である漏洩認識機能選択を採用する。
複数の正対負の比率で、性能は安定であり、AutoMLアプローチは評価されたモデルの中で最強のAUROCを達成する。
論文 参考訳(メタデータ) (2026-01-27T15:25:04Z) - Consistency Checks for Language Model Forecasters [54.62507816753479]
予測器の性能を,論理的に異なる質問に対する予測の整合性の観点から測定する。
我々は,一連の基本質問を生成し,これらの質問から整合性チェックをインスタンス化し,予測者の予測を導き,予測の整合性を測定する自動評価システムを構築した。
論文 参考訳(メタデータ) (2024-12-24T16:51:35Z) - Revisiting Confidence Estimation: Towards Reliable Failure Prediction [53.79160907725975]
多くの信頼度推定法は誤分類誤りを検出するのに有害である。
本稿では, 最先端の故障予測性能を示す平坦な最小値を求めることにより, 信頼性ギャップを拡大することを提案する。
論文 参考訳(メタデータ) (2024-03-05T11:44:14Z) - When Does Confidence-Based Cascade Deferral Suffice? [69.28314307469381]
カスケードは、推論コストをサンプル毎に適応的に変化させる古典的な戦略である。
deferralルールは、シーケンス内の次の分類子を呼び出すか、または予測を終了するかを決定する。
カスケードの構造に執着しているにもかかわらず、信頼に基づく推論は実際は極めてうまく機能することが多い。
論文 参考訳(メタデータ) (2023-07-06T04:13:57Z) - Beyond calibration: estimating the grouping loss of modern neural
networks [68.8204255655161]
適切なスコアリングルール理論は、キャリブレーション損失が与えられた場合、個々のエラーを特徴づける欠片がグループ化損失であることを示している。
視覚およびNLPにおける現代のニューラルネットワークアーキテクチャは、特に分散シフト設定においてグループ化損失を示す。
論文 参考訳(メタデータ) (2022-10-28T07:04:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。