論文の概要: FinVerse: Financial Time-Series Benchmark
- arxiv url: http://arxiv.org/abs/2608.03259v1
- Date: Tue, 04 Aug 2026 07:32:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.081253
- Title: FinVerse: Financial Time-Series Benchmark
- Title(参考訳): FinVerse:金融時系列ベンチマーク
- Abstract要約: ファイナンスドメインの時系列予測ベンチマークであるFinVerseを紹介し、より現実的な評価に向けて第一歩を踏み出した。
均一なポイント予測や確率的精度を重視した一般的な予測ベンチマークとは異なり、FinVerseは78評価指標からなる11のメトリクスファミリを定義している。
43の公共時系列予測基盤モデルを分析した結果, 総合予測基準下での強い性能が必ずしも有用な財務予測に変換されないことがわかった。
- 参考スコア(独自算出の注目度): 13.359564942661251
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: As time-series foundation models have emerged, the need for benchmarks that can evaluate their forecasting ability in meaningful ways has become increasingly important. Existing time-series forecasting benchmarks provide useful standardized comparisons, but they often evaluate heterogeneous series with uniform error-based metrics. Strong performance under such metrics does not necessarily imply that a model's forecasts will support the best real-world decisions across domains. For example, in stock forecasting, correctly predicting whether a price will rise or fall can be more directly relevant to realized returns than minimizing point-wise forecast error alone. To this end, we introduce FinVerse, a finance-domain time-series forecasting benchmark that takes a first step toward more realistic evaluation. The released FinVerse data artifact contains 116,897 financial time series with 171.1M observations, of which 60,232 series with 17.4M observations are selected as evaluated targets based on their economic relevance to financial decisions. Unlike generic forecasting benchmarks that primarily emphasize uniform point-forecast or probabilistic accuracy, FinVerse defines 11 metric families comprising 78 evaluation metrics and assigns the most appropriate evaluation metrics to each individual time series based on its underlying economic meaning. Our analysis of 43 public time-series forecasting foundation models shows that strong performance under generic forecasting criteria does not necessarily translate into useful financial forecasts. This finding highlights the need for domain-aware benchmarks that evaluate models under objectives closer to real-world decision making.
- Abstract(参考訳): 時系列基盤モデルが出現するにつれて、有意義な方法で予測能力を評価できるベンチマークの必要性が高まっている。
既存の時系列予測ベンチマークは、有用な標準化された比較結果を提供するが、不均一な時系列をエラーベースのメトリクスで評価することが多い。
このような指標の下での強いパフォーマンスは、必ずしもモデルの予測がドメイン間の最高の現実的な決定をサポートすることを暗示するわけではない。
例えば、株価予測において、価格が上昇するか下落するかを正確に予測することは、ポイントワイズ予測エラーを最小化することよりも、実現したリターンに直接関連している。
この目的のために、ファイナンスドメインの時系列予測ベンチマークであるFinVerseを紹介し、より現実的な評価に向けて第一歩を踏み出した。
公表されたFinVerseデータアーティファクトは116,897の財務時系列と171.1Mの観測結果を含んでおり、そのうち60,232の17.4Mの観測結果が財務決定の経済的関連性に基づいて評価対象として選択されている。
均一な点予測や確率的精度を強調する一般的な予測ベンチマークとは異なり、FinVerseは78の評価指標からなる11のメトリクスファミリを定義し、その基礎となる経済的意味に基づいて各時系列に最も適切な評価指標を割り当てる。
43の公共時系列予測基盤モデルを分析した結果, 総合予測基準下での強い性能が必ずしも有用な財務予測に変換されないことがわかった。
この発見は、現実の意思決定に近い目的の下でモデルを評価するドメイン認識ベンチマークの必要性を強調している。
関連論文リスト
- FinBench: Time-Gated Calibration and Uncertainty Benchmarking for Agentic Financial Forecasting [0.0]
FinBenchは、財務予測のためのキャリブレーションと不確実性の品質を評価するために設計されたベンチマークである。
本稿では,ベンチマークの仕様を記述し,パイプラインの健全性チェックとして小さなパイロット走行を報告する。
論文 参考訳(メタデータ) (2026-06-24T01:27:30Z) - Nexus : An Agentic Framework for Time Series Forecasting [72.73790673303154]
時系列予測は、ニュースやイベントのような構造化されていないコンテキストデータによる推論を必要とする。
予測を特殊なステージに分解するマルチエージェント予測フレームワークであるNexusを紹介します。
本研究では,現在のLLMは,従来よりも強い固有予測能力を有することを示す。
論文 参考訳(メタデータ) (2026-05-14T05:12:13Z) - Quantifying the Risk-Return Tradeoff in Forecasting [0.0]
平均予測精度は予測信頼性と同じではない。
私は、ベンチマークに対する予測損失差をリターンシリーズとして扱います。
次に、シャープ比、ソルティーノ比、オメガ比、ドローダウンベースの指標など、金融のリスク調整されたパフォーマンス指標を用いて、これらのリターンを評価する。
論文 参考訳(メタデータ) (2026-05-10T19:21:12Z) - QuitoBench: A High-Quality Open Time Series Forecasting Benchmark [32.21290355342465]
時系列予測は、ファイナンス、ヘルスケア、クラウドコンピューティングにおいて重要である。
時系列予測のための状態バランスのベンチマークであるtextscQuitoBenchを紹介する。
論文 参考訳(メタデータ) (2026-03-27T02:24:34Z) - Accuracy Law for the Future of Deep Time Series Forecasting [65.46625911002202]
時系列予測は、部分的に観測可能で不確実な性質のため、本質的にゼロでない誤差の低い境界に直面する。
本稿では、ディープ時系列予測の性能上限をどうやって推定するかという根本的な問題に焦点をあてる。
新たに訓練された2,800以上の深層予測器の厳密な統計的テストに基づいて、深部モデルの最小予測誤差とウィンドウワイズ級数パターンの複雑さとの間に有意な指数関数的関係を見出した。
論文 参考訳(メタデータ) (2025-10-03T05:18:47Z) - FinZero: Launching Multi-modal Financial Time Series Forecast with Large Reasoning Model [27.20045729222667]
FinZeroは、FVLDBファイナンシャル時系列の推論、予測、分析的理解を行うために、UARPOによって微調整されたマルチモーダル事前訓練モデルである。
UARPOで微調整した後、FinZeroは高信頼グループのGPT-4oよりも予測精度が約13.48%向上した。
論文 参考訳(メタデータ) (2025-09-10T16:32:41Z) - Consistency Checks for Language Model Forecasters [54.62507816753479]
予測器の性能を,論理的に異なる質問に対する予測の整合性の観点から測定する。
我々は,一連の基本質問を生成し,これらの質問から整合性チェックをインスタンス化し,予測者の予測を導き,予測の整合性を測定する自動評価システムを構築した。
論文 参考訳(メタデータ) (2024-12-24T16:51:35Z) - GIFT-Eval: A Benchmark For General Time Series Forecasting Model Evaluation [90.53485251837235]
時系列基礎モデルはゼロショット予測に優れ、明示的なトレーニングなしで多様なタスクを処理する。
GIFT-Evalは、多様なデータセットに対する評価を促進するための先駆的なベンチマークである。
GIFT-Evalには、144,000の時系列と17700万のデータポイントの23のデータセットが含まれている。
論文 参考訳(メタデータ) (2024-10-14T11:29:38Z) - When Rigidity Hurts: Soft Consistency Regularization for Probabilistic
Hierarchical Time Series Forecasting [69.30930115236228]
確率的階層的時系列予測は時系列予測の重要な変種である。
ほとんどの手法は点予測に焦点を絞っており、確率的確率分布を十分に調整していない。
ProFHiTは,階層全体の予測分布を共同でモデル化する完全確率的階層予測モデルである。
論文 参考訳(メタデータ) (2023-10-17T20:30:16Z) - When Rigidity Hurts: Soft Consistency Regularization for Probabilistic
Hierarchical Time Series Forecasting [69.30930115236228]
確率的階層的時系列予測は時系列予測の重要な変種である。
ほとんどの手法は点予測に焦点を絞っており、確率的確率分布を十分に調整していない。
ProFHiTは,階層全体の予測分布を共同でモデル化する完全確率的階層予測モデルである。
論文 参考訳(メタデータ) (2022-06-16T06:13:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。