論文の概要: LEAF: A Living Benchmark for Event-Augmented Forecasting
- arxiv url: http://arxiv.org/abs/2605.16358v1
- Date: Sat, 09 May 2026 03:17:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 23:51:08.288642
- Title: LEAF: A Living Benchmark for Event-Augmented Forecasting
- Title(参考訳): LEAF: イベント拡張予測のためのリビングベンチマーク
- Abstract要約: LEAFは、イベント拡張予測タスクの最初の生きたベンチマークである。
我々は最先端のプロプライエタリかつオープンウェイトなLLMを評価した。
LLMは、より予測し易いと自信を持って判断し、より優れたパフォーマンスを実現する。
- 参考スコア(独自算出の注目度): 78.94019460534442
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) are increasingly applied to forecasting. To evaluate this capability while mitigating pre-training data contamination, several living benchmarks have been proposed. However, existing benchmarks either lack the multidimensional events essential for accurate forecasting due to data scarcity, or focus on relatively closed environments. To assess the predictive capabilities of LLMs in complex, real-world scenarios, we propose LEAF, the first living benchmark for event-augmented forecasting tasks, including future event probabilities, trend and time series forecasting. LEAF utilizes a recursive retrieval agent system paired with dual-agent cross-validation to provide comprehensive and relevant auxiliary text for forecasting. Evaluating state-of-the-art proprietary and open-weight LLMs, we find that these models can leverage signals extracted from complex events to enhance predictive performance. In the stock domain, we find that LLMs achieve better performance on equities they confidently identify as more predictable. Furthermore, the events demonstrate a strong correlation with the target equities. To this end, LEAF provides a necessary, dynamically updating testbed to continuously track and drive progress in event-driven forecasting tasks.
- Abstract(参考訳): 大きな言語モデル(LLM)は、予測にますます適用されています。
事前学習データ汚染を軽減しつつ、この能力を評価するために、いくつかの生きたベンチマークが提案されている。
しかし、既存のベンチマークでは、データの不足による正確な予測に不可欠な多次元イベントが欠落しているか、あるいは比較的閉じた環境に焦点を当てている。
複雑な実世界のシナリオにおけるLLMの予測能力を評価するため、LEAFは、将来の事象確率、トレンド、時系列予測を含む、イベント拡張予測タスクの最初の生きたベンチマークである。
LEAFは、二重エージェントのクロスバリデーションと組み合わせた再帰的検索エージェントシステムを用いて、予測のための包括的で関連する補助テキストを提供する。
最先端のプロプライエタリかつオープンウェイトなLLMを評価することで,複雑なイベントから抽出した信号を利用して予測性能を向上させることができることがわかった。
ストックドメインでは、LLMは、より予測可能であると自信を持って認識する株式でより良いパフォーマンスを達成する。
さらに、これらの事象は対象の株式と強い相関を示す。
この目的のために、LEAFはイベント駆動予測タスクの進捗を継続的に追跡し、推進するために、必要な、動的に更新されたテストベッドを提供する。
関連論文リスト
- LLM-based Agents for Forecasting and Prediction: Methods, Training, Evaluation, and Applications [76.41731220830714]
大規模言語モデル(LLM)は、言語ベースの推論と時間的データ、エビデンス検索、外部ツール、反復予測を組み合わせた予測システムをサポートするようになった。
ファイナンス、天気、健康、エネルギー、オペレーションの応用について検討し、評価に使用されるベンチマークとデータセットを要約する。
論文 参考訳(メタデータ) (2026-08-24T10:02:39Z) - Distribution-Aware Diffusion-LLM for Robust Ultra-Long-Term Time Series Forecasting [8.2867621159451]
時系列予測は基本的な機械学習タスクである。
最近の研究は、この目的のために、強力な一般化、パターン認識、ゼロショットまたは少数ショット機能のために、Large Language Models (LLMs)を探索している。
LLMに基づく予測パイプラインに条件付き拡散モデルを統合する新しいフレームワークDiffusion-LLMを提案する。
論文 参考訳(メタデータ) (2026-06-22T14:18:28Z) - CastFlow: Learning Role-Specialized Agentic Workflows for Time Series Forecasting [74.29761960394848]
大規模言語モデル(LLM)のための動的エージェント予測フレームワークであるCastFlowを提案する。
CastFlowは予測プロセスを計画、アクション、予測、リフレクションに編成し、エージェントワークフローを確立する。
第3に、CastFlowは、汎用推論と特殊な数値予測を組み合わせたロール特殊化設計を採用する。
論文 参考訳(メタデータ) (2026-04-30T13:24:42Z) - The Forecast Critic: Leveraging Large Language Models for Poor Forecast Identification [74.64864354503204]
本稿では,Large Language Models (LLM) を利用した予測自動監視システムであるThe Forecast Criticを提案する。
LLMの時系列予測品質を評価する能力を評価する。
合成および実世界の予測データを含む3つの実験を行った。
論文 参考訳(メタデータ) (2025-12-12T21:59:53Z) - Beyond Naïve Prompting: Strategies for Improved Zero-shot Context-aided Forecasting with LLMs [57.82819770709032]
大規模言語モデル (LLM) は、na "ive direct prompting" を通じて効果的な文脈支援予測を行うことができる。
ReDPは、明確な推論トレースを抽出することで、解釈可能性を改善し、コンテキスト上でモデルの推論を評価することができる。
CorDPはLLMを活用して、既存の予測をコンテキストで洗練し、現実の予測パイプラインにおける適用性を高める。
IC-DPは、文脈支援予測タスクの歴史的例を即時に組み込むことを提案し、大規模モデルにおいても精度を大幅に向上させる。
論文 参考訳(メタデータ) (2025-08-13T16:02:55Z) - Wisdom of the Crowds in Forecasting: Forecast Summarization for Supporting Future Event Prediction [17.021220773165016]
Future Event Prediction (FEP) は、複数のドメインにまたがる需要とアプリケーションの範囲にまたがる重要なアクティビティである。
予測方法の1つは、将来についての集合的な意見を収集して集約し、累積的な視点が今後の出来事の可能性を推定する可能性をもたらすように予測することである。
本研究では,個々の予測を集約することで,群衆の知恵に基づく今後のイベント予測を支援するために,既存の研究・フレームワークを編成する。
論文 参考訳(メタデータ) (2025-02-12T08:35:10Z) - Are LLMs Prescient? A Continuous Evaluation using Daily News as the Oracle [13.192628306219248]
本研究では,大規模言語モデルの時間的一般化と予測能力を評価するための連続評価手法として,将来の事象予測を提案する。
私たちのベンチマークであるDaily Oracleは、毎日のニュースから質問と回答のペアを自動的に生成します。
論文 参考訳(メタデータ) (2024-11-13T04:20:20Z) - Scaling Laws for Predicting Downstream Performance in LLMs [75.28559015477137]
この研究は、性能推定のためのより計算効率のよい指標として、事前学習損失に焦点を当てている。
FLP-Mは、事前トレーニング中に複数のソースからのデータセットを統合する実践的なニーズに対処する、パフォーマンス予測の基本的なアプローチである。
論文 参考訳(メタデータ) (2024-10-11T04:57:48Z) - A Comprehensive Evaluation of Large Language Models on Temporal Event Forecasting [45.0261082985087]
時間的事象予測のための大規模言語モデル(LLM)を総合的に評価する。
テキストによる微調整 LLM は性能を著しく向上させることができる。
しかし、LLMでは人気バイアスやロングテール問題などの問題が続いている。
論文 参考訳(メタデータ) (2024-07-16T11:58:54Z) - F-FOMAML: GNN-Enhanced Meta-Learning for Peak Period Demand Forecasting with Proxy Data [65.6499834212641]
本稿では,需要予測をメタラーニング問題として定式化し,F-FOMAMLアルゴリズムを開発した。
タスク固有のメタデータを通してドメインの類似性を考慮することにより、トレーニングタスクの数が増加するにつれて過剰なリスクが減少する一般化を改善した。
従来の最先端モデルと比較して,本手法では需要予測精度が著しく向上し,内部自動販売機データセットでは平均絶対誤差が26.24%,JD.comデータセットでは1.04%削減された。
論文 参考訳(メタデータ) (2024-06-23T21:28:50Z) - Can Language Models Use Forecasting Strategies? [14.332379032371612]
実世界の出来事と関連する人間の予測の新たなデータセットを用いた実験について述べる。
モデルはまだ、未来に関する正確な予測に苦戦している。
論文 参考訳(メタデータ) (2024-06-06T19:01:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。