論文の概要: Forecast-Dojo: Replayable Environments for Benchmarking and Training LLM Forecasting Agents
- arxiv url: http://arxiv.org/abs/2609.28876v1
- Date: Thu, 24 Sep 2026 00:52:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.622384
- Title: Forecast-Dojo: Replayable Environments for Benchmarking and Training LLM Forecasting Agents
- Title(参考訳): Forecast-Dojo: LLM予測エージェントのベンチマークとトレーニングのための再生可能な環境
- Abstract要約: Forecast-Dojoは、LSM予測エージェントのベンチマークとトレーニングのための再生可能な環境である。
Forecast-Dojoには1,568のPolymarketイベントがあり、トレーニングと評価期間に分割され、18.8Mの日付のニュース記事がある。
- 参考スコア(独自算出の注目度): 17.265952476219123
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Forecast-Dojo, a replayable environment for benchmarking and training LLM forecasting agents. It combines resolved prediction-market questions with dated news, allowing agents to research an event and revisit their predictions at successive historical dates. The same tasks and tools support repeated evaluation, collection of training interactions, and feedback from recorded outcomes without waiting for new events to resolve. Forecast-Dojo contains 1,568 Polymarket events, split by time into training and evaluation periods, and 18.8M dated news articles. In an evaluation of 12 models, research tools lower Brier score for all 12. Forecasts also improve as events unfold, with the largest gains at steps where more newly dated evidence is recorded. Every model still trails historical market forecasts in both Brier score and accuracy. A belief notebook carried between dates lowers research cost but does not consistently improve forecast quality. Beyond evaluation, Forecast-Dojo provides interaction trajectories and outcome feedback for agent learning, with supervised fine-tuning as a proof of concept.
- Abstract(参考訳): 我々は,LDM予測エージェントのベンチマークとトレーニングを行うための再生可能な環境であるForecast-Dojoを紹介した。
解決された予測市場質問と日付付きニュースを組み合わせることで、エージェントはイベントを調査し、連続した歴史的日付で予測を再考することができる。
同じタスクやツールは、新たなイベントの解決を待つことなく、繰り返し評価、トレーニングインタラクションの収集、記録された結果からのフィードバックをサポートする。
Forecast-Dojoには1,568のPolymarketイベントがあり、トレーニングと評価期間に分割され、18.8Mの日付のニュース記事がある。
12モデルの評価では,調査ツールがBrierスコアを12。
イベントが広がるにつれて予測も改善され、より新しい証拠が記録されるステップで最大の利益が得られた。
どのモデルも、Brierのスコアと正確性の両方において、歴史的市場予測に追随している。
日付間で運ばれる信条ノートは、研究コストを下げるが、常に予測品質を向上しない。
評価以外にも、Forecast-Dojoはエージェント学習のためのインタラクショントラジェクトリと結果フィードバックを提供し、教師付き微調整を概念実証として提供する。
関連論文リスト
- From Narrative to Auditable Forecasts: A Structured Scaffold for Agentic Forecasting [28.10023756949099]
AuditForecastは構造化確率予測のためのエージェント的な足場である。
予測を適切な定量的ベースラインモデルで固定し、モデル誘導データ検索を使用してベース確率を導出し、モデルの範囲外で状況要因を更新する。
AuditForecastは、予測構築を明確にし、系統的なポストホック分析をサポートする監査可能な予測レポートを生成する。
論文 参考訳(メタデータ) (2026-09-05T05:58:39Z) - LLM-based Agents for Forecasting and Prediction: Methods, Training, Evaluation, and Applications [76.41731220830714]
大規模言語モデル(LLM)は、言語ベースの推論と時間的データ、エビデンス検索、外部ツール、反復予測を組み合わせた予測システムをサポートするようになった。
ファイナンス、天気、健康、エネルギー、オペレーションの応用について検討し、評価に使用されるベンチマークとデータセットを要約する。
論文 参考訳(メタデータ) (2026-08-24T10:02:39Z) - LEAF: A Living Benchmark for Event-Augmented Forecasting [78.94019460534442]
LEAFは、イベント拡張予測タスクの最初の生きたベンチマークである。
我々は最先端のプロプライエタリかつオープンウェイトなLLMを評価した。
LLMは、より予測し易いと自信を持って判断し、より優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-05-09T03:17:59Z) - Scaling Open-Ended Reasoning to Predict the Future [56.672065928345525]
我々は、オープンエンドの予測質問の予測を行うために言語モデルを訓練する。
トレーニングデータをスケールアップするために、毎日のニュースで報告されるグローバルイベントから新しい予測質問を合成する。
トレーニングの予測によるキャリブレーションの改善は、一般的なベンチマークで一般化されている。
論文 参考訳(メタデータ) (2025-12-31T18:59:51Z) - Bench to the Future: A Pastcasting Benchmark for Forecasting Agents [0.14980193397844666]
Bench To the Futureは、数百の高品質な質問がすでにその解決が知られている"pastcasting"ベンチマークである。
その結果,我々の過去の放送環境は,未解決の質問に対してインターネットを用いた予測に基づく結果に匹敵する結果が得られることが示唆された。
これは生きたベンチマークであり、トレーニングデータのカットオフ日数の増加を考慮し、新たな質問を継続的に追加するつもりです。
論文 参考訳(メタデータ) (2025-06-11T16:18:40Z) - Outcome-based Reinforcement Learning to Predict the Future [1.4313866885019229]
コンパクトな(14B)推論モデルは、o1のようなフロンティアモデルの予測精度に適合または超えるように訓練可能であることを示す。
ポリマーケットのトレーディングシミュレーションでは、その賭けが10%以上の投資のリターンをもたらすと見積もっている。
論文 参考訳(メタデータ) (2025-05-23T14:56:07Z) - Consistency Checks for Language Model Forecasters [54.62507816753479]
予測器の性能を,論理的に異なる質問に対する予測の整合性の観点から測定する。
我々は,一連の基本質問を生成し,これらの質問から整合性チェックをインスタンス化し,予測者の予測を導き,予測の整合性を測定する自動評価システムを構築した。
論文 参考訳(メタデータ) (2024-12-24T16:51:35Z) - From News to Forecast: Integrating Event Analysis in LLM-Based Time Series Forecasting with Reflection [16.47323362700347]
本稿では,テキストデータと時系列データの両方を解析することで時系列予測を強化する新しい手法を提案する。
言語を媒体として,社会イベントを予測モデルに適応的に統合し,ニュースコンテンツと時系列のゆらぎを一致させてより豊かな洞察を提供する。
具体的には、LSMをベースとしたエージェントを用いて、無関係なニュースを反復的にフィルタリングし、人間ライクな推論を用いて予測を評価する。
論文 参考訳(メタデータ) (2024-09-26T03:50:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。