論文の概要: Do Your Own Research: Learning to Forecast by Learning to Search
- arxiv url: http://arxiv.org/abs/2610.01955v1
- Date: Thu, 01 Oct 2026 16:12:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.265126
- Title: Do Your Own Research: Learning to Forecast by Learning to Search
- Title(参考訳): 独自の研究を行う - 検索を学ぶことで予測を学習する
- Abstract要約: アウトカムベースの強化学習は、言語モデルをトレーニングして現実世界の事象を予測できるが、事前予測作業は、テスト時にのみエージェントリサーチをトレーニングまたはデプロイする前に研究コンテキストを凍結する。
我々は2100以上の解決されたPolymarket質問から構築されたエージェント予測環境、データセット、ハーネスを紹介する。
訓練は、エージェントが情報とどのように相互作用するかを変える:キャリブレーションは30-40%改善し、証拠の規律が学習されると、探索の試みはロールアウト毎に3.8から2.25に低下する。
- 参考スコア(独自算出の注目度): 0.13325819064668773
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Outcome-based reinforcement learning can train language models to forecast real-world events, but prior forecasting work either freezes research context before training or deploys agentic research only at test time, so the skill of gathering evidence is never shaped by the reward. We introduce an agentic forecasting environment, dataset, and harness built from 2,100+ resolved Polymarket questions; the agent acquires its own context at rollout time (web search, page reading, and financial time series, all restricted by layered leak filtering to information published before each question's cutoff), and we train Qwen3.5-35B-A3B (3B active parameters) on it with single-epoch GRPO under a Brier-score reward. Training changes how the agent interacts with information: calibration improves 30-40%, and search attempts fall from 3.8 to 2.25 per rollout as evidence discipline is learned. Evaluated in an identical harness against four frontier models, the trained policy also finishes ahead of every frontier model tested at evidence-based forecasting, including Claude Opus 4.5 (soft-Brier 0.254 vs. 0.256, n=265), at about 5% of the inference cost, and its margin is widest on the hardest questions, the ones the crowd itself had not decided. We release the environment, dataset, and per-rollout records as a reusable harness for temporal forecasting agents.
- Abstract(参考訳): アウトカムベースの強化学習は、言語モデルをトレーニングして現実世界の出来事を予測することができるが、事前予測作業は、トレーニング前に研究コンテキストを凍結するか、テスト時にのみエージェント研究を展開させるため、証拠収集のスキルは報酬によって形成されることはない。
我々は2100以上の解決されたPolymarket質問から構築されたエージェント予測環境、データセット、ハーネスを導入し、そのエージェントはロールアウト時に独自のコンテキスト(Web検索、ページ読み込み、ファイナンシャル時系列、各質問のカット前に公開された情報に層状リークフィルタリングによって制限される)を取得し、単一エピックGRPOを用いてQwen3.5-35B-A3B (3B アクティブパラメータ)をトレーニングする。
訓練は、エージェントが情報とどのように相互作用するかを変える:キャリブレーションは30-40%改善し、証拠の規律が学習されると、探索の試みはロールアウト毎に3.8から2.25に低下する。
4つのフロンティアモデルに対する同一のハーネスで評価され、訓練されたポリシーは、クロード・オプス4.5(ソフトブリエ0.254対0.256, n=265)を含むエビデンスベースの予測でテストされた全てのフロンティアモデルよりも、推論コストの約5%で終了する。
時間予測エージェントのための再利用可能なハーネスとして,環境,データセット,ロールアウト毎のレコードをリリースする。
関連論文リスト
- Does Learning to Predict the World Help Agents Act? Auditing World-Model Post-Training [33.73456133272386]
訓練後、エージェントは次の観察を予測し、その予測を報酬または直接的な監視信号に変換する必要がある。
我々は、トレーニングプロセス中に、真の次の観測対象を、分布不一致の観察に置き換える。
この発見をVisualWebArenaに一般化します。そこでは、ランダムリワードトレーニングがベースモデルに対してpass@64を14.3%上昇させます。
論文 参考訳(メタデータ) (2026-09-27T08:07:05Z) - Forecast-Dojo: Replayable Environments for Benchmarking and Training LLM Forecasting Agents [17.265952476219123]
Forecast-Dojoは、LSM予測エージェントのベンチマークとトレーニングのための再生可能な環境である。
Forecast-Dojoには1,568のPolymarketイベントがあり、トレーニングと評価期間に分割され、18.8Mの日付のニュース記事がある。
論文 参考訳(メタデータ) (2026-09-24T00:52:53Z) - An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction [2.0451307225357422]
本研究では,会話データ収集,構造化データ処理,行動予測を統合した3エージェントワークフローを提案する。
9つの局所展開型大言語モデル (LLM) を4つのゼロショットプロンプト・コンテクスト条件で評価した。
習慣的旅行情報は最も一貫した利益をもたらし、専門家フレーミングは一般的にロールプレイよりも優れており、習慣的旅行情報が入手できない場合にペルソナ情報は最も有用であった。
論文 参考訳(メタデータ) (2026-08-20T17:57:42Z) - OpenThoughts-Agent: Data Recipes for Agentic Models [99.10629645072653]
OT-Agentプロジェクトはエージェントモデルをトレーニングするための完全にオープンなデータキュレーションパイプラインである。
パイプラインの各段階について100以上の制御アブレーション実験を行った。
このデータセットには、パイプラインから100Kのサンプルと微調整されたQwen3-32Bのトレーニングセットが組み込まれています。
論文 参考訳(メタデータ) (2026-06-23T17:34:29Z) - Scaling Open-Ended Reasoning to Predict the Future [56.672065928345525]
我々は、オープンエンドの予測質問の予測を行うために言語モデルを訓練する。
トレーニングデータをスケールアップするために、毎日のニュースで報告されるグローバルイベントから新しい予測質問を合成する。
トレーニングの予測によるキャリブレーションの改善は、一般的なベンチマークで一般化されている。
論文 参考訳(メタデータ) (2025-12-31T18:59:51Z) - Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training [68.94373533768501]
我々は、知識保持をモデル化し、そのコーパスから事実情報を記憶するための事前学習言語モデルの能力を示し、学習前にそれを推定する原則的手法を導入する。
本稿では,知識周波数,知識特異度,モデルサイズを統合し,クローズドブック質問応答(QA)の精度を予測する情報理論予測器である,サイズ依存型相互情報(SMI)を提案する。
論文 参考訳(メタデータ) (2025-02-06T13:23:53Z) - Unifying Language Learning Paradigms [96.35981503087567]
データセットやセットアップ全体にわたって普遍的に有効である事前学習モデルのための統一的なフレームワークを提案する。
本研究では, 事前学習対象を相互に配置し, 異なる対象間の補間を効果的に行う方法を示す。
また,テキスト内学習において,ゼロショットSuperGLUEで175B GPT-3,ワンショット要約でT5-XXLの性能を3倍に向上させた。
論文 参考訳(メタデータ) (2022-05-10T19:32:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。