論文の概要: Reinforcement Learning for LLM-based Event Forecasting
- arxiv url: http://arxiv.org/abs/2606.15917v1
- Date: Sun, 14 Jun 2026 16:46:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.9401
- Title: Reinforcement Learning for LLM-based Event Forecasting
- Title(参考訳): LLMに基づくイベント予測のための強化学習
- Abstract要約: グループ相対政策最適化 (GRPO) は近年, サンプルとメモリ効率のよい強化学習法を考案した。
我々は、現在の情報を取得する能力を備えた1.5Bから14Bパラメータの範囲で、事前学習したLLMを微調整する。
1.5Bパラメータ変換器(Qwen 2.5 1.5B)を、同じデータセット上でClaude Sonnet 3.5よりも優れたパフォーマンスを予測できる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We use Group Relative Policy Optimization (GRPO), a recently devised sample and memory efficient reinforcement learning method, to finetune pretrained LLMs in the range of 1.5B to 14B parameters equipped with the ability to get current information through the use of a Wikipedia revisions tool, or news summaries, to forecast real events beyond the knowledge cutoff of the LLM, as well as problems made to simulate different aspects of the dynamics of that training. We use the results of these experiments to comment on the scaling capability of LLMs for forecasting, as well as classify how judgmental forecasting fits into the verifiable/unverifiable domain taxonomy, considering the impact of the inherent aleatoric uncertainty when forecasting future events (e.g. the roll of a die). As a result of the GRPO training, we manage to bring a 1.5B parameter transformer (Qwen 2.5 1.5B) to forecasting performance superior to Claude Sonnet 3.5 over the same dataset as measured by cross entropy from the market agreed probabilities. We also discuss various dead ends on the path to this result.
- Abstract(参考訳): 我々は、最近考案されたサンプルとメモリ効率のよい強化学習手法であるグループ相対ポリシー最適化(GRPO)を用いて、1.5Bから14Bパラメータの範囲で事前学習したLCMを微調整し、ウィキペディア改訂ツールやニュース要約を用いて現在の情報を取得する能力を備え、LCMの知識遮断を超えた実際の事象を予測し、そのトレーニングのダイナミクスの異なる側面をシミュレートする。
本研究では, これらの実験結果を用いて, LLMのスケーリング能力についてコメントするとともに, 将来の事象(例えば, ダイのロール)の予測において, 固有のアレタリックな不確実性の影響を考慮し, 判定予測が検証不可能な領域分類にどのように適合するかを分類する。
その結果,1.5Bパラメータ変換器(Qwen 2.5 1.5B)をClaude Sonnet 3.5よりも優れた性能を市場合意確率のクロスエントロピーで測定した同じデータセット上で予測することに成功した。
また、この結果への道の様々な致命的な結末についても論じる。
関連論文リスト
- LLM-based Agents for Forecasting and Prediction: Methods, Training, Evaluation, and Applications [76.41731220830714]
大規模言語モデル(LLM)は、言語ベースの推論と時間的データ、エビデンス検索、外部ツール、反復予測を組み合わせた予測システムをサポートするようになった。
ファイナンス、天気、健康、エネルギー、オペレーションの応用について検討し、評価に使用されるベンチマークとデータセットを要約する。
論文 参考訳(メタデータ) (2026-08-24T10:02:39Z) - LEAF: A Living Benchmark for Event-Augmented Forecasting [78.94019460534442]
LEAFは、イベント拡張予測タスクの最初の生きたベンチマークである。
我々は最先端のプロプライエタリかつオープンウェイトなLLMを評価した。
LLMは、より予測し易いと自信を持って判断し、より優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-05-09T03:17:59Z) - The Forecast Critic: Leveraging Large Language Models for Poor Forecast Identification [74.64864354503204]
本稿では,Large Language Models (LLM) を利用した予測自動監視システムであるThe Forecast Criticを提案する。
LLMの時系列予測品質を評価する能力を評価する。
合成および実世界の予測データを含む3つの実験を行った。
論文 参考訳(メタデータ) (2025-12-12T21:59:53Z) - Bridging the Gap Between Bayesian Deep Learning and Ensemble Weather Forecasts [100.26854618129039]
天気予報は、大気のカオス的な性質によって根本的に挑戦されている。
ベイジアンディープラーニング(BDL)の最近の進歩は、有望だがしばしば非接続な代替手段を提供する。
気象予報のための統合型BDLフレームワークにより,これらのパラダイムを橋渡しする。
論文 参考訳(メタデータ) (2025-11-18T07:49:52Z) - Using LLMs to Directly Guess Conditional Expectations Can Improve Efficiency in Causal Estimation [0.3222802562733787]
過去のデータに基づいて学習した生成モデルによる予測は,これらの推定器の性能向上に有効であることを示す。
オンラインジュエリーオークションの小さなデータセットを用いてケーススタディを考察し,LLM生成推定を予測子として含めることによって推定効率が向上することを示した。
論文 参考訳(メタデータ) (2025-10-09T03:34:06Z) - Outcome-based Reinforcement Learning to Predict the Future [1.4313866885019229]
コンパクトな(14B)推論モデルは、o1のようなフロンティアモデルの予測精度に適合または超えるように訓練可能であることを示す。
ポリマーケットのトレーディングシミュレーションでは、その賭けが10%以上の投資のリターンをもたらすと見積もっている。
論文 参考訳(メタデータ) (2025-05-23T14:56:07Z) - Scalable Multi-Stage Influence Function for Large Language Models via Eigenvalue-Corrected Kronecker-Factored Parameterization [31.379237532476875]
事前訓練された大規模言語モデル(LLM)は、一般的に下流タスクに適応するように微調整される。
本稿では,学習前データに対する微調整LDMの属性予測のための多段階影響関数を提案する。
論文 参考訳(メタデータ) (2025-05-08T07:43:44Z) - Can Pre-training Indicators Reliably Predict Fine-tuning Outcomes of LLMs? [42.608899417822656]
本研究では,501BパラメータLLM変種を用いて,系統的な事前学習構成を持つデータセットを構築した。
本稿では,事前学習から得られた新しい教師なしおよび教師なしのプロキシメトリクスを導入し,相対的な性能予測誤差率を50%以上削減する。
論文 参考訳(メタデータ) (2025-04-16T21:19:09Z) - Scaling Laws for Predicting Downstream Performance in LLMs [75.28559015477137]
この研究は、性能推定のためのより計算効率のよい指標として、事前学習損失に焦点を当てている。
FLP-Mは、事前トレーニング中に複数のソースからのデータセットを統合する実践的なニーズに対処する、パフォーマンス予測の基本的なアプローチである。
論文 参考訳(メタデータ) (2024-10-11T04:57:48Z) - Prediction-Oriented Bayesian Active Learning [51.426960808684655]
予測情報ゲイン(EPIG)は、パラメータではなく予測空間における情報ゲインを測定する。
EPIGは、さまざまなデータセットやモデルにわたるBALDと比較して、予測パフォーマンスが向上する。
論文 参考訳(メタデータ) (2023-04-17T10:59:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。