論文の概要: Understanding Reasoning from Pretraining to Post-Training
- arxiv url: http://arxiv.org/abs/2607.16097v1
- Date: Fri, 17 Jul 2026 16:31:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.901092
- Title: Understanding Reasoning from Pretraining to Post-Training
- Title(参考訳): プレトレーニングからポストトレーニングへの推論の理解
- Abstract要約: チェスは前訓練から後訓練までのパイプライン全体にわたって推論を研究するための制御テストベッドとして使用します。
所定のRL計算レベルでのポストRL性能は、事前学習損失からよく予測できる。
さらに,数学領域のテキスト上での1B言語モデルの訓練により,我々の研究結果がチェスを超えるか否かを検証した。
- 参考スコア(独自算出の注目度): 53.890128750021375
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) has become central to improving large language models (LLMs) on complex reasoning tasks, yet RL post-training is largely studied in isolation from the pretraining that precedes it. As a result, two basic questions remain open: (1) how do pretraining choices (model size, data) shape the returns to RL compute, and (2) what does RL actually do to the model? These questions are difficult to study in the standard LLM setting: pretraining corpora are vast and uncontrolled, making it hard to attribute behaviors to pretraining versus RL, and systematic compute sweeps across both stages are prohibitively expensive. To address these challenges, we use chess as a controlled testbed for studying reasoning across the full pretraining-to-post-training pipeline. We follow the standard LLM training pipeline by pretraining language models from 5M to 1B parameters on human chess games, supervised fine-tuning on synthetic reasoning traces, and running RL on chess puzzles with verifiable rewards. Using this framework, we find that the post-RL performance at given RL compute level is well-predicted from the pretraining loss, and slope of the RL reward curves improves approximately linearly with the pretraining tokens. Beyond scaling, we find that RL does not simply sharpen the SFT policy: on easy puzzles it amplifies correct moves the SFT policy already preferred, while on hard puzzles it surfaces correct moves that were nearly absent under SFT. We further test whether our findings transfer beyond chess by training a 1B language model on math-domain text, where the same predictive pattern emerges: longer-pretrained checkpoints reach higher post-RL performance and improve faster under RL. In sum, we provide a quantitative account of the pretraining-to-RL interface and a controlled testbed for studying the science of reasoning across the full pretraining-to-post-training pipeline.
- Abstract(参考訳): 強化学習(RL)は、複雑な推論タスクにおける大規模言語モデル(LLM)の改善の中心となっているが、RLのポストトレーニングは、その先行する事前学習とは独立に研究されている。
その結果、(1)事前学習した選択(モデルサイズ、データ)はどのようにしてRL計算への回帰を形作るのか、(2)RLが実際にモデルに何をするのか、という2つの基本的な疑問が残っている。
事前学習コーパスは広大かつ制御されていないため、事前学習とRLの属性付けが困難であり、どちらの段階も体系的な計算スイープは違法に高価である。
これらの課題に対処するため、私たちは、事前学習から後訓練までのパイプライン全体にわたる推論を研究するために、チェスを制御されたテストベッドとして使用しています。
我々は、人間のチェスゲームにおける5Mから1Bパラメータの言語モデルを事前学習し、合成推論トレースの微調整を監督し、検証可能な報酬でチェスパズル上でRLを実行することで、標準的なLLMトレーニングパイプラインに従う。
このフレームワークを用いて、所定のRL計算レベルでのポストRL性能は事前学習損失から良好に予測され、RL報酬曲線の傾きは事前学習トークンとほぼ線形に改善される。
簡単なパズルでは、SFTポリシーがすでに好まれていた正しい動きを増幅し、ハードパズルでは、SFTの下でほとんど欠落していた正しい動きを表面化する。
さらに,予測パターンが同じである数学領域のテキスト上で1B言語モデルをトレーニングすることで,我々の研究結果がチェスを超えて移動するかどうかを検証した。
要約すると、事前学習-RLインターフェースの定量的な説明と、事前学習-後学習パイプライン全体にわたって推論の科学を研究するための制御テストベッドを提供する。
関連論文リスト
- Demystifying Reinforcement Learning Post-Training of Language Models [32.79823433295599]
強化学習(RL)ポストトレーニングは,大規模言語モデル(LLM)の能力向上のための強力なフレームワークとして登場した。
しかし、多くの研究者や実践者にとって、古典的RLの背後にある原則は「ブラックボックス」のままである。
論文 参考訳(メタデータ) (2026-08-24T18:39:45Z) - Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data [48.92748013043833]
また,Mixed SFTは,RLよりも明らかに高い性能を示すことを示す。
また,RLVR前精度は必ずしも高次RLVR後精度に変換されないことを示した。
論文 参考訳(メタデータ) (2026-08-24T13:47:45Z) - RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training [18.932290080075685]
RLは非常に早期に有効であることが分かっており、SFT$to$RLパイプラインと早期にマッチすることが多い。
ベースチェックポイントに直接RLを適用すると、モデルの分布が拡大する。
モデル全体の能力は基本的にRLによって変わらず、SFTの後に劣化する。
論文 参考訳(メタデータ) (2026-06-02T22:55:18Z) - Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes [22.721425502443253]
我々はPrefixRLを導入し、そこでは、成功裏のトレースのプレフィックスを条件にし、それらを完了させるために、オンデマンドのRLを実行します。
PrefixRLは、問題の難易度を政治外接頭辞の長さで調節することで、難しい問題に対する学習信号を強化する。
我々はPrefixRLの目的が標準RLの目的と一致しているだけでなく、より効率的なことを証明する。
論文 参考訳(メタデータ) (2026-01-26T18:57:00Z) - Not All Steps are Informative: On the Linearity of LLMs' RLVR Training [14.59942263367421]
検証可能な報酬(RLVR)による強化学習は,大規模言語モデル(LLM)のポストトレーニングの中心的コンポーネントとなっている。
本研究では,将来のモデル状態が外挿による中間チェックポイントから予測可能かどうかを検討する。
Weight Extrapolationは標準RLトレーニングに匹敵する性能のモデルを生成すると同時に,計算量を大幅に削減することを示した。
論文 参考訳(メタデータ) (2026-01-08T03:06:18Z) - On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models [73.10315509190623]
最近の強化学習技術は、言語モデルにおいて顕著な推論改善をもたらした。
ポストトレーニングが、事前トレーニング中に取得したものを超えて、モデルの推論能力を真に拡張するかどうかは不明だ。
プレトレーニング,ミッドトレーニング,およびRLベースのポストトレーニングの因果的貢献を分離する,完全に制御された実験フレームワークを開発した。
論文 参考訳(メタデータ) (2025-12-08T18:12:10Z) - Reinforcement Learning on Pre-Training Data [55.570379963147424]
我々は,大規模言語モデル(LLM)を最適化するための新しい訓練時間スケーリングパラダイムである,事前学習データ(R)の強化学習を紹介する。
Rは、有意義な軌道を自律的に探索し、事前学習データから学び、強化学習(RL)を通してその能力を向上させる。
複数のモデルにわたる一般領域および数学的推論ベンチマークの広範な実験は、Rの有効性を検証した。
論文 参考訳(メタデータ) (2025-09-23T17:10:40Z) - Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning [93.00629872970364]
強化学習(Reinforcement Learning, RL)は, 複雑な推論タスクにおいて, 言語モデルの性能向上のための主要なパラダイムとなっている。
SPARKLE(SPARKLE)は、3つの重要な次元にわたるRLの効果を詳細に解析するフレームワークである。
我々は、RL信号と混合品質の推論トレースを産出しない難題が、依然としてトレーニングに有効であるかどうかを調査する。
論文 参考訳(メタデータ) (2025-06-05T07:53:59Z) - AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning [50.02117478165099]
大規模強化学習は, 強大・中小モデルの推論能力を大幅に向上させることができることを示す。
まずは算数のみのプロンプト、次にコードのみのプロンプトのトレーニングを行う。
論文 参考訳(メタデータ) (2025-05-22T08:50:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。