論文の概要: Does Scaling Reinforcement Learning Really Require More Training?
- arxiv url: http://arxiv.org/abs/2610.01133v2
- Date: Tue, 06 Oct 2026 05:30:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.254585
- Title: Does Scaling Reinforcement Learning Really Require More Training?
- Title(参考訳): 強化学習のスケーリングはトレーニングを本当に必要か?
- Abstract要約: 推論のスケーリングは通常、強化学習(RL)や推論により多くの計算を費やす。
完成したRLトレーニング履歴は、その計算によって訪れたチェックポイントよりも強力なポリシーが得られることを示す。
我々は、このポリシー空間のスケーリングを、固定されたRL履歴からアクセス可能なデプロイ可能なポリシーを拡張します。
- 参考スコア(独自算出の注目度): 12.66270635536347
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scaling reasoning typically spends more compute on reinforcement learning (RL) or on inference. We show that a completed RL training history can yield policies stronger than the checkpoints visited by its optimizer. We call this policy-space scaling: expanding the deployable policy set accessible from a fixed RL history, without extending training or increasing per-query inference computation. We instantiate it with SURGE (Scaling Up RL Gradient-free via Eigenspace fusion). SURGE combines two checkpoints from the same RL run: a high-accuracy anchor and a competitive donor that generates shorter responses. It expresses both checkpoints as changes from their shared initialization, then spectrally decomposes the anchor's update to retain its dominant component and incorporate the donor's complementary component. With a fixed target for how much of the anchor update to retain, SURGE determines the block size from the weights without testing candidate policies. We evaluate two 1.5B mathematical-reasoning histories, DeepSeek and Nemotron, and one 7B coding history, OLMo. SURGE improves benchmark-average accuracy over both input checkpoints while using fewer reasoning tokens than the anchor. It reaches 54.17% on DeepSeek AIME24 against a measured native maximum of 50.83%, and 83.7% on OLMo HumanEval+ against 82.8%. These gains exceed the observed training curves. Geometric controls support the importance of RL-update structure beyond weight displacement or token reduction alone. Each constructed model runs as a single policy. Our findings identify stored RL history as a reusable scaling resource: the capability available from a training run need not end at its best checkpoint.
- Abstract(参考訳): 推論のスケーリングは通常、強化学習(RL)や推論により多くの計算を費やす。
完成したRLトレーニング履歴は、オプティマイザが訪れたチェックポイントよりも強力なポリシーが得られることを示す。
トレーニングを拡張したり、クエリごとの推論計算を増やしたりすることなく、固定されたRL履歴からアクセス可能なデプロイ可能なポリシセットを拡張します。
SURGE (Scaling Up RL Gradient-free via Eigenspace fusion) でインスタンス化する。
SURGEは、2つのチェックポイントを同じRLランから組み合わせる: 高精度アンカーと、より短い応答を生成する競合ドナーである。
両方のチェックポイントを共有初期化から変更として表現し、アンカーの更新をスペクトル的に分解して、支配的なコンポーネントを保持し、ドナーの補完的なコンポーネントを組み込む。
アンカー更新のどれだけを保持すべきかを固定されたターゲットで、SURGEは、候補ポリシーをテストせずに重みからブロックサイズを決定する。
We evaluate two 1.5B mathematical-reasoning history, DeepSeek and Nemotron and one 7B coding history, OLMo。
SURGEは、アンカーよりも推論トークンが少ないため、両方の入力チェックポイントに対するベンチマーク平均精度を改善する。
DeepSeek AIME24では54.17%、ネイティブの最大値50.83%、OLMo HumanEval+では83.7%である。
これらの利得は観察されたトレーニング曲線を超える。
幾何学的制御は、重量変位やトークン還元以外のRL更新構造の重要性を支持する。
各構築されたモデルは単一のポリシーとして実行される。
本研究は, 保存したRL履歴を再利用可能なスケーリングリソースとして同定した。
関連論文リスト
- Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs [59.62441340813425]
我々は、強化学習がパラメトリック知識の直接的リコールを改善するかどうかを検討する。
3つのモデルファミリと複数の事実QAベンチマークで、RLの平均相対利得は27%である。
機械的には、RLは主に新しい事実を得るのではなく、既存の知識の確率質量を再分配する。
論文 参考訳(メタデータ) (2026-05-08T02:40:12Z) - Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis [16.739617199649615]
効率改善から機能拡張を分離する指標であるPASS@(k,T)を紹介する。
我々の主な発見は、静的推論結果とは対照的に、ツール利用RLは機能境界を真に拡大するということです。
一致したトレーニングデータの下では、教師付き微調整は、同じ構成上の境界を回帰させ、因果因子として自己指向的な探索を分離する。
論文 参考訳(メタデータ) (2026-04-16T11:06:19Z) - DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning [134.03095505580276]
Doing Length pEnalty Right (DLER)は、バッチワイド報酬正規化、高いクリッピング、ダイナミックサンプリング、単純なトランケーション長ペナルティを組み合わせたトレーニングレシピである。
DLERは最先端の精度-効率のトレードオフを実現し、出力長を70%以上削減し、以前のベースライン精度をすべて上回っている。
論文 参考訳(メタデータ) (2025-10-16T20:05:57Z) - From Supervision to Exploration: What Does Protein Language Model Learn During Reinforcement Learning? [76.288870982181]
タンパク質言語モデル(PLM)は、大規模事前学習と拡張性のあるアーキテクチャを通じて高度な計算タンパク質科学を持つ。
強化学習(RL)は探索を拡大し、タンパク質設計における正確な多目的最適化を可能にした。
RLはサンプリング効率を向上し,さらに重要な点として,教師あり学習で捉えない能力を明らかにするかどうかを問う。
論文 参考訳(メタデータ) (2025-10-02T01:31:10Z) - AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning [50.02117478165099]
大規模強化学習は, 強大・中小モデルの推論能力を大幅に向上させることができることを示す。
まずは算数のみのプロンプト、次にコードのみのプロンプトのトレーニングを行う。
論文 参考訳(メタデータ) (2025-05-22T08:50:47Z) - Knowledge Graph Reasoning with Self-supervised Reinforcement Learning [30.359557545737747]
本稿では,RLトレーニング前の政策ネットワークを温めるための自己指導型事前学習手法を提案する。
教師付き学習段階において、エージェントはポリシーネットワークに基づいて行動を選択し、生成されたラベルから学習する。
我々のSSRLモデルは、すべてのHits@kおよび平均相互ランク(MRR)メトリクスにおいて、現在の最先端結果と一致または超えていることを示す。
論文 参考訳(メタデータ) (2024-05-22T13:39:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。