論文の概要: From Base Rollouts to RL Reasoning: A Budgeted Search Perspective
- arxiv url: http://arxiv.org/abs/2609.01274v1
- Date: Tue, 01 Sep 2026 14:08:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.722033
- Title: From Base Rollouts to RL Reasoning: A Budgeted Search Perspective
- Title(参考訳): ベースロールアウトからRL推論へ:予算的な検索視点
- Authors: Wenhe Sun, Cunxiang Wang, Zijun Yao, Yixin Cao,
- Abstract要約: 検証可能な報酬(RLVR)による強化学習は、言語モデル推論を改善するが、これらの効果が推論時復号と探索にどのように関係するかは、まだ不明である。
我々は、トークンレベルのサンプリング、ビームライクな検索、ツリー検索、シーケンスレベルの再サンプリングを、共有予算の運用空間上で実行可能なポリシーとして表現するUDF(Unified Decoding Framework)を用いて、これを行動的に研究する。
そこで,SimpleRL-Zoo の Base/RL チェックポイントをペア化することにより,RL のデフォルト政治曲線を Base 動作点の構造化経路で近似できるかどうかを問う。
- 参考スコア(独自算出の注目度): 18.608302860158872
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) improves language-model reasoning, but how these gains relate to inference-time decoding and search remains unclear. Does RL create reasoning the base model lacks, or shift the rollout distribution toward trajectories it can already reach but rarely samples? We study this behaviorally with a Unified Decoding Framework (UDF), which expresses token-level sampling, beam-like search, tree search, and sequence-level resampling as executable policies over a shared budgeted operating space, scored post hoc with pass@$k$, self-consistency, best-of-$N$, and first-finish success. Using paired Base/RL checkpoints from SimpleRL-Zoo, we ask whether an RL default-policy curve can be approximated by a structured path of Base operating points. On Math500, AIME, GPQA, and IFEval, the pass@$k$ recovery path follows a Budgeted Operating-Point Transition Rule (BOPTR), $N_{\mathrm{Base}} \approx αN_{\mathrm{RL}}^β$, with benchmark-conditioned exponents. On Qwen2.5-7B, BOPTR gives the lowest transfer error among the non-oracle rules we test, 3.41 pp (95% CI [2.32, 5.53]); a three-seed replication gives 3.07 $\pm$ 0.39 pp. The rule extends to ten models across four families (3.28 to 4.87 pp on checkpoints added after fitting), to four benchmarks it was never fitted on (5.03 pp vs. 4.44 pp in fit), and holds without an RL checkpoint for the target model (4.19 pp) or without RL supervision of any kind (5.08 pp). These results support a qualified internalized-search reading: under the recipe we test, much of the measured RL gain corresponds to a change in sampling efficiency toward operating points the base model can already reach under search. We treat the scaling patterns as descriptive of this recipe and cohort, report where they break down, and use UDF and BOPTR as behavioral diagnostics rather than evidence of parameter-level equivalence.
- Abstract(参考訳): 検証可能な報酬(RLVR)による強化学習は、言語モデル推論を改善するが、これらの効果が推論時復号と探索にどのように関係するかは、まだ不明である。
RLはベースモデルに欠けている理由を生み出しているのか、あるいは既に到達できるが稀なサンプルにロールアウト分布を移動させるのか?
我々は、トークンレベルのサンプリング、ビームライクな検索、ツリー検索、シーケンスレベルの再サンプリングを、共有予算の運用空間上で実行可能なポリシーとして表現し、pass@$k$、自己整合性、ベストオブN$、ファーストフィニッシュな成功によって得られたポストホックとして、行動的に研究する。
そこで,SimpleRL-Zoo の Base/RL チェックポイントをペア化することにより,RL のデフォルト政治曲線を Base 動作点の構造化経路で近似できるかどうかを問う。
Math500, AIME, GPQA, IFEvalでは、pass@$k$リカバリパスはBudgeted Operating-Point Transition Rule (BOPTR), $N_{\mathrm{Base}} \approx αN_{\mathrm{RL}}^β$, with benchmark-conditioned exponentsである。
Qwen2.5-7Bでは、BOPTRはテスト対象の非オークルルールの中で最低の転送誤差である3.41 pp (95% CI [2.32, 5.53])を与え、3列レプリケーションは3.07 $\pm$ 0.39 ppを与える。
このルールは4つのファミリー(3.28から4.87pp)にまたがって10のモデルに拡張され、4つのベンチマーク(5.03pp対4.44pp)に適合せず、ターゲットモデルのRLチェックポイント(4.19pp)も、いかなる種類のRL監督(5.08pp)も持たない。
これらの結果から, 評価されたRLゲインの多くは, 探索下で既に到達可能な操作点に対するサンプリング効率の変化に対応していることがわかった。
スケーリングパターンを,このレシピとコホートの説明として扱うとともに,それらがどこで崩壊するかを報告し,UDFとBOPTRをパラメータレベルの等価性の証拠ではなく,行動診断として利用する。
関連論文リスト
- Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - When Does Deep RL Beat Calibrated Baselines? A Benchmark Study on Adaptive Resource Control [3.1555521133346685]
適切に調整されたルールベースのオートスケーラは、テスト対象のワークロード毎に6つのメインストリームの深層強化学習(DRL)アルゴリズムのうち、どれか1つを打ち負かすことができる。
PPO, DQN, A2C, SAC, TD3, DDPGを一致したトレーニング予算下で評価し, 基準基準に対する報酬関数について検討した。
論文 参考訳(メタデータ) (2026-05-26T01:07:42Z) - REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge [83.2858110368572]
回帰報酬を最適化するための原則的RLフレームワークである textbfREAL (underlineREgression-underlineAware Reinforcement underlineLThought) を提案する。
我々は,REALがレグレッション対応SFTベースラインと標準RL法の両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-17T21:19:08Z) - Single-stream Policy Optimization [21.214853668053234]
SPO(Single-stream Policy Optimization)を導入する。
SPOはグループ単位のベースラインを永続的なKL適応値トラッカーに置き換え、バッチ全体にわたってメリットを標準化する。
グループフリーであるため、SPOはより高いスループットと、長い水平またはツール統合された設定で効果的にスケールすることができる。
論文 参考訳(メタデータ) (2025-09-16T16:39:11Z) - $Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training [63.602824642605775]
$Qsharp$ は KL 正規化 RL の値に基づくアルゴリズムで、最適な正規化 $Q$ 関数を使用して参照ポリシーを導出する。
この結果から,LLMのポストトレーニングに有効なアプローチとして$Qsharp$が注目され,性能と理論的保証が向上した。
論文 参考訳(メタデータ) (2025-02-27T21:43:00Z) - Bridging RL Theory and Practice with the Effective Horizon [18.706109961534676]
先行境界は、深いRLが成功するか失敗するかは相関しないことを示す。
我々はこれを、有効地平線と呼ぶ新しいMDPの複雑さ尺度に一般化する。
また,既存の境界と異なり,実効地平線は報酬形成や事前訓練された探査政策を用いることの効果を予測できることがわかった。
論文 参考訳(メタデータ) (2023-04-19T17:59:01Z) - Human-in-the-loop: Provably Efficient Preference-based Reinforcement
Learning with General Function Approximation [107.54516740713969]
本研究は,RL(Human-in-the-loop reinforcement learning)を軌道的嗜好で検討する。
各ステップで数値的な報酬を受ける代わりに、エージェントは人間の監督者から軌道上のペアよりも優先される。
一般関数近似を用いたPbRLの楽観的モデルベースアルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-05-23T09:03:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。