論文の概要: SERA: Scale-Equalized Rollout Allocation for Maximum Likelihood Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.36552v1
- Date: Tue, 29 Sep 2026 02:40:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.128139
- Title: SERA: Scale-Equalized Rollout Allocation for Maximum Likelihood Reinforcement Learning
- Title(参考訳): SERA:最大等級強化学習のためのスケール等化ロールアウトアロケーション
- Abstract要約: 有限ロールアウト予算の下では、MaxRLが使用する推定器はその成功確率とロールアウト数に依存する因子によって各プロンプトの確率勾配を減衰する。
均一なロールアウトアロケーションの下では、共通のロールアウトカウントは成功に依存した減衰を補うことができず、低リスクはより強く減衰し、期待される集約勾配への相対的な寄与を歪ませる。
本稿では、これらの有限ロールアウトスケーリング係数をほぼ等化するために、固定ロールアウト予算を再編成するSERAを紹介する。
- 参考スコア(独自算出の注目度): 47.874792904138154
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Maximum Likelihood Reinforcement Learning (MaxRL) targets prompt-wise log-success and has shown strong performance on reasoning tasks. Under finite rollout budgets, however, the estimator used by MaxRL attenuates each prompt's likelihood gradient by a factor that depends on its success probability and rollout count. Under uniform rollout allocation, the common rollout count fails to compensate for success-dependent attenuation, leaving low-success prompts more strongly attenuated and distorting their relative contributions to the expected aggregate gradient. We introduce SERA (Scale-Equalized Rollout Allocation), which redistributes a fixed rollout budget to approximately equalize these finite-rollout scaling factors. Building on our theoretical analysis of how finite rollouts distort prompt-wise likelihood gradients, we formulate the allocation as a fixed-budget max--min problem, derive a waterline solution to its continuous relaxation, and introduce a multiplicity correction to remove the additional prompt weighting induced by heterogeneous rollout counts. Experiments show stronger alignment with exact likelihood gradients in a controlled ImageNet setting and improved multi-sample solution coverage over MaxRL on maze navigation and mathematical reasoning under matched training rollout budgets.
- Abstract(参考訳): MaxRL(Maximum Likelihood Reinforcement Learning)は、素早い対数学習を目標としており、推論タスクに強いパフォーマンスを示している。
しかし、有限ロールアウト予算の下では、MaxRL が使用する推定器はその成功確率とロールアウト数に依存する因子によって各プロンプトの確率勾配を減衰させる。
均一なロールアウトアロケーションの下では、共通のロールアウトカウントは成功に依存した減衰を補うことができず、低リスクはより強く減衰し、期待される集約勾配への相対的な寄与を歪ませる。
本稿では,SERA(Scale-Equalized Rollout Allocation)を導入し,これら有限ロールアウトスケーリング係数をほぼ等化するために,固定ロールアウト予算を再編成する。
有限ロールアウトが即時近似勾配をゆがめるかの理論解析に基づいて、固定予算の最大-分問題としての割り当てを定式化し、その連続緩和に対するウォーターライン解を導出し、不均一ロールアウト数によって引き起こされる追加のプロンプト重み付けを除去する多重度補正を導入する。
実験は、制御されたImageNet設定において、正確な精度勾配との整合性を強く示し、マッチしたトレーニングロールアウト予算下での迷路ナビゲーションと数学的推論において、MaxRLによるマルチサンプルソリューションカバレッジを改善した。
関連論文リスト
- Robust Peak-cost Constrained Reinforcement Learning [10.897248153175935]
我々は、堅牢なピークコスト制約強化学習(RP-CRL)について検討する。
目的は、軌道に沿って発生する最大コストを制御しながら、期待される報酬を最大化することである。
標準CMDPとは異なり、ピークコストの制約されたMDPはゼロ双対性ギャップを認めない可能性がある。
論文 参考訳(メタデータ) (2026-07-16T21:00:50Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Cross-Epoch Adaptive Rollout Optimization for RL Post-Training [5.459625245330074]
LLMポストトレーニングは、しばしばプロンプト毎に複数のロールアウトをサンプリングする強化学習手法に依存している。
既存のほとんどのアプローチでは、トレーニング信号に大きな違いがあるにも関わらず、すべてのプロンプトに対して固定的なロールアウト予算を使用している。
我々は、固定されたグローバル予算の下でのアダプティブ・ロールアウト・アロケーションについて検討し、即時還元リターンを伴うオンラインリソースアロケーションとして問題を定式化する。
論文 参考訳(メタデータ) (2026-06-04T02:27:51Z) - DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - Difficulty-Estimated Policy Optimization [38.86673795561421]
推論アライメントの効率性とロバスト性を最適化する新しいフレームワークであるDifficulty-Estimated Policy Optimization (DEPO)を提案する。
提案手法は,高性能推論モデルの学習における計算障壁を大幅に減らし,推論スケーリングのためのより持続可能な経路を提供する。
論文 参考訳(メタデータ) (2026-02-06T04:12:23Z) - Maximum Likelihood Reinforcement Learning [51.83034817019976]
MaxRLは、強化学習技術を用いて、最大極大度を近似するサンプリングベースのフレームワークである。
MaxRLは,GRPOで訓練したものと比較して,最大20倍のスケーリング効率を達成できることを示す。
論文 参考訳(メタデータ) (2026-02-02T19:23:42Z) - Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards [26.5011687714416]
既存のグループベースのポリシー最適化手法は、すべてのトレーニングプロンプトに対して一定数のロールアウトを割り当てる。
この均一な割り当ては全てのプロンプトを等しく情報的扱いし、非効率的な計算予算の使用と訓練の進捗を妨げる可能性がある。
本稿では、既存のバッチのプロンプトに所定のロールアウト予算を割り当て、ポリシー更新のグラデーションのばらつきを最小限に抑える可変インフォームド予測割当戦略であるVIPを紹介する。
論文 参考訳(メタデータ) (2026-02-02T03:50:01Z) - False Correlation Reduction for Offline Reinforcement Learning [115.11954432080749]
本稿では,実効的かつ理論的に証明可能なアルゴリズムであるオフラインRLに対するfalSe Correlation Reduction (SCORE)を提案する。
SCOREは、標準ベンチマーク(D4RL)において、様々なタスクにおいて3.1倍の高速化でSoTA性能を達成することを実証的に示す。
論文 参考訳(メタデータ) (2021-10-24T15:34:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。