論文の概要: Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime
- arxiv url: http://arxiv.org/abs/2605.05112v1
- Date: Wed, 06 May 2026 16:44:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.941281
- Title: Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime
- Title(参考訳): ロールアウトパスレート制御:最もインフォームティブなレジームに向けた2次リワードRLのステアリング
- Abstract要約: 我々は、この非効率性をパスレート制御問題とみなし、50%のパスレートが最も有益な操作点であることを示す。
我々は,この体制に向かってスキュード群を操るために,軌道上の接頭辞を再生するPrefix Sampling (PS)を提案する。
PSはQwen3-14Bでは2.01x、Qwen3-32Bでは1.55xで、最終的な性能を保留または改善している。
- 参考スコア(独自算出の注目度): 28.346931878148524
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: SWE-bench-style agentic reinforcement learning relies on expensive stateful trajectories, yet substantial compute is wasted on sampled rollout groups with skewed pass rates, where binary rewards provide a weak contrastive signal. We frame this inefficiency as a pass-rate control problem and show that a 50% pass rate is the most informative operating point: it maximizes reward entropy, the probability of surviving group filtering, RLOO advantage energy under GRPO, and success--failure contrastive structure. Guided by this principle, we propose Prefix Sampling (PS), which replays trajectory prefixes to steer skewed groups toward this regime: successful prefixes serve as head starts for mostly failing groups, while failing prefixes serve as handicaps for mostly passing groups. In stateful agent environments, prefix states are reconstructed through replay while replayed tokens are excluded from the loss, restricting optimization to continuations generated by the current policy. On SWE-bench-style agentic RL, PS delivers end-to-end wall-clock speedups of 2.01x on Qwen3-14B and 1.55x on Qwen3-32B while preserving or improving final verified performance. For 14B, the SWE-bench Verified peak rises from the baseline peak of 0.273 to 0.295 under PS. Additional mathematical reasoning experiments on AIME 2025 show the same pass-rate control pattern and decompose the gains into replay, bidirectional coverage, and adaptive control.
- Abstract(参考訳): SWEベンチ型エージェント強化学習は、高価なステートフルな軌跡に依存するが、二進法報酬が弱いコントラスト信号を与えるスキュードパスレートのサンプルロールアウトグループでは、かなりの計算が無駄にされる。
我々は、この非効率性をパスレート制御問題とみなし、50%パスレートが最も有益な操作点であることを示す:報酬エントロピー、生存するグループフィルタリングの確率、GRPO下でのROO利得エネルギー、成功-失敗コントラスト構造。
この原理で導かれたPrefix Smpling (PS) は, 軌道上の接頭辞をスキュード群にリプレイし, 成功した接頭辞は, 主に失敗するグループのヘッドスタートとして機能し, 失敗した接頭辞は, ほとんど通過するグループのハンディキャップとして機能する。
ステートフルエージェント環境では、プレフィックス状態はリプレイによって再構成され、リプレイされたトークンは損失から除外され、現在のポリシーによって生成される継続に最適化が制限される。
SWE-benchスタイルのエージェントRLでは、PSはQwen3-14Bで2.01x、Qwen3-32Bで1.55xのエンドツーエンドのウォールクロックスピードアップを提供する。
14Bでは、SWEベンチ検証ピークがベースラインピークの0.273から0.295まで上昇する。
AIME 2025の数学的推論実験は、同じパスレート制御パターンを示し、ゲインをリプレイ、双方向カバレッジ、適応制御に分解する。
関連論文リスト
- TTPO: Test-Time Policy Optimization [53.81524570216593]
テストタイムポリシー最適化(TTPO)は、OPSDを介してロールアウトに同意し、Grouped RLと不一致なロールアウトを罰する非対称な目的である。
TTPOは5つの競合レベルのベンチマークでラベル管理されたOPSDと一致し、Qwen3-1.7Bは38.0%から45.2%まで上昇し、思考せずに+25.2%から+36.4%に上昇し、クロスタスクの一般化を示す。
論文 参考訳(メタデータ) (2026-08-27T17:58:10Z) - Verifier-Induced Support Reshaping in On-Policy Optimization [27.782412748608255]
検証可能な報酬(RLVR)によるオンライン強化学習は、現在の目標を改善できる一方で、後の目標に対する行動の成功は、サンプリングや強化が極めて稀であることを示す。
我々は、この検証者によるサポートの再構築と呼び、有効な報奨支援を、固定されたロールアウト予算内で到達可能な軌道として定義する。
論文 参考訳(メタデータ) (2026-07-31T19:05:43Z) - LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts [0.0]
数学的推論のための検証可能な報酬(RLVR)からの強化学習は、構造的な盲点に悩まされる。
損失勾配を回復するサンプリング時間機構であるLSPO(LoRA Scaffolded Policy Optimization)を導入する。
DeepSeek-R1-Distill-Qwen-1.5Bを用いたDeepMath-103Kでは、腕1本あたりのn=5対の種子に対してLSPOの5シードの平均値が一致し、全16細胞でDAPOベースラインを打ち負かす。
論文 参考訳(メタデータ) (2026-07-30T07:21:34Z) - The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and What Actually Works [3.040305634723913]
群正規化RLの下では、ポテンシャルに基づく予測報酬が全てのランを退化吸収状態に駆動することを示す。
単一エピソードアブレーションは原因を和らげる -- GRPOの正規化だけを取り除くことで、破滅からベースラインパリティへと同じ報酬が変わる。
我々の中心的な洞察はこれを一般化している: z-scoring amplify は、全フェイル群が支配的である間、高密度信号の群内分散である。
論文 参考訳(メタデータ) (2026-07-23T12:50:18Z) - SCOPE-RL: Optimizing Reasoning Paths Before and After Success [15.079558450636592]
SCOPE-RLは、検証可能な報酬を伴う強化学習のフレームワークである。
結果のみのGRPOよりも平均精度を最大11.2pp向上させる。
結果のみのGRPOよりも、推論トークンを最大27.1%削減する。
論文 参考訳(メタデータ) (2026-07-13T12:56:28Z) - STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability [78.63876433996107]
GRPOの下でトークンレベルのエントロピーダイナミクスの1次勾配解析を行う。
本稿では,バッチ内部量子化によるエントロピークリティカルトークンのサブセットを識別するSTAREを提案する。
AIME24とAIME25では、STAREはDAPOや他の競争ベースラインを平均精度で4%-8%上回っている。
論文 参考訳(メタデータ) (2026-06-17T16:13:42Z) - ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents [48.80766702702854]
LLMベースの検索エージェントは、主に結果のみの報酬で訓練され、検索プロセス自体は監督されていない。
この信号は、全てのサンプル軌跡が同じ正当性を共有する結果同質な群に対して退化し、群内の優位性はゼロとなり、勾配は得られない。
ARBOR(Adaptive Buffer for Online Reward)は,クエリ間で共有されるルーリックメモリを維持する再利用可能なプロセス・リワードフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T06:58:54Z) - VeriGate: Verifier-Gated Step-Level Supervision for GRPO [51.26100506256885]
グループ相対政策最適化は、検証者に基づく結果報酬を伴う推論モデルをトレーニングするための効果的なレシピである。
GRPO の検証子付き拡張である VeriGate を提案し,これらの制限を3つの設計選択で解決する。
We show that VeriGate improves average accuracy around 20% and 12% for 1.5B and 7B models respectively。
論文 参考訳(メタデータ) (2026-05-28T18:20:32Z) - ReCast: Recasting Learning Signals for Reinforcement Learning in Generative Recommendation [18.825912740441858]
本稿では,ReCastを提案する。
ReCastは全ゼログループに対して最小限の学習性を復元することを示す。
また、ReCastは永続的なオールゼロ/シングルヒット体制を緩和します。
論文 参考訳(メタデータ) (2026-04-24T02:44:36Z) - Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing [79.88256756334327]
自己蒸留政策最適化(SDPO)は、より密集したロジットレベルの監視を提供することによってこの問題に対処する。
サンプル制御ポリシー最適化(SRPO)を提案する。
SRPOは、試料をGRPOの報酬整合強化に向け、サンプルをSDPOの目標ロジットレベルの補正に向ける。
論文 参考訳(メタデータ) (2026-04-02T17:29:18Z) - What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time [57.533031432715084]
TTRL(Test-Time Reinforcement Learning)は、Large Language Models(LLM)が、ラベルのないテストストリームの推論能力を向上することを可能にする。
既存のTTRL法は、正の擬似ラベル戦略にのみ依存している。
本研究では,ラベル雑音増幅を効果的に緩和する堅牢なテスト時間強化学習フレームワークであるSCRLを提案する。
論文 参考訳(メタデータ) (2026-03-20T11:47:12Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models [68.45272703833209]
現状のPRMは、逆最適化圧力下で体系的に利用可能であることを示す。
これらの脆弱性を定量化するために、敵の圧力を増大させる3段階の診断フレームワークを導入する。
我々は、PRM-BiasBenchと診断ツールキットをリリースし、デプロイ前にロバストネスの評価を可能にする。
論文 参考訳(メタデータ) (2026-02-20T23:38:03Z) - WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning [67.45237332694025]
グループ相対政策最適化は、複雑な推論に基づいて言語モデルを訓練するのに効果的である。
Weakly Supervised GRPOを提案し、端末報酬を正当性を考慮したガイダンスに変換することにより、ロールアウト効率を向上させる。
論文 参考訳(メタデータ) (2026-02-19T02:43:35Z) - STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens [38.425692691443764]
既存の強化学習(RL)ファインチューニング手法は、安定性を維持するためにエントロピー正則化と再重み付けに大きく依存している。
実際には、彼らはしばしば後期的なパフォーマンスの崩壊に悩まされ、推論品質の低下と不安定なトレーニングにつながります。
トレーニングの不安定性は、約0.01%の少量のトークンによって引き起こされる可能性がある。
安定かつ効果的な大規模モデル改良を促進するSTAPO(Spurious-Token-Aware Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-02-17T14:46:48Z) - CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning [57.24524263804788]
コード検証は、LLMベースのコード生成の検証後において重要な役割を果たす。
既存の教師付き微調整手法は、データの不足、高い失敗率、推論効率の低下に悩まされている。
機能的な報酬しか持たない単純RLは、難しいブランチやサンプルに対して効果的な単体テストを生成することができないことを示す。
論文 参考訳(メタデータ) (2026-01-30T10:33:29Z) - Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning [59.76691952347156]
強化学習(RL)は,大規模言語モデル(LLM)の推論能力向上のための強力なフレームワークとして登場した。
既存のRLアプローチの多くは疎結果報酬に依存しており、部分的に成功した解では正しい中間段階を信用できない。
本稿では、PRMを用いてRL中の最初のエラーをローカライズする検証済み事前修正ポリシー最適化(VPPO)を提案する。
論文 参考訳(メタデータ) (2026-01-26T21:38:20Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Quantile Advantage Estimation for Entropy-Safe Reasoning [44.192277495613695]
RLVRによる強化学習はLLM推論を強化するが、エントロピー崩壊とエントロピー爆発の間のトレーニングはしばしば振動する
いずれのハザードも値のないRLで使われる平均ベースラインに辿り着くが、これは不適切に報酬のアウトリージの下で負のアドバンテージサンプルをペナルティ化する。
本稿では,平均値をグループ単位のK量子基底線に置き換えた量子アドバンテージ推定(QAE)を提案する。
論文 参考訳(メタデータ) (2025-09-26T17:37:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。