論文の概要: Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.01418v1
- Date: Sun, 02 Aug 2026 18:02:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.197502
- Title: Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning
- Title(参考訳): 政策ラグ下におけるリユース・ロールアウト: LLM強化学習のための修正-Normalized Policy Optimization
- Abstract要約: 自己回帰的なロールアウト生成は、強化学習における大きな計算コストである。
PNPOは累積比を、各因果接頭辞に沿った確率比の平均に置き換える。
PNPOは1つのエポックでGSPOを一貫して上回るわけではない。
4エポックのPNPOは150回のロールアウトの後に49.66のAvg@32に到達し、1エポックの600回の後に到達した49.56に匹敵する。
- 参考スコア(独自算出の注目度): 21.43528083212271
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Autoregressive rollout generation is a major computational cost in reinforcement learning for large language models. Reusing each rollout batch for additional learner updates amortizes this cost, but later updates become increasingly off-policy as the learner departs from the behavior policy. At a token position, exact off-policy correction must account for both the current action and the probability of reaching its prefix. The cumulative importance ratio provides this correction, but its product form can produce an unwieldy dynamic range. We study Prefix-Normalized Policy Optimization (PNPO), which replaces the cumulative ratio with the geometric mean of likelihood ratios along each causal prefix, preserving causal-prefix dependence at each position while compressing the log-weight scale. In controlled long-context mathematical reasoning experiments, we induce two off-policy regimes by using one or four policy-update epochs per rollout batch. PNPO does not consistently outperform GSPO with one epoch. With four epochs, it attains the highest observed Avg@32 on each benchmark; the unweighted mean of the three independently selected benchmark peaks is 50.24, 3.00 percentage points above GSPO. Under a matched 2,400-update budget, four-epoch PNPO reaches a final macro Avg@32 of 49.66 after 150 rollout batches, comparable to the 49.56 reached after 600 batches with one epoch. These results provide preliminary evidence that PNPO can be advantageous as training moves further off-policy.
- Abstract(参考訳): 自動回帰ロールアウト生成は、大規模言語モデルの強化学習において、大きな計算コストである。
追加の学習者更新のために各ロールアウトバッチを再利用することは、このコストを和らげるが、学習者が行動ポリシーから離脱するにつれて、後続の更新はますます非政治的になる。
トークン位置では、正確な非政治的訂正は現在の行動とプレフィックスに到達する確率の両方を考慮しなければならない。
累積的な重要性比はこの補正を提供するが、その積形式は扱いにくいダイナミックレンジを生み出すことができる。
対数重み尺度を圧縮しながら各位置における因果-因果関係を保存し, 累積比を各因果接頭辞に沿って公約比の幾何平均に置き換えるプリフィックス-Normalized Policy Optimization (PNPO) について検討した。
制御された長文数学的推論実験では、ロールアウトバッチ毎に1つまたは4つのポリシー更新エポックを用いて2つの非政治体制を誘導する。
PNPOは1つのエポックでGSPOを一貫して上回るわけではない。
4つのエポックで、各ベンチマークで最も観測されたAvg@32に達し、3つの独立したベンチマークピークの未重み付け平均は、GSPOより50.24, 3.00ポイント高い。
一致した2400の予算の下で、4エポックのPNPOは150回のロールアウト後に49.66のAvg@32に到達し、1エポックで600回のバッチで到達した49.56に匹敵する。
これらの結果は、PNPOがより非政治的になるにつれて有利であることを示す予備的な証拠となる。
関連論文リスト
- Why Sample What You Can Enumerate? Exact Policy Optimization for Genomic Tool Selection [23.92446384027772]
凍結した推論子による強化学習は、外部ツールが呼び出すポリシーを教える一般的なレシピとなっている。
本手法は, ツール・サブセット空間の完全化が可能な専門的な科学的環境において, 構造的に不一致となることを示す。
FGPOを導入し、すべてのツールサブセットをスコアし、正確なアクション期待を最適化します。
論文 参考訳(メタデータ) (2026-09-09T14:20:47Z) - CliffRank: A Dual-Branch Framework for Activity-Cliff Ranking Prediction [8.452103801866203]
CliffRankは平均二乗誤差、閾値付きリストワイドロス、ペアワイド参照一貫性(PPC)の2つの並列予測器を訓練する。
ESM2-t12とCliffRankの3つの抗菌ペプチドデータセットでは,平均スピアマン相関が0.5393,平均Recall@50が21.4であった。
今後の研究は、より多くの標的と抗菌ペプチドシステムを評価し、適応的なPPCスケジュールを開発し、利用可能なタンパク質や膜コンテキストを組み込む必要がある。
論文 参考訳(メタデータ) (2026-09-01T07:57:56Z) - Physics-Guided Policy Optimization with Self-Distillation [13.212487988108592]
自己蒸留政策最適化(SDPO)はLLMポストトレーニングの一般的なパラダイムとなっている。
本稿では,情報変調ステップサイズ乗算器であるPGPOを提案する。
この変調は、バニラSGDのオーダー-1弱近似保証を保ち、反復毎に無視できないオーバーヘッドを生じさせることを示す。
論文 参考訳(メタデータ) (2026-06-02T13:20:39Z) - Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training [50.86545293331458]
強化学習は、教師付き学習よりも構造的に難しい。
本稿では,固定クリッピングを政策比率の正規化された有効サンプルサイズに置き換える,単純かつ効果的なバッチ適応目的を提案する。
論文 参考訳(メタデータ) (2026-05-12T16:44:47Z) - Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective [22.848847562976633]
トークンレベルのIS比は、PPOとGRPOが採用しているように、プレフィックス状態の分布ミスマッチを無視してバイアスを導入する。
我々は、累積トークンIS比と、累積対数比の自然な$sqrtt$成長に応じて、対数空間のクリップ境界を拡大する位置適応クリッピングを組み合わせたCTPOを提案する。
論文 参考訳(メタデータ) (2026-05-08T06:35:02Z) - FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization [84.58281577727566]
本稿では,大規模言語モデルにおける推論ボトルネックを克服する強化学習アルゴリズムであるFuture-KL Influenced Policy Optimization (FIPO)を提案する。
FIPOは、割引先KLの分岐をポリシー更新に組み込むことでこの問題に対処し、その後の軌道行動への影響に基づいてトークンを再重み付けする密集した有利な定式化を作成する。
Qwen2.5-32Bで評価され、FIPOは平均チェーン長を約4,000から10,000以上のトークンに拡張し、AIME 2024 Pass@1の精度を50.0%から58.0%に向上させた。
論文 参考訳(メタデータ) (2026-03-20T10:24:50Z) - Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization [133.27496265096445]
我々は,グループ相対的政策最適化を,その適合性を検討することなく,マルチリワード設定で適用する方法を示す。
次に、これらの問題を解決するための新しい政策最適化手法であるグループ報酬分離正規化政策最適化(GDPO)を紹介する。
GDPOはGRPOを一貫して上回り、マルチリワード強化学習最適化の有効性と一般化性を示す。
論文 参考訳(メタデータ) (2026-01-08T18:59:24Z) - A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation [2.5291809836356998]
我々は、政治外の修正を規制政策更新から切り離すための近親政策を導入する。
このポリシーでは、トレーニングの各ステップでネットワークをさらに前方通過する必要があるため、計算ボトルネックが発生します。
我々は,親近性ポリシが行動と対象ポリシの間に固定された信頼領域としてのみ機能するため,明示的な計算をせずに簡単な方法で近似することができることを観察した。
論文 参考訳(メタデータ) (2025-12-06T19:37:39Z) - Single-stream Policy Optimization [21.214853668053234]
SPO(Single-stream Policy Optimization)を導入する。
SPOはグループ単位のベースラインを永続的なKL適応値トラッカーに置き換え、バッチ全体にわたってメリットを標準化する。
グループフリーであるため、SPOはより高いスループットと、長い水平またはツール統合された設定で効果的にスケールすることができる。
論文 参考訳(メタデータ) (2025-09-16T16:39:11Z) - Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model [56.92219181993453]
本稿では,PPOやGRPOなどのオンラインRFT手法をオフ・ポリティクスデータに活用するために,Reincarnating Mix-policy Proximal Policy Gradient (ReMix)を提案する。
ReMix は,(1) 効率的なトレーニングのための更新データ(UTD)比が増大した混成政策勾配,(2) 安定性と柔軟性のトレードオフのバランスをとるためのKL-Convex 政策制約,(3) 効率的な早期学習から安定した改善へのシームレスな移行を実現するための政策再編成の3つの主要な構成要素から構成される。
論文 参考訳(メタデータ) (2025-07-09T14:29:45Z) - You May Not Need Ratio Clipping in PPO [117.03368180633463]
Proximal Policy Optimization (PPO) 法は、複数のミニバッチ最適化エポックを1組のサンプルデータで反復的に実行することでポリシーを学習する。
比率クリッピングPPOは、ターゲットポリシーとサンプル収集に使用されるポリシーの確率比をクリップする一般的な変種である。
本論文では, この比クリッピングが有効に結合できないため, 良好な選択ではないことを示す。
ESPOは、多くのワーカーによる分散トレーニングに簡単にスケールアップでき、パフォーマンスも高いことを示す。
論文 参考訳(メタデータ) (2022-01-31T20:26:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。