論文の概要: Free Everywhere, Exact on Trees: PPO's Dropped Correction Buys Sample Efficiency Under Aggressive Reuse
- arxiv url: http://arxiv.org/abs/2609.39634v1
- Date: Wed, 30 Sep 2026 12:41:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.781956
- Title: Free Everywhere, Exact on Trees: PPO's Dropped Correction Buys Sample Efficiency Under Aggressive Reuse
- Title(参考訳): PPOの値下げ補正が攻撃的再利用でサンプル効率向上
- Abstract要約: 本研究では,各状態が正確に1つの履歴に到達した履歴インジェクティブ・ダイナミクスの下では,各状態ビジュアライゼーション比がサンプルプレフィックスに沿ったステップごとのポリシー比の積と等しいことを示す。
クリッピングが既に再利用バイアスを含んでいる場合、全会一致で行われる修正は、有害である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Common policy improvement methods, including TRPO, PPO, and GRPO, estimate policy improvement under the behavioral policy's state-visitation distribution rather than the improved policy's own. The substitution makes the objective estimable from the behavioral policy's rollouts but adds a bias growing with policy divergence, hence the trust region or clip, and hence no reuse of a batch far off-policy. We show that under history-injective dynamics, where each state is reached by exactly one history, the dropped state-visitation ratio equals the product of per-step policy ratios along the sampled prefix, on every trajectory and not only in expectation. The ratio is therefore restored exactly, from log-probabilities PPO already computes. Autoregressive generation and canonical-order constructive optimization are both history-injective. The exact correction pays importance-sampling variance that grows with the horizon, so we generalize it to a one-parameter family with PPO ($α{=}0$) and the full correction ($α{=}1$) as endpoints: a single bias--variance knob. A gradient-level analysis of the unclipped surrogate identifies two channels the correction acts through and three conditions under which it carries signal; an enumerable testbed confirms the conditions' predictions. On hard credit-assignment scheduling tasks, a short corrected warmup with aggressive early sample reuse learns faster than PPO and than the same reuse uncorrected; the marginal gain grows with task difficulty ($+0.02$ to $+0.09$ learning-curve AUC), and the early win over PPO tracks the prefix bias that reuse incurs. A correction held throughout, or applied where clipping already contains the reuse bias, is null to harmful.
- Abstract(参考訳): TRPO、PPO、GRPOなどの共通政策改善手法は、政策改善そのものではなく、行動政策の国家観念分布に基づく政策改善を推定する。
この代替によって、行動政策の展開から目的を推定できるが、政策のばらつきによって成長するバイアスが生じるため、信頼領域やクリップが生じる。
本研究では,各状態が正確に1つの履歴に到達した履歴インジェクティブ・ダイナミクスの下では,ドロップ状態ビジュアライゼーション比は,サンプルプレフィックスに沿ったステップごとのポリシー比の積に等しいことを示す。
したがって、ログ確率 PPO が既に計算済みであるため、その比率は正確に復元される。
自己回帰生成と正準次構成最適化はどちらも履歴インジェクティブである。
正確な補正は地平線とともに成長する重要サンプリング分散を納入するので、PPO(α{=}0$)を持つ1パラメータ族に一般化し、完全な補正(α{=}1$)を終点として、単一のバイアス分散ノブとする。
切り離されたサロゲートの勾配レベルの解析では、補正が作用する2つのチャネルと、信号を運ぶ3つの条件が識別される。
ハードクレジット割り当てスケジューリングタスクでは、アグレッシブな初期サンプル再利用を伴う短い修正されたウォームアップがPPOよりも早く学習し、同じ再利用が修正されず、タスクの難しさ(+0.02$から+0.09$の学習曲線AUC)で限界ゲインが増加し、PPOに対する早期の勝利は再利用が生じるプレフィックスバイアスを追跡する。
クリッピングが既に再利用バイアスを含んでいる場合、全会一致で行われる修正は、有害である。
関連論文リスト
- OPTS-TTPO: Enhancing Finite-Sample Policy-Gradient Learning with Tree Search [18.059989803562807]
木探索が一定の予算内で網羅性を向上させるかどうかを検討した。
On-Policy Parallel Tree Search (OPTS) と Tree Trajectory Policy Optimization (TTPO) を導入する。
TTPOは、訪れた州で現在の政策から新しい接尾辞をサンプリングするオンラインツリートラジェクトリを使用している。
論文 参考訳(メタデータ) (2026-09-30T16:06:51Z) - EasyPPO: Stabilizing the Critic Is Key [57.76826550536797]
PPO(Proximal Policy Optimization)の主な強みは、その学習的批判である。
批判は、大規模言語モデルの強化学習における不安定性の主要な原因でもある。
EasyPPOはフルトレーニングの地平線を通して安定しており、バニラPPO、VAPO、HL-GaussPPOより一貫して優れている。
論文 参考訳(メタデータ) (2026-09-29T06:15:00Z) - BCPPO: Bachelier-Inspired Constrained Proximal Policy Optimization for Tail-Risk-Aware Safe Reinforcement Learning [0.5461938536945722]
本稿では,BCPPO (Bachelier-Inspireed Constrained Proximal Policy Optimization) をポリシ最適化 (PPO) 手法として提案する。
異なるコスト予測ネットワーク(批評家)は、トレーニングデータにどの状態アクション領域が発生するかに敏感な予測を示す不一致を生成する。
飽和対応コントローラは、平均コストペナルティを調整し、そのペナルティが切断されている間に累積誤差が増大するのを阻止する。
論文 参考訳(メタデータ) (2026-08-31T05:52:29Z) - Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective [22.848847562976633]
トークンレベルのIS比は、PPOとGRPOが採用しているように、プレフィックス状態の分布ミスマッチを無視してバイアスを導入する。
我々は、累積トークンIS比と、累積対数比の自然な$sqrtt$成長に応じて、対数空間のクリップ境界を拡大する位置適応クリッピングを組み合わせたCTPOを提案する。
論文 参考訳(メタデータ) (2026-05-08T06:35:02Z) - Mitigating Mismatch within Reference-based Preference Optimization [55.07698254211876]
直接選好最適化(DPO)は、大規模な言語モデルのオフライン選好アライメントのデファクトスタンダードとなっている。
DPOは、信頼された領域内で更新を規則化することでトレーニングを安定化する参照に対して、各更新を重み付けする。
この依存は、参照モデルが拒否された応答を好む悲観的なペアにとって問題となる。
DPOを変更して、$_-_mathrmref$を$_-max0,_mathrmref$に置き換えることで、悲観的な場合、参照を中立的に扱うようにします。
論文 参考訳(メタデータ) (2026-02-12T12:55:51Z) - Coverage Improvement and Fast Convergence of On-policy Preference Learning [67.36750525893514]
言語モデルアライメントのためのオンラインのオンラインプライオリティ学習アルゴリズムは、オフラインのアルゴリズムよりも大幅に優れている。
我々は,サンプリング政策の包括的範囲が政治訓練を通じてどのように進展するかを分析する。
一般機能クラス設定における報奨蒸留のための原則的オンライン方式を開発した。
論文 参考訳(メタデータ) (2026-01-13T10:46:06Z) - Moments Matter:Stabilizing Policy Optimization using Return Distributions [9.430246534202857]
連続制御タスクでは、小さなパラメータシフトでさえ不安定な歩行を生み出す。
環境に配慮した代替案を提案する。
論文 参考訳(メタデータ) (2026-01-05T05:27:11Z) - Reinforcement Learning with Verifiable Rewards: GRPO's Effective Loss, Dynamics, and Success Amplification [10.617854230082896]
グループ相対政策最適化は、検証可能な(バイナリ)報酬の下でLLMの推論を促進するために最近導入された。
我々は、報酬正規化(平均のみ対平均+分散)とKL分散を用いた更新の正則化の仕方が異なる変種を解析する。
論文 参考訳(メタデータ) (2025-03-09T14:36:45Z) - Policy Gradient with Active Importance Sampling [55.112959067035916]
政策勾配法(PG法)はISの利点を大いに生かし、以前に収集したサンプルを効果的に再利用することができる。
しかし、ISは歴史的サンプルを再重み付けするための受動的ツールとしてRLに採用されている。
我々は、政策勾配のばらつきを減らすために、サンプルを収集する最良の行動ポリシーを模索する。
論文 参考訳(メタデータ) (2024-05-09T09:08:09Z) - The Role of Baselines in Policy Gradient Optimization [83.42050606055822]
Emphstateのバリューベースラインが、オン・ポリティクスを可能にしていることを示す。
世界的な最適な政策勾配(NPG)に収束する。
O (1/t) レート勾配でのポリシー。
値ベースラインの主な効果は、その分散ではなく、更新のアグレッシブさをthabfreduceすることにある。
論文 参考訳(メタデータ) (2023-01-16T06:28:00Z) - Universal Off-Policy Evaluation [64.02853483874334]
ユニバーサルオフ政治推定器(UnO)への第一歩を踏み出す
我々は, 平均, 分散, 分位数/中間数, 分位数範囲, cvar, および累積分布全体の推定と同時結合に uno を用いる。
論文 参考訳(メタデータ) (2021-04-26T18:54:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。