論文の概要: Reusing Past Samples in Proximal Policy Optimization: When and How Does It Help?
- arxiv url: http://arxiv.org/abs/2610.01399v1
- Date: Thu, 01 Oct 2026 10:05:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.046797
- Title: Reusing Past Samples in Proximal Policy Optimization: When and How Does It Help?
- Title(参考訳): 政策最適化における過去のサンプルの再利用:いつ、どのように役立つのか?
- Abstract要約: 複数の重み付けフレームワーク内で2つの変種をインスタンス化することにより、PPOにおけるサンプル再利用の有効性について検討する。
我々は、それぞれの損失に対する理論的根拠を提供する、政策改善の低い境界を導出する。
- 参考スコア(独自算出の注目度): 73.85707391058558
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Among on-policy deep reinforcement learning methods, Proximal Policy Optimization (PPO) has become the de facto standard, due to its consistently strong empirical performance across diverse application domains. However, on-policy methods are inherently sample inefficient: fresh data collected under the current policy is used for just a few updates before being discarded. Off-policy methods avoid this inefficiency via experience replay, achieving notable sample efficiency gains, but at the cost of training instabilities or extensive tuning. This motivated the rise of hybrid strategies that augment PPO with off-policy data reuse. Existing sample-reuse variants of PPO demonstrated improved sample efficiency over vanilla PPO, yet a systematic study of when reuse helps, in which scenarios, and to what extent remains missing. In this work, we study the effectiveness of sample reuse in PPO by instantiating two variants within a multiple importance weighting framework. Both retain the core PPO mechanics, reusing only samples from a window of recent iterations, thereby isolating the effect of data reuse from other factors. The variants, termed wPPO-U and wPPO-BH, employ vanilla importance weights or balance-heuristic-corrected ones, respectively. For both, we derive policy improvement lower bounds providing theoretical grounding for their respective losses. We use them to empirically study when and how data reuse improves sample efficiency or final performance of PPO across continuous control tasks.
- Abstract(参考訳): 政治の深い強化学習手法の中で、PPO(Proximal Policy Optimization)がデファクトスタンダードとなっている。
しかし、オンラインの方法は本質的に非効率なサンプルである:現在のポリシーの下で収集された新鮮なデータは、破棄される前にほんの数回のアップデートに使用される。
オフ・ポリティクスの手法は、経験的な再生を通じてこの非効率性を避け、顕著なサンプル効率の向上を達成するが、トレーニングの不安定さや広範囲なチューニングのコストがかかる。
このことは、PPOを非政治データの再利用で強化するハイブリッド戦略の台頭を動機づけた。
既存のPPOのサンプル再利用版では、バニラPPOよりもサンプル効率が向上した。
本研究では,複数の重み付けフレームワーク内で2つの変種をインスタンス化することにより,PPOにおけるサンプル再利用の有効性について検討する。
どちらもコアPPO機構を保持し、最近のイテレーションのウィンドウからサンプルのみを再利用することで、他の要因からデータ再利用の効果を分離する。
wPPO-U と wPPO-BH と呼ばれる派生型は、それぞれバニラ重みまたはバランス・ヒューリスティック補正の重みを用いる。
どちらの場合も、それぞれの損失に理論的根拠を与えるような政策改善の低い境界を導出する。
我々は、データ再利用が連続制御タスクにおけるサンプル効率やPPOの最終性能をいつ、どのように改善するかを実証的に研究する。
関連論文リスト
- RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning [49.04912820721943]
Group Prioritized Off-Policy Optimization (POPO)は、ロールアウトオーバーヘッドを発生させることなく、効果的なトレーニングバッチを活用するフレームワークである。
POPOは2つの重要なコンポーネントで構成されている。
POPOはRL微細化を著しく加速し、ロールアウトを著しく少なくして強力な推論性能を達成する。
論文 参考訳(メタデータ) (2026-05-31T15:06:38Z) - ExO-PPO: an Extended Off-policy Proximal Policy Optimization Algorithm [2.6813717321945103]
より効率的な非政治データ利用による保守的オン・ポリティクス反復の安定性保証に基づく新しいPPO変種を提案する。
PPOと他の最先端の変種と比較して、バランスの取れたサンプル効率と各種タスクの安定性により、ExO-PPOの性能が向上することを示した。
論文 参考訳(メタデータ) (2026-02-10T12:29:57Z) - Behaviour Policy Optimization: Provably Lower Variance Return Estimates for Off-Policy Reinforcement Learning [52.97053840476386]
我々は、よく設計された行動ポリシーを用いて、分散リターン推定を確実に低くするために、政治外のデータを収集できることを示します。
我々は、この重要な洞察を、政策評価と改善の両方がインターリーブされるオンライン強化学習環境に拡張する。
論文 参考訳(メタデータ) (2025-11-13T23:06:40Z) - PVPO: Pre-Estimated Value-Based Policy Optimization for Agentic Reasoning [6.050409262589219]
本稿では,アドバンスト参照アンカーとデータ事前サンプリングによって強化された効率的な強化学習手法であるPVPOを提案する。
本手法は,グループ内比較によって生じる累積バイアスを効果的に補正し,トレーニング中のロールアウト数への依存を著しく低減する。
このアプローチは,複数のタスクにまたがる堅牢な一般化を示すだけでなく,さまざまなスケールのモデルにまたがるスケーラブルなパフォーマンスを示す。
論文 参考訳(メタデータ) (2025-08-28T09:18:26Z) - A Simple and Effective Reinforcement Learning Method for Text-to-Image Diffusion Fine-tuning [61.403275660120606]
強化学習(Reinforcement Learning, RL)に基づく微調整は, 拡散モデルとブラックボックスの目的を整合させる強力なアプローチとして登場した。
拡散微調整のための新しいRLであるLOOP(Left-one-out PPO)を提案する。
以上の結果から, LOOPは様々なブラックボックス対象の拡散モデルを効果的に改善し, 計算効率と性能のバランスを良くすることを示す。
論文 参考訳(メタデータ) (2025-03-02T13:43:53Z) - Policy Gradient with Active Importance Sampling [55.112959067035916]
政策勾配法(PG法)はISの利点を大いに生かし、以前に収集したサンプルを効果的に再利用することができる。
しかし、ISは歴史的サンプルを再重み付けするための受動的ツールとしてRLに採用されている。
我々は、政策勾配のばらつきを減らすために、サンプルを収集する最良の行動ポリシーを模索する。
論文 参考訳(メタデータ) (2024-05-09T09:08:09Z) - Sample Dropout: A Simple yet Effective Variance Reduction Technique in
Deep Policy Optimization [18.627233013208834]
重要度サンプリングを用いることで, 目的推定値に高いばらつきが生じる可能性が示唆された。
そこで本研究では, サンプルの偏差が高すぎる場合に, サンプルをドロップアウトすることで, 推定分散を束縛する, サンプルドロップアウトと呼ばれる手法を提案する。
論文 参考訳(メタデータ) (2023-02-05T04:44:35Z) - You May Not Need Ratio Clipping in PPO [117.03368180633463]
Proximal Policy Optimization (PPO) 法は、複数のミニバッチ最適化エポックを1組のサンプルデータで反復的に実行することでポリシーを学習する。
比率クリッピングPPOは、ターゲットポリシーとサンプル収集に使用されるポリシーの確率比をクリップする一般的な変種である。
本論文では, この比クリッピングが有効に結合できないため, 良好な選択ではないことを示す。
ESPOは、多くのワーカーによる分散トレーニングに簡単にスケールアップでき、パフォーマンスも高いことを示す。
論文 参考訳(メタデータ) (2022-01-31T20:26:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。