論文の概要: FERPO: Forward Entropy-Regularized Policy Optimization
- arxiv url: http://arxiv.org/abs/2610.02198v1
- Date: Thu, 01 Oct 2026 17:59:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.371784
- Title: FERPO: Forward Entropy-Regularized Policy Optimization
- Title(参考訳): FERPO:フォワードエントロピー-正規化政策最適化
- Abstract要約: 本稿では,最大エントロピー強化学習アルゴリズムであるフォワードエントロピー正規化政策最適化(FERPO)を提案する。
FERPOは、批評家を行動に関して差別化することなく、批判値を使用して政策改善を行う。
MuJoCo PlaygroundとManiSkillの実験と改善は、競争性能とサンプル効率の向上を示している。
- 参考スコア(独自算出の注目度): 5.677602352510579
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Several state-of-the-art methods for online reinforcement learning in continuous control improve policies using action gradients of a learned critic. However, critics are typically trained to predict returns, and accurate value predictions do not necessarily yield accurate action derivatives, potentially leading to unreliable policy updates. We propose Forward Entropy-Regularized Policy Optimization (FERPO), an on-policy maximum entropy reinforcement learning algorithm that performs policy improvement using critic values without differentiating the critic with respect to actions. FERPO derives an optimal target action distribution from a policy-improvement objective regularized by entropy and Kullback-Leibler (KL) divergence. We then fit the actor to this target by minimizing a forward-KL objective, estimated using self-normalized importance sampling (SNIS) with actions drawn from the rollout policy. By limiting the target distribution's deviation from the rollout policy, the KL regularization helps keep these importance weights well behaved. In contrast to reverse-KL objectives, which can favor a subset of the target distribution's modes, the forward-KL objective encourages coverage of multiple high-value modes and thereby promotes exploration. Experiments and ablations on MuJoCo Playground and ManiSkill show competitive performance and sample-efficiency gains. Computational benchmarks also demonstrate faster actor updates than Relative Entropy Pathwise Policy Optimization (REPPO).
- Abstract(参考訳): 継続的制御におけるオンライン強化学習の最先端的手法は、学習評論家の行動勾配を用いて政策を改善する。
しかし、批評家は一般的にリターンを予測するよう訓練されており、正確な値予測が必ずしも正確なアクションデリバティブをもたらすとは限らないため、信頼性の低い政策更新につながる可能性がある。
本稿では,政治最大エントロピー強化学習アルゴリズムであるフォワードエントロピー正規化政策最適化(FERPO)を提案する。
FERPOは、エントロピーとKL(Kulback-Leibler)の発散によって正規化されたポリシー改善目標から最適な目標行動分布を導出する。
次に、自己正規化重要度サンプリング(SNIS)を用いて推定したフォワードKL目標を、ロールアウトポリシーから引き出されたアクションで最小化することにより、このターゲットにアクターを適合させる。
目標分布のロールアウトポリシーからの逸脱を制限することで、KL正規化はこれらの重みを適切に振る舞うのに役立つ。
対象の分布モードのサブセットを好む逆KL目的とは対照的に、フォワードKL目的は複数の高値モードのカバレッジを奨励し、探索を促進する。
MuJoCo PlaygroundとManiSkillの実験と改善は、競争性能とサンプル効率の向上を示している。
計算ベンチマークでは、Relative Entropy Pathwise Policy Optimization (REPPO)よりも高速なアクター更新も示されている。
関連論文リスト
- Role-Adaptive Policy Optimization for Offline Reinforcement Learning [15.88392414749782]
オフライン強化学習における政策規則化は、不確実な価値推定に依存することに対する政策改善のバランスをとる。
本稿では,役割適応型政策最適化(RAPO, Role-Adaptive Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-09-30T16:53:45Z) - Schrödinger--Föllmer Actor--Critic: Diffusion Policy Improvement with Finite-Sample Analysis [16.115903198836694]
拡散ポリシは、マルチモーダルなアクション分布を表すが、アドバンテージ重み付けされた更新では、結果のターゲット分布からサンプルする方法を規定していない。
我々は,KL(Kulback--Leibler)のオフライン-オンライン強化学習(RL)手法であるSchrdinger-Fllmer Actor-Critic (SFAC)を提案する。
適切な条件下では、評価評価、神経ドリフト回帰、有限サンプルSNIS、拡散離散化、およびアクターエラーが期待される平均的政策最適性に与える影響を分離する有限サンプル境界を導出する。
論文 参考訳(メタデータ) (2026-09-27T05:27:34Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent [53.828537014796574]
オンラインの非政治強化学習(RL)は、ポリシークラスと更新ルールの2つの選択肢によって構成されている。
我々は、MeanFlow変換を通じてノイズをアクションにマッピングする一段階生成ポリシークラスであるMeanFlow Policiesを提案する。
7つのMuJoCoベンチマークで、Sは1ステップの推論効率を維持しながら、ガウスおよび生成ベースラインを改善する。
論文 参考訳(メタデータ) (2026-05-20T15:14:14Z) - Policy Improvement Reinforcement Learning [40.05196753615896]
Reinforcement Learning with Verifiable Rewards (RLVR) は、大規模言語モデルの推論能力を改善するためのトレーニング後の中心的なパラダイムとなっている。
既存のメソッドは共通の盲点を共有している: 結果の更新によってモデルが実際に改善されたかどうかを検証することなく、即時のグループレベルまたはバッチレベルの統計に基づいてポリシーを最適化する。
我々は、政策改善のフィードバックが欠落していること、すなわち、中間段階の進捗を直接測定し、最適化する能力が欠けていることを論じる。
論文 参考訳(メタデータ) (2026-04-01T13:10:20Z) - A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization [58.116300485427764]
強化学習のポストトレーニングは、大きな言語モデルにおける推論の振る舞いを引き出すことができる。
トークンレベルの補正は、オフポリシーネスの度合いが大きい場合、不安定なトレーニングダイナミクスにつながることが多い。
我々は,最小固定率 (MinPRO) を簡易かつ効果的に提案する。
論文 参考訳(メタデータ) (2026-01-30T08:47:19Z) - What Is Preference Optimization Doing, How and Why? [73.78865043839939]
一般的な考え方は、DPOは教師付き学習であり、PPOは強化学習である。
まず、勾配に基づく更新の目標方向を調べ、DPOが安定した目標に従うのに対し、PPOは探索とエクスプロイトのバランスをとる動的目標に従う。
第2に、PO法における3つの重要な要素である正の学習、負の学習、損失再重み付けの役割について検討する。
論文 参考訳(メタデータ) (2025-11-30T08:27:59Z) - BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping [69.74252624161652]
適応クリッピング(BAPO)を用いたBAlanced Policy Optimizationを提案する。
BAPOはクリッピングバウンダリを動的に調整し、適応的に正と負のコントリビューションを再バランスさせ、エントロピーを保持し、RL最適化を安定化させる。
AIME 2024とAIME 2025ベンチマークでは、7B BAPOモデルがSkyWork-OR1-7Bのようなオープンソースモデルを上回っています。
論文 参考訳(メタデータ) (2025-10-21T12:55:04Z) - Clipped-Objective Policy Gradients for Pessimistic Policy Optimization [3.2996723916635275]
政策勾配法は、政策出力の有界変化を通じて単調な改善を図っている。
本研究では,PPOの性能を連続的な作用空間に適用した場合,目的の単純変化によって一貫した改善が期待できることを示す。
PPO と PPO の両目標に比較して, COPG の目標が平均的な「悲観的」であること, 2) この悲観主義は探索を促進させることを示した。
論文 参考訳(メタデータ) (2023-11-10T03:02:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。