論文の概要: Role-Adaptive Policy Optimization for Offline Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.40149v1
- Date: Wed, 30 Sep 2026 16:53:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:28.113564
- Title: Role-Adaptive Policy Optimization for Offline Reinforcement Learning
- Title(参考訳): オフライン強化学習における役割適応型政策最適化
- Abstract要約: オフライン強化学習における政策規則化は、不確実な価値推定に依存することに対する政策改善のバランスをとる。
本稿では,役割適応型政策最適化(RAPO, Role-Adaptive Policy Optimization)を提案する。
- 参考スコア(独自算出の注目度): 15.88392414749782
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Policy regularization in offline reinforcement learning balances policy improvement against reliance on uncertain value estimates. This balance can differ between selecting actions for execution and supplying actions for critic bootstrapping, yet methods such as TD3+BC couple these roles through a shared policy. We propose Role-Adaptive Policy Optimization (RAPO), which adapts policy-update coefficients according to their roles in value learning and execution. RAPO learns these coefficients by differentiating through candidate policy updates formed using the base algorithm's actor objective. For TD3+BC, RAPO separates bootstrap and execution actors and adapts their coefficients independently: the bootstrap objective penalizes policy-induced changes in target values, while the execution objective evaluates a local policy-improvement surrogate. For IQL, whose value learning is already independent of the execution actor, RAPO preserves the original value updates and adapts only the inverse temperature in advantage-weighted policy extraction. Experiments on D4RL locomotion and AntMaze tasks show improvements over both base algorithms, with larger gains for TD3+BC, whose RAPO instantiation outperforms baselines on average.
- Abstract(参考訳): オフライン強化学習における政策規則化は、不確実な価値推定に依存することに対する政策改善のバランスをとる。
このバランスは、実行のためのアクションの選択と、批判的なブートストラップのためのアクションの供給との違いがあるが、TD3+BCのようなメソッドは、共有ポリシーを通じてこれらの役割を結合する。
本稿では,役割適応型政策最適化(RAPO, Role-Adaptive Policy Optimization)を提案する。
RAPOは、基本アルゴリズムのアクター目的を用いた候補ポリシー更新を通じて、これらの係数を微分することで学習する。
TD3+BCの場合、RAPOはブートストラップと実行アクターを分離し、その係数を独立に適応する。
価値学習が実行アクタから独立しているIQLでは、RAPOは元の値更新を保持し、有利なポリシ抽出で逆温度のみを適用する。
D4RLロコモーションとAntMazeタスクの実験では、両方のベースアルゴリズムよりも改善され、TD3+BCはRAPOインスタンスが平均ベースラインを上回っている。
関連論文リスト
- SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning [13.558040481824037]
エージェント強化学習(RL)は,大規模言語モデルのポストトレーニングにおいて重要な段階となっている。
本稿では,シングルロールアウト型自己回帰政策最適化(SAPO)を提案する。これは低メモリかつ計算効率のフレームワークで,ポリシーと値関数が単一の自己回帰バックボーンを共有する。
論文 参考訳(メタデータ) (2026-08-20T09:43:47Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training [50.86545293331458]
強化学習は、教師付き学習よりも構造的に難しい。
本稿では,固定クリッピングを政策比率の正規化された有効サンプルサイズに置き換える,単純かつ効果的なバッチ適応目的を提案する。
論文 参考訳(メタデータ) (2026-05-12T16:44:47Z) - EXPO: Stable Reinforcement Learning with Expressive Policies [74.30151915786233]
2つのパラメータ化ポリシーで値の最大化を実現するために,サンプル効率のよいオンライン強化学習アルゴリズムを提案する。
提案手法は, 従来手法に比べて試料効率を最大2~3倍向上させる。
論文 参考訳(メタデータ) (2025-07-10T17:57:46Z) - Clipped-Objective Policy Gradients for Pessimistic Policy Optimization [3.2996723916635275]
政策勾配法は、政策出力の有界変化を通じて単調な改善を図っている。
本研究では,PPOの性能を連続的な作用空間に適用した場合,目的の単純変化によって一貫した改善が期待できることを示す。
PPO と PPO の両目標に比較して, COPG の目標が平均的な「悲観的」であること, 2) この悲観主義は探索を促進させることを示した。
論文 参考訳(メタデータ) (2023-11-10T03:02:49Z) - Off-Policy Evaluation for Large Action Spaces via Policy Convolution [60.6953713877886]
ポリシ・コンボリューション(Policy Convolution)のファミリーは、アクション内の潜在構造を使用して、ログとターゲットポリシを戦略的に畳み込みます。
合成およびベンチマークデータセットの実験では、PCを使用する場合の平均二乗誤差(MSE)が顕著に改善されている。
論文 参考訳(メタデータ) (2023-10-24T01:00:01Z) - Statistically Efficient Variance Reduction with Double Policy Estimation
for Off-Policy Evaluation in Sequence-Modeled Reinforcement Learning [53.97273491846883]
本稿では、オフラインシーケンスモデリングとオフライン強化学習をダブルポリシー推定と組み合わせたRLアルゴリズムDPEを提案する。
D4RLベンチマークを用いて,OpenAI Gymの複数のタスクで本手法を検証した。
論文 参考訳(メタデータ) (2023-08-28T20:46:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。