論文の概要: Decoupling Policy Extraction for Offline Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.20909v1
- Date: Fri, 21 Aug 2026 09:26:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.48817
- Title: Decoupling Policy Extraction for Offline Reinforcement Learning
- Title(参考訳): オフライン強化学習のためのデカップリングポリシー抽出
- Abstract要約: オフラインのRLメソッドは通常、アクターと批評家を共同で訓練する。
従来のオフラインRLパラダイムを再検討し、アクタートレーニングからポリシー改善を分離することを提案する。
具体的には、アクターが個別に学習した批評家と複数のアクター生成提案を並べ替えることで、行動分布をモデル化し、推論時にポリシー改善を行うように、アクターを訓練する。
- 参考スコア(独自算出の注目度): 18.247325284604553
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Offline RL methods commonly jointly train the actor and critic, where the critic is used to guide the actor toward higher-value actions. This coupled learning process is well motivated in online RL, where an improved actor collects new data that can further update the actor and the critic. However, training data remains fixed in offline RL, making actor-side policy improvement unable to generate new data to validate or correct the critic. Moreover, retaining this coupled paradigm leads to two related challenges. Firstly, actor updates can drift toward high-valued but potentially out-of-distribution (OOD) actions and amplify critic overestimation. Secondly, conservative value estimation or behavior-cloning regularization creates a difficult trade-off between suppressing OOD actions and selecting high-value actions within the data-supported region. Motivated by this observation, we revisit the conventional offline RL paradigm and propose decoupling policy improvement from actor training. Specifically, we train the actor solely to model the behavior distribution and perform policy improvement at inference time by reranking multiple actor-generated proposals with a separately learned critic. We refer to this paradigm as the decoupled policy extraction paradigm. Under such paradigm, the actor provides behavior-supported action candidates, while the critic performs value-based selection within this candidate set. Extensive experiments show that the decoupled policy extraction paradigm outperforms both behavior cloning and jointly learned offline RL methods, while remaining effective even with a naive Q-learning critic.
- Abstract(参考訳): オフラインのRL手法は、一般的にアクターと批評家を共同で訓練する。
オンラインRLでは、改良されたアクターが新たなデータを収集し、アクターと批評家をさらに更新することができる。
しかし、トレーニングデータはオフラインのRLで固定されているため、アクター側のポリシー改善は、批判を検証または修正するための新しいデータを生成することができない。
さらに、この結合パラダイムを維持することは、関連する2つの課題につながります。
第一に、アクターのアップデートは高い評価を受けるが、アウト・オブ・ディストリビューション(OOD)のアクションに流れ込み、批判的過大評価を増幅する。
第二に、保守的な値推定や行動閉鎖規則化は、OODアクションの抑制と、データ支援領域内での高価値アクションの選択との間に難しいトレードオフをもたらす。
そこで本研究では,従来のオフラインRLパラダイムを再考し,アクタートレーニングから政策改善を分離することを提案する。
具体的には、アクターが個別に学習した批評家と複数のアクター生成提案を並べ替えることで、行動分布をモデル化し、推論時にポリシー改善を行うように、アクターを訓練する。
我々はこのパラダイムを、分離された政策抽出パラダイムと呼んでいる。
このようなパラダイムの下で、アクターは行動支援されたアクション候補を提供し、批評家はこの候補セット内で価値ベースの選択を行う。
広汎な実験により、分離されたポリシー抽出パラダイムは、行動クローニングと共同学習されたオフラインRL手法の両方より優れた性能を示しながら、単純なQ-ラーニング評論家でさえ有効であることがわかった。
関連論文リスト
- Simple Actors and Deep Critics for Scalable Reinforcement Learning [4.626261940793026]
オフライン強化学習の最近の進歩は、表現的生成的アクターによって引き起こされている。
本研究では,オフラインアクタにキャパシティを投資すべき場所を再考する。
LAC (Light Actor, Deep Critic) を提案する。
OGBenchでは、LACは最も高い拡散・流動整合基線と一致し、蒸留のない1段階蒸留法に匹敵する4倍の推論遅延を達成した。
論文 参考訳(メタデータ) (2026-08-27T06:14:12Z) - Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning [22.17044827069627]
安定なアクターによって生成される高価値なアクションに置き換える,プラグアンドプレイのトレーニングサンプル置換器を提案する。
実験の結果、PARはパフォーマンスを継続的に改善し、基礎的なTD3+BCと組み合わせることで最先端にアプローチすることがわかった。
論文 参考訳(メタデータ) (2026-02-07T08:44:27Z) - Causal Flow Q-Learning for Robust Offline Reinforcement Learning [53.63254824501714]
構築された実演から表現型フローマッチングポリシーを学習する実践的実装を提案する。
提案手法は,最先端のオフラインRL法よりも120%の成功率を達成する。
論文 参考訳(メタデータ) (2026-02-02T21:50:52Z) - Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning [89.60378227969643]
より強力な監督を伴わないクオリティク言語モデルを開発するためのオンラインRLアプローチであるCrytique-RLを提案する。
提案手法は,アクターが応答を生成し,批評家がフィードバックを提供し,アクターがそれに応じて応答を洗練する,という2段階のパラダイムに基づいている。
さまざまなタスクやモデルに対する実験では、Cristique-RLが大幅なパフォーマンス改善を実現している。
論文 参考訳(メタデータ) (2025-10-28T11:37:01Z) - D2 Actor Critic: Diffusion Actor Meets Distributional Critic [4.669386607943427]
D2ACは,オンライン上で表現的拡散政策を効果的に訓練するために設計された新しいモデルフリー強化学習(RL)アルゴリズムである。
その中核は政策改善の目標であり、典型的な政策勾配の高分散と時間経過によるバックプロパゲーションの複雑さを避ける。
この安定した学習プロセスは、我々の第2の貢献によって、ロバストな分布的批判によって可能となり、分布的RLとクリップされた二重Q-ラーニングを融合して設計する。
得られたアルゴリズムは非常に効果的で、ヒューマノイド、ドッグ、シャドウハンドを含む18のハードRLタスクのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-10-03T20:47:24Z) - Statistically Efficient Variance Reduction with Double Policy Estimation
for Off-Policy Evaluation in Sequence-Modeled Reinforcement Learning [53.97273491846883]
本稿では、オフラインシーケンスモデリングとオフライン強化学習をダブルポリシー推定と組み合わせたRLアルゴリズムDPEを提案する。
D4RLベンチマークを用いて,OpenAI Gymの複数のタスクで本手法を検証した。
論文 参考訳(メタデータ) (2023-08-28T20:46:07Z) - Offline Reinforcement Learning with Adaptive Behavior Regularization [1.491109220586182]
オフライン強化学習(RL)は、静的で以前に収集されたデータセットからポリシーを学習する、サンプル効率のよい学習パラダイムを定義する。
適応行動正規化(Adaptive Behavior regularization, ABR)と呼ばれる新しい手法を提案する。
ABRは、データセットの生成に使用するポリシーのクローン化と改善の間に、ポリシーの最適化目標を適応的に調整することを可能にする。
論文 参考訳(メタデータ) (2022-11-15T15:59:11Z) - Curriculum Offline Imitation Learning [72.1015201041391]
オフラインの強化学習タスクでは、エージェントは、環境とのさらなるインタラクションなしに、事前にコンパイルされたデータセットから学ぶ必要がある。
我々は,適応的な近隣政策を模倣する経験的選択戦略を,より高いリターンで活用するテキストカリキュラムオフライン学習(COIL)を提案する。
連続制御ベンチマークでは、COILを模倣ベースとRLベースの両方の手法と比較し、混合データセット上で平凡な振る舞いを学ぶことを避けるだけでなく、最先端のオフラインRL手法と競合することを示します。
論文 参考訳(メタデータ) (2021-11-03T08:02:48Z) - Off-policy Reinforcement Learning with Optimistic Exploration and
Distribution Correction [73.77593805292194]
我々は、政治以外のアクター批判的枠組みにおいて、批評家のほぼ上位信頼度を最大化するために、別の調査政策を訓練する。
最近導入されたDICEフレームワークを応用して、非政治アクター犯罪訓練のための分布補正比を学習する。
論文 参考訳(メタデータ) (2021-10-22T22:07:51Z) - Offline Reinforcement Learning with Implicit Q-Learning [85.62618088890787]
現行のオフライン強化学習手法では、トレーニング中に見つからない行動の価値を問い合わせて、ポリシーを改善する必要がある。
本稿では,データセット外の動作を評価する必要のないオフラインRL手法を提案する。
この方法により、学習したポリシーは、一般化によってデータの最良の振る舞いを大幅に改善することができる。
論文 参考訳(メタデータ) (2021-10-12T17:05:05Z) - BRAC+: Improved Behavior Regularized Actor Critic for Offline
Reinforcement Learning [14.432131909590824]
オフライン強化学習は、以前に収集したデータセットを使用して効果的なポリシーをトレーニングすることを目的としている。
標準的なオフ・ポリティクスRLアルゴリズムは、アウト・オブ・ディストリビューション(探索されていない)アクションの値を過大評価する傾向がある。
動作の規則化によるオフライン強化学習を改善し,BRAC+を提案する。
論文 参考訳(メタデータ) (2021-10-02T23:55:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。