論文の概要: Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.02332v1
- Date: Mon, 03 Aug 2026 14:52:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.610028
- Title: Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning
- Title(参考訳): オフライン強化学習のための行動アドバンテージ補正を用いた拡散政策
- Authors: Botao Dong, Longyang Huang, Ning Pang, Hongtian Chen,
- Abstract要約: オフライン強化学習(RL)では, 行動データと学習方針の分布変化は, 誤ったemphQ値推定につながる可能性がある。
本研究では,行動優位修正政策評価(BAC-PE)アプローチを開発し,学習方針のemphQ関数を補正する。
DPBACは最先端(SOTA)アルゴリズムよりも優れた性能を示す。
- 参考スコア(独自算出の注目度): 21.895439172123474
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In offline reinforcement learning (RL), the distribution shift between behavioral data and the learned policy can lead to erroneous \emph{Q}-value estimation, thereby misguiding the direction of policy optimization. To address this issue, we develop a behavioral advantage corrected policy evaluation (BAC-PE) approach, which utilizes the \emph{Q}-function of the behavior policy to correct the learned policy's \emph{Q}-function, thus mitigating pessimistic conservatism and overestimation bias. Furthermore, the convergence of BAC-PE is analyzed theoretically, and an upper bound on the difference between the learned \emph{Q}-function and the true \emph{Q}-function is derived. To alleviate distribution shift, this work employs diffusion models to represent both the behavior policy and the learned policy, performing distribution matching for accurate policy regularization. Additionally, \emph{Q}-value guidance is incorporated into the training process to achieve effective policy improvement. By combining BAC-PE with diffusion policy modeling, we propose the diffusion policy with behavioral advantage correction (DPBAC) algorithm. Compared to existing offline methods, DPBAC demonstrates stronger policy representation capabilities and effectively mitigates the bias in \emph{Q}-value estimation. Experimental results on multiple domains of D4RL tasks show that DPBAC achieves superior performance, with notable advantages over state-of-the-art (SOTA) algorithms.
- Abstract(参考訳): オフライン強化学習(RL)では、行動データと学習方針の分布シフトは誤った \emph{Q}-値を推定し、政策最適化の方向性を誤る可能性がある。
この問題に対処するため,行動的優位性補正政策評価(BAC-PE)手法を開発し,行動政策の「emph{Q}-関数」を用いて学習政策の「emph{Q}-関数」を補正し,悲観的保守主義と過大評価バイアスを緩和する。
さらに BAC-PE の収束を理論的に解析し、学習した \emph{Q}-函数と真の \emph{Q}-函数との差の上限を導出する。
分散シフトを緩和するために、この研究は拡散モデルを用いて行動ポリシーと学習ポリシーの両方を表現し、正確なポリシー正則化のための分布マッチングを実行する。
さらに、効果的な政策改善を達成するためのトレーニングプロセスには、emph{Q}値ガイダンスが組み込まれている。
BAC-PEと拡散ポリシモデリングを組み合わせることで,拡散ポリシと行動優位補正(DPBAC)アルゴリズムを提案する。
既存のオフライン手法と比較して、DPBACはより強力なポリシー表現能力を示し、emph{Q}-値推定におけるバイアスを効果的に緩和する。
D4RLタスクの複数の領域に対する実験結果から,DPBACは最先端のSOTAアルゴリズムよりも優れた性能を示した。
関連論文リスト
- Diffusion Actor-Critic: Formulating Constrained Policy Iteration as Diffusion Noise Regression for Offline Reinforcement Learning [13.163511229897667]
オフラインの強化学習では、価値関数の過大評価を防ぐために、配布外動作を管理する必要がある。
拡散雑音回帰問題としてクルバック・リブラー (KL) 制約ポリシーの繰り返しを定式化する拡散アクタ・クリティカル (DAC) を提案する。
提案手法はD4RLベンチマークで評価され,ほぼすべての環境において最先端の手法よりも優れている。
論文 参考訳(メタデータ) (2024-05-31T00:41:04Z) - Diffusion-based Reinforcement Learning via Q-weighted Variational Policy Optimization [55.97310586039358]
拡散モデルは強化学習(Reinforcement Learning, RL)において、その強力な表現力と多モード性に対して広く注目を集めている。
モデルなし拡散に基づくオンラインRLアルゴリズムQ-weighted Variational Policy Optimization (QVPO)を提案する。
具体的には、ある条件下でのオンラインRLにおける政策目標の厳密な下限を証明できるQ重み付き変動損失を導入する。
また,オンラインインタラクションにおける拡散ポリシのばらつきを低減し,サンプル効率を向上させるための効率的な行動ポリシーも開発している。
論文 参考訳(メタデータ) (2024-05-25T10:45:46Z) - Offline Reinforcement Learning with On-Policy Q-Function Regularization [57.09073809901382]
ヒストリーデータセットと所望のポリシー間の分布シフトによって引き起こされる(潜在的に破滅的な)外挿誤差に対処する。
正規化により推定Q-関数を利用する2つのアルゴリズムを提案し、D4RLベンチマークに強い性能を示すことを示す。
論文 参考訳(メタデータ) (2023-07-25T21:38:08Z) - Diffusion Policies as an Expressive Policy Class for Offline
Reinforcement Learning [70.20191211010847]
オフライン強化学習(RL)は、以前に収集した静的データセットを使って最適なポリシーを学ぶことを目的としている。
本稿では,条件付き拡散モデルを用いたディフュージョンQ-ラーニング(Diffusion-QL)を提案する。
本手法はD4RLベンチマークタスクの大部分において最先端の性能を実現することができることを示す。
論文 参考訳(メタデータ) (2022-08-12T09:54:11Z) - Offline Reinforcement Learning with Implicit Q-Learning [85.62618088890787]
現行のオフライン強化学習手法では、トレーニング中に見つからない行動の価値を問い合わせて、ポリシーを改善する必要がある。
本稿では,データセット外の動作を評価する必要のないオフラインRL手法を提案する。
この方法により、学習したポリシーは、一般化によってデータの最良の振る舞いを大幅に改善することができる。
論文 参考訳(メタデータ) (2021-10-12T17:05:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。