論文の概要: Expert Behavior Prior Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.21302v2
- Date: Mon, 27 Jul 2026 12:47:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 14:56:47.04024
- Title: Expert Behavior Prior Reinforcement Learning
- Title(参考訳): 強化学習以前のエキスパート行動
- Abstract要約: 行動事前強化学習(BPRL)は、オンライン強化学習(RL)におけるサンプル効率向上のための有望なパラダイムとして登場した。
既存のBPRLメソッドの多くは静的なオフラインデータセットに依存しており、データ多様性の低さと最適下軌道品質に悩まされることが多い。
本稿では,オンライン再生バッファから直接,エキスパートポリシーの事前生成を学習するエキスパート行動優先(EBP)アルゴリズムを提案する。
EBPは最先端のオンラインRLアルゴリズムを著しく上回り、より高いサンプリング効率とより安定した収束を実現している。
- 参考スコア(独自算出の注目度): 10.983482150597913
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Behavior prior reinforcement learning (BPRL) has emerged as a promising paradigm to improve sample efficiency in online reinforcement learning (RL) by leveraging policy priors derived from offline demonstrations. However, most existing BPRL methods rely on static offline datasets, which often suffer from low data diversity and suboptimal trajectory quality. This reliance restricts the effectiveness of policy priors, hindering both policy exploitation and stability during online training. Consequently, agents are prone to inefficient exploration and unstable learning dynamics. To address these limitations, we deviate from existing offline pre-training methods and propose an Expert Behavior Prior (EBP) algorithm. Specifically, we introduce a Q-guided conditional variational autoencoder (Q-CVAE) that learns to generate expert policy priors directly from the online replay buffer. This enables the generation of high-value actions for guiding policy updates without relying on pre-collected expert trajectories. To further enhance policy exploitation, we propose an expert policy guidance (EPG) mechanism that selects expert actions from a generative support set, and we integrate a policy gradient correction (PGC) module to harmonize Q-guidance with expert supervision, promoting stable and consistent policy improvement. Extensive experiments conducted on robotic control (Gym, PyBullet) and industrial control (DMControl) benchmarks demonstrate that EBP significantly outperforms state-of-the-art online RL algorithms, achieving higher sample efficiency and more stable convergence.
- Abstract(参考訳): 行動事前強化学習(BPRL)は,オンライン強化学習(RL)におけるサンプル効率向上に期待できるパラダイムとして,オフラインでの実証から得られた政策事前を活用する。
しかし、既存のほとんどのBPRL手法は静的なオフラインデータセットに依存しており、しばしば低データの多様性と準最適軌道品質に悩まされる。
この依存は、政策事前の有効性を制限し、オンライントレーニング中の政策利用と安定性の両方を妨げる。
その結果、エージェントは非効率な探索と不安定な学習ダイナミクスの傾向が生じる。
これらの制約に対処するため、既存のオフライン事前学習方法から逸脱し、エキスパート行動優先(EBP)アルゴリズムを提案する。
具体的には、Q-CVAE(Q-Guided Conditional variational autoencoder)を導入し、オンライン再生バッファから直接エキスパートポリシーの事前生成を学習する。
これにより、事前に決められた専門家の軌跡に頼ることなく、ポリシー更新を導くための高価値なアクションを生成することができる。
政策活用をさらに強化するため、我々は、生成支援セットから専門家行動を選択するエキスパートポリシーガイダンス(EPG)機構を提案し、専門家の監督とQガイダンスを調和させ、安定的で一貫した政策改善を促進するために、ポリシー勾配修正(PGC)モジュールを統合する。
ロボット制御(Gym, PyBullet)と産業制御(DMControl)のベンチマークで実施された大規模な実験により、BPは最先端のオンラインRLアルゴリズムを著しく上回り、より高いサンプル効率とより安定した収束を実現していることが示された。
関連論文リスト
- Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning [50.738952715864116]
表現的連続制御ポリシは、シミュレーションされた実ロボット制御のための模倣学習のスケーリングにおける進歩のバックボーンを形成する。
テスト時に完全にポリシー最適化を行うRLアルゴリズムであるQGF(Q-Guided Flow)を提案する。
実証的には、QGFはシングルタスクおよびゴール条件のオフラインRLベンチマークにおいて、以前のテスト時間RLメソッドよりも優れている。
論文 参考訳(メタデータ) (2026-06-09T16:45:57Z) - OGPO: Sample Efficient Full-Finetuning of Generative Control Policies [53.42266064673132]
ジェネレーティブコントロールポリシー(GCP)は、ロボット学習に有効なパラメータ化として登場した。
この研究は、GCPを微調整するためのサンプル効率であるOGPO(Off-policy Generative Policy Optimization)を導入している。
OGPOはマルチタスク設定、高精度挿入、デクスタラス制御にまたがる操作タスクにおける最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-05-04T18:36:40Z) - EXPO: Stable Reinforcement Learning with Expressive Policies [74.30151915786233]
2つのパラメータ化ポリシーで値の最大化を実現するために,サンプル効率のよいオンライン強化学習アルゴリズムを提案する。
提案手法は, 従来手法に比べて試料効率を最大2~3倍向上させる。
論文 参考訳(メタデータ) (2025-07-10T17:57:46Z) - Offline-Boosted Actor-Critic: Adaptively Blending Optimal Historical Behaviors in Deep Off-Policy RL [42.57662196581823]
オフ・ポリティクス強化学習(RL)は、多くの複雑な現実世界のタスクに取り組むことで顕著な成功を収めた。
既存のRLアルゴリズムの多くは、リプレイバッファ内の情報を最大限活用できない。
OBAC(Offline-Boosted Actor-Critic)は、モデルのないオンラインRLフレームワークで、優れたオフラインポリシーをエレガントに識別する。
論文 参考訳(メタデータ) (2024-05-28T18:38:46Z) - Diffusion-based Reinforcement Learning via Q-weighted Variational Policy Optimization [55.97310586039358]
拡散モデルは強化学習(Reinforcement Learning, RL)において、その強力な表現力と多モード性に対して広く注目を集めている。
モデルなし拡散に基づくオンラインRLアルゴリズムQ-weighted Variational Policy Optimization (QVPO)を提案する。
具体的には、ある条件下でのオンラインRLにおける政策目標の厳密な下限を証明できるQ重み付き変動損失を導入する。
また,オンラインインタラクションにおける拡散ポリシのばらつきを低減し,サンプル効率を向上させるための効率的な行動ポリシーも開発している。
論文 参考訳(メタデータ) (2024-05-25T10:45:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。