論文の概要: Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2602.07441v1
- Date: Sat, 07 Feb 2026 08:44:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-10 20:26:24.623803
- Title: Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning
- Title(参考訳): オフライン強化学習における行動クローン・アクター・クライトの近行動置換
- Abstract要約: 安定なアクターによって生成される高価値なアクションに置き換える,プラグアンドプレイのトレーニングサンプル置換器を提案する。
実験の結果、PARはパフォーマンスを継続的に改善し、基礎的なTD3+BCと組み合わせることで最先端にアプローチすることがわかった。
- 参考スコア(独自算出の注目度): 22.17044827069627
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Offline reinforcement learning (RL) optimizes policies from a previously collected static dataset and is an important branch of RL. A popular and promising approach is to regularize actor-critic methods with behavior cloning (BC), which yields realistic policies and mitigates bias from out-of-distribution actions, but can impose an often-overlooked performance ceiling: when dataset actions are suboptimal, indiscriminate imitation structurally prevents the actor from fully exploiting high-value regions suggested by the critic, especially in later training when imitation is already dominant. We formally analyzed this limitation by investigating convergence properties of BC-regularized actor-critic optimization and verified it on a controlled continuous bandit task. To break this ceiling, we propose proximal action replacement (PAR), a plug-and-play training sample replacer that progressively replaces low-value actions with high-value actions generated by a stable actor, broadening the action exploration space while reducing the impact of low-value data. PAR is compatible with multiple BC regularization paradigms. Extensive experiments across offline RL benchmarks show that PAR consistently improves performance and approaches state-of-the-art when combined with the basic TD3+BC.
- Abstract(参考訳): オフライン強化学習(RL)は、以前に収集した静的データセットからのポリシーを最適化し、RLの重要なブランチである。
人気があり有望なアプローチは、行動クローニング(BC)によるアクター批判的手法を規則化し、現実的なポリシーを導き、配布外の行動からバイアスを緩和するが、しばしば見過ごされるパフォーマンス天井を課すことである。
我々は,BC-正規化アクター批判最適化の収束特性を調査して,この制限を公式に解析し,制御された連続バンディットタスクで検証した。
この天井を壊すために, プラスティック・アンド・プレイの訓練用サンプル交換器であるPARを提案し, 低値データの影響を低減しつつ, 動作探索空間を拡大し, 安定したアクターによって生成された高値のアクションに徐々に置き換える。
PARは複数のBC正規化パラダイムと互換性がある。
オフラインRLベンチマークによる大規模な実験により、PARはパフォーマンスを一貫して改善し、基礎的なTD3+BCと組み合わせることで最先端にアプローチする。
関連論文リスト
- Decoupling Policy Extraction for Offline Reinforcement Learning [18.247325284604553]
オフラインのRLメソッドは通常、アクターと批評家を共同で訓練する。
従来のオフラインRLパラダイムを再検討し、アクタートレーニングからポリシー改善を分離することを提案する。
具体的には、アクターが個別に学習した批評家と複数のアクター生成提案を並べ替えることで、行動分布をモデル化し、推論時にポリシー改善を行うように、アクターを訓練する。
論文 参考訳(メタデータ) (2026-08-21T09:26:53Z) - IADD-TR: Intervention-Aware Dynamics Decoupling with Targeted Regularization for Model-Based Reinforcement Learning [57.16513298507272]
IADD-TRは、IADD(Intervention-Aware Dynamics Decoupling)とTR(Targeted Regularization)を組み合わせた統合フレームワークである。
IADDは、ゼロアクションアンカーを用いて、アクション干渉段階とアクションフリー自然進化段階への遷移を分解し、堅牢な一般化のためにこの2段階の分解の非特異性を解決する。
政策学習においては,リプレイ状態の政策段階関数の効率的な影響関数からTRを導出する。
論文 参考訳(メタデータ) (2026-08-11T08:20:02Z) - Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning [7.604367783364084]
Collaborative Weighting Actor-Critic (CWAC) は、価値推定における予測の不確実性を考慮に入れた統合フレームワークである。
CWACは最小限のオーバーヘッドで既存の外部アルゴリズムフレームワークにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-07-29T06:18:19Z) - RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry [46.0185525503119]
Implicit Drifting Policy (IDP)は、ロボット制御のための一段階の模倣学習フレームワークである。
IDPは、明示的なベクトル場推定なしでポリシー学習にドリフトの訓練時間補正をもたらす。
論文 参考訳(メタデータ) (2026-05-31T08:39:57Z) - Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - Less is More: Clustered Cross-Covariance Control for Offline RL [13.198112768636207]
オフライン強化学習における基本的な課題は、分散シフトである。
ローカルなリプレイパーティションへの更新を制限する分割バッファサンプリングを提案する。
また,各更新における共分散誘発バイアスを解消する,明確な勾配に基づく補正ペナルティも導入する。
論文 参考訳(メタデータ) (2026-01-28T16:55:04Z) - BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping [69.74252624161652]
適応クリッピング(BAPO)を用いたBAlanced Policy Optimizationを提案する。
BAPOはクリッピングバウンダリを動的に調整し、適応的に正と負のコントリビューションを再バランスさせ、エントロピーを保持し、RL最適化を安定化させる。
AIME 2024とAIME 2025ベンチマークでは、7B BAPOモデルがSkyWork-OR1-7Bのようなオープンソースモデルを上回っています。
論文 参考訳(メタデータ) (2025-10-21T12:55:04Z) - Learning to Reason as Action Abstractions with Scalable Mid-Training RL [55.24192942739207]
効果的な中間訓練フェーズは、有用なアクションのコンパクトなセットを特定し、高速な選択を可能にする。
本稿では,スケーラブルなミッドトレーニングアルゴリズムであるReasoning as Action Abstractions (RA3)を提案する。
論文 参考訳(メタデータ) (2025-09-30T05:34:20Z) - The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning [10.727328530242461]
我々は、異なるクライアントからの批判者の分散を取り除くために、更新順序(まずアクタ、次に批判)を反転させるFedRACを提案する。
実験結果から,提案アルゴリズムはより高い累積報酬を得て,より高速に5つの実験に収束することが示唆された。
論文 参考訳(メタデータ) (2025-06-02T02:20:22Z) - Mirror Descent Actor Critic via Bounded Advantage Learning [0.0]
Mirror Descent Value Iteration (MDVI)は、Kulback-Leiblerの発散とエントロピーを、その値とポリシー更新の正則化として使用している。
本稿では,MDVIのアクター・アクター・アクター・アクター・クリティカル(MDAC)を連続的なアクション・ドメインに対するアクター・アクター・アクター・アクター・アクター・アクター・クリティ(MDAC)として提案する。
論文 参考訳(メタデータ) (2025-02-06T08:14:03Z) - B3C: A Minimalist Approach to Offline Multi-Agent Reinforcement Learning [2.9312156642007303]
オフライン強化学習(RL)において,政策評価中の未確認行動の選択による過大評価が大きな課題である
本稿では,批判クリッピング(B3C)を用いた行動クローン規則化を提案する。
B3Cは、様々なオフラインマルチエージェントベンチマークで最先端のアルゴリズムより優れている。
論文 参考訳(メタデータ) (2025-01-30T05:02:33Z) - Offline Reinforcement Learning with Adaptive Behavior Regularization [1.491109220586182]
オフライン強化学習(RL)は、静的で以前に収集されたデータセットからポリシーを学習する、サンプル効率のよい学習パラダイムを定義する。
適応行動正規化(Adaptive Behavior regularization, ABR)と呼ばれる新しい手法を提案する。
ABRは、データセットの生成に使用するポリシーのクローン化と改善の間に、ポリシーの最適化目標を適応的に調整することを可能にする。
論文 参考訳(メタデータ) (2022-11-15T15:59:11Z) - False Correlation Reduction for Offline Reinforcement Learning [115.11954432080749]
本稿では,実効的かつ理論的に証明可能なアルゴリズムであるオフラインRLに対するfalSe Correlation Reduction (SCORE)を提案する。
SCOREは、標準ベンチマーク(D4RL)において、様々なタスクにおいて3.1倍の高速化でSoTA性能を達成することを実証的に示す。
論文 参考訳(メタデータ) (2021-10-24T15:34:03Z) - Continuous Doubly Constrained Batch Reinforcement Learning [93.23842221189658]
環境とのオンラインインタラクションではなく、固定されたオフラインデータセットのみを使用して効果的なポリシーを学ぶバッチRLのアルゴリズムを提案する。
バッチRLにおける制限されたデータは、トレーニングデータに不十分に表現された状態/動作の値推定に固有の不確実性をもたらす。
この分散を減らすための政策制約と、過度に楽観的な見積もりを妨げる価値制約という2つの簡単な罰則によってこの問題を軽減することを提案する。
論文 参考訳(メタデータ) (2021-02-18T08:54:14Z) - Iterative Amortized Policy Optimization [147.63129234446197]
政策ネットワークは、継続的制御のための深層強化学習(RL)アルゴリズムの中心的な特徴である。
変分推論の観点からは、ポリシーネットワークは、ポリシー分布を直接ではなく、ネットワークパラメータを最適化する、テキスト化最適化の一形態である。
我々は,反復的アモート化ポリシ最適化により,ベンチマーク連続制御タスクの直接アモート化よりも性能が向上することが実証された。
論文 参考訳(メタデータ) (2020-10-20T23:25:42Z) - Discrete Action On-Policy Learning with Action-Value Critic [72.20609919995086]
離散的な行動空間における強化学習(RL)は、実世界の応用では至るところで行われているが、その複雑さは行動空間次元とともに指数関数的に増大する。
我々は,行動値関数を推定し,相関行動に適用し,これらの評価値を組み合わせて勾配推定の分散を制御する。
これらの取り組みにより、分散制御技術に頼って、関連するRLアルゴリズムを実証的に上回る、新たな離散的なRLアルゴリズムが実現される。
論文 参考訳(メタデータ) (2020-02-10T04:23:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。