論文の概要: Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning
- arxiv url: http://arxiv.org/abs/2608.10473v2
- Date: Thu, 13 Aug 2026 16:34:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.68277
- Title: Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning
- Title(参考訳): 効果的なオンライン強化学習のための批判自由事前学習
- Authors: Daoyi Li, Yixian Zhang, Wenbo Ding, Yu Wang, Chao Yu,
- Abstract要約: 批判自由事前訓練は、オフライン批判訓練のアプローチを完全に放棄する効率的なパラダイムである。
各種のO2Oアルゴリズムと互換性があり、従来のO2Oアルゴリズムと一貫して一致するか改善されている。
- 参考スコア(独自算出の注目度): 8.965329606005263
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Offline-to-online (O2O) reinforcement learning aims to leverage policies pretrained on static datasets while improving them through online interaction. However, directly reusing an offline-trained critic can hinder online fine-tuning: as the policy and data distribution change rapidly, value estimates inherited from offline training may become misaligned with the online environment, leading to inaccurate policy improvement and inefficient exploration. To address this problem, we introduce Critic-Free Pretraining: an efficient paradigm that completely abandons the approach of offline critic training, allowing a freshly initialized critic to adapt without inheriting biased estimates. CFP is compatible with various mainstream O2O algorithms and consistently matches or improves upon conventional O2O algorithms across a diverse set of tasks, with particularly pronounced gains on several challenging tasks.
- Abstract(参考訳): Offline-to-online(O2O)強化学習は、静的データセットに事前トレーニングされたポリシーを活用すると同時に、オンラインインタラクションを通じて改善することを目的としている。
しかし、オフライントレーニングされた批評家を直接再利用することは、オンラインの微調整を妨げる可能性がある: ポリシーとデータ配布が急速に変化するにつれて、オフライントレーニングから受け継がれた価値推定はオンライン環境と不一致になり、不正確な政策改善と非効率な探索につながる。
この問題に対処するために、オフライン批判トレーニングのアプローチを完全に放棄する効率的なパラダイムであるCritic-Free Pretrainingを導入し、バイアス付き見積を継承することなく、新しく初期化された批評家が適応できるようにする。
CFPは様々な主要なO2Oアルゴリズムと互換性があり、従来のO2Oアルゴリズムを様々なタスクで一貫してマッチングまたは改善している。
関連論文リスト
- ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization [19.46945184186446]
適応データ混合(ROAD)を最適化した強化学習を提案する。
ROADはデータ再生プロセスを自動化する動的プラグイン・アンド・プレイフレームワークである。
我々の経験的結果は、このアプローチが様々なデータセットで既存のデータ再生方法より一貫して優れていることを示している。
論文 参考訳(メタデータ) (2026-05-14T07:35:58Z) - Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning [22.717342103512493]
オフラインからオンラインへの強化学習(O2O-RL)では、ポリシが最初に、以前に収集されたデータセットを使用して、安全にオフラインでトレーニングされる。
我々は,O2O-RLにおけるオンラインインタラクション予算の下で,政策選択と微調整のための新しい適応的アプローチを提案する。
論文 参考訳(メタデータ) (2026-05-06T16:51:44Z) - Q-learning with Adjoint Matching [58.78551025170267]
本稿では,新しいTD-based reinforcement learning (RL)アルゴリズムであるAdjoint Matching (QAM) を用いたQ-learningを提案する。
QAMは、最近提案された生成モデリング手法であるadjoint matchingを活用することで、2つの課題を回避している。
オフラインとオフラインの両方のRLにおいて、ハードでスパースな報酬タスクに対する従来のアプローチよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-01-20T18:45:34Z) - Adversarial Fine-tuning in Offline-to-Online Reinforcement Learning for Robust Robot Control [12.961180148172199]
本研究では、クリーンなデータに対するポリシーをトレーニングし、敵対的な微調整を行うオフライン・オンライン・フレームワークを提案する。
性能認識カリキュラムは、指数移動平均信号を介してトレーニング中の摂動確率を調整する。
連続制御ロコモーションタスクの実験は、提案手法がオフラインのみのベースラインよりもロバスト性を向上させることを示す。
論文 参考訳(メタデータ) (2025-10-15T09:45:24Z) - Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL [36.65926744075032]
オフラインからオンラインへの強化学習(O2O)は、オンラインインタラクションの制限によって、パフォーマンスが急速に向上する。
近年の研究では、特定のオフラインRL手法の微調整戦略を設計することが多く、任意のオフライン手法から一般のO2O学習を行うことはできない。
この2つのミスマッチを同時に処理し,オフラインメソッドからオンラインメソッドへの一般的なO2O学習を実現することを提案する。
論文 参考訳(メタデータ) (2024-12-25T09:52:22Z) - Small Dataset, Big Gains: Enhancing Reinforcement Learning by Offline
Pre-Training with Model Based Augmentation [59.899714450049494]
オフラインの事前トレーニングは、準最適ポリシーを生成し、オンライン強化学習のパフォーマンスを低下させる可能性がある。
本稿では,オフライン強化学習による事前学習のメリットを最大化し,有効となるために必要なデータの規模を削減するためのモデルベースデータ拡張戦略を提案する。
論文 参考訳(メタデータ) (2023-12-15T14:49:41Z) - Statistically Efficient Variance Reduction with Double Policy Estimation
for Off-Policy Evaluation in Sequence-Modeled Reinforcement Learning [53.97273491846883]
本稿では、オフラインシーケンスモデリングとオフライン強化学習をダブルポリシー推定と組み合わせたRLアルゴリズムDPEを提案する。
D4RLベンチマークを用いて,OpenAI Gymの複数のタスクで本手法を検証した。
論文 参考訳(メタデータ) (2023-08-28T20:46:07Z) - Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs
and Practical Solutions [30.050083797177706]
オフライン強化学習(RL)では、環境とのインタラクションなしに、オフラインデータセットから有能なエージェントをトレーニングすることができる。
このようなオフラインモデルのオンライン微調整により、パフォーマンスがさらに向上する。
より高速な改善のために、標準的なオンラインオフラインアルゴリズムを使用することが可能であることを示す。
論文 参考訳(メタデータ) (2023-03-30T14:08:31Z) - Adaptive Behavior Cloning Regularization for Stable Offline-to-Online
Reinforcement Learning [80.25648265273155]
オフライン強化学習は、固定データセットから学習することで、環境と対話することなくエージェントの動作を学ぶことができる。
オンラインの微調整中、オフラインからオンラインデータへの突然の分散シフトにより、事前訓練されたエージェントのパフォーマンスが急速に低下する可能性がある。
エージェントの性能と訓練安定性に基づいて,オンラインファインチューニングにおける行動クローンの損失を適応的に評価することを提案する。
実験の結果,提案手法はD4RLベンチマークにおいて,最先端のオフライン-オンライン強化学習性能が得られることがわかった。
論文 参考訳(メタデータ) (2022-10-25T09:08:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。