論文の概要: Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?
- arxiv url: http://arxiv.org/abs/2607.27203v2
- Date: Mon, 03 Aug 2026 21:04:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.398949
- Title: Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?
- Title(参考訳): オンラインRLファインチューニングのためのQ-Functionsの事前訓練は本当に必要か?
- Abstract要約: 本研究は,Q-関数の事前学習が,事前学習ベースポリシー上での微調整に実際に役立つかどうかを考察する。
事前訓練中に学習したQ関数は、事前訓練された政策のQ関数であり、オンラインの微調整が収束するQ関数ではない。
オンラインRLにおけるQ関数学習のブートストラップとして,多種多様なポリシーをトレーニングし,プールされたロールアウトを利用する簡単な方法であるPolicy Ensemble (IPE) による初期化を提案する。
- 参考スコア(独自算出の注目度): 68.87153412034499
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pre-training followed by fine-tuning has become the dominant recipe for learning performant policies, and in value-based reinforcement learning (RL) this raises a natural question: given a pretrained policy, should the Q-function be pretrained on offline data too? Conventional wisdom suggests it should, but recent results show that online RL with a randomly-initialized Q-function can result in highly performant and reliable policies without needing to pretrain the Q-function. In this paper, we systematically study whether pretraining the Q-function actually helps when fine-tuning on top of a pretrained base policy. We find, surprisingly, that naive Q-function pretraining often provides little benefit over random initialization. We show this stems from a fundamental mismatch: the Q-function learned during pretraining targets the pretrained policy's Q-function, not the Q-function that online fine-tuning converges to, and this gap persists even after offline value maximization. Motivated by this finding, we propose Initialization via Policy Ensemble (IPE), a simple method that trains multiple diverse policies and uses their pooled rollouts to bootstrap the Q-function learning in online RL. Across a suite of challenging continuous control benchmarks, IPE yields an average 1.26x improvement in fine-tuning performance over naive Q-function pre-training.
- Abstract(参考訳): 事前学習と微調整がパフォーマンスポリシーを学習するための主流のレシピとなり、価値に基づく強化学習(RL)では、これは自然な疑問を引き起こす:事前訓練されたポリシーを考慮すれば、Q-関数もオフラインデータ上で事前訓練されるべきだろうか?
従来の知恵が示すように、近年の結果、ランダムに初期化Q-関数を持つオンラインRLは、Q-関数を事前訓練する必要なく、高性能で信頼性の高いポリシーをもたらすことが示されている。
本稿では,Q-関数の事前学習が,事前学習ベースポリシー上での微調整に実際に役立つかどうかを系統的に検討する。
意外なことに、素質的なQ-関数事前学習はランダム初期化よりもほとんど利益をもたらすことがしばしばある。
事前訓練中に学習したQ関数は、オンラインの微調整が収束するQ関数ではなく、事前訓練された政策のQ関数をターゲットにしており、このギャップはオフライン値の最大化後も持続する。
そこで本研究では,多種多様なポリシーをトレーニングし,そのプールロールアウトを利用してオンラインRLにおけるQ関数学習をブートストラップする簡単な手法であるPolyty Ensemble (IPE) による初期化を提案する。
難易度の高い連続制御ベンチマークでは、IPEはQ-関数事前トレーニングよりも1.26倍の微調整性能が向上する。
関連論文リスト
- When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning [18.872979307256962]
BC(Behavior Cloning)は、ロボット学習において、非常に効果的なパラダイムとして登場した。
BCには、デモが収集された後、オンライン改善のための自己誘導メカニズムがない。
我々は,強化学習のためのBCからQ2RL,Q-Estimation,Q-Gatingを提案する。
論文 参考訳(メタデータ) (2026-05-06T17:40:11Z) - Q-learning with Adjoint Matching [58.78551025170267]
本稿では,新しいTD-based reinforcement learning (RL)アルゴリズムであるAdjoint Matching (QAM) を用いたQ-learningを提案する。
QAMは、最近提案された生成モデリング手法であるadjoint matchingを活用することで、2つの課題を回避している。
オフラインとオフラインの両方のRLにおいて、ハードでスパースな報酬タスクに対する従来のアプローチよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-01-20T18:45:34Z) - Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only [22.94253602450729]
既存のオンライン強化学習(RL)ファインチューニング手法では、安定性と性能のために、オフラインで事前訓練されたQ-関数によるトレーニングを継続する必要がある。
オフライン事前学習ポリシーのみを用いたオンラインRLファインチューニング手法を提案する。
PORL(Policy-Only Reinforcement Learning Fine-Tuning)を導入し、オンライン段階でQ-関数をスクラッチから迅速に初期化する。
論文 参考訳(メタデータ) (2025-05-22T16:14:08Z) - Digi-Q: Learning Q-Value Functions for Training Device-Control Agents [73.60512136881279]
Digi-QはVLMベースのアクション値Q関数を訓練し、エージェントポリシーを抽出する。
Digi-Qは、Android-in-the-Wildのユーザスケールデバイス制御タスクにおいて、いくつかの従来手法より優れている。
論文 参考訳(メタデータ) (2025-02-13T18:55:14Z) - Offline Reinforcement Learning with On-Policy Q-Function Regularization [57.09073809901382]
ヒストリーデータセットと所望のポリシー間の分布シフトによって引き起こされる(潜在的に破滅的な)外挿誤差に対処する。
正規化により推定Q-関数を利用する2つのアルゴリズムを提案し、D4RLベンチマークに強い性能を示すことを示す。
論文 参考訳(メタデータ) (2023-07-25T21:38:08Z) - Online Target Q-learning with Reverse Experience Replay: Efficiently
finding the Optimal Policy for Linear MDPs [50.75812033462294]
我々は,Q-ラーニングの実践的成功と悲観的理論的結果とのギャップを埋める。
本稿では,新しいQ-Rex法とQ-RexDaReを提案する。
Q-Rex は線形 MDP の最適ポリシを効率的に見つけることができる。
論文 参考訳(メタデータ) (2021-10-16T01:47:41Z) - Offline Reinforcement Learning with Implicit Q-Learning [85.62618088890787]
現行のオフライン強化学習手法では、トレーニング中に見つからない行動の価値を問い合わせて、ポリシーを改善する必要がある。
本稿では,データセット外の動作を評価する必要のないオフラインRL手法を提案する。
この方法により、学習したポリシーは、一般化によってデータの最良の振る舞いを大幅に改善することができる。
論文 参考訳(メタデータ) (2021-10-12T17:05:05Z) - Offline-to-Online Reinforcement Learning via Balanced Replay and
Pessimistic Q-Ensemble [135.6115462399788]
深いオフライン強化学習により、オフラインデータセットから強力なロボットエージェントをトレーニングすることが可能になった。
状態-作用分布シフトは、微調整中に厳しいブートストラップエラーを引き起こす可能性がある。
本稿では,オンライン上で遭遇したサンプルを優先しながら,ほぼ政治的なサンプルの使用を奨励するバランスの取れたリプレイ方式を提案する。
論文 参考訳(メタデータ) (2021-07-01T16:26:54Z) - EMaQ: Expected-Max Q-Learning Operator for Simple Yet Effective Offline
and Online RL [48.552287941528]
オフ・ポリティクス強化学習は、意思決定ポリシーのサンプル効率の学習を約束する。
オフラインのRL設定では、標準のオフポリシーのRLメソッドは大幅に性能が低下する。
本稿では,提案アルゴリズムとより密接な関係を持つ期待値Q-Learning(EMaQ)を提案する。
論文 参考訳(メタデータ) (2020-07-21T21:13:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。