論文の概要: RL Forgets! Towards Continual Policy Optimization
- arxiv url: http://arxiv.org/abs/2607.04364v2
- Date: Mon, 13 Jul 2026 11:16:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.252574
- Title: RL Forgets! Towards Continual Policy Optimization
- Title(参考訳): RL Forgets! 継続的な政策最適化に向けて
- Abstract要約: 継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
- 参考スコア(独自算出の注目度): 57.4336338996653
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Continual post-training is becoming a central paradigm for adapting vision-language models to evolving tasks. Recent work has increasingly favored reinforcement learning over supervised fine-tuning, driven by the belief that reinforcement learning is inherently less prone to forgetting. However, the belief remains insufficiently validated, as existing evidence is largely drawn from outdated or homogeneous benchmarks. We revisit this assumption under recent and diverse multimodal reasoning tasks. To this end, we introduce MRCL, a Multimodal Reasoning Continual Learning benchmark. Experiments on MRCL show that standard reinforcement learning still suffers from severe catastrophic forgetting during continual post-training. We trace this failure to an objective mismatch: the KL regularization used in common policy optimization methods is evaluated on current-task data, whereas forgetting is caused by behavioral drift on prior-task distributions. To address this problem, we propose Continual Policy Optimization (CPO), a replay-free framework grounded in a prior-task behavioral KL objective. CPO relaxes the intractable historical KL constraint into sparse parameter-movement regularization, limiting policy drift without storing old data. Extensive experiments across multiple model scales show that CPO consistently reduces forgetting while preserving, and in some cases improving, pretrained model capabilities. On Qwen3-VL-8B, CPO reduces forgetting by 13.7% and improves pretrained capability by 7.0%. The implementation code is available at https://github.com/MaolinLuo/CPO.
- Abstract(参考訳): 継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
しかし、既存の証拠は時代遅れまたは均質なベンチマークから大きく引き出されるため、この信念は依然として不十分に検証されている。
我々は,近年の多モード推論タスクにおいて,この仮定を再考する。
この目的のために,Multimodal Reasoning Continual LearningベンチマークであるMRCLを紹介する。
MRCLの実験では、標準的な強化学習は継続訓練中に深刻な破滅的な忘れ込みに悩まされることが示されている。
共通ポリシ最適化手法で使用されるKL正規化は、現在のタスクデータに基づいて評価されるが、一方で、前タスク分布の振る舞いのドリフトによって忘れられる。
この問題に対処するため,我々は,事前タスク動作KLの目的を基礎としたリプレイフリーフレームワークであるContinuous Policy Optimization (CPO)を提案する。
CPOは、難易度の高い歴史的KL制約をスパースパラメータ移動正規化に緩和し、古いデータを格納せずにポリシードリフトを制限する。
複数のモデルスケールにわたる大規模な実験は、CPOが保存中の忘れを一貫して減らし、場合によっては事前訓練されたモデル機能を改善することを示している。
Qwen3-VL-8Bでは、CPOは忘れを13.7%減らし、事前学習能力を7.0%改善する。
実装コードはhttps://github.com/MaolinLuo/CPOで公開されている。
関連論文リスト
- Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning [43.981833556858135]
完全出力分布から正当性条件付き応答分布への保存制約を狭める条件正規化フレームワークを提案する。
CoKLは,既存の正規化手法よりも目標タスク改善と事前能力維持のバランスが良好である。
論文 参考訳(メタデータ) (2026-08-03T06:10:33Z) - Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning [7.604367783364084]
Collaborative Weighting Actor-Critic (CWAC) は、価値推定における予測の不確実性を考慮に入れた統合フレームワークである。
CWACは最小限のオーバーヘッドで既存の外部アルゴリズムフレームワークにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-07-29T06:18:19Z) - Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning [58.088509347353465]
強化学習(Reinforcement Learning, RL)は、言語モデルトレーニングにおいて広く使われている。
我々は,このトレードオフに明確な統計的解釈を与えるゲーム理論の枠組みを提案する。
論文 参考訳(メタデータ) (2026-07-29T00:19:09Z) - Denser $\neq$ Better: Limits of On-Policy Self-Distillation for Continual Post-Training [44.59915053122529]
継続的なポストトレーニングにより、ファンデーションモデルは既存の能力を保ちながら新しい知識を得ることができる。
最近の研究は、政治的学習が忘れを軽減し、特に魅力的なアプローチとして、政治的自己蒸留が出現していることを示唆している。
実験の結果、SDPOは教師の信号が安定して整合性が高い場合にドメイン内特殊化を加速できるが、配布外シナリオへの一般化に苦慮している。
論文 参考訳(メタデータ) (2026-07-02T06:24:30Z) - Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training [50.86545293331458]
強化学習は、教師付き学習よりも構造的に難しい。
本稿では,固定クリッピングを政策比率の正規化された有効サンプルサイズに置き換える,単純かつ効果的なバッチ適応目的を提案する。
論文 参考訳(メタデータ) (2026-05-12T16:44:47Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Stabilizing Reinforcement Learning with LLMs: Formulation and Practices [61.361819972410046]
本稿では,REINFORCEなどの政策勾配法において,真のシーケンスレベルの報酬を代用トークンレベルの目的によって最適化できる理由と条件を示す。
この洞察は、RLトレーニングの安定化において、広く採用されているいくつかのテクニックの重要な役割について、原則化された説明を提供する。
論文 参考訳(メタデータ) (2025-12-01T07:45:39Z) - Mind the Gap: Preserving and Compensating for the Modality Gap in CLIP-Based Continual Learning [11.50324946279326]
コントラスト言語-画像事前訓練モデル(CLIP)は、様々な下流タスクに強い能力を示す。
視覚言語事前学習モデルの微調整におけるモダリティギャップの変化を分析する。
クラス増分学習におけるCLIPの性能を向上する単純なMG-CLIPを提案する。
論文 参考訳(メタデータ) (2025-07-12T02:28:42Z) - Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training [36.69514399442043]
本稿では,教師付きファインチューニング(SFT)と強化ファインチューニング(RFT)の2つのコアポストトレーニングパラダイムの比較分析を行った。
本実験は,7つの多様なマルチモーダルタスクからなるベンチマークで実施した。
論文 参考訳(メタデータ) (2025-07-07T18:17:06Z) - Temporal-Difference Variational Continual Learning [77.92320830700797]
複数の先行推定の正則化効果を統合する新たな学習目標を提案する。
提案手法は, 変分CL法より優れたカタストロフィックフォーミングを効果的に緩和する。
論文 参考訳(メタデータ) (2024-10-10T10:58:41Z) - LoRanPAC: Low-rank Random Features and Pre-trained Models for Bridging Theory and Practice in Continual Learning [103.45785408116146]
連続学習(CL)は、連続的に提示される複数のタスクを解決できるモデルを訓練することを目的としている。
最近のCLアプローチは、ダウンストリームタスクをうまく一般化する大規模な事前学習モデルを活用することで、強力なパフォーマンスを実現している。
しかし、これらの手法には理論的保証がなく、予期せぬ失敗をしがちである。
理論的に健全で高性能な単純なCL法を設計することで,このギャップを埋めることを目指している。
論文 参考訳(メタデータ) (2024-10-01T12:58:37Z) - BRAC+: Improved Behavior Regularized Actor Critic for Offline
Reinforcement Learning [14.432131909590824]
オフライン強化学習は、以前に収集したデータセットを使用して効果的なポリシーをトレーニングすることを目的としている。
標準的なオフ・ポリティクスRLアルゴリズムは、アウト・オブ・ディストリビューション(探索されていない)アクションの値を過大評価する傾向がある。
動作の規則化によるオフライン強化学習を改善し,BRAC+を提案する。
論文 参考訳(メタデータ) (2021-10-02T23:55:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。