論文の概要: Continual Reasoning Gym: Diagnosing and Harnessing Shared Reasoning in Continual RLVR
- arxiv url: http://arxiv.org/abs/2608.18574v2
- Date: Thu, 20 Aug 2026 03:39:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 14:00:35.539152
- Title: Continual Reasoning Gym: Diagnosing and Harnessing Shared Reasoning in Continual RLVR
- Title(参考訳): 連続共振ジャム:連続RLVRにおける共有共振の診断とハーネス
- Authors: Lirui Luo, Guoxi Zhang, Hongming Xu, Rongqing Li, Cong Fang, Lifeng Fan,
- Abstract要約: タスクが到着するたびに既存のモデルを更新する連続RLVRについて検討する。
逐次RLVRはわずかに忘れられるが、最終的な性能はMTRLのそれ以下である。
そこで我々は,CPR(Continuous Prompt Replay)を導入する。
- 参考スコア(独自算出の注目度): 10.844041396587976
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) commonly post-trains reasoning models on multiple tasks, while rerunning multitask RLVR (MTRL) as new tasks are added makes capability expansion costly. We therefore study continual RLVR, which updates the existing model as each task arrives. The central question is whether a model updated this way can perform as well as a jointly trained model. To answer this question, we introduce Continual Reasoning Gym, a continual-RLVR environment that organizes text and visual reasoning tasks into five task sequences. In this setting, we identify two key observations: Sequential RLVR exhibits modest forgetting, yet its final performance remains below that of MTRL. To understand the latter, we decompose final performance and show that forgetting accounts for only part of the gap. To explain the former, we identify shared reasoning: transferable reasoning structure allows training on one task to support others on average. We therefore introduce Continual Prompt Replay (CPR), which harnesses shared reasoning to improve learning on the arriving and future tasks by replaying previous-task prompts and regenerating their responses with the current policy. On average, only CPR reaches MTRL-level performance.
- Abstract(参考訳): 検証可能な報酬付き強化学習(RLVR)は、複数のタスクに対するトレーニング後推論モデルが一般的であるが、新しいタスクを追加してマルチタスクRLVR(MTRL)を再実行することで、機能拡張がコストがかかる。
そこで本研究では,タスクが到着するたびに既存のモデルを更新する連続RLVRについて検討する。
中心的な問題は、この方法で更新されたモデルが、共同でトレーニングされたモデルと同様に機能するかどうかである。
本稿では,テキストと視覚的推論タスクを5つのタスクシーケンスにまとめる連続RLVR環境であるContinuous Reasoning Gymを紹介する。
逐次RLVRはわずかに忘れられるが、最終的な性能はMTRLのそれ以下である。
後者を理解するために、最終性能を分解し、そのギャップの一部だけを忘れることを示す。
伝達可能な推論構造は、あるタスクに対して平均的に他のタスクをサポートすることができる。
そこで我々はCPR(Continuous Prompt Replay)を導入し、従来のタスクのプロンプトをリプレイし、現在のポリシーで応答を再生することで、共用推論を利用して、到着と将来のタスクの学習を改善する。
平均的に、CPRのみがMTRLレベルの性能に達する。
関連論文リスト
- On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR [51.935533482549545]
RLVRはトレーニングデータセットに過度に適合する暗黙の報酬を示す可能性がある。
モデルは、トレーニングプロセス中に報酬が比較的低いままであっても、テストセット上で満足なパフォーマンスを達成することができる。
論文 参考訳(メタデータ) (2026-05-07T16:30:28Z) - SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning [8.073523925328645]
オンライン強化学習のための唯一の報酬信号として設計されたビデオ言語推論モデル。
我々は、SOLE-R1が24の未確認タスクで成功し、強い視覚言語報酬器を著しく上回っていることを示す。
論文 参考訳(メタデータ) (2026-03-30T17:46:31Z) - Adaptive Ability Decomposing for Unlocking Large Reasoning Model Effective Reinforcement Learning [82.91265691530351]
A$2$Dは、検証可能な報酬による強化学習の有効性を高めるための適応能力分解手法である。
まず、蒸留なしでRLVRを介して分解器を訓練し、複雑な質問を単純なサブクエストの集合に分解する。
次に、このデコンパイラを使用して、トレーニングデータセットの各質問に対するサブクエストをアノテートし、サブクエストガイダンスを用いてRLVR下での推論をトレーニングする。
論文 参考訳(メタデータ) (2026-01-31T14:48:23Z) - Limits of Generalization in RLVR: Two Case Studies in Mathematical Reasoning [3.437656066916039]
Reinforcement with Verifiable Rewards (RLVR)は、そのような機能を強化するための有望なアプローチとして登場した。
完全検証解の2つの問題についてRLVRについて検討する。
RLVRは評価基準を改善するが、しばしば新たな推論戦略を得るよりも、表層学習指標を強化することで改善する。
論文 参考訳(メタデータ) (2025-10-30T23:16:02Z) - RL in the Wild: Characterizing RLVR Training in LLM Deployment [43.81962834561768]
Reinforcement Learning with Verifiable Rewards (RLVR)は、その推論と理解能力を高めるために、ここ数ヶ月で急増している。
しかし、その複雑なデータフローと多様なタスクは、RLトレーニングシステムに重大な課題をもたらす。
システムの観点からは、RLVRの理解は限られている。
論文 参考訳(メタデータ) (2025-09-29T03:09:27Z) - Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model? [66.61292196146016]
RLVR(Reinforcement Learning with Verifiable Rewards)は近年,大規模言語モデル(LLM)の推論性能の向上に成功している。
本研究はRLVRの現状を批判的に考察する。
現在のトレーニング設定では、根本的な新しい推論パターンが生まれていないことが分かりました。
論文 参考訳(メタデータ) (2025-04-18T17:59:56Z) - Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1 [53.894789613838654]
ビデオ理解におけるMLLMのポストトレーニング手法を評価するためのベンチマークであるSEED-Bench-R1を紹介する。
複雑な現実世界のビデオや、複数の質問の形式での複雑な日常的な計画タスクも含んでいる。
Qwen2-VL-Instruct-7Bをベースモデルとして、RLと教師付き微調整(SFT)を比較した。
我々の詳細な分析では、RLは視覚知覚を増強するが、しばしばコヒーレント推論連鎖を減少させる。
論文 参考訳(メタデータ) (2025-03-31T17:55:23Z) - Continual Diffuser (CoD): Mastering Continual Offline Reinforcement Learning with Experience Rehearsal [54.93261535899478]
強化学習のロボット制御のような現実世界の応用では、タスクが変化し、新しいタスクが順次発生する。
この状況は、タスクの変更に適応し、獲得した知識を保持するエージェントを訓練する上で、可塑性-安定トレードオフという新たな課題を生じさせる。
本研究では,連続拡散器(Continuous diffuser,CoD)と呼ばれるリハーサルに基づく連続拡散モデルを提案する。
論文 参考訳(メタデータ) (2024-09-04T08:21:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。