論文の概要: REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.19450v2
- Date: Wed, 29 Jul 2026 12:12:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 16:47:49.713185
- Title: REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning
- Title(参考訳): オフライン強化学習によるエキスパート・ジェネリスト蒸留のための再生リサイクル
- Abstract要約: オフラインRLを用いたエキスパート・ジェネリスト蒸留のための再生リサイクル(REGEN: Replay-Recycling for Expert-to-Generalist Distillation)を提案する。
複数の教師モデルから蒸留する代わりに、REGENはリプレイメモリをリサイクルすることでジェネラリストを訓練する。
オンラインRLは、ワンオフ学習の段階ではなく、データ合成の過程に転換する可能性がある。
- 参考スコア(独自算出の注目度): 5.0321327064523595
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large-scale online reinforcement learning (RL) is the predominant means of eliciting advanced abilities including long-term reasoning and agentic tool use in large language models (LLMs). However, continuing to scale it across vast task domains of interest remains challenging in both computational infrastructure and cost, especially when considering RL as merely a one-off learning stage. Recently, a widely used technique for distilling knowledge across various domains and training stages, multi-teacher on-policy distillation (MOPD), helps to decouple the RL stage, saving costs, while maintaining generality across vast domains. Nonetheless, similar to online RL, MOPD requires coupled inference and backward passes, which continues to limit its scalability and computational efficiency. To address these challenges, we propose REGEN: Replay-recycling for Expert-to-Generalist Distillation with Offline RL. Instead of distilling from multiple teacher models, REGEN trains a generalist by simply recycling the replay memory -- the free by-product of the teachers' specialized RL training -- and employing offline RL algorithms. REGEN completely decouples the rollout sampling from the backward training process and thus greatly reduces the training cost. Across mathematical reasoning, code generation, and instruction following, REGEN matches the accuracy of MOPD at substantially lower cost. It potentially turns online RL into a data synthesis process instead of a one-off learning stage, and can be extended to large-scale post-training without requiring heavy computational load. Code is available at https://github.com/yunjie-sysu/REGEN.
- Abstract(参考訳): 大規模オンライン強化学習(英語: Large-scale online reinforcement learning, RL)は、大規模言語モデル(LLM)における長期的推論やエージェントツールの使用を含む高度な能力を引き出す主要な手段である。
しかし、特にRLを単なるワンオフ学習段階として考える場合、計算インフラとコストの両方において、関心の広いタスク領域にわたってスケールし続けることは困難である。
近年,様々な領域にまたがる知識の蒸留技術や訓練段階に広く用いられているマルチティーチンガー・オン・ポリーズ蒸留(MOPD)は,多分野にわたる一般性を維持しつつ,RLステージを分離し,コスト削減に寄与している。
それでもオンラインRLと同様、MOPDは複雑な推論と後方通過を必要としており、拡張性と計算効率を制限し続けている。
これらの課題に対処するため、我々はREGEN: Replay-recycling for Expert-to-Generalist Distillation with Offline RLを提案する。
複数の教師モデルから蒸留する代わりに、REGENは、教師の特別なRLトレーニングの副産物であるリプレイメモリを再利用し、オフラインのRLアルゴリズムを採用することで、ジェネラリストを訓練する。
REGENは後方トレーニングプロセスからロールアウトサンプリングを完全に分離し、トレーニングコストを大幅に削減する。
数学的推論、コード生成、命令に続いて、REGENはMOPDの精度をかなり低いコストで一致させる。
オンラインRLは、ワンオフ学習の段階ではなく、データ合成プロセスに転換する可能性があり、大量の計算負荷を必要とせずに大規模なポストトレーニングに拡張することができる。
コードはhttps://github.com/yunjie-sysu/REGEN.comで入手できる。
関連論文リスト
- SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling [54.276306194000405]
SortedRLを提案する。SortedRLは、強化学習をスケールするためのオンライン長対応スケジューリング戦略である。
SortedRLは、出力長に基づいてロールアウトサンプルをリオーダーし、短いサンプルが早期更新のためにグループを形成することを優先順位付けする。
LLaMA-3.1-8BとQwen-2.5-32Bを論理パズルを含む様々なタスクで実験した結果、SortedRLはRLトレーニングバブル比を50%以上削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T16:48:31Z) - Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates [53.3717573880076]
JitRL(Just-In-Time Reinforcement Learning、ジャスト・イン・タイム強化学習)は、テスト時間ポリシーの最適化を可能にするトレーニング不要のフレームワークである。
JitRLは、経験の動的で非パラメトリックな記憶を維持し、関連する軌跡を取得して、オンザフライでのアクションの利点を推定する。
WebArenaとJerrichoの実験では、JitRLがトレーニング不要メソッドの間に新しい最先端技術を確立していることが示されている。
論文 参考訳(メタデータ) (2026-01-26T14:16:51Z) - On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models [73.10315509190623]
最近の強化学習技術は、言語モデルにおいて顕著な推論改善をもたらした。
ポストトレーニングが、事前トレーニング中に取得したものを超えて、モデルの推論能力を真に拡張するかどうかは不明だ。
プレトレーニング,ミッドトレーニング,およびRLベースのポストトレーニングの因果的貢献を分離する,完全に制御された実験フレームワークを開発した。
論文 参考訳(メタデータ) (2025-12-08T18:12:10Z) - Expressive Value Learning for Scalable Offline Reinforcement Learning [9.946269411850064]
強化学習(Reinforcement Learning, RL)は、意思決定の順序を学習するための強力なパラダイムである。
オフラインRLは、大規模で多様なデータセットのトレーニングエージェントによる有望な道を提供する。
オフライン強化学習のための表現的価値学習(EVOR)を導入する。これはスケーラブルなオフラインRLアプローチであり、表現的ポリシーと表現的価値関数を統合している。
論文 参考訳(メタデータ) (2025-10-09T13:42:20Z) - Reinforcement Learning Teachers of Test Time Scaling [21.551446057221185]
LMを推論する主要なユースケースは、新しい学生を蒸留し、将来のRLイテレーションを冷静に開始する教師として機能することである。
我々は,RLの探究課題を回避するために,RLT(Reinforcement-Learned Teachers)の新たなクラスを育成する枠組みを導入する。
RLTは、各問題に対する質問と解決の両方で促され、生徒に合った詳細な説明で単に「接続する」ことを任務とする。
論文 参考訳(メタデータ) (2025-06-10T02:53:24Z) - AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning [50.02117478165099]
大規模強化学習は, 強大・中小モデルの推論能力を大幅に向上させることができることを示す。
まずは算数のみのプロンプト、次にコードのみのプロンプトのトレーニングを行う。
論文 参考訳(メタデータ) (2025-05-22T08:50:47Z) - Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning [0.0]
Transfer Learning(TL)は、未知のタスクを扱うエージェントの学習複雑性を低減することを目的としている。
他のタスクやエージェントからの外部知識を使用することで、学習プロセスを強化することができる。
これは、学習モデルに必要な新しい情報の量を減らすことで達成され、結果として全体の収束時間が短縮される。
論文 参考訳(メタデータ) (2025-01-26T11:53:18Z) - Unsupervised-to-Online Reinforcement Learning [59.910638327123394]
Unsupervised-to-online RL (U2O RL) は、ドメイン固有の教師なしオフラインRLを非教師なしオフラインRLに置き換える。
U2O RLは、複数の下流タスクのために訓練済みのモデルを再利用できるだけでなく、より良い表現も学べる。
U2O RLは、従来のオフライン-オフラインのRLアプローチにマッチしたり、さらに性能が優れていることを実証的に実証する。
論文 参考訳(メタデータ) (2024-08-27T05:23:45Z) - SRL: Scaling Distributed Reinforcement Learning to Over Ten Thousand Cores [13.948640763797776]
本稿では,RLトレーニングアプリケーションを汎用フレームワークに統合する,RLトレーニングのデータフローに関する新しい抽象化を提案する。
スケーラブルで効率的で分散的なRLシステムであるReaLly scalableRLを開発した。
SRLは15k以上のCPUコアでRL実験を大規模に実施した初めての学術コミュニティである。
論文 参考訳(メタデータ) (2023-06-29T05:16:25Z) - RL$^3$: Boosting Meta Reinforcement Learning via RL inside RL$^2$ [12.111848705677142]
本稿では,従来のRLによるタスクごとの学習をMeta-RLに入力するハイブリッドアプローチであるRL$3$を提案する。
RL$3$は、RL$2$よりも長期で累積的な報酬を得られる一方で、メタトレーニング時間を大幅に削減し、アウト・オブ・ディストリビューション・タスクをより一般化することを示す。
論文 参考訳(メタデータ) (2023-06-28T04:16:16Z) - Beyond Tabula Rasa: Reincarnating Reinforcement Learning [37.201451908129386]
タブララ・ラサの学習は、事前の知識がなければ、強化学習(RL)研究における一般的なワークフローである。
我々は、RLエージェントの設計イテレーション間で事前の計算作業を再利用または転送するワークフローとして、RLを再導入する。
既存のアプローチはこの設定で失敗し、それらの制限に対処するための単純なアルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-06-03T15:11:10Z) - Single-Shot Pruning for Offline Reinforcement Learning [47.886329599997474]
深層強化学習(Deep Reinforcement Learning, RL)は、複雑な現実世界の問題を解決するための強力なフレームワークである。
この問題に対処するひとつの方法は、必要なパラメータだけを残したニューラルネットワークをプルークすることです。
我々は,RLと単発プルーニングのギャップを埋め,オフラインRLに対する一般的なプルーニング手法を提案する。
論文 参考訳(メタデータ) (2021-12-31T18:10:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。