Fugu-MT 論文翻訳(概要): RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning

論文の概要: RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning

arxiv url: http://arxiv.org/abs/2507.07451v1
Date: Thu, 10 Jul 2025 05:58:55 GMT
ステータス: 翻訳完了
システム内更新日: 2025-07-11 16:40:15.288139
Title: RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning
Title（参考訳）: RLEP: LLM推論のための経験的リプレイによる強化学習
Authors: Hongzhi Zhang, Jia Fu, Jingyuan Zhang, Kai Fu, Qi Wang, Fuzheng Zhang, Guorui Zhou,
Abstract要約: 大規模言語モデルのための強化学習(RL)はエネルギー集約的な取り組みである。 emphRLEPは、まず検証された軌道を収集し、その後にトレーニング中に再生するフレームワークである。アップデートのステップごとに、ポリシーは、新しく生成されたロールアウトと再生された成功を混ぜたミニバッチに最適化される。
参考スコア（独自算出の注目度）: 18.62575670251997
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Reinforcement learning (RL) for large language models is an energy-intensive endeavor: training can be unstable, and the policy may gradually drift away from its pretrained weights. We present \emph{RLEP}\, -- \,Reinforcement Learning with Experience rePlay\, -- \,a two-phase framework that first collects verified trajectories and then replays them during subsequent training. At every update step, the policy is optimized on mini-batches that blend newly generated rollouts with these replayed successes. By replaying high-quality examples, RLEP steers the model away from fruitless exploration, focuses learning on promising reasoning paths, and delivers both faster convergence and stronger final performance. On the Qwen2.5-Math-7B base model, RLEP reaches baseline peak accuracy with substantially fewer updates and ultimately surpasses it, improving accuracy on AIME-2024 from 38.2% to 39.9%, on AIME-2025 from 19.8% to 22.3%, and on AMC-2023 from 77.0% to 82.2%. Our code, datasets, and checkpoints are publicly available at https://github.com/Kwai-Klear/RLEP to facilitate reproducibility and further research.
Abstract（参考訳）: 大規模言語モデルの強化学習(RL)はエネルギー集約的な取り組みであり、訓練は不安定であり、その政策はその事前訓練された重量から徐々に遠ざかっていく可能性がある。確認された軌跡を最初に収集し、その後のトレーニング中に再生する2段階のフレームワークである。アップデートのステップごとに、ポリシーは、新しく生成されたロールアウトとこれらのリプレイされた成功を混ぜたミニバッチに最適化される。高品質な例を再生することで、RLEPはモデルを実りのない探索から遠ざけ、期待できる推論パスを学ぶことに集中し、より高速な収束とより強力な最終パフォーマンスを提供します。 Qwen2.5-Math-7Bベースモデルでは、RLEPはベースラインのピーク精度を著しく低下させ、最終的にそれを上回り、AIME-2024は38.2%から39.9%に、AIME-2025は19.8%から22.3%に、AMC-2023は77.0%から82.2%に向上した。私たちのコード、データセット、チェックポイントは、再現性とさらなる研究を容易にするためにhttps://github.com/Kwai-Klear/RLEPで公開されています。

関連論文リスト

Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model [56.92219181993453]
本稿では,PPOやGRPOなどのオンラインRFT手法をオフ・ポリティクスデータに活用するために,Reincarnating Mix-policy Proximal Policy Gradient (ReMix)を提案する。 ReMix は,(1) 効率的なトレーニングのための更新データ(UTD)比が増大した混成政策勾配,(2) 安定性と柔軟性のトレードオフのバランスをとるためのKL-Convex 政策制約,(3) 効率的な早期学習から安定した改善へのシームレスな移行を実現するための政策再編成の3つの主要な構成要素から構成される。
論文参考訳（メタデータ） (2025-07-09T14:29:45Z)
Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models [43.98994504606355]
大規模言語モデル(LLM)のための自己信頼による強化学習(RLSC)を提案する。 RLSCはモデル自身の自信を報奨信号として使用し、ラベル、選好モデル、報酬工学の必要性を排除している。
論文参考訳（メタデータ） (2025-06-05T19:55:15Z)
AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning [50.02117478165099]
大規模強化学習は, 強大・中小モデルの推論能力を大幅に向上させることができることを示す。まずは算数のみのプロンプト、次にコードのみのプロンプトのトレーニングを行う。
論文参考訳（メタデータ） (2025-05-22T08:50:47Z)
Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking [16.441081996257576]
本稿では, 簡易かつ効果的なテスト時間スケーリング手法としてマルチラウンド思考を提案する。この方法は、その後のラウンドのプロンプトとして過去の回答を活用することにより、モデル推論を反復的に洗練する。 QwQ-32BやDeepSeek-R1など、複数のモデルにわたる実験は、一貫してパフォーマンス改善を示している。
論文参考訳（メタデータ） (2025-03-25T17:19:38Z)
An Empirical Study on Eliciting and Improving R1-like Reasoning Models [90.52239241349504]
RLトレーニングのスケーリングは、そのような推論モデルを実装するための中心的なテクニックとなっている。我々のRLトレーニングアプローチはQwen2.5-32Bベースモデルを継続的に改善することを示した。また、ツール操作の利用についても検討し、大きな推論モデルの推論性能を大幅に向上させることを見出した。
論文参考訳（メタデータ） (2025-03-06T15:34:27Z)
LIMR: Less is More for RL Scaling [25.477841726836836]
学習影響測定(Learning Impact Measurement, LIM)は, 学習サンプルを評価・優先順位付けする自動手法である。提案手法は,1,389個のサンプルと8,523個のサンプルの完全なデータセットとを比較して,同等あるいは優れた性能を実現する。再現可能な研究と今後のイノベーションのために、LIMRをオープンソース化しています。LIMRの実装、トレーニングと評価コード、キュレートされたデータセット、トレーニングされたモデルなどです。
論文参考訳（メタデータ） (2025-02-17T15:13:29Z)
Kimi k1.5: Scaling Reinforcement Learning with LLMs [84.95584393629998]
我々は、強化学習で訓練された最新のマルチモーダル言語モデル、Kimi k1.5の訓練実践について報告する。長いコンテキストスケーリングと改善されたポリシー最適化手法が、我々のアプローチの鍵となる要素である。本システムは,複数のベンチマークやモダリティに対して,最先端の推論性能を実現する。
論文参考訳（メタデータ） (2025-01-22T02:48:14Z)
Process Supervision-Guided Policy Optimization for Code Generation [15.943210767010045]
単体テストフィードバックによる強化学習(RL)は、大規模言語モデルのLLM(LLM)コード生成を強化したが、完全なコード評価後にのみ提供されるスパース報酬に依存している。本稿では,人間のコード修正を模倣したプロセス・リワード・モデル(PRM)を提案する。
論文参考訳（メタデータ） (2024-10-23T07:22:33Z)
VinePPO: Refining Credit Assignment in RL Training of LLMs [66.80143024475635]
我々は,言語環境の柔軟性を利用してモンテカルロをベースとした推定値を計算する,簡単なアプローチであるVinePPOを提案する。本手法は,MATHおよびGSM8Kデータセット間のPPOおよび他のベースラインをウォールクロック時間以下で連続的に上回る。
論文参考訳（メタデータ） (2024-10-02T15:49:30Z)
Learning to Prune Deep Neural Networks via Reinforcement Learning [64.85939668308966]
PuRLは、ニューラルネットワークのプルーニングのためのディープ強化学習ベースのアルゴリズムである。現在の最先端の手法に匹敵する幅と精度を実現している。
論文参考訳（メタデータ） (2020-07-09T13:06:07Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。