Fugu-MT 論文翻訳(概要): SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling

論文の概要: SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling

arxiv url: http://arxiv.org/abs/2603.23414v1
Date: Tue, 24 Mar 2026 16:48:31 GMT
ステータス: 翻訳完了
システム内更新日: 2026-03-25 19:53:37.591915
Title: SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
Title（参考訳）: SortedRL:オンライン長さ対応スケジューリングによるLLMの高速化RLトレーニング
Authors: Yiqi Zhang, Huiqiang Jiang, Xufang Luo, Zhihe Yang, Chengruidong Zhang, Yifei Shen, Dongsheng Li, Yuqing Yang, Lili Qiu, Yang You,
Abstract要約: SortedRLを提案する。SortedRLは、強化学習をスケールするためのオンライン長対応スケジューリング戦略である。 SortedRLは、出力長に基づいてロールアウトサンプルをリオーダーし、短いサンプルが早期更新のためにグループを形成することを優先順位付けする。 LLaMA-3.1-8BとQwen-2.5-32Bを論理パズルを含む様々なタスクで実験した結果、SortedRLはRLトレーニングバブル比を50%以上削減することが示された。
参考スコア（独自算出の注目度）: 54.276306194000405
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Scaling reinforcement learning (RL) has shown strong promise for enhancing the reasoning abilities of large language models (LLMs), particularly in tasks requiring long chain-of-thought generation. However, RL training efficiency is often bottlenecked by the rollout phase, which can account for up to 70% of total training time when generating long trajectories (e.g., 16k tokens), due to slow autoregressive generation and synchronization overhead between rollout and policy updates. We propose SortedRL, an online length-aware scheduling strategy designed to address this bottleneck by improving rollout efficiency and maintaining training stability. SortedRL reorders rollout samples based on output lengths, prioritizing short samples forming groups for early updates. This enables large rollout batches, flexible update batches, and near on-policy micro-curriculum construction simultaneously. To further accelerate the pipeline, SortedRL incorporates a mechanism to control the degree of off-policy training through a cache-based mechanism, and is supported by a dedicated RL infrastructure that manages rollout and update via a stateful controller and rollout buffer. Experiments using LLaMA-3.1-8B and Qwen-2.5-32B on diverse tasks, including logical puzzles, and math challenges like AIME 24, Math 500, and Minerval, show that SortedRL reduces RL training bubble ratios by over 50%, while attaining 3.9% to 18.4% superior performance over baseline given same amount of data.
Abstract（参考訳）: 拡張強化学習(RL)は大規模言語モデル(LLM)の推論能力の向上に強く期待されている。しかし、RLトレーニングの効率はロールアウトフェーズによってボトルネックされることが多く、ロールアウトとポリシー更新の間の遅延自動回帰生成と同期オーバーヘッドのため、長いトラジェクトリ(例えば16kトークン)を生成する際のトレーニング時間の最大70%を占めることができる。 SortedRLは、ロールアウト効率を改善し、トレーニング安定性を維持することで、このボトルネックに対処するために設計されたオンライン長対応スケジューリング戦略である。 SortedRLは、出力長に基づいてロールアウトサンプルをリオーダーし、短いサンプルが早期更新のためにグループを形成することを優先順位付けする。これにより、大規模なロールアウトバッチ、フレキシブルな更新バッチ、およびほぼ政治上のマイクロカリキュラム構築が同時に可能になる。パイプラインをさらに加速するために、SortedRLはキャッシュベースのメカニズムを通じて、オフポリシートレーニングの度合いを制御するメカニズムを組み込んでおり、ステートフルコントローラとロールアウトバッファを介してロールアウトと更新を管理する専用のRLインフラストラクチャによってサポートされている。 LLaMA-3.1-8B と Qwen-2.5-32B を論理パズルや AIME 24、Math 500、Minerval などの数学の課題など様々なタスクで実験した結果、SortedRL は RL トレーニングバブル比を50%以上削減し、同じ量のデータに対して 3.9% から 18.4% の優れたパフォーマンスを達成した。

関連論文リスト

Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning [6.742598086990326]
強化学習(RL)は、現代の大規模言語モデル(LLM)の進展に欠かせないものとなっているが、既存の同期RLシステムは、重大なパフォーマンスボトルネックに直面している。従来見過ごされていた出力長と生成パターンの類似性を利用して,同じプロンプトを共有することで,これらの課題に対処する新しいオンラインコンテキスト学習システムであるSeerを提案する。 Seer氏は、動的ロードバランシングのための分割ロールアウト、コンテキスト対応スケジューリング、適応的なグループ化された投機的デコーディングの3つの主要なテクニックを紹介している。
論文参考訳（メタデータ） (2025-11-18T16:12:21Z)
Beat the long tail: Distribution-Aware Speculative Decoding for RL Training [75.75462952580796]
モデル出力を変更することなくRLロールアウトを高速化する分散Aware Speculativeデコーディングフレームワークを提案する。数学とコード推論タスクの実験は、DASが同一のトレーニング曲線を保ちながらロールアウト時間を最大50%短縮することを示している。
論文参考訳（メタデータ） (2025-11-17T19:02:12Z)
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs [80.76334908639745]
大規模言語モデル(LLM)のための量子化強化学習フレームワークQeRLを提案する。 QeRLは、NVFP4量子化とローランド適応(LoRA)を組み合わせた問題に対処する。実験によると、QeRLはロールアウトフェーズで1.5倍以上のスピードアップを実現している。
論文参考訳（メタデータ） (2025-10-13T17:55:09Z)
RollPacker: Mitigating Long-Tail Rollouts for Fast, Synchronous RL Post-Training [19.00988498482758]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)の推論能力を高めるための重要なポストトレーニング手法である。多くのRLシステムは同期を緩和することでこの問題を緩和しようとするが、これは精度のトレーニングを損なう可能性がある。同期RLのための新しいロールアウトスケジューリング戦略であるtailを導入し,ロールアウトステップの小さなサブセット(ロングラウンド)に長いテール応答をもたらすプロンプトを体系的に統合する。 RollPackerは、veRLと比較して2.03x-2.56xのトレーニング時間を短縮し、Qwen2.5のRLHFuseよりも最大2.24倍のスピードアップを実現している。
論文参考訳（メタデータ） (2025-09-25T11:13:22Z)
History Rhymes: Accelerating LLM Reinforcement Learning with RhymeRL [14.506189610798929]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)の推論能力を高めるための重要な方法論として登場した。 RhymeRLは、RLトレーニングを2つの重要なイノベーションで加速するLLM RLシステムである。まず、ロールアウト生成を強化するために、投機的復号推論エンジンであるHistoSpecを紹介する。第二に、ロールアウトバブルに取り組むために、2層スケジューリング戦略であるHistoPipeを紹介します。
論文参考訳（メタデータ） (2025-08-26T01:42:46Z)
Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle [65.14124923451077]
強化学習(Reinforcement Learning, RL)は、マルチモーダル大言語モデル(MLLM)の推論能力を高めるための効果的なポストトレーニングパラダイムとして登場した。しかしながら、現在のRLパイプラインは、アドバンテージ・コラプシング(Advantage Collapsing)とロールアウト・サイレンシング(Rollout Silencing)という2つの未解決の問題によって、トレーニングの非効率に悩まされることが多い。軌道サンプリングとバッチ合成を動的に再構成することにより、RLの微調整効率を向上する、シンプルだが原則化されたフレームワークであるShuffle-R1を提案する。
論文参考訳（メタデータ） (2025-08-07T17:53:47Z)
StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation [55.75008325187133]
強化学習(RL)は,大規模言語モデル(LLM)の学習後のコアとなる。 StreamRLは、最初の原則から分離して、2種類のパフォーマンスボトルネックに対処するように設計されている。実験により、StreamRLは既存の最先端システムと比較してスループットを最大2.66倍改善することが示された。
論文参考訳（メタデータ） (2025-04-22T14:19:06Z)
Trajectory Balance with Asynchrony: Decoupling Exploration and Learning for Fast, Scalable LLM Post-Training [71.16258800411696]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)のポストトレーニングにおいて重要な要素である。ポストトレーニングに使われている既存のオンラインアルゴリズムは、経験的リプレイバッファの使用と本質的に相容れない。本稿では,TBA(Trajectory Balance with Asynchrony)によるバッファの再生を効率よく行うことを提案する。
論文参考訳（メタデータ） (2025-03-24T17:51:39Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。