論文の概要: QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch
- arxiv url: http://arxiv.org/abs/2604.07853v1
- Date: Thu, 09 Apr 2026 06:11:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 18:34:05.731189
- Title: QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch
- Title(参考訳): QaRL: 高速安定トレーニングのためのロールアウト対応量子化RL-推論ミスマッチ
- Authors: Hao Gu, Hao Wang, Jiacheng Liu, Lujun Li, Qiyuan Zhu, Bei Liu, Binxing Xu, Lei Wang, Xintong Yang, Sida Lin, Sirui Han, Yike Guo,
- Abstract要約: 本稿では,QaRL(Rollout Alignment Quantization-Aware RL)を提案する。
数学問題に対するQwen3-30B-A3B MoEでは、QaRLは量子化されたロールアウトトレーニングを+5.5で上回り、安定性を改善し、低ビットスループットの利点を保っている。
- 参考スコア(独自算出の注目度): 33.82215097004296
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) reinforcement learning (RL) pipelines are often bottlenecked by rollout generation, making end-to-end training slow. Recent work mitigates this by running rollouts with quantization to accelerate decoding, which is the most expensive stage of the RL loop. However, these setups destabilize optimization by amplifying the training-inference gap: rollouts are operated at low precision, while learning updates are computed at full precision. To address this challenge, we propose QaRL (Rollout Alignment Quantization-Aware RL), which aligns training-side forward with the quantized rollout to minimize mismatch. We further identify a failure mode in quantized rollouts: long-form responses tend to produce repetitive, garbled tokens (error tokens). To mitigate these problems, we introduce TBPO (Trust-Band Policy Optimization), a sequence-level objective with dual clipping for negative samples, aimed at keeping updates within the trust region. On Qwen3-30B-A3B MoE for math problems, QaRL outperforms quantized-rollout training by +5.5 while improving stability and preserving low-bit throughput benefits.
- Abstract(参考訳): 大規模言語モデル(LLM)強化学習(RL)パイプラインはロールアウト生成によってボトルネックになり、エンドツーエンドのトレーニングが遅くなる。
最近の研究は、RLループの最も高価なステージであるデコーディングを加速するために、量子化でロールアウトを実行することでこれを緩和している。
しかし、これらの設定はトレーニングと推論のギャップを増幅することで最適化を不安定にする:ロールアウトは低い精度で操作され、学習更新は完全精度で計算される。
この課題に対処するために、トレーニング側を量子化ロールアウトと整合させてミスマッチを最小限に抑えるQaRL(Rollout Alignment Quantization-Aware RL)を提案する。
さらに、量子化されたロールアウトにおける障害モードを特定します。 長文の応答は、繰り返し、ガブルドトークン(エラートークン)を生成する傾向があります。
これらの問題を緩和するため, TBPO (Trust-Band Policy Optimization) を導入した。
数学問題に対するQwen3-30B-A3B MoEでは、QaRLは量子化されたロールアウトトレーニングを+5.5で上回り、安定性を改善し、低ビットスループットの利点を保っている。
関連論文リスト
- SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling [54.276306194000405]
SortedRLを提案する。SortedRLは、強化学習をスケールするためのオンライン長対応スケジューリング戦略である。
SortedRLは、出力長に基づいてロールアウトサンプルをリオーダーし、短いサンプルが早期更新のためにグループを形成することを優先順位付けする。
LLaMA-3.1-8BとQwen-2.5-32Bを論理パズルを含む様々なタスクで実験した結果、SortedRLはRLトレーニングバブル比を50%以上削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T16:48:31Z) - IsoCompute Playbook: Optimally Scaling Sampling Compute for LLM RL [75.28528082188787]
大規模言語モデル(LLM)におけるオンライン強化学習手法におけるサンプリング計算の最適割当について検討する。
並列ロールアウトの計算最適数は,計算予算とともに予測可能で増加し,飽和することがわかった。
本結果は,RLスケーリング法則を規範的割り当て規則として再考し,計算効率の高いLLM RLポストトレーニングのための実践的ガイダンスを提供する。
論文 参考訳(メタデータ) (2026-03-12T16:49:21Z) - QuRL: Efficient Reinforcement Learning with Quantized Rollout [23.326106976928898]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデル(LLM)の学習におけるトレンドパラダイムとなっている。
LLMの自己回帰復号性のため、ロールアウトプロセスはRLトレーニングの効率ボトルネックとなり、総トレーニング時間の最大70%を占める。
本稿では,Quantized Reinforcement Learning(QuRL)を提案する。
論文 参考訳(メタデータ) (2026-02-15T01:48:10Z) - Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates [53.3717573880076]
JitRL(Just-In-Time Reinforcement Learning、ジャスト・イン・タイム強化学習)は、テスト時間ポリシーの最適化を可能にするトレーニング不要のフレームワークである。
JitRLは、経験の動的で非パラメトリックな記憶を維持し、関連する軌跡を取得して、オンザフライでのアクションの利点を推定する。
WebArenaとJerrichoの実験では、JitRLがトレーニング不要メソッドの間に新しい最先端技術を確立していることが示されている。
論文 参考訳(メタデータ) (2026-01-26T14:16:51Z) - Beat the long tail: Distribution-Aware Speculative Decoding for RL Training [75.75462952580796]
モデル出力を変更することなくRLロールアウトを高速化する分散Aware Speculativeデコーディングフレームワークを提案する。
数学とコード推論タスクの実験は、DASが同一のトレーニング曲線を保ちながらロールアウト時間を最大50%短縮することを示している。
論文 参考訳(メタデータ) (2025-11-17T19:02:12Z) - CoPRIS: Efficient and Stable Reinforcement Learning via Concurrency-Controlled Partial Rollout with Importance Sampling [11.252930904797]
重要サンプリングを用いた並列制御部分ロールアウト(CoPRIS)を提案する。
CoPRISは、一定数の同時ロールアウトを維持し、十分なサンプルが収集されたら早期終了し、その後のロールアウトで未完成のトラジェクトリを再利用することで、長いテールの非効率を緩和する。
実験の結果、CoPRISは同期RLシステムに匹敵する性能を維持しながら、最大1.94倍高速なトレーニングを実現している。
論文 参考訳(メタデータ) (2025-11-05T11:39:32Z) - BroRL: Scaling Reinforcement Learning via Broadened Exploration [88.69554867685243]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルにおいて複雑な推論能力を解き放つ鍵となる要素として登場した。
最近のProRLは、トレーニングステップの数を増やすことで、RLのスケーリングを約束している。
RL, BroR-Lineasing the followingary paradigm for scaling RL, BroR-Lincreasing the rollouts per example to hundreds。
論文 参考訳(メタデータ) (2025-10-01T17:59:02Z) - SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning [51.10866035483686]
強化学習(RL)における高アップデート・トゥ・データ(UTD)比のアルゴリズムは、サンプル効率を改善するが、高い計算コストを伴い、現実世界のスケーラビリティを制限している。
我々は、低UTDオンライントレーニングと周期的オフライン安定化フェーズを組み合わせたRLアルゴリズムである、効率的なQ-Learningのためのオフライン安定化フェーズ(SPEQ)を提案する。
これらのフェーズでは、Q-関数は固定されたリプレイバッファ上で高いUTD比で微調整され、サブ最適データの冗長な更新が削減される。
論文 参考訳(メタデータ) (2025-01-15T09:04:19Z) - Continuous Control with Coarse-to-fine Reinforcement Learning [15.585706638252441]
本稿ではRLエージェントを粗い方法で連続的なアクション空間にズームインするよう訓練するフレームワークを提案する。
我々は、CQN(Coarse-to-fine Q-Network)と呼ばれる、具体的な価値に基づくアルゴリズムをフレームワーク内に導入する。
CQNは、オンライントレーニングの数分後に現実世界の操作タスクを解決するために、しっかりと学習している。
論文 参考訳(メタデータ) (2024-07-10T16:04:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。