論文の概要: ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.24062v1
- Date: Mon, 27 Jul 2026 07:05:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.334698
- Title: ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning
- Title(参考訳): ACRL:安定強化学習のためのトレーニング推論の適応制御
- Abstract要約: 大規模言語モデル(LLM)のための強化学習(RL)トレーニングは、トレーニングと推論の相違により不安定な場合が多い。
本稿では,適応制御強化学習(Adaptive Control Reinforcement Learning, ACRL)を提案する。
ACRLはBF16ベースラインの精度だけでなく、重要サンプリング(IS)の修正よりも優れている。
- 参考スコア(独自算出の注目度): 8.215647507089594
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Reinforcement Learning (RL) training for Large Language Models (LLMs) often suffers from instability due to the discrepancy between training and inference. This training-inference discrepancy stems from two primary factors: an architectural separation between training and inference engines, and the use of low-precision quantization in inference versus higher-precision computation in training. To address training instability issues caused by high training-inference discrepancy, we present the principles and methods for its adaptive control. We propose Adaptive Control Reinforcement Learning (ACRL), which adaptively maintains the training-inference discrepancy within a reasonable range to ensure stable RL training. Beyond stabilization, ACRL inherently increases policy entropy, thereby enhancing exploration and improving accuracy. The experimental results show that when the inference engine utilizes FP8 quantization, ACRL consistently maintains the training-inference discrepancy within a reasonable range and stabilizes RL training. Furthermore, ACRL not only matches the accuracy of the BF16 baseline but also outperforms importance sampling (IS) fixes.
- Abstract(参考訳): 大規模言語モデル(LLM)のための強化学習(RL)トレーニングは、トレーニングと推論の相違により不安定な場合が多い。
このトレーニング推論の相違は、トレーニングと推論エンジンの間のアーキテクチャ的な分離と、推論における低精度量子化とトレーニングにおける高精度計算の2つの主要な要因から生じる。
トレーニング・推論の相違によるトレーニング不安定性の問題に対処するため,適応制御の原理と方法を提案する。
本稿では,適応制御強化学習(Adaptive Control Reinforcement Learning, ACRL)を提案する。
安定化以外にも、ACRLは本質的にポリシーのエントロピーを高め、探索を強化し、精度を向上させる。
実験結果から,推論エンジンがFP8量子化を利用する場合,ACRLは適切な範囲内でトレーニングと推論の相違を一貫して維持し,RLトレーニングを安定させることがわかった。
さらに、ACRLはBF16ベースラインの精度だけでなく、重要サンプリング(IS)の修正よりも優れている。
関連論文リスト
- The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning [65.72688364382331]
強化学習(RL)は、大規模言語モデル(LLM)の訓練後に注目を集めているが、RLトレーニングは脆弱であり、不安定や崩壊に悩まされる可能性がある。
LLMは別個の推論とトレーニングエンジンを採用して、生成効率とトレーニング精度を高めている。
2段階のLLM RLフレームワークであるMonotonic Inference Policy Update (MIPU)を導入し、サンプル参照候補更新を構築し、同期候補を選択的に受け入れる。
論文 参考訳(メタデータ) (2026-06-28T17:40:02Z) - AIS: Adaptive Importance Sampling for Quantized RL [21.387834718338496]
大規模言語モデル(LLM)の強化学習はロールアウト生成のコストに支配されている。
これは、ロールアウトトレーニングミスマッチを導入し、ポリシー勾配を偏り、推論ベンチマークでトレーニングが完全に崩壊する可能性がある。
このミスマッチは非定常的であり、二重刃の剣として機能し、初期のトレーニングでは探索ボーナスを提供し、トレーナーがアンダーサンプするトラジェクトリーへの勾配を露呈する。
本稿では,適応的重要度サンプリング(AIS)を提案する。
論文 参考訳(メタデータ) (2026-05-13T03:36:57Z) - Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow [48.48936574810267]
本研究は,FP8 RLトレーニングの総合的研究である。
安定かつ堅牢なRL最適化を実現するFP8 RLトレーニングフレームワークであるJet-RLを提案する。
論文 参考訳(メタデータ) (2026-01-20T18:54:31Z) - On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models [73.10315509190623]
最近の強化学習技術は、言語モデルにおいて顕著な推論改善をもたらした。
ポストトレーニングが、事前トレーニング中に取得したものを超えて、モデルの推論能力を真に拡張するかどうかは不明だ。
プレトレーニング,ミッドトレーニング,およびRLベースのポストトレーニングの因果的貢献を分離する,完全に制御された実験フレームワークを開発した。
論文 参考訳(メタデータ) (2025-12-08T18:12:10Z) - Stabilizing Reinforcement Learning with LLMs: Formulation and Practices [61.361819972410046]
本稿では,REINFORCEなどの政策勾配法において,真のシーケンスレベルの報酬を代用トークンレベルの目的によって最適化できる理由と条件を示す。
この洞察は、RLトレーニングの安定化において、広く採用されているいくつかのテクニックの重要な役割について、原則化された説明を提供する。
論文 参考訳(メタデータ) (2025-12-01T07:45:39Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers [33.18639109838351]
我々は,MoEモデルのトレーニングと推論の整合性を解析し,ルーティング行動における顕著な相違点を同定する。
本稿では、推論エンジンからのルーティング分布を記録し、トレーニング中にリプレイするRollout Replay Routing (R3)を提案する。
R3は、トレーニング速度を損なうことなく、トレーニング推論ポリシーKLのばらつきを著しく低減し、極端な不一致を緩和する。
論文 参考訳(メタデータ) (2025-10-13T13:11:27Z) - Symmetric Reinforcement Learning Loss for Robust Learning on Diverse Tasks and Model Scales [13.818149654692863]
強化学習(RL)トレーニングは、移動目標や高勾配分散などの要因により本質的に不安定である。
本研究では,雑音データに対する教師付き学習から逆クロスエントロピー(RCE)を適用し,対称的なRL損失を定義することにより,RLトレーニングの安定性を向上させる。
論文 参考訳(メタデータ) (2024-05-27T19:28:33Z) - Low-Precision Reinforcement Learning [63.930246183244705]
教師付き学習における計算時間、メモリフットプリント、エネルギー消費を減らすために、低精度トレーニングが一般的なアプローチになっている。
本稿では,最先端のsacエージェントを用いた継続的制御について検討し,教師あり学習による低精度適応が失敗することを実証する。
論文 参考訳(メタデータ) (2021-02-26T16:16:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。