論文の概要: Score Centering Stabilizes Off-policy Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.20807v1
- Date: Thu, 17 Sep 2026 17:58:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.420702
- Title: Score Centering Stabilizes Off-policy Reinforcement Learning
- Title(参考訳): Score Centeringがオフ・ポリティクス強化学習を安定化
- Abstract要約: トレーニング推論ミスマッチ(TIM)における強化学習の不安定性は,主にドリフトによるものであることを示す。
ドリフトをキャンセルすることでTIM下でRLを安定化させる付加的な「スコアセンター」補正項を導出する。
- 参考スコア(独自算出の注目度): 10.62282272763028
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) of large language models is notoriously sensitive to small differences between training and inference engines, often referred to as the training-inference mismatch (TIM). However, completely eliminating TIM is impractical, as it would come at a major cost to rollout efficiency. In this paper, we show that the instability of RL under TIM is primarily caused by drift: a persistent bias between training and inference engines that accumulates with every training step. We derive an additive "score centering" correction term that stabilizes RL under TIM by canceling drift. When training models from 0.6B to 30B parameters, score centering alone matches or outperforms methods based on importance sampling under quantization, with the gap growing as the mismatch becomes more severe. Because the correction is additive, score centering also composes with importance sampling -- their composition outperforms pure importance-sampling baselines in our staleness experiments.
- Abstract(参考訳): 大規模言語モデルの強化学習(RL)は、トレーニングエンジンと推論エンジンの小さな違いに敏感で、しばしばトレーニング推論ミスマッチ(TIM)と呼ばれる。
しかし、TIMを完全に排除するのは現実的ではない。
本稿では,TIM下でのRLの不安定性が主にドリフトに起因することを示し,トレーニングステップ毎に蓄積されるトレーニングエンジンと推論エンジンとの永続的バイアスについて述べる。
ドリフトをキャンセルすることでTIM下でRLを安定化させる付加的な「スコアセンター」補正項を導出する。
0.6B から 30B パラメータのトレーニングモデルでは、スコアセンタリングのみが量子化下での重要サンプリングに基づいてメソッドにマッチまたは性能を向上し、ミスマッチがより深刻になるにつれてギャップが増大する。
補正は加法的であるため、スコアセンタリングは重要なサンプリングとともに構成される。
関連論文リスト
- ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning [8.215647507089594]
大規模言語モデル(LLM)のための強化学習(RL)トレーニングは、トレーニングと推論の相違により不安定な場合が多い。
本稿では,適応制御強化学習(Adaptive Control Reinforcement Learning, ACRL)を提案する。
ACRLはBF16ベースラインの精度だけでなく、重要サンプリング(IS)の修正よりも優れている。
論文 参考訳(メタデータ) (2026-07-27T07:05:10Z) - Diagnosing Training Inference Mismatch in LLM Reinforcement Learning [10.829322294499882]
トレーニング・推論・ミスマッチ (TIM) は, 外部のドリフトと共通安定化機構に絡み合っているため, 検査が困難である。
本研究では,TIMをゼロミスマッチ診断装置(VeXact)で分離し,トークンレベルの数値的相違が独立にトレーニング崩壊を引き起こすことを示す。
論文 参考訳(メタデータ) (2026-05-14T00:27:35Z) - AIS: Adaptive Importance Sampling for Quantized RL [21.387834718338496]
大規模言語モデル(LLM)の強化学習はロールアウト生成のコストに支配されている。
これは、ロールアウトトレーニングミスマッチを導入し、ポリシー勾配を偏り、推論ベンチマークでトレーニングが完全に崩壊する可能性がある。
このミスマッチは非定常的であり、二重刃の剣として機能し、初期のトレーニングでは探索ボーナスを提供し、トレーナーがアンダーサンプするトラジェクトリーへの勾配を露呈する。
本稿では,適応的重要度サンプリング(AIS)を提案する。
論文 参考訳(メタデータ) (2026-05-13T03:36:57Z) - The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation [67.26315138466312]
モデルロールアウトから経験的信頼性を推定するキャリブレーション対応のOPDフレームワークであるCaOPDを提案する。
本研究は, 能力蒸留が信頼性を示唆するものではないこと, 信頼性をポストトレーニングの本質的な目的として扱うべきであることを明らかにする。
論文 参考訳(メタデータ) (2026-04-18T04:43:40Z) - What Does Flow Matching Bring To TD Learning? [28.717975688380488]
強化学習(RL)におけるスカラーQ値関数推定にフローマッチングが有効である
これらの結果から, 分布 RL ではその成功は説明されず, リターン分布を明示的にモデル化することで, 性能が低下することを示した。
我々は,この統合プロセスの各ステップにおける値の読み出しと高密度な速度管理に積分を用いることで,2つのメカニズムによるTD学習が向上すると主張している。
論文 参考訳(メタデータ) (2026-03-04T17:51:30Z) - Beyond Precision: Training-Inference Mismatch is an Optimization Problem and Simple LR Scheduling Fixes It [24.70923739848818]
トレーニングが進むにつれて,勾配雑音やトレーニング推論ミスマッチが増大することが明らかとなった。
更新サイズを小さくすることで、ミスマッチを効果的に抑制できることがわかった。
本稿では,学習率スケジューラという,シンプルで効果的な手法を提案する。
論文 参考訳(メタデータ) (2026-02-02T09:00:53Z) - Training Language Models to Self-Correct via Reinforcement Learning [98.35197671595343]
自己補正は、現代の大規模言語モデル(LLM)では、ほとんど効果がないことが判明した。
完全自己生成データを用いたLLMの自己補正能力を大幅に向上させるマルチターンオンライン強化学習手法であるSCoReを開発した。
SCoReは最先端の自己補正性能を実現し,MATHとHumanEvalでそれぞれ15.6%,9.1%向上した。
論文 参考訳(メタデータ) (2024-09-19T17:16:21Z) - Prior Constraints-based Reward Model Training for Aligning Large Language Models [58.33118716810208]
本稿では,この問題を解決するために,事前制約に基づくリワードモデル(PCRM)のトレーニング手法を提案する。
PCRMは、前回の制約、特に各比較ペアの出力間の長さ比とコサイン類似性を、最適化の規模を調節しスコアマージンを制御するための報酬モデルトレーニングに組み入れている。
実験結果から,PCRMは報酬スコアのスケーリングを効果的に抑制することによりアライメント性能を著しく向上することが示された。
論文 参考訳(メタデータ) (2024-04-01T07:49:11Z) - Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation [63.180725016463974]
クロスモーダル検索は、実際は精力的な、十分に整合した大規模データセットに依存している。
我々は、新しい雑音対応学習フレームワーク、textbfSelf-textbfReinforcing textbfErrors textbfMitigation(SREM)を導入する。
論文 参考訳(メタデータ) (2023-12-27T09:03:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。