論文の概要: Rollout Efficiency in Reinforcement Learning for Reasoning Large Language Models: A Taxonomy and Future Directions
- arxiv url: http://arxiv.org/abs/2609.25463v1
- Date: Mon, 21 Sep 2026 22:40:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.13624
- Title: Rollout Efficiency in Reinforcement Learning for Reasoning Large Language Models: A Taxonomy and Future Directions
- Title(参考訳): 大規模言語モデルの推論のための強化学習におけるロールアウト効率:分類学と今後の方向性
- Abstract要約: 推論指向強化学習(Reasoning-oriented reinforcement learning)は、大規模言語モデルで数学、コーディング、その他の多段階タスクを解くことを可能にする。
ロールアウト機構は、トレーニングデータの鮮度、一貫性、統計的妥当性を維持しながら、このコストを削減するために不可欠である。
- 参考スコア(独自算出の注目度): 20.745717424230246
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reasoning-oriented reinforcement learning enables large language models to solve mathematical, coding, and other multi-step tasks, but shifts a substantial portion of the training cost to rollout, where trajectories are generated for policy updates. Efficient rollout mechanisms are therefore essential to reduce this cost while maintaining the freshness, consistency, and statistical validity of training data. This survey provides a systematic taxonomy of recent research on rollout efficiency for reasoning-oriented reinforcement learning, classifying existing approaches from both mechanism and bottleneck perspectives. Based on this taxonomy, we analyze how different technique families address distinct sources of rollout inefficiency, examine opportunities and potential conflicts for combining them, identify gaps in the evaluation and reporting of efficiency gains, and discuss open challenges and future research directions.
- Abstract(参考訳): 推論指向強化学習(Reasoning-oriented reinforcement learning)は、大規模言語モデルで数学、コーディング、その他のマルチステップタスクを解くことができるが、トレーニングコストのかなりの部分がロールアウトにシフトし、ポリシー更新のために軌道が生成される。
したがって、効率的なロールアウト機構は、トレーニングデータの鮮度、一貫性、統計的妥当性を維持しながら、このコストを削減するために不可欠である。
この調査は、推論指向強化学習のロールアウト効率に関する最近の研究の体系的な分類を提供し、メカニズムとボトルネックの両方の観点から既存のアプローチを分類する。
この分類に基づいて、異なるテクニックファミリーが異なるロールアウト非効率源にどう対処するかを分析し、それらを組み合わせるための機会と潜在的な対立を調べ、効率向上の評価と報告のギャップを特定し、オープン課題と今後の研究方向性について議論する。
関連論文リスト
- A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions [60.897488753340674]
強化学習(RL)は、大規模言語モデル(LLM)の推論能力を高めるための強力なポストトレーニングパラダイムとして登場した。
RLは、高品質な外部監視の可用性の制限や、モデル生成エクスペリエンスの制限されたボリュームなど、データ不足の大きな課題に直面している。
データ中心の視点、トレーニング中心の視点、フレームワーク中心の視点という3つの相補的な視点に基づいて構築されたボトムアップ階層的なフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-19T08:01:31Z) - A Systematic Study of Training-Free Methods for Trustworthy Large Language Models [23.758453206408102]
トレーニング後アライメント技術に代わる費用対効果の代替手段として、トレーニングフリーな手法が登場した。
信頼性の高い各種設定に対するトレーニングフリー手法の有効性を再評価し,有用性,堅牢性,計算オーバーヘッドに与える影響について検討した。
我々の分析は、現在のアプローチにおけるいくつかのトレードオフと未解決の課題を強調しています。
論文 参考訳(メタデータ) (2026-04-17T07:50:42Z) - Toward Efficient Agents: Memory, Tool learning, and Planning [96.93533945696156]
本稿では,レイテンシ,トークン,ステップなどのコストを考慮したメモリ,ツール学習,計画という,エージェントの3つのコアコンポーネントの効率性について検討する。
論文 参考訳(メタデータ) (2026-01-20T17:51:56Z) - Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration [33.02780998281276]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデルの推論能力を改善した。
本研究は,RLVRにおけるデータ効率の向上に本質的なデータ特性の活用,すなわちトレーニング中のほぼ自由な利益をいかに生かすかを検討する。
論文 参考訳(メタデータ) (2025-11-02T04:16:47Z) - CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs [53.749193998004166]
カリキュラム学習は,大規模言語モデルの学習効率を高める上で重要な役割を担っている。
収束を加速し,計算オーバーヘッドを最小限に抑えるためにベイズ後続推定を用いた効率的な学習法であるCurESを提案する。
論文 参考訳(メタデータ) (2025-10-01T15:41:27Z) - Dynamic Programming Techniques for Enhancing Cognitive Representation in Knowledge Tracing [125.75923987618977]
認知表現動的プログラミングに基づく知識追跡(CRDP-KT)モデルを提案する。
質問の難易度とそれらの間の性能間隔に基づいて認知表現を最適化する動的プログラミングアルゴリズムである。
これは、その後のモデルトレーニングのためにより正確で体系的な入力機能を提供し、それによって認知状態のシミュレーションにおける歪みを最小限にする。
論文 参考訳(メタデータ) (2025-06-03T14:44:48Z) - Recent Advances in Federated Learning Driven Large Language Models: A Survey on Architecture, Performance, and Security [24.969739515876515]
Federated Learning(FL)は、データプライバシを保持し、通信オーバーヘッドを最小限に抑えながら、大規模言語モデル(LLM)を分散的にトレーニングするための有望なパラダイムを提供する。
我々は、摂動に基づく手法、モデル分解、漸進的再学習を含む、連合LLMにおける未学習を可能にする様々な戦略についてレビューする。
本調査では, 現実の展開に向けて, 安全で適応性があり, 高性能なLLMシステムの開発に向けた重要な研究方向を明らかにする。
論文 参考訳(メタデータ) (2024-06-14T08:40:58Z) - Exploring Federated Unlearning: Review, Comparison, and Insights [101.64910079905566]
フェデレーション・アンラーニングは、フェデレーション・システムで訓練されたモデルからデータを選択的に除去することを可能にする。
本稿では,既存のフェデレーション・アンラーニング手法について検討し,アルゴリズムの効率,モデル精度への影響,プライバシ保護の有効性について検討する。
フェデレートされたアンラーニング手法を評価するための統一ベンチマークであるOpenFederatedUnlearningフレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-30T01:34:33Z) - Variance-Covariance Regularization Improves Representation Learning [28.341622247252705]
我々は,分散共分散正規化(VCReg)を導入して,自己教師型学習規則化手法を教師型学習コンテキストに適用する。
我々は、VCRegが画像やビデオの転送学習を大幅に強化し、多数のタスクやデータセットで最先端のパフォーマンスを達成することを実証した。
要約すると、VCRegは、転送学習を大幅に進歩させ、勾配飢餓、神経崩壊、特徴伝達可能性の間の接続を強調する、普遍的に適用可能な正規化フレームワークを提供する。
論文 参考訳(メタデータ) (2023-06-23T05:01:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。