論文の概要: Learn from the Gap: Differential-Aware Advantage Pruning with Adaptive Rollout Sampling for GRPO
- arxiv url: http://arxiv.org/abs/2609.36932v2
- Date: Sat, 03 Oct 2026 05:05:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.425225
- Title: Learn from the Gap: Differential-Aware Advantage Pruning with Adaptive Rollout Sampling for GRPO
- Title(参考訳): GRPOのアダプティブロールアウトサンプリングによる差分認識アドバンテージ・プルーニング
- Abstract要約: FastRLは、新しいプラグアンドプレイ強化学習フレームワークである。
訓練効率と政策学習の有効性を同時に向上させる。
実験により、FastRLはGRPO、DAPO、GSPOにシームレスに統合できることが示されている。
- 参考スコア(独自算出の注目度): 16.87211092191826
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recently, Group Relative Policy Optimization (GRPO) and its variants have been developed for policy optimization and demonstrated notable performance gains. However, these methods usually incur substantial computational overhead due to per-question multi-rollout sampling and repeated per-token probability evaluation across rollouts. Furthermore, low-information or highly homogeneous trajectories can degrade downstream learning signal efficiency, hindering model optimization and limiting final performance. To address these issues, we propose FastRL, a novel plug-and-play reinforcement learning framework that simultaneously improves training efficiency and the effectiveness of policy learning. Specifically, 1) We introduce an advantage-aware pruning strategy to selectively preserve high-advantage trajectories while maximizing inter-trajectory gradient diversity. 2) Then, we design an adaptive rollout sampling mechanism to dynamically adjust the sampling scale across different training stages based on historical pruning distributions, balancing exploration adequacy and computational efficiency. Experiments demonstrate that FastRL can be seamlessly integrated into GRPO, DAPO, and GSPO variants, achieving an average 2.07$\times$ training speedup on Geometry3K and GeoQA8K-R1V, along with an approximately 1.64\% improvement in average accuracy on visual reasoning benchmarks. Source codes will be available at https://github.com/Nicozwy/FastRL.
- Abstract(参考訳): 近年,政策最適化のためのグループ相対政策最適化(GRPO)とその変種が開発され,顕著な性能向上が示されている。
しかし、これらの手法は、通常、要求毎のマルチロールアウトサンプリングとロールアウト毎の繰り返し確率評価により、かなりの計算オーバーヘッドを発生させる。
さらに、低情報または高均一な軌道は、下流学習信号の効率を低下させ、モデルの最適化を阻害し、最終的な性能を制限することができる。
これらの課題に対処するために,FastRLを提案する。FastRLは,学習効率と政策学習の有効性を同時に向上する新しいプラグアンドプレイ強化学習フレームワークである。
具体的には
1) トラジェクティブ間の勾配の多様性を最大化しつつ, 高付加性軌道を選択的に保存するアドバンテージ・アウェア・プルーニング・ストラテジーを導入する。
2) 歴史的採点分布, 探索精度, 計算効率のバランスに基づいて, 異なる訓練段階にわたるサンプリングスケールを動的に調整する適応的なロールアウトサンプリング機構を設計する。
実験により、FastRLはGRPO、DAPO、GSPOにシームレスに統合され、Geometry3KおよびGeoQA8K-R1Vでのトレーニングスピードアップの平均2.07$\times$を達成するとともに、ビジュアル推論ベンチマークの平均精度が約1.64\%向上した。
ソースコードはhttps://github.com/Nicozwy/FastRL.comで入手できる。
関連論文リスト
- AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO [78.36537400975298]
グループ相対政策最適化(GRPO)は、テキスト・ツー・イメージ(T2I)フローモデルと人間の嗜好の整合において顕著な成功を収めた。
我々は,現在のフローベースGRPOの学習ループが,学習者の現在の能力から根本的に切り離されていることを確認した。
本稿では,フローモデルに適した新しい能力認識型RLアルゴリズムであるAdaptive GRPO(AdaGRPO)を提案する。
論文 参考訳(メタデータ) (2026-06-05T02:07:08Z) - Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - RFS: Reinforcement Learning with Residual Flow Steering for Dexterous Manipulation [7.500999283386335]
残留フローステアリング(Residual Flow Steering、RFS)は、事前訓練された生成ポリシーを適用するためのデータ効率の強化学習フレームワークである。
RFSは、残留動作と潜時雑音分布を協調的に最適化することにより、事前訓練されたフローマッチングポリシーを操る。
シミュレーションと実世界の両方の設定において, RFS が効率よく微調整できることを示す。
論文 参考訳(メタデータ) (2026-02-02T08:11:57Z) - CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs [53.749193998004166]
カリキュラム学習は,大規模言語モデルの学習効率を高める上で重要な役割を担っている。
収束を加速し,計算オーバーヘッドを最小限に抑えるためにベイズ後続推定を用いた効率的な学習法であるCurESを提案する。
論文 参考訳(メタデータ) (2025-10-01T15:41:27Z) - Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle [65.14124923451077]
強化学習(Reinforcement Learning, RL)は、マルチモーダル大言語モデル(MLLM)の推論能力を高めるための効果的なポストトレーニングパラダイムとして登場した。
しかしながら、現在のRLパイプラインは、アドバンテージ・コラプシング(Advantage Collapsing)とロールアウト・サイレンシング(Rollout Silencing)という2つの未解決の問題によって、トレーニングの非効率に悩まされることが多い。
軌道サンプリングとバッチ合成を動的に再構成することにより、RLの微調整効率を向上する、シンプルだが原則化されたフレームワークであるShuffle-R1を提案する。
論文 参考訳(メタデータ) (2025-08-07T17:53:47Z) - Leveraging Stochastic Depth Training for Adaptive Inference [1.996143466020199]
本稿では,ゼロオーバーヘッド,単一モデル,時間予測可能な推論を用いた適応推論の簡易かつ効果的な代替手法を提案する。
従来のResNetと比較して、精度0.71%の低下で最大2倍の効率向上を実現した。
論文 参考訳(メタデータ) (2025-05-23T08:36:56Z) - DPO: A Differential and Pointwise Control Approach to Reinforcement Learning [3.2857981869020327]
連続状態行動空間における強化学習(RL)は、科学計算において依然として困難である。
本稿では,連続時間制御の観点からRLを再構成する新しいフレームワークである差分強化学習(Differential RL)を紹介する。
我々は,局所運動演算子を洗練させる段階的アルゴリズムである微分ポリシー最適化(DPO)を開発した。
論文 参考訳(メタデータ) (2024-04-24T03:11:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。