論文の概要: LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL
- arxiv url: http://arxiv.org/abs/2609.03528v1
- Date: Thu, 03 Sep 2026 08:24:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.983331
- Title: LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL
- Title(参考訳): LeanGRPO:拡散RLにおける冗長再計算の排除
- Authors: Sijie Wang, Zhiqiang Tan, Xinrui Yang, Shaohuai Shi,
- Abstract要約: 拡散強化学習(RL)は,最近,映像生成モデルや映像生成モデルにおいて大きな成功を収めている。
DanceGRPOやFlowGRPOを含むほとんどのRLメソッドは、ロールアウト後の勾配追跡で選択した時間ステップを再計算する。
本稿では、データ並列レイアウトを再構築し、トラジェクトリ-ログプロブ計算RLのための2つの再計算不要なトレーニングスケジュールを導入することにより、LeanGRPOを提案する。
- 参考スコア(独自算出の注目度): 18.67514175891835
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion reinforcement learning (RL) has recently achieved significant success in post-training image and video generative models. However, most diffusion RL methods, including DanceGRPO and FlowGRPO, recompute selected timesteps with gradient tracking after rollout. Under on-policy training with the same backend for rollout and update, this recomputation is mathematically redundant. Intuitively, the rollout and policy update steps can reuse the same feed-forward backbone to avoid redundant computation, but doing so can incur a large memory overhead during rollout. To address the issue, we present LeanGRPO by restructuring the data-parallel layout and introducing two recompute-free training schedules for trajectory-logprob diffusion RL: (1) LeanGRPO-Retain enables gradient tracking during rollout and directly reuses the resulting computation graphs and saved activations for backward during update, requiring no recomputation; and (2) LeanGRPO-Reweight also enables gradients during rollout, but immediately backpropagates each selected step using a provisional advantage and delays gradient synchronization, then corrects the provisional gradients with the true advantage after the trajectory is completed. These schedules target different model scales and input sizes. Across FlowGRPO/DanceGRPO with FLUX.1-dev and Wan, LeanGRPO achieves up to 1.83x end-to-end speedup while preserving the original optimization objective.
- Abstract(参考訳): 拡散強化学習(RL)は,最近,映像生成モデルや映像生成モデルにおいて大きな成功を収めている。
しかし,DanceGRPOやFlowGRPOなどの拡散RL法は,ロールアウト後の勾配追跡によって選択した時間ステップを再計算する。
ロールアウトとアップデートを同じバックエンドで行うオンプレミスのトレーニングでは、この再計算は数学的に冗長である。
直感的には、ロールアウトとポリシー更新のステップは同じフィードフォワードバックボーンを再利用して冗長な計算を避けることができるが、ロールアウト時に大きなメモリオーバーヘッドが発生する可能性がある。
本稿では,データ並列レイアウトを再構築し,トラジェクトリ・ログプロブ拡散RLのための2つの再計算不要なトレーニングスケジュールを導入することにより,LeanGRPOを提案する。(1)LeanGRPO-Retainはロールアウト時の勾配追跡を可能にし,結果の計算グラフと保存されたアクティベーションを直接再利用する。
これらのスケジュールは、異なるモデルスケールと入力サイズをターゲットにしている。
FlowGRPO/DanceGRPOをFLUX.1-devとWanと組み合わせて、LeanGRPOは、オリジナルの最適化目標を維持しながら、最大1.83倍のエンドツーエンドのスピードアップを達成する。
関連論文リスト
- ReFPO: Reflow Regularization for Flow Matching Policy Gradients [58.32178725687043]
本稿では,フローマッチングポリシーに明示的なリフロー正規化を追加する,シンプルなオンラインRL手法を提案する。
ReFPOはGridWorld, MuJoCo Playground, および高次元ヒューマノイド制御タスクにおける平均性能と離散化を改善することを実験的に実証した。
論文 参考訳(メタデータ) (2026-06-19T04:23:10Z) - Reversal Q-Learning [57.43956630070019]
逆Q-ラーニング(Reversal Q-learning)は、事前データに基づいてフローポリシーをトレーニングする、非政治的なRLアルゴリズムである。
RQLは、最先端のフローベースオフラインRLアルゴリズムと比較して、平均的なオフラインRLパフォーマンスをもたらすことを示す。
論文 参考訳(メタデータ) (2026-06-16T05:56:10Z) - Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking [5.238545250784642]
本稿では,軌道毎のチャンクの小さな確率的に選択されたサブセットに勾配を割り当てるGRPOのドロップイン修正である確率的チャンクマスキング(PCM)を提案する。
3つのLIBEROベンチマークでは、PCMは標準GRPOの最終的な成功率と一致し、2.38倍のウォールクロック速度、4.8倍の勾配更新、60%のピークアクティベーションメモリを達成した。
論文 参考訳(メタデータ) (2026-05-15T16:33:59Z) - Off-Policy Value-Based Reinforcement Learning for Large Language Models [25.962820072445222]
ReValはベルマン更新に基づく手法で、内部の一貫性を捉える段階的な信号と、結果検証から導出される軌道レベルの信号を組み合わせる。
DeepSeek-R1-Distill-1.5Bでは、ReValはトレーニング効率を改善し、AIME24の2.7%、GRPOのGPQAの4.5%の改善を実現している。
論文 参考訳(メタデータ) (2026-03-24T15:55:02Z) - DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay [57.80564154223355]
既存のエクスペリエンスリプレイメソッドは、直接ポリシー更新のための正確なサンプルを再利用することで、この問題に対処する。
歴史的データは単に正確性を強化するのではなく、持続的な多様性を優先すべきである、と我々は主張する。
本稿では,シンプルで効果的な正規化フレームワークであるLEPJRを提案する。
論文 参考訳(メタデータ) (2026-03-17T06:20:56Z) - Parallel Diffusion Solver via Residual Dirichlet Policy Optimization [88.7827307535107]
拡散モデル(DM)は、最先端の生成性能を達成したが、シーケンシャルなデノナイジング特性のため、高いサンプリング遅延に悩まされている。
既存のソルバベースの加速度法では、低次元の予算で画像品質が著しく低下することが多い。
本研究では,各ステップに複数の勾配並列評価を組み込んだ新しいODE解法であるEnsemble Parallel Directionsolvr(EPD-EPr)を提案する。
論文 参考訳(メタデータ) (2025-12-28T05:48:55Z) - BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models [57.304411396229035]
BranchGRPOは、ロールアウトプロセスを分岐木に再構成する手法である。
HPDv2.1イメージアライメントでは、BranchGRPOはDanceGRPOよりも最大でtextbf16%のアライメントスコアを改善する。
ハイブリッド版であるBranchGRPO-MixはDanceGRPOよりも4.7倍の速度でトレーニングを加速する。
論文 参考訳(メタデータ) (2025-09-07T12:53:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。