論文の概要: OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models
- arxiv url: http://arxiv.org/abs/2604.04142v1
- Date: Sun, 05 Apr 2026 15:00:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.943166
- Title: OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models
- Title(参考訳): OP-GRPO:フローマッチングモデルのための効率的なオフポリティGRPO
- Abstract要約: 本稿では,フローマッチングモデルに適したOff-Policy GRPOフレームワークであるOP-GRPOを提案する。
高品質なトラジェクトリを積極的に選択し、それらをリプレイバッファに適応的に組み込んで、その後のトレーニングイテレーションで再利用する。
- 参考スコア(独自算出の注目度): 14.396100082949005
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post training via GRPO has demonstrated remarkable effectiveness in improving the generation quality of flow-matching models. However, GRPO suffers from inherently low sample efficiency due to its on-policy training paradigm. To address this limitation, we present OP-GRPO, the first Off-Policy GRPO framework tailored for flow-matching models. First, we actively select high-quality trajectories and adaptively incorporate them into a replay buffer for reuse in subsequent training iterations. Second, to mitigate the distribution shift introduced by off-policy samples, we propose a sequence-level importance sampling correction that preserves the integrity of GRPO's clipping mechanism while ensuring stable policy updates. Third, we theoretically and empirically show that late denoising steps yield ill-conditioned off-policy ratios, and mitigate this by truncating trajectories at late steps. Across image and video generation benchmarks, OP-GRPO achieves comparable or superior performance to Flow-GRPO with only 34.2% of the training steps on average, yielding substantial gains in training efficiency while maintaining generation quality.
- Abstract(参考訳): GRPOによるポストトレーニングは,フローマッチングモデルの生成品質向上に顕著な効果を示した。
しかし、GRPOは本来、政策上の訓練パラダイムのため、サンプル効率の低下に悩まされている。
この制限に対処するため,フローマッチングモデルに適した最初のOff-Policy GRPOフレームワークであるOP-GRPOを提案する。
まず、我々は、高品質な軌道を積極的に選択し、それらをリプレイバッファに適応的に組み込んで、その後のトレーニングイテレーションで再利用する。
第2に,非政治サンプルによる分散シフトを軽減するために,GRPOのクリッピング機構の整合性を維持しつつ,安定なポリシー更新を確実にするシーケンスレベルの重要度サンプリング補正を提案する。
第3に, 遅延復調段階が不調な非政治比率を生じることを理論的, 実証的に示し, 遅延段階における軌道の切り離しによってこれを緩和する。
画像およびビデオ生成ベンチマーク全体を通じて、OP-GRPOは、平均的なトレーニングステップの34.2%でFlow-GRPOと同等または優れたパフォーマンスを達成し、生成品質を維持しながら、トレーニング効率を大幅に向上させる。
関連論文リスト
- AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO [78.36537400975298]
グループ相対政策最適化(GRPO)は、テキスト・ツー・イメージ(T2I)フローモデルと人間の嗜好の整合において顕著な成功を収めた。
我々は,現在のフローベースGRPOの学習ループが,学習者の現在の能力から根本的に切り離されていることを確認した。
本稿では,フローモデルに適した新しい能力認識型RLアルゴリズムであるAdaptive GRPO(AdaGRPO)を提案する。
論文 参考訳(メタデータ) (2026-06-05T02:07:08Z) - BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization [23.13988703785064]
大規模言語モデル(LLM)における社会的バイアスの緩和は、異なるアライメントの課題を示す。
直接選好最適化(DPO)は、オフライントレーニングに固有の探索の欠如によって制限される。
PPO(Proximal Policy Optimization)は、潜在的に信頼性の低い批評家の推定により、トレーニング不安定につながる可能性がある。
論文 参考訳(メタデータ) (2026-06-03T12:31:42Z) - Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance [38.06932977050757]
CGPO, textbfCritic-textbfGuided diffusion textbfPolicy textbfOptimizationを提案する。
CGPOは、批評家ネットワークによって定義された高価値領域に対してアクション生成を制御し、回帰目的として誘導されたアクションを使用する。
5つのMuJoCo移動タスクにおけるCGPOの有効性を検証し,既存の拡散型RL法と比較してCGPOが最先端性能を達成することを示す。
論文 参考訳(メタデータ) (2026-05-28T15:07:50Z) - V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think [90.69263509098948]
本稿では,ELBOをベースとしたサロゲートとグループ相対ポリシー最適化アルゴリズムを統合した変分GRPOを提案する。
V-GRPOはテキストと画像の合成において最先端のパフォーマンスを実現し、MixGRPOよりも2倍のスピードアップ、DiffusionNFTより3倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-04-25T17:03:21Z) - Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - iGRPO: Self-Feedback-Driven LLM Reasoning [88.83313431248473]
大規模言語モデル(LLM)は複雑な数学的問題を解く上で有望であるが、正確で一貫したソリューションを生み出すには至っていない。
IGRPO(Iterative Group Relative Policy Optimization)は、モデル生成ドラフトを通じて動的自己条件を追加するGRPOの2段階拡張である。
一致するロールアウト予算の下では、iGRPOはGRPOをベースモデルで一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-09T18:45:11Z) - GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping [63.33669214116784]
GRPO-Guardは、既存のGRPOフレームワークのシンプルで効果的な拡張である。
PPOクリッピングが有害な更新を適切に制限することを保証するため、バランスとステップ一貫性の重要度を回復する。
重いKL正則化に頼ることなく、暗黙の過最適化を実質的に緩和する。
論文 参考訳(メタデータ) (2025-10-25T14:51:17Z) - BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping [69.74252624161652]
適応クリッピング(BAPO)を用いたBAlanced Policy Optimizationを提案する。
BAPOはクリッピングバウンダリを動的に調整し、適応的に正と負のコントリビューションを再バランスさせ、エントロピーを保持し、RL最適化を安定化させる。
AIME 2024とAIME 2025ベンチマークでは、7B BAPOモデルがSkyWork-OR1-7Bのようなオープンソースモデルを上回っています。
論文 参考訳(メタデータ) (2025-10-21T12:55:04Z) - BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models [57.304411396229035]
BranchGRPOは、ロールアウトプロセスを分岐木に再構成する手法である。
HPDv2.1イメージアライメントでは、BranchGRPOはDanceGRPOよりも最大でtextbf16%のアライメントスコアを改善する。
ハイブリッド版であるBranchGRPO-MixはDanceGRPOよりも4.7倍の速度でトレーニングを加速する。
論文 参考訳(メタデータ) (2025-09-07T12:53:06Z) - TempFlow-GRPO: When Timing Matters for GRPO in Flow Models [22.023027865557637]
本稿では,フローベース生成に固有の時間構造を捕捉し,活用する,原理的なGRPOフレームワークを提案する。
新しい革新は、基礎となる生成力学を尊重する時間的に認識された最適化をモデルに与える。
論文 参考訳(メタデータ) (2025-08-06T11:10:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。