論文の概要: UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
- arxiv url: http://arxiv.org/abs/2603.23500v1
- Date: Tue, 24 Mar 2026 17:59:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.634444
- Title: UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
- Title(参考訳): UniGRPO: 推論駆動ビジュアルジェネレーションのための統一ポリシー最適化
- Authors: Jie Liu, Zilyu Ye, Linxiao Yuan, Shenhan Zhu, Yu Gao, Jie Wu, Kunchang Li, Xionghui Wang, Xiaonan Nie, Weilin Huang, Wanli Ouyang,
- Abstract要約: インターリーブドジェネレーションが可能な統一モデルが有望なパラダイムとして登場している。
インターリーブ・ジェネレーションに適した統合強化学習フレームワークを提案する。
実験により,この統合学習レシピは推論による画像生成品質を著しく向上させることが示された。
- 参考スコア(独自算出の注目度): 51.41441081823758
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unified models capable of interleaved generation have emerged as a promising paradigm, with the community increasingly converging on autoregressive modeling for text and flow matching for image generation. To advance this direction, we propose a unified reinforcement learning framework tailored for interleaved generation. We validate our approach on its fundamental unit: a single round of reasoning-driven image generation, where the model first expands the user prompt through reasoning, followed by image synthesis. Formulating this multimodal generation process as a Markov Decision Process with sparse terminal rewards, we introduce UniGRPO to jointly optimize text and image generation policies using GRPO. Adopting a minimalist methodology to avoid over-design, we leverage established training recipes for both modalities by seamlessly integrating standard GRPO for reasoning and FlowGRPO for visual synthesis. To ensure scalability to multi-round interleaved generation, we introduce two critical modifications to the original FlowGRPO: (1) eliminating classifier-free guidance to maintain linear, unbranched rollouts, which is essential for scaling to complex scenarios involving multi-turn interactions and multi-condition generation (e.g., editing); and (2) replacing the standard latent KL penalty with an MSE penalty directly on the velocity fields, providing a more robust and direct regularization signal to mitigate reward hacking effectively. Our experiments demonstrate that this unified training recipe significantly enhances image generation quality through reasoning, providing a robust and scalable baseline for the future post-training of fully interleaved models.
- Abstract(参考訳): コミュニティは、テキストの自動回帰モデリングと画像生成のためのフローマッチングにますます集中し、インターリーブドジェネレーションが可能な統一モデルが有望なパラダイムとして登場した。
この方向性を推し進めるため、我々はインターリーブ世代に適した統合強化学習フレームワークを提案する。
モデルがまずユーザプロンプトを推論によって拡張し,続いて画像合成を行う,推論駆動画像生成の単一ラウンドである。
我々は,このマルチモーダル生成プロセスを,少ない端末報酬を持つマルコフ決定プロセスとして定式化し,テキストおよび画像生成ポリシーをGRPOを用いて協調的に最適化するUniGRPOを導入する。
過度な設計を避けるために最小限の方法論を採用することで、標準のGRPOをシームレスに統合し、ビジュアル合成のためのFlowGRPOをシームレスに統合することで、両方のモダリティのための確立されたトレーニングレシピを活用する。
複数ラウンドのインターリーブ生成のスケーラビリティを確保するために,(1) 線形で分岐のないロールアウトを維持するための分類器のないガイダンスを廃止すること,(2) 標準の潜伏KLペナルティをMSEペナルティに置き換えることにより,報酬ハッキングを効果的に軽減する,より堅牢で直接的な正規化信号を提供する。
実験により,この統合学習手法は推論による画像生成品質を著しく向上させ,完全インターリーブモデルの将来的な学習のための堅牢でスケーラブルなベースラインを提供することを示した。
関連論文リスト
- Unified Personalized Reward Model for Vision Generation [27.496220369122494]
視覚生成のためのパーソナライズされた報酬モデルであるUnifiedReward-Flexを提案する。
我々はまず,高度閉ソースVLMからブートストラップSFTまで,構造化された高品質な推論トレースを蒸留した。
次に、慎重にキュレートされた選好ペア上で直接選好最適化(DPO)を行い、推論の忠実度と識別的アライメントをさらに強化する。
論文 参考訳(メタデータ) (2026-02-02T17:44:21Z) - ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL [54.100889131719626]
連鎖推論と強化学習がNLPの突破口となった。
我々はReasonGen-R1を紹介した。ReasonGen-R1は自動回帰画像生成器に明示的なテキストベースの「思考」スキルを付与するフレームワークである。
ReasonGen-R1は、強いベースラインや先行技術モデルよりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2025-05-30T17:59:48Z) - Policy Optimized Text-to-Image Pipeline Design [73.9633527029941]
本稿では,テキスト・ツー・イメージ生成のための新しい強化学習フレームワークを提案する。
提案手法は、まず、画像品質のスコアをインタプリタ-ワークフローの組み合わせから直接予測できる報奨モデルのアンサンブルを訓練する。
次に、最初の語彙学習とGRPOに基づく最適化という2段階のトレーニング戦略を実装した。
論文 参考訳(メタデータ) (2025-05-27T17:50:47Z) - Boosting Generative Image Modeling via Joint Image-Feature Synthesis [15.133906625258797]
低レベル画像潜在者を共同でモデル化するために拡散モデルを活用することで、ギャップをシームレスに橋渡しする新しい生成画像モデリングフレームワークを提案する。
我々の潜在セマンティック拡散アプローチは、純雑音からコヒーレントな画像-特徴対を生成することを学ぶ。
複雑な蒸留目的の必要をなくすことで、我々の統一設計は訓練を単純化し、強力な新しい推論戦略である表現誘導を解き放つ。
論文 参考訳(メタデータ) (2025-04-22T17:41:42Z) - A Generic Approach for Enhancing GANs by Regularized Latent Optimization [79.00740660219256]
本稿では,事前学習したGANを効果的かつシームレスに拡張できる,エミュレーティブモデル推論と呼ばれる汎用フレームワークを提案する。
我々の基本的な考え方は、ワッサーシュタイン勾配流法を用いて与えられた要求に対する最適潜時分布を効率的に推算することである。
論文 参考訳(メタデータ) (2021-12-07T05:22:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。