論文の概要: Stepwise Credit Assignment for GRPO on Flow-Matching Models
- arxiv url: http://arxiv.org/abs/2603.28718v1
- Date: Mon, 30 Mar 2026 17:35:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.541698
- Title: Stepwise Credit Assignment for GRPO on Flow-Matching Models
- Title(参考訳): フローマッチングモデルにおけるGRPOの段階的クレジット割り当て
- Authors: Yash Savani, Branislav Kveton, Yuchen Liu, Yilin Wang, Jing Shi, Subhojyoti Mukherjee, Nikos Vlassis, Krishna Kumar Singh,
- Abstract要約: Flow-GRPOは、フローモデルに強化学習をうまく適用するが、すべてのステップで均一なクレジット割り当てを使用する。
本稿では,各ステップの報酬改善に基づいてクレジットを割り当てるStepwise-Flow-GRPOを提案する。
- 参考スコア(独自算出の注目度): 42.56165883397638
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Flow-GRPO successfully applies reinforcement learning to flow models, but uses uniform credit assignment across all steps. This ignores the temporal structure of diffusion generation: early steps determine composition and content (low-frequency structure), while late steps resolve details and textures (high-frequency details). Moreover, assigning uniform credit based solely on the final image can inadvertently reward suboptimal intermediate steps, especially when errors are corrected later in the diffusion trajectory. We propose Stepwise-Flow-GRPO, which assigns credit based on each step's reward improvement. By leveraging Tweedie's formula to obtain intermediate reward estimates and introducing gain-based advantages, our method achieves superior sample efficiency and faster convergence. We also introduce a DDIM-inspired SDE that improves reward quality while preserving stochasticity for policy gradients.
- Abstract(参考訳): Flow-GRPOは、フローモデルに強化学習をうまく適用するが、すべてのステップで均一なクレジット割り当てを使用する。
これは拡散生成の時間構造を無視し、初期ステップは組成と内容(低周波構造)を決定、後期ステップは細部とテクスチャ(高周波詳細)を解決する。
さらに、最終画像のみに基づく均一なクレジットの割り当ては、特に拡散軌跡の後にエラーが修正された場合、必然的に準最適中間ステップに報いることができる。
本稿では,各ステップの報酬改善に基づいてクレジットを割り当てるStepwise-Flow-GRPOを提案する。
Tweedieの公式を利用して中間報酬推定を行い、ゲインベースの利点を導入することにより、より優れたサンプル効率とより高速な収束を実現する。
また、DDIMにインスパイアされたSDEを導入し、政策勾配の確率性を維持しながら報酬品質を向上させる。
関連論文リスト
- Euphonium: Steering Video Flow Matching via Process Reward Gradient Guided Stochastic Dynamics [49.242224984144904]
本稿では,プロセス報酬勾配誘導ダイナミクスによる生成を支援する新しいフレームワークであるEuphoniumを提案する。
我々の重要な洞察は、プロセス・リワード・モデルの勾配を明示的に組み込んだ理論的に原理化されたアルゴリズムとしてサンプリング・プロセスを定式化することである。
我々は,誘導信号をフローネットワークに内部化する蒸留目標を導出し,報奨モデルへの推論時間依存性を排除した。
論文 参考訳(メタデータ) (2026-02-04T08:59:57Z) - TempFlow-GRPO: When Timing Matters for GRPO in Flow Models [22.023027865557637]
本稿では,フローベース生成に固有の時間構造を捕捉し,活用する,原理的なGRPOフレームワークを提案する。
新しい革新は、基礎となる生成力学を尊重する時間的に認識された最適化をモデルに与える。
論文 参考訳(メタデータ) (2025-08-06T11:10:39Z) - Improving Progressive Generation with Decomposable Flow Matching [50.63174319509629]
Decomposable Flow Matching (DFM)は、ビジュアルメディアのプログレッシブな生成のためのシンプルで効果的なフレームワークである。
Imagenet-1k 512pxでは、DFMはベースアーキテクチャよりも35.2%改善され、ベースラインは26.4%向上した。
論文 参考訳(メタデータ) (2025-06-24T17:58:02Z) - Reward-Guided Iterative Refinement in Diffusion Models at Test-Time with Applications to Protein and DNA Design [87.58981407469977]
進化的アルゴリズムにインスパイアされた拡散モデルを用いた推論時間報酬最適化のための新しいフレームワークを提案する。
当社のアプローチでは,各イテレーションにおける2つのステップ – ノイズ発生と報酬誘導という,反復的な改善プロセスを採用しています。
論文 参考訳(メタデータ) (2025-02-20T17:48:45Z) - Directly Fine-Tuning Diffusion Models on Differentiable Rewards [22.1685707267062]
本稿では,微分可能報酬関数を最大化するために,拡散モデルを微調整するダイレクト・リワード・ファイン・チューニング(DRaFT)を提案する。
まず,全サンプリング手順で報酬関数勾配を逆伝播させることで,様々な報酬に対して高い性能が得られることを示す。
提案手法は,様々な報酬関数に対して有効であり,安定拡散1.4で生成した画像の美的品質を大幅に向上させることができる。
論文 参考訳(メタデータ) (2023-09-29T17:01:02Z) - Extrapolation for Large-batch Training in Deep Learning [72.61259487233214]
我々は、バリエーションのホストが、我々が提案する統一されたフレームワークでカバー可能であることを示す。
本稿では,この手法の収束性を証明し,ResNet,LSTM,Transformer上での経験的性能を厳格に評価する。
論文 参考訳(メタデータ) (2020-06-10T08:22:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。