論文の概要: Flow-Map GRPO: Reinforcement Learning for Few-Step Flow-Map Generators via Anchored Stochastic Composition
- arxiv url: http://arxiv.org/abs/2607.00535v1
- Date: Wed, 01 Jul 2026 07:25:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.77796
- Title: Flow-Map GRPO: Reinforcement Learning for Few-Step Flow-Map Generators via Anchored Stochastic Composition
- Title(参考訳): Flow-Map GRPO: Anchored Stochastic compositionによるFew-Step Flow-Map Generatorの強化学習
- Abstract要約: 一貫性モデルやMeanFlowのような数ステップのフローマップジェネレータは、ノイズとデータの間の長距離トランスポートマップを直接学習することで、サンプリングを高速化する。
これらのモデルは典型的には決定論的であり、ポストトレーニング手法では最適化が困難である。
本稿では,数ステップのフローマップ生成のための決定論的ポストトレーニングフレームワークであるFlow-MapOを提案する。
- 参考スコア(独自算出の注目度): 13.766141027420879
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Few-step flow-map generators, such as consistency models and MeanFlow, accelerate sampling by directly learning long-range transport maps between noise and data. However, these models are typically deterministic, which makes them difficult to optimize with reinforcement learning (RL) post-training methods that require stochastic trajectories and well-defined likelihood ratios. Existing SDE-based stochasticization techniques are designed for velocity-based samplers with infinitesimal or finely discretized transitions, and therefore do not directly apply to long-range flow maps. In this work, we propose Flow-Map GRPO, an online RL post-training framework for deterministic few-step flow-map generators. The key component is Anchored Stochastic Flow Map Composition (ASFMC), a path-preserving stochasticization mechanism that introduces randomness through anchor-based conditional resampling while preserving the original marginal probability path of the deterministic flow map. We derive GRPO objectives for both single-time and two-time flow-map parameterizations. Experiments on few-step FLUX-based text-to-image generators, including MeanFlow and sCM, show that Flow-Map GRPO improves pretrained deterministic flow-map models across reward-based, perceptual, and task-level evaluation metrics. Our results demonstrate that deterministic few-step flow-map generators can be effectively aligned with RL post-training without modifying their original model parameterization or retraining them as native stochastic models.
- Abstract(参考訳): 一貫性モデルやMeanFlowのような数ステップのフローマップジェネレータは、ノイズとデータの間の長距離トランスポートマップを直接学習することで、サンプリングを高速化する。
しかし、これらのモデルは典型的には決定論的であり、確率的軌道と明確に定義された確率比を必要とする強化学習(RL)後学習法で最適化することが困難である。
既存のSDEベースの確率化手法は、無限小あるいは微細に離散化された遷移を持つ速度ベースサンプリングのために設計されており、したがって長距離フローマップには直接適用されない。
本研究では,オンラインRLポストトレーニングフレームワークであるFlow-Map GRPOを提案する。
鍵となるコンポーネントは Anchored Stochastic Flow Map composition (ASFMC) である。これは経路保存確率化機構で、決定論的フローマップの元の限界確率パスを保ちながらアンカーベースの条件再サンプリングによってランダム性を導入する。
単一時間と2時間の両方のフローマップパラメータ化におけるGRPOの目的を導出する。
MeanFlowやsCMなど、FLUXベースの数ステップのテキスト・ツー・イメージジェネレータの実験では、Flow-Map GRPOが、報酬ベース、知覚的、タスクレベルの評価指標を越えて、事前学習された決定論的フローマップモデルを改善することが示されている。
この結果から, 決定論的数ステップのフローマップ生成器は, 元のモデルのパラメータ化を変更したり, あるいは固有確率モデルとして再学習することなく, RLポストトレーニングに効果的に対応できることが示唆された。
関連論文リスト
- Flow Map Learning via Nongradient Vector Flow [22.985676782036904]
拡散とフローベースのモデルは単純な回帰損失の恩恵を受けるが、サンプリングは統合を必要とするため、推論はかなりのオーバーヘッドを引き起こす。
モデル反復による明示的な可逆性制約や高価な微分を回避し,フローマップを学習するためのアプローチであるSGFlowを紹介する。
論文 参考訳(メタデータ) (2026-07-29T02:17:27Z) - Itô maps for any-step SDEs [5.492715250025273]
最近の一段階生成モデルは、基礎となる力学の決定論的フローマップを学習することでサンプリングを加速する。
中間状態とブラウン経路を取り、将来の状態を1回のパスで予測する任意のステップフローマップであるイットマップを導入する。
マップは、固定された中間状態から多様な条件付きエンドポイントサンプルを生成し、合成および画像生成ベンチマーク上で強力なステアリング性能をサポートする。
論文 参考訳(メタデータ) (2026-06-09T17:39:22Z) - Strong Stochastic Flow Maps [38.75021352054866]
流れと拡散モデルは多くのモードで高品質なサンプルを生成する。
フローマップは微分方程式の解写像を直接学習することでこの問題を緩和する。
我々は,加法雑音SDEの強解マップを学習するための新しいフレームワークとして,Strong Flow Map (SSFM)を提案する。
論文 参考訳(メタデータ) (2026-05-31T08:14:47Z) - Entropy Across the Bridge: Conditional-Marginal Discretization for Flow and Schrödinger Samplers [68.9946633641494]
フローマッチングとシュルディンガーブリッジは確率を定義するが、その推論格子は通常一点拡散から受け継がれる。
終端条件付き橋梁形状を境界流の進化から分離し, 橋梁を識別する条件付きエントロピーレートを導出する。
EDM/CIFAR-10では、エントロピックな時間分散は5段階のFID(186.3 pm 4.0対200.5 pm 2.9対cosineの238.0 pm 5.3)が最適である。
論文 参考訳(メタデータ) (2026-05-15T16:11:10Z) - AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation [70.80207977907908]
フローマップをベースとした,最初のノンステップビデオ拡散蒸留フレームワークであるAnyFlowを紹介した。
我々は、AnyFlowがいくつかの段階において、パフォーマンスの一致を達成するか、一貫性ベースの結果を上回ることを示す。
論文 参考訳(メタデータ) (2026-05-13T16:06:34Z) - One-Step Generative Modeling via Wasserstein Gradient Flows [56.266175641614986]
W-Flowは、単純な参照分布からサンプルをターゲットデータ分布からサンプルに変換するジェネレータを1ステップでトレーニングするフレームワークである。
我々は1ステップのImageNet 256$times$256 生成のための新しい技術状況を設定し、モードカバレッジとドメイン転送を改善した 1.29 FID を達成した。
論文 参考訳(メタデータ) (2026-05-12T08:29:44Z) - Riemannian MeanFlow for One-Step Generation on Manifolds [54.09734511705173]
フローマッチングは、生成モデルのシミュレーション不要なトレーニングを可能にする。
平均フローは、位置依存接空間に速度が存在する多様体値生成に拡張することができる。
球面, トーリ, SO(3)における実験は, 品質・効率のトレードオフを改善し, サンプリングコストを大幅に削減して, 競争力のある一段階サンプリングを実証した。
論文 参考訳(メタデータ) (2026-03-11T12:41:46Z) - FlowConsist: Make Your Flow Consistent with Real Trajectory [99.22869983378062]
現在の高速フロートレーニングパラダイムには,2つの根本的な問題がある,と我々は主張する。
ランダムにペアリングされたノイズデータサンプルから構築された条件付き速度は、系統的な軌跡ドリフトを導入する。
本研究では,高速フローにおける軌道整合性を実現するためのトレーニングフレームワークであるFlowConsistを提案する。
論文 参考訳(メタデータ) (2026-02-06T03:24:23Z) - Test-time scaling of diffusions with flow maps [68.79792714591564]
テスト時の拡散モデルを改善するための一般的なレシピは、報酬の勾配を拡散そのものの力学に導入することである。
フローマップを直接扱うことで,簡単な解を提案する。
本研究では, 流図と流速場の関係を利用して, 従来のテスト時間法よりも精度の高いフローマップトラジェクトリ・ティルティング (FMTT) アルゴリズムを構築した。
論文 参考訳(メタデータ) (2025-11-27T18:44:12Z) - Flow map matching with stochastic interpolants: A mathematical framework for consistency models [15.520853806024943]
フローマップマッチングは、基礎となる生成モデルの2時間フローマップを学ぶための原則化されたフレームワークである。
FMMは,高速サンプリングのための既存手法の幅広いクラスを統一し,拡張することを示す。
論文 参考訳(メタデータ) (2024-06-11T17:41:26Z) - Learning Stochastic Dynamical System via Flow Map Operator [3.9752110899603053]
計測データを用いて未知の力学系を学習するための数値的枠組みを提案する。
学習システムでは,2つのサブフローマップの重ね合わせとなるフローマップを定義する。
トレーニングデータは、まず決定論的サブマップを構築し、次にサブマップを構築するために使用される。
論文 参考訳(メタデータ) (2023-05-05T23:24:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。