論文の概要: Step Back to Move Forward: Reflection-Aware Preference Optimization for Visual Generation
- arxiv url: http://arxiv.org/abs/2609.04282v1
- Date: Thu, 03 Sep 2026 04:37:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.765173
- Title: Step Back to Move Forward: Reflection-Aware Preference Optimization for Visual Generation
- Title(参考訳): Step Back to Move Forward: ビジュアルジェネレーションのための反射認識推論最適化
- Abstract要約: Reflection-Aware GRPO は拡散生成モデルのための新しい RL ベースのリフレクションアライメントフレームワークである。
本研究では, 拡散過程を弱い推定器で反転させることにより, 中間サンプリング軌道を補正する拡散反射法を提案する。
また,これらの整形軌跡を暗黙的に抽出し,探索による探索の利点を内在化できるようにするために,対物経路合成を導入している。
- 参考スコア(独自算出の注目度): 12.58348084349179
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion models have become the mainstream paradigm for modern visual generation and have substantially advanced multimedia content synthesis, especially in text-to-image and text-to-video tasks. To further align such generative models with human preferences, reinforcement learning (RL) has recently shown strong potential as a post-training strategy. Nevertheless, existing policy gradient-based methods often explore inefficiently, making them vulnerable to local optima that may degrade semantic faithfulness and visual realism. To address these challenges, we present Reflection-Aware GRPO (RA-GRPO), a new RL-based preference alignment framework for diffusion generative models. The core idea is to improve "forward" generation by incorporating "backward" reflection during optimization. We first introduce Diffusion Reflection, which rectifies intermediate sampling trajectories by inverting the diffusion process with a weak estimator, guiding latent states toward higher-probability regions of the true data manifold. Furthermore, we introduce Counterfactual Path Synthesis to implicitly distill these rectified trajectories into the policy, enabling the model to internalize the benefits of search-based exploration without incurring inference-time overhead. Extensive experiments on T2I and T2V models demonstrate that RA-GRPO significantly outperforms existing methods, particularly in mitigating reward hacking and improving generalization. The method remains architecture-agnostic and integrates seamlessly with standard pipelines, suggesting a promising direction for stable preference alignment.
- Abstract(参考訳): 拡散モデルは、現代視覚生成の主流パラダイムとなり、特にテキスト・ツー・イメージやテキスト・トゥ・ビデオタスクにおいて、かなり高度なマルチメディアコンテンツ合成が行われている。
このような生成モデルを人間の好みに合わせるために、強化学習(RL)はポストトレーニング戦略として最近強い可能性を示している。
それでも、既存の政策勾配に基づく手法は、しばしば非効率に探索し、意味的忠実性や視覚的リアリズムを低下させるような局所最適性に弱い。
これらの課題に対処するために、拡散生成モデルのための新しいRLベースの優先アライメントフレームワークであるReflection-Aware GRPO(RA-GRPO)を提案する。
中心となる考え方は、最適化中に"後方"のリフレクションを組み込むことで、"前方"生成を改善することである。
まずDiffusion Reflectionを導入し、弱い推定器で拡散過程を反転させ、真のデータ多様体の高確率領域へ誘導することで、中間サンプリング軌道を補正する。
さらに,これらの整形軌跡を暗黙的に抽出し,推測時間オーバーヘッドを発生させることなく探索に基づく探索の利点を内部化できるようにする。
T2IモデルとT2Vモデルに対する大規模な実験により、RA-GRPOは既存の手法、特に報酬ハッキングの軽減と一般化の改善において著しく優れていることが示された。
この手法はアーキテクチャに依存しないままであり、標準パイプラインとシームレスに統合する。
関連論文リスト
- Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping [66.25536973294726]
テキスト・トゥ・イメージ(T2I)モデルのポストトレーニング手法はハッキングに報いる傾向がある。
SLAS(Super-Linear Advantage Shaping)は、地方政策の分野を再考する。
SLASは、DanceGRPOベースラインを複数のバックボーンとベンチマークで一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-11T17:59:25Z) - Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers [12.948398661304184]
Diffusion-APOは、ビデオ拡散モデルと人間の意図を一致させる軌跡認識アルゴリズムである。
オンラインランキング、半オンラインアンカー、オフラインリファインメント、蒸留対応ドリフト補正を統合した統一かつモジュール化されたRLHFフレームワークを導入する。
本研究では,Diffusion-APOが視覚的品質と指示の基準線を一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-08T09:37:46Z) - S-GRPO: Unified Post-Training for Large Vision-Language Models [11.901218794806796]
我々はLVLM(Large Vision-Language Models)適応のためのS-GRPO(Supervised Group Relative Policy Optimization)を提案する。
S-GRPOは、模擬学習の指導を選好最適化の多軌道探索に統合する。
監督ファインチューニング(SFT)と強化学習(RL)のギャップを優雅に埋める
論文 参考訳(メタデータ) (2026-04-17T08:39:07Z) - Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations [98.44542103979735]
勾配勾配降下法(SGD)とアダム(Adam)による1次勾配勾配降下法は、現代の訓練パイプラインの基礎となる。
大規模モデルトレーニング、厳格なプライバシ要件、分散学習パラダイムは、プライバシ保護とメモリ効率に関する従来のアプローチにおける重要な制限を明らかにする。
深層学習最適化アルゴリズムの進化軌道を振り返って分析し、様々なモデルアーキテクチャやトレーニングシナリオの主流を包括的に評価する。
我々は、重要な新興トレンドと基本設計のトレードオフを抽出し、将来の研究の有望な方向性を示唆する。
論文 参考訳(メタデータ) (2026-04-14T17:01:36Z) - UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation [51.41441081823758]
インターリーブドジェネレーションが可能な統一モデルが有望なパラダイムとして登場している。
インターリーブ・ジェネレーションに適した統合強化学習フレームワークを提案する。
実験により,この統合学習レシピは推論による画像生成品質を著しく向上させることが示された。
論文 参考訳(メタデータ) (2026-03-24T17:59:17Z) - Toward Generalizable Deblurring: Leveraging Massive Blur Priors with Linear Attention for Real-World Scenarios [9.82847623835017]
GLOWDeblurは、畳み込みベースの事前再構成とドメインアライメントモジュールと軽量な拡散バックボーンを組み合わせた、一般化可能なreaL-wOrld Light Weight Deblurモデルである。
本稿では,Blur Pattern Pretraining (BPP)を提案する。
我々はさらに、高度劣化下でぼやけた前兆を強化するためにMoSeG(MoSeG)を導入し、それをGLOWDeblur(GLOWDeblur)に統合する。
論文 参考訳(メタデータ) (2026-01-10T11:01:31Z) - Generative Actor Critic [74.04971271003869]
Generative Actor Critic (GAC) は、軌道上での関節分布の生成モデル学習として、テキスト政治評価を反映して、シーケンシャルな意思決定を分離する新しいフレームワークである。
Gym-MuJoCoとMaze2Dベンチマークの実験では、GACの強いオフライン性能と、最先端の手法と比較してオフラインからオフラインへの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-12-25T06:31:11Z) - Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment [54.17386822940477]
PromptLoopはプラグインとプレイの強化学習フレームワークで、遅延フィードバックをステップワイドな即興改善に組み込む。
この設計は、プロンプトベースのアライメントの柔軟性と一般性を維持しながら、拡散RLアプローチと構造的な類似性を実現する。
論文 参考訳(メタデータ) (2025-10-01T02:18:58Z) - Rethinking Direct Preference Optimization in Diffusion Models [15.358181258656229]
拡散に基づく選好最適化を改良する新しい手法を提案する。
まず、凍結参照モデルを緩和し、探索を促進する安定した参照モデル更新戦略を導入する。
第2に、タイムステップ間の報酬スケール不均衡問題を緩和するタイムステップ対応トレーニング戦略を提案する。
論文 参考訳(メタデータ) (2025-05-24T15:14:45Z) - A Survey of Direct Preference Optimization [103.59317151002693]
LLM(Large Language Models)は、前例のない生成能力を示す。
人的価値との整合性は、有用で無害なデプロイメントを保証する上で、依然として重要です。
直接優先度最適化(DPO)は、最近、合理化された代替案として注目されている。
論文 参考訳(メタデータ) (2025-03-12T08:45:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。