論文の概要: Optimizing Visual Generative Models via Distribution-wise Rewards
- arxiv url: http://arxiv.org/abs/2607.02291v1
- Date: Thu, 02 Jul 2026 15:08:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.881554
- Title: Optimizing Visual Generative Models via Distribution-wise Rewards
- Title(参考訳): 分布ワイド・リワードによる視覚生成モデルの最適化
- Authors: Ruihang Li, Mengde Xu, Shuyang Gu, Leigang Qu, Fuli Feng, Han Hu, Wenjie Wang,
- Abstract要約: 本稿では,実世界のデータ分布との整合性を確保するために,分布ワイド報酬を用いた生成モデルを微調整する新しいフレームワークを提案する。
提案手法は,SiTでは5.77,EDM2では3.74から3.52まで,様々なベースモデルでFID-50Kを大幅に改善する。
- 参考スコア(独自算出の注目度): 57.46109819595665
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Conventional reinforcement learning strategies for visual generation typically employ sample-wise reward functions, yet this practice frequently results in reward hacking that degrades image diversity and introduces visual anomalies. To address these limitations, we present a novel framework that finetunes generative models using distribution-wise rewards, ensuring better alignment with real-world data distributions. Unlike rewards that evaluate samples individually, distribution-wise reward accounts for the data distribution of the samples, mitigating the mode collapse problem that occurs when all samples optimize towards the same direction independently. To overcome the prohibitive computational cost of estimating these rewards, we introduce a subset-replace strategy that efficiently provides reward signals by updating only a small subset of a generated reference set. Additionally, we apply RL to optimize post-hoc model merging coefficients, potentially mitigating the train-inference inconsistency caused by introducing stochastic differential equation (SDE) in regular RL practices. Extensive experiments show our approach significantly improves FID-50K across various base models, from 8.30 to 5.77 for SiT and from 3.74 to 3.52 for EDM2. Qualitative evaluation also confirms that our method enhances perceptual quality while preserving sample diversity.
- Abstract(参考訳): 視覚生成のための従来の強化学習戦略は、通常、サンプル単位の報酬関数を用いるが、このプラクティスは、画像の多様性を低下させ、視覚異常を導入する報酬ハックをもたらすことが多い。
これらの制約に対処するため,我々は,実世界のデータ分布との整合性を確保するために,分散的報酬を用いた生成モデルを微調整する新しいフレームワークを提案する。
サンプルを個別に評価する報酬とは異なり、分布的な報酬はサンプルのデータ分布を考慮し、全てのサンプルが独立して同じ方向に最適化されたときに発生するモード崩壊問題を緩和する。
これらの報酬を推定する禁断的な計算コストを克服するために、生成された参照セットの小さなサブセットだけを更新することで、報酬信号を効率的に提供するサブセット置換戦略を導入する。
さらに,RL をポストホックモデルマージ係数の最適化に適用し,通常の RL のプラクティスに確率微分方程式(SDE)を導入することによって生じる列車の干渉不整合を緩和する可能性がある。
広汎な実験により,SiTは8.30から5.77に,EDM2は3.74から3.52に,FID-50Kは様々なベースモデルで大幅に改善された。
また,本手法は,サンプルの多様性を保ちながら知覚品質を高めることも確認した。
関連論文リスト
- Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models [54.597200388738656]
Reward-based fine-tuningは、事前訓練された拡散またはフローベース生成モデルを、より高い逆サンプルに向けて操ることを目的としている。
報酬スコアマッチング (RSM) と呼ばれる共通フレームワークで記述できることが示される。
論文 参考訳(メタデータ) (2026-04-19T12:47:52Z) - Policy-based Tuning of Autoregressive Image Models with Instance- and Distribution-Level Rewards [16.135177543347773]
自己回帰モデル(AR)は画像生成に非常に効果的であるが、標準の最大形推定トレーニングではサンプルの品質と多様性を直接最適化することができない。
本稿では,トークンベースのAR推論をマルコフ決定プロセスとして,グループ相対ポリシー最適化によって最適化した軽量なRLフレームワークを提案する。
私たちの中核的な貢献は、新しい流通レベルのLeave-One-Out FID(LOO-FID)の報酬の導入です。
論文 参考訳(メタデータ) (2026-03-24T11:28:36Z) - Fine-Tuning Diffusion-Based Recommender Systems via Reinforcement Learning with Reward Function Optimization [21.769717387197943]
拡散モデルは、ユーザ・イテム相互作用の生成過程をモデル化することによって、最先端のパフォーマンスを提供する。
ReFiTはReinforcement Learning(RL)ベースのFin-Tuningを拡散型レコメンデータシステムに統合する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-11-10T10:38:16Z) - Understanding Sampler Stochasticity in Training Diffusion Models for RLHF [11.537564997052606]
本稿では,報酬ギャップを理論的に特徴づけ,一般拡散モデルに対して非空境界を与える。
実験では,テキスト・ツー・イメージ・モデルによる大規模な実験により,報酬ギャップがトレーニングよりも一定に狭まることが確認された。
論文 参考訳(メタデータ) (2025-10-12T19:08:38Z) - G$^2$RPO: Granular GRPO for Precise Reward in Flow Models [74.21206048155669]
本稿では,サンプリング方向の高精度かつ包括的な報酬評価を実現する新しいグラニュラー-GRPO(G$2$RPO)フレームワークを提案する。
複数の拡散スケールで計算された利点を集約するマルチグラニュラリティ・アドバンテージ・インテグレーション・モジュールを導入する。
G$2$RPOは既存のフローベースGRPOベースラインを著しく上回る。
論文 参考訳(メタデータ) (2025-10-02T12:57:12Z) - Flow-GRPO: Training Flow Matching Models via Online RL [80.62659379624867]
本稿では,オンライン政策強化学習をフローマッチングモデルに統合する最初の方法であるFlow-GRPOを提案する。
提案手法では,(1)決定論的正規微分方程式を同値な微分方程式に変換するODE-to-SDE変換と,(2)推論ステップの数を維持しながらトレーニングの段階を短縮するDenoising Reduction戦略の2つの主要な戦略を用いる。
論文 参考訳(メタデータ) (2025-05-08T17:58:45Z) - Distributionally Robust Models with Parametric Likelihood Ratios [123.05074253513935]
3つの単純なアイデアにより、より広いパラメトリックな確率比のクラスを用いてDROでモデルを訓練することができる。
パラメトリック逆数を用いてトレーニングしたモデルは、他のDROアプローチと比較して、サブポピュレーションシフトに対して一貫して頑健であることがわかった。
論文 参考訳(メタデータ) (2022-04-13T12:43:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。