Optimizing Visual Generative Models via Distribution-wise Rewards
Abstractの概要
本論文は、従来のサンプル単位の報酬ではなく、分布単位の報酬を用いる視覚生成モデルのための強化学習フレームワークを提案する。サンプル単位の報酬は報酬ハッキングを助長し、アーティファクトの発生や多様性の低下を招き得るが、分布レベルのシグナルは実際の画像分布との整合性をより適切に反映するというのがその動機である。このような報酬を計算可能にするため、著者らはロールアウト中に生成された参照セットの小さなサブセットのみを更新することでFIDベースの報酬を推定する、サブセット置換戦略を導入した。さらに、このサブセット置換報酬戦略を事後的なモデルマージ係数の最適化に適用し、SDEベースの強化学習トレーニングに伴う学習と推論の不一致の回避を図っている。
新規性
主な新規性は、視覚生成モデルの強化学習による最適化において、FIDに基づく分布単位の報酬シグナルを活用した点である。もう一つの機軸となる貢献は、密で低コストな報酬推定値を得るためのサブセット置換メカニズムの導入に加えて、ODEベースのサンプリング下で事後的なモデルマージ係数を最適化するために強化学習を利用したことである。
成果
ImageNet 256x256において、この手法はRLの適用によりSiT-XL/2のベースラインのFID-50Kを8.30から5.77へと改善し、FD_DINOv2スコアを230.39から164.88に低減させた。また、棄却サンプリングの変形版ではFID 6.98を達成した。ImageNet 512x512における事後的なモデルマージについて、RLを利用した最適化により、EDM2-XSのFIDは3.74から3.52へ、EDM2-SのFIDは2.57から2.52へとそれぞれ改善された。
論文の注目点
- 画像生成の強化学習におけるサンプル単位の報酬は報酬ハッキングを引き起こしやすく、これにより多様性が低下し、視覚的なアーティファクトが発生する。
- 新規のサブセット置換戦略は、生成された参照セット内の小さなサブセットを置き換えることで分布単位の報酬を近似し、FIDベースの報酬が抱える甚大な計算コストとフィードバックの疎な性質の問題を解決する。
- 提案されたフレームワークは、直接的なRLファインチューニングとRLを利用した事後的なモデルマージの両方に適用され、SiTおよびEDM2アーキテクチャ全体で一貫した定量的な改善を実証した。
参考リンク
- arXiv: https://arxiv.org/abs/2607.02291v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2607.02291v1
- Hugging Face Papers: https://huggingface.co/papers/2607.02291