Representation Distribution Matching for One-Step Visual Generation
Abstractの概要
本論文は、凍結された事前学習済みエンコーダの下で生成と参照の特徴量分布を一致させることにより、1ステップの視覚生成器を訓練するフレームワークである表現分布マッチング(RDM)について研究しています。手法の空間を、分布がどのように比較されるか、また比較にどの表現が使用されるかという2つの設計軸に沿って整理しています。制御された実験を通じて、元の学習データ全体の参照に対するNyströmベースの引力項とバッチ内の正確な反発項を用いて推定された場合にMMDが効果的になること、新しい大きな生成バッチが重要であること、単一のエンコーダのみでのマッチングは抜け道になり得ることを主張しています。これらの設計の選択を組み合わせた改良型RDM(iRDM)を提案し、ImageNetでの1ステップ画像生成、およびテキストから画像への生成におけるFLUX.2 [klein]の4ステップから1ステップへの事後学習において評価を行っています。
新規性
本論文の主な新規性は、単一の経験的な手法を提示するのではなく、1ステップ生成の表現分布マッチングに関する体系的な設計空間の分析を行った点です。また、NyströmベースのMMD推定、新しい大きな生成バッチ、条件付きタスクにおける画像とテキストの同時マッチング、複数エンコーダ間の制約付きバランス調整を組み合わせたiRDMと、スライスドWasserstein距離に基づく複数エンコーダ評価指標を導入しています。
成果
ImageNet-256において、iRDMはSW_r^14 = 1.30という1ステップの過去最高性能を達成し、PickScoreによる一致サンプルの71.2%で従来の最高の1ステップ生成器よりも選好されました。テキストから画像への生成の事後学習では、同じ手法を用いて約90時間のH200 GPU稼働で4ステップのFLUX.2 [klein]を1ステップモデルに変換し、GenEval(0.826対0.794)およびPickScore(22.76対22.58)において4ステップ版を上回りました。アブレーション実験により、Nyström-MMD、大きな新しい生成バッチ、画像とテキストの同時マッチング、複数エンコーダの制約付き重み付けの役割がさらに裏付けられています。
論文の注目点
- 本論文はRDMの2つの主要な設計軸(分布の比較戦略と表現の選択)を特定し、条件を統制したアブレーション実験を通じてこれらを研究している。
- 単一エンコーダのマッチングでは、生成器がある表現に過剰適合しつつも視覚的な欠陥を残す可能性があるため不十分だと主張し、複数エンコーダにわたるバランスの取れた最適化の動機付けとしている。
- 提案されたiRDM手法は、ImageNetでの1ステップ画像生成品質を向上させ、同等以上のプロンプト追従性や選好される指標を伴うFLUX.2 [klein]の1ステップでの事後学習を可能にする。
参考リンク
- arXiv: https://arxiv.org/abs/2607.02375v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2607.02375v1
- Hugging Face Papers: https://huggingface.co/papers/2607.02375
- Project: https://alan-lanfeng.github.io/rdm/