Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher
Abstractの概要
本論文では、Flow Matchingモデル向けに教師モデルを必要としないオンポリシー蒸留フレームワークであるSelf-OPDを提案しています。個別のタスク特化型教師に依存する代わりに、モデルの決定論的な次状態予測を複数の確率的SDE候補に分岐させ、それらをロールアウトして決定論的な自己参照ベースラインと比較してスコアリングします。これにより得られた正規化ブランチアドバンテージは、方向を考慮した減衰を伴いつつ、モデルをより良い局所軌道へ引き寄せ、より悪い軌道から遠ざける全ブランチpull-push蒸留目的関数を通じて、密なステップごとの教師信号を提供します。さらに本論文では、パラメータ空間の勾配を直接混合することなくブランチの順位付けのために複数の報酬を組み合わせる、マルチ目的アライメントのための報酬レベルの融合も導入しています。
新規性
主な新規性は、生徒モデル自身の局所的なSDE探索と決定論的な自己参照ベースラインを密なステップごとの教師信号に変換することで、OPDにおける外部教師モデルを排除した点にあります。これは、方向を考慮した減衰を備えた全ブランチpull-push蒸留目的関数、およびマルチ目的アライメント時の勾配衝突を回避する報酬レベルの融合と組み合わされています。
成果
テキストレンダリング、構図生成、選好アライメントにわたる単一報酬および混合報酬のベンチマークにおいて、Self-OPDは従来の教師なしRLベースラインを上回り、教師ありOPD手法と同等以上の性能を達成しました。混合報酬設定では、同一テスト画像においてGenEvalの厳密/連続評価で0.9521/0.9691、OCRで0.9597、PickScoreで23.87、HPSv2で0.3214を達成し、全体のトレーニング実時間を削減しながら、これらの複合的な選好指標でDiffusionOPDを上回りました。
論文の注目点
- Self-OPDは、局所的なSDE分岐と決定論的な自己参照ロールアウトを組み合わせることで、タスク特化型の教師を必要とせずに密なステップごとの教師信号を生成します。
- 全ブランチpull-push損失は正と負の両方のブランチ全体で最適化を行い、KLに着想を得た遷移分散の正規化と勾配干渉を防ぐ方向認識型の減衰を組み込んでいます。
- 報酬レベルの融合は、複合的に正規化された報酬を用いてサンプリングされた軌道を順位付けすることでマルチ目的アライメントを処理し、GenEval、OCR、および選好ベンチマーク全体で強力な同時性能を達成します。
参考リンク
- arXiv: https://arxiv.org/abs/2608.26872v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2608.26872v1
- Hugging Face Papers: https://huggingface.co/papers/2608.26872
- GitHub: https://github.com/Shiy-Zhang/Self-OPD