DanceOPD: On-Policy Generative Field Distillation
Abstractの概要
DanceOPDは、テキストからの画像生成や様々な形式の編集など、複数の機能を単一の生徒モデルに統合することを目的とした、フロー・マッチング画像モデル向けのオンポリシー生成場蒸留(on-policy generative field distillation)フレームワークである。本手法は、固定された各機能ソースを共有された生成状態空間上の速度場として扱い、各訓練サンプルを正確に一つの機能場にルーティングし、オフポリシー状態ではなく生徒自身のロールアウト状態に対して教師信号を照会する。さらに、サンプルごとに単一の低ノイズかつセマンティック側のクエリを使用し、単純な速度MSE目的関数を用いて生徒モデルを訓練する。本論文では、これらの設計選択を、複数機能の蒸留における3つのアライメント問題(ターゲット場の曖昧性、状態分布の不一致、軌跡とクエリの相関)に対する解決策として位置付けている。
新規性
本論文の主な特徴は、複数機能の画像生成を、同時学習、パラメータ統合、または推論時の合成ではなく、ルーティングされた機能場に対するオンポリシー生成場蒸留として定式化している点である。サンプルの厳密なルーティング、生徒状態に対するオンポリシークエリ、および単一のセマンティック側低ノイズクエリという具体的な組み合わせが、本手法の中核的な貢献であると考えられる。
成果
T2Iと編集、局所編集と大域編集、リアリズム場の吸収、および分類器フリーガイダンス(CFG)の吸収などの様々な設定において、実験結果はDanceOPDがアンカーの生成品質を維持しつつターゲット機能を全般的に強化することを示している。また、再実装されたOPDベースラインやオフポリシー蒸留を上回る成果が報告されており、そのアブレーション研究により、ソフトな教師の混合や、同一ロールアウト中の密な教師信号、あるいはその他の重み付き目的関数よりも、厳密なルーティング、低ノイズのセマンティック側クエリ、単純な速度MSEがより強力なデフォルト設定であることが示されている。
論文の注目点
- DanceOPDは、各サンプルを一つの固定された機能場にルーティングし、生徒モデル自体のロールアウト状態に教師信号を与えることで、競合するターゲット機能が直接平均化されるのを避けている。
- 本手法は、相関する密な軌跡の教師信号に対する実用的な対応として、サンプルごとに単一の低ノイズなセマンティック側クエリと速度MSE損失を使用する。
- 実験結果は、T2Iと編集、局所および大域編集、リアリズム吸収、CFG吸収を含め、機能の合成と場の吸収の両方をカバーしている。
参考リンク
- arXiv: https://arxiv.org/abs/2606.27377v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2606.27377v1
- Hugging Face Papers: https://huggingface.co/papers/2606.27377
- Project: https://DanceOPD.github.io