論文の概要: DanceOPD: On-Policy Generative Field Distillation
- arxiv url: http://arxiv.org/abs/2606.27377v1
- Date: Thu, 25 Jun 2026 17:59:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.401032
- Title: DanceOPD: On-Policy Generative Field Distillation
- Title(参考訳): DanceOPD: オンデマンド生成フィールド蒸留
- Authors: Wei Zhou, Xiongwei Zhu, Zelin Xu, Bo Dong, Lixue Gong, Yongyuan Liang, Meng Chu, Leigang Qu, Lingdong Kong, Wei Liu, Tat-Seng Chua,
- Abstract要約: 本研究では,フローマッチングモデルのためのオンライン生成フィールド蒸留フレームワークであるDanceOPDを紹介する。
各サンプルを1つの機能フィールドにルーティングし、1つの低雑音の学生が引き起こした状態をクエリし、単純な速度MSE目的のトレーニングを行う。
T2I, 編集, リアリズム-フィールド吸収, CFG吸収に関する総合的な実験により, 提案手法は多機能化を図っている。
- 参考スコア(独自算出の注目度): 62.31008793798276
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Modern image generation demands a single model that unifies diverse capabilities, including text-to-image (T2I), local editing, and global editing. However, these capabilities are rarely naturally aligned and often conflict. For instance, editing tends to degrade T2I performance, while global and local editing interfere with each other. Consequently, effectively composing these capabilities has become a central challenge for image generation model training. To tackle this, we introduce DanceOPD, an on-policy generative field distillation framework for flow-matching models that routes each sample to one capability field, queries one low-noise student-induced state, and trains with a simple velocity MSE objective. With each capability source defined as a velocity field over the shared flow state space, the student learns from fields queried on its own rollout states to compose expert capabilities. This formulation also absorbs operator-defined fields such as classifier-free guidance. Comprehensive experiments on T2I, editing, realism-field absorption, and CFG absorption show that our approach improves multi-capability composition, strengthening target capabilities while preserving anchor generation quality. We believe this work establishes a practical route for generative field distillation in flow-matching models.
- Abstract(参考訳): 現代の画像生成には、テキスト・トゥ・イメージ(T2I)、ローカル編集、グローバル編集など、多様な機能を統一する単一モデルが必要である。
しかし、これらの能力は自然に一致し、しばしば矛盾することが多い。
例えば、編集はT2I性能を低下させる傾向があり、グローバルとローカルの編集は互いに干渉する。
その結果、これらの機能を効果的に構築することは、画像生成モデルのトレーニングにおいて中心的な課題となっている。
そこで我々はDanceOPDを紹介した。DanceOPDはフローマッチングモデルのためのオンライン生成フィールド蒸留フレームワークで、各サンプルを1つの能力場にルーティングし、低雑音の学生が引き起こす1つの状態をクエリし、単純な速度MSE目的の訓練を行う。
各能力源が共有フロー状態空間上の速度場として定義されることにより、学生は自身のロールアウトステートでクエリされたフィールドから専門家の能力を構成することができる。
この定式化は、分類子なしガイダンスのような演算子定義のフィールドも吸収する。
T2I, 編集, リアリズム-フィールド吸収, CFG吸収に関する総合的な実験により, 本手法は, アンカー生成品質を維持しつつ, 目標能力を強化し, 多機能化を図った。
本研究は,フローマッチングモデルにおける生成場蒸留の実践的方法を確立していると信じている。
関連論文リスト
- Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization [105.71296914822898]
単一ドメインの一般化は、目に見えない多くのドメインでうまく機能する堅牢なモデルを学ぶことを目的としている。
単一ドメインの一般化を達成するための有望な方向の1つは、データ拡張や画像生成を通じて、外部ドメイン(OOD)のトレーニングデータを生成することである。
本稿では,T2I基盤モデルを利用したトレーニングデータ作成手法を提案する。
論文 参考訳(メタデータ) (2026-06-19T20:46:24Z) - D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models [27.90064267850009]
ステップ蒸留拡散モデルのための新しい訓練パラダイムであるD-OPSDを提案する。
D-OPSDにより、モデルは元の数ステップのキャパシティを犠牲にすることなく、新しい概念、スタイルなどを学ぶことができる。
論文 参考訳(メタデータ) (2026-05-06T17:59:34Z) - Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image Diffusion [15.384896404310645]
制御可能なT2Iモデルにおける制御条件を適切に反映する訓練不要なDual Recursive Feedback(DRF)システムを提案する。
提案手法は高品質でセマンティック・コヒーレントで構造的に一貫した画像を生成する。
論文 参考訳(メタデータ) (2025-08-13T07:46:00Z) - UniSTD: Towards Unified Spatio-Temporal Learning across Diverse Disciplines [64.84631333071728]
本稿では,時間的モデリングのためのトランスフォーマーベースの統合フレームワークであるbfUnistageを紹介する。
我々の研究は、タスク固有の視覚テキストが時間学習のための一般化可能なモデルを構築することができることを示した。
また、時間的ダイナミクスを明示的に組み込むための時間的モジュールも導入する。
論文 参考訳(メタデータ) (2025-03-26T17:33:23Z) - DiffMoE: Dynamic Token Selection for Scalable Diffusion Transformers [86.5541501589166]
DiffMoEはバッチレベルのグローバルトークンプールで、トレーニング中に専門家がグローバルトークンの配布にアクセスできるようにする。
ImageNetベンチマークの拡散モデル間での最先端のパフォーマンスを実現する。
このアプローチの有効性は、クラス条件生成を超えて、テキスト・ツー・イメージ生成のようなより困難なタスクにも及んでいる。
論文 参考訳(メタデータ) (2025-03-18T17:57:07Z) - UniCombine: Unified Multi-Conditional Combination with Diffusion Transformer [24.159791066104358]
条件の組み合わせを扱える多条件制御可能な多条件生成フレームワークを提案する。
具体的には、新しいMMDiTアテンション機構を導入し、トレーニング可能なLoRAモジュールを組み込む。
また,マルチ条件生成タスク用に設計された最初のデータセットであるSubjectSpatial200Kを構築するための新しいパイプラインを提案する。
論文 参考訳(メタデータ) (2025-03-12T11:22:47Z) - Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models [52.84391764467939]
統一生成モデルは、テキストおよび画像生成において顕著な性能を示した。
複雑な画像生成の課題に対処するために、思考の連鎖(CoT)を統一生成モデルに導入する。
実験により、FoXは様々なT2Iベンチマークで既存の統一モデルよりも一貫して優れていることが示された。
論文 参考訳(メタデータ) (2025-03-03T08:36:16Z) - Stable Flow: Vital Layers for Training-Free Image Editing [74.52248787189302]
拡散モデルはコンテンツ合成と編集の分野に革命をもたらした。
最近のモデルでは、従来のUNetアーキテクチャをDiffusion Transformer (DiT)に置き換えている。
画像形成に欠かせないDiT内の「硝子層」を自動同定する手法を提案する。
次に、実画像編集を可能にするために、フローモデルのための改良された画像反転手法を提案する。
論文 参考訳(メタデータ) (2024-11-21T18:59:51Z) - Divide and Conquer: Rethinking the Training Paradigm of Neural Radiance
Fields [24.99410489251996]
ニューラルレイディアンス場(NeRF)は3Dシーンの高忠実度ビューに可能性を示した。
NeRFの標準トレーニングパラダイムは、トレーニングセットの各画像に等しい重要性を前提としている。
本稿では、現在のトレーニングパラダイムの意義を詳しく調べ、より優れたレンダリング品質のために再設計する。
論文 参考訳(メタデータ) (2024-01-29T13:23:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。