論文の概要: DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
- arxiv url: http://arxiv.org/abs/2605.15055v1
- Date: Thu, 14 May 2026 16:49:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.95911
- Title: DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
- Title(参考訳): DiffusionOPD: 拡散モデルにおけるオンライン蒸留の統一的展望
- Authors: Quanhao Li, Junqiu Yu, Kaixun Jiang, Yujie Wei, Zhen Xing, Pandeng Li, Ruihang Chu, Shiwei Zhang, Yu Liu, Zuxuan Wu,
- Abstract要約: DiffusionOPDはオンライン政策蒸留(OPD)に基づく拡散モデルのための新しいマルチタスクトレーニングパラダイムである
本研究では,DiffusionOPDがトレーニング効率と最終性能において,マルチリワードRLとカスケードRLのベースラインを一貫して上回っていることを示す。
- 参考スコア(独自算出の注目度): 55.01951088768769
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning has emerged as a powerful tool for improving diffusion-based text-to-image models, but existing methods are largely limited to single-task optimization. Extending RL to multiple tasks is challenging: joint optimization suffers from cross-task interference and imbalance, while cascade RL is cumbersome and prone to catastrophic forgetting. We propose DiffusionOPD, a new multi-task training paradigm for diffusion models based on Online Policy Distillation (OPD). DiffusionOPD first trains task-specific teachers independently, then distills their capabilities into a unified student along the student own rollout trajectories. This decouples single-task exploration from multi-task integration and avoids the optimization burden of solving all tasks jointly from scratch. Theoretically, we lift the OPD framework from discrete tokens to continuous-state Markov processes, deriving a closed-form per-step KL objective that unifies both stochastic SDE and deterministic ODE refinement via mean-matching. We formally and empirically demonstrate that this analytic gradient provides lower variance and better generality compared to conventional PPO-style policy gradients. Extensive experiments show that DiffusionOPD consistently surpasses both multi-reward RL and cascade RL baselines in training efficiency and final performance, while achieving state-of-the-art results on all evaluated benchmarks.
- Abstract(参考訳): 強化学習は拡散に基づくテキスト・ツー・イメージモデルを改善する強力なツールとして登場したが、既存の手法はシングルタスクの最適化に限られている。
RLを複数のタスクに拡張することは難しい: 共同最適化はクロスタスクの干渉と不均衡に悩まされ、カスケードRLは厄介で破滅的な忘れがちである。
オンライン政策蒸留(OPD)に基づく拡散モデルのためのマルチタスク学習パラダイムであるDiffusionOPDを提案する。
DiffusionOPDは、まずタスク固有の教師を個別に訓練し、その後、学生自身のロールアウト軌道に沿って、その能力を統一された学生に蒸留する。
これにより、マルチタスク統合からのシングルタスク探索を分離し、スクラッチからすべてのタスクを共同で解決する際の最適化の負担を回避することができる。
理論的には、OPDフレームワークを離散トークンから連続状態マルコフプロセスに引き上げ、確率的SDEと平均マッチングによる決定論的ODE洗練の両方を統一する閉形式毎ステップKLの目的を導出する。
我々は、この解析勾配が従来のPPOスタイルの政策勾配と比較して、より低い分散とより良い一般性をもたらすことを正式に実証した。
拡張実験により、DiffusionOPDはトレーニング効率と最終性能において、マルチリワードRLとカスケードRLのベースラインを一貫して上回り、評価されたすべてのベンチマークで最先端の結果が得られた。
関連論文リスト
- Enhancing Diffusion-based Restoration Models via Difficulty-Adaptive Reinforcement Learning with IQA Reward [93.04811239892852]
強化学習(Reinforcement Learning, RL)は近年, 拡散モデルに組み入れられている。
本稿では,拡散型修復モデルにRLを効果的に組み込む方法について検討する。
論文 参考訳(メタデータ) (2025-11-03T14:57:57Z) - Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces [57.466101098183884]
強化学習(Reinforcement Learning, RL)は、現実の多くの問題に共通する大規模なアクション空間にスケールするために苦労する。
本稿では、複雑な環境下での高効率なポリシーとして、離散拡散モデルを訓練するための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-26T21:53:36Z) - VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL [28.95582264086289]
VAlue-based Reinforced Diffusion (VARD) は、中間状態から報酬の期待を予測する値関数を初めて学習する新しい手法である。
提案手法は,バックプロパゲーションによる効果的な,安定したトレーニングを可能にしつつ,事前訓練されたモデルに近づき続ける。
論文 参考訳(メタデータ) (2025-05-21T17:44:37Z) - Consistency Trajectory Matching for One-Step Generative Super-Resolution [27.414903007958657]
現在の拡散に基づく超解像法は、高い推論オーバーヘッドを犠牲にして可換性を実現する。
超解法のための一貫性トラジェクトリマッチング (CTMSR) を提案する。これは蒸留不要戦略であり、フォトリアリスティックSRを1ステップで生成できる。
提案手法は, 合成データセットと実データセットの両方において, 同等あるいはそれ以上の能力が得られることを示す。
論文 参考訳(メタデータ) (2025-03-26T09:20:42Z) - Taming Flow Matching with Unbalanced Optimal Transport into Fast Pansharpening [10.23957420290553]
本稿では,一段階の高品位パンシャーピングを実現するための最適輸送フローマッチングフレームワークを提案する。
OTFMフレームワークは、パンシャーピング制約の厳格な遵守を維持しつつ、シミュレーション不要なトレーニングとシングルステップ推論を可能にする。
論文 参考訳(メタデータ) (2025-03-19T08:10:49Z) - Diffusion Policies as an Expressive Policy Class for Offline
Reinforcement Learning [70.20191211010847]
オフライン強化学習(RL)は、以前に収集した静的データセットを使って最適なポリシーを学ぶことを目的としている。
本稿では,条件付き拡散モデルを用いたディフュージョンQ-ラーニング(Diffusion-QL)を提案する。
本手法はD4RLベンチマークタスクの大部分において最先端の性能を実現することができることを示す。
論文 参考訳(メタデータ) (2022-08-12T09:54:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。