論文の概要: DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models
- arxiv url: http://arxiv.org/abs/2608.09233v2
- Date: Thu, 13 Aug 2026 04:14:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.542732
- Title: DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models
- Title(参考訳): DreOPD:フローマッチングモデルにおける劣化関連性外挿オンポリシィ蒸留
- Authors: Mingfeng Lin, Chengfei Cai, Lin Xu, Yuxiang Wei, Liang Han,
- Abstract要約: DreOPDは、フローマッチングモデルのための分解参照補間OPD法である。
DreOPD は OPD とマルチタスク RL のベースラインを平均性能で上回ることを示す。
- 参考スコア(独自算出の注目度): 11.299607850340607
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Flow-matching models are now a mainstream method to image generation, but its adaptation to diverse downstream scenarios typically relies on post-training, which may cause conflicts among task-specific optimization objectives. Reinforcement learning enables direct optimization of task-specific rewards beyond the original models, yet trajectory-level optimization may incur high-variance gradients and cross-task interference. On-policy distillation (OPD) offers dense and stable supervision on student rollouts, but conventional teacher matching remains imitation-based. We propose DreOPD, a Degraded-reference extrapolative OPD method for flow-matching models that bridges these two paradigms. Our DreOPD converts implicit reward extrapolation into closed-form velocity regression, enabling extrapolative post-training with the stability of OPD. It further uses a mildly degraded reference to strengthen the teacher-reference contrast, yielding a clearer extrapolation direction. Experiments on single- and multi-teacher settings show that DreOPD outperforms OPD and multi-task RL baselines in average performance, while surpassing specialized teachers on most metrics.
- Abstract(参考訳): フローマッチングモデルは現在、画像生成の主流となっているが、様々な下流シナリオへの適応は、通常、ポストトレーニングに依存しており、タスク固有の最適化目標間の衝突を引き起こす可能性がある。
強化学習は、元のモデルを超えてタスク固有の報酬を直接最適化することを可能にするが、軌跡レベルの最適化は高分散勾配とクロスタスク干渉を引き起こす可能性がある。
オンライン蒸留(OPD)は学生のロールアウトを厳密かつ安定的に管理するが、従来の教師マッチングは模擬方式のままである。
本稿では,これら2つのパラダイムを橋渡しする流れマッチングモデルに対して,DreOPDを提案する。
我々のDreOPDは暗黙の報酬外挿をクローズドフォームの速度回帰に変換し,OPDの安定性を考慮した補間後トレーニングを可能にした。
さらに、軽度に劣化した参照を使用して、教師-参照コントラストを強化し、より明確な外挿方向を生成する。
単体およびマルチ教師設定の実験では、DreOPDは平均的なパフォーマンスでPDとマルチタスクRLのベースラインを上回り、ほとんどのメトリクスで専門教師を上回っている。
関連論文リスト
- dOPSD: On-Policy Self-Distillation for Diffusion Language Models [52.60302464420127]
拡散大言語モデルは、マスキングシーケンスを反復的に復調することでテキストを生成する。
監督された微調整は非政治的であり、露出バイアスに悩まされる一方、強化学習はわずかにシーケンスレベルの報酬しか与えない。
On-policy Self-distillation (OPSD)は、学生と教師の両方に1つのモデルを用いて、有望な代替手段を提供する。
論文 参考訳(メタデータ) (2026-07-05T17:47:29Z) - DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models [55.01951088768769]
DiffusionOPDはオンライン政策蒸留(OPD)に基づく拡散モデルのための新しいマルチタスクトレーニングパラダイムである
本研究では,DiffusionOPDがトレーニング効率と最終性能において,マルチリワードRLとカスケードRLのベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-14T16:49:09Z) - Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models [65.89572755202245]
拡散言語モデル(DLM)は、より強力なグローバル認識と高い並列生成を提供する。
標準負のエビデンス下界(NELBO)に基づく教師付き微調整後のDLMは非効率である。
そこで本研究では,学習を推論の容易かつハードな構造に整合させる,自己蒸留軌道に基づくポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T09:39:06Z) - TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment [52.570581883709345]
本稿では,報酬を人間レベルの報酬分布マッチングに置き換えるトラジェクティブマッチングポリシバランス最適化(TMPO)を提案する。
TMPOは最先端の手法に対する生成的多様性を9.1%向上させ、下流および効率の指標で競合性能を達成する。
大規模フロープレフィックスのマルチトラックトレーニング時間を短縮するため、TMPOはDynamic Tree Smplingモデルを導入し、動的にスケジュールされたステップでトラジェクトリがdenoisingとブランチを共有する。
論文 参考訳(メタデータ) (2026-05-09T04:41:02Z) - Ranking-based Preference Optimization for Diffusion Models from Implicit User Feedback [28.40216934244641]
Diffusion Denoising Ranking Optimization (Diffusion-DRO) は、逆強化学習に基づく新しい好み学習フレームワークである。
拡散DROは、選好学習をランキング問題としてキャストすることで、報酬モデルへの依存を除去する。
オフラインの専門家によるデモとオンラインポリシー生成のネガティブなサンプルを統合することで、人間の好みを効果的に捉えることができる。
論文 参考訳(メタデータ) (2025-10-21T07:22:34Z) - Prior-Guided Diffusion Planning for Offline Reinforcement Learning [5.819784482811376]
Prior Guidance(PG)は、行動閉ざされた拡散モデルに先立って標準ガウスを置き換えた新しいサンプリングフレームワークである。
我々は,潜時空間における行動規則化を適用した効率的なトレーニング戦略を提案し,PGが多種多種多種多種多種多種多様オフラインRLベンチマークにおいて最先端拡散ポリシーやプランナーより優れていることを実証的に示す。
論文 参考訳(メタデータ) (2025-05-16T05:39:02Z) - Avoiding mode collapse in diffusion models fine-tuned with reinforcement learning [0.0]
強化学習(RL)による微調整基礎モデルは、下流の目標に整合する上で有望であることが証明されている。
拡散モデル (DM) の階層的性質を生かし, 各エポックでRL法で動的に訓練する。
HRFで訓練したモデルは、下流タスクにおける多様性の保存性を向上し、微調整の堅牢性を高め、平均報酬を損なうことなく達成できることが示される。
論文 参考訳(メタデータ) (2024-10-10T19:06:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。