論文の概要: $R_\text{dm}$: Re-conceptualizing Distribution Matching as a Reward for Diffusion Distillation
- arxiv url: http://arxiv.org/abs/2603.28460v2
- Date: Tue, 31 Mar 2026 14:28:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:02.459136
- Title: $R_\text{dm}$: Re-conceptualizing Distribution Matching as a Reward for Diffusion Distillation
- Title(参考訳): $R_\text{dm}$:拡散蒸留のリワードとしての分散マッチングの再概念化
- Abstract要約: 拡散モデルは最先端の生成性能を達成するが、その遅くて反復的なサンプリングプロセスによってボトルネックとなる。
最近のアプローチでは、強化学習(RL)を統合して、この天井を壊そうとしている。
本稿では,分散マッチングを報酬として再概念化し,$R_textdm$と表記する新しいパラダイムを提案する。
- 参考スコア(独自算出の注目度): 9.105357939499683
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion models achieve state-of-the-art generative performance but are fundamentally bottlenecked by their slow, iterative sampling process. While diffusion distillation techniques enable high-fidelity, few-step generation, traditional objectives often restrict the student's performance by anchoring it solely to the teacher. Recent approaches have attempted to break this ceiling by integrating Reinforcement Learning (RL), typically through a simple summation of distillation and RL objectives. In this work, we propose a novel paradigm by re-conceptualizing distribution matching as a reward, denoted as $R_\text{dm}$. This unified perspective bridges the algorithmic gap between Diffusion Matching Distillation (DMD) and RL, providing several primary benefits. (1) Enhanced Optimization Stability: We introduce Group Normalized Distribution Matching (GNDM), which adapts standard RL group normalization to stabilize $R_\text{dm}$ estimation. By leveraging group-mean statistics, GNDM establishes a more robust and effective optimization direction. (2) Seamless Reward Integration: Our reward-centric formulation inherently supports adaptive weighting mechanisms, allowing for the fluid combination of DMD with external reward models. (3) Improved Sampling Efficiency: By aligning with RL principles, the framework readily incorporates Importance Sampling (IS), leading to a significant boost in sampling efficiency. Extensive experiments demonstrate that GNDM outperforms vanilla DMD, reducing the FID by 1.87. Furthermore, our multi-reward variant, GNDMR, surpasses existing baselines by striking an optimal balance between aesthetic quality and fidelity, achieving a peak HPS of 30.37 and a low FID-SD of 12.21. Ultimately, $R_\text{dm}$ provides a flexible, stable, and efficient framework for real-time, high-fidelity synthesis. Codes are coming soon.
- Abstract(参考訳): 拡散モデルは最先端の生成性能を達成するが、その遅くて反復的なサンプリングプロセスによって根本的にボトルネックとなる。
拡散蒸留技術は高忠実な数ステップ生成を可能にするが、従来の目的は教師のみに固定することで生徒のパフォーマンスを制限することがしばしばある。
近年のアプローチでは, 蒸留とRL目標の単純な和で強化学習(RL)を統合することで, この天井を壊そうとしている。
本稿では,分布マッチングを報酬として再概念化し,$R_\text{dm}$と表記する新しいパラダイムを提案する。
この統合された視点は拡散整合蒸留(DMD)とRLのアルゴリズム的なギャップを埋め、いくつかの主要な利点をもたらす。
1) 最適化安定性の向上: 標準RL群正規化を適用して$R_\text{dm}$推定を安定化するグループ正規化分布マッチング(GNDM)を導入する。
グループ平均統計を利用して、GNDMはより堅牢で効果的な最適化の方向性を確立する。
2)Seamless Reward Integration:我々の報酬中心の定式化は,適応重み付け機構を本質的にサポートし,MDDと外部報酬モデルとの流体結合を可能にする。
(3) サンプリング効率の改善: RLの原則と整合することにより、Importance Smpling(IS)が容易に組み込まれ、サンプリング効率が大幅に向上する。
大規模な実験により、GNDMはバニラDMDより優れ、FIDが1.87減少することが示された。
さらに, マルチリワード型であるGNDMRは, 審美的品質と忠実度を最適にバランスさせ, ピークHPS30.37, 低FID-SD12.21を達成することにより, 既存のベースラインを超える。
最終的に$R_\text{dm}$は、リアルタイムで高忠実な合成のための柔軟で安定で効率的なフレームワークを提供する。
コードももうすぐ来る。
関連論文リスト
- DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models [55.01951088768769]
DiffusionOPDはオンライン政策蒸留(OPD)に基づく拡散モデルのための新しいマルチタスクトレーニングパラダイムである
本研究では,DiffusionOPDがトレーニング効率と最終性能において,マルチリワードRLとカスケードRLのベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-14T16:49:09Z) - Guiding Distribution Matching Distillation with Gradient-Based Reinforcement Learning [41.982957134224904]
拡散蒸留は、数ステップの発電では大きな可能性を秘めているが、サンプリング速度のために品質を犠牲にすることが多い。
GDMDは, 原画素出力よりも蒸留勾配を優先することで, 報酬機構を再定義する新しいフレームワークである。
我々のモデルは、その多段階教師の質を上回り、GenEvalと人為的基準の指標において、従来のDMDRよりもかなり上回っている。
論文 参考訳(メタデータ) (2026-04-21T02:57:13Z) - UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models [35.98585605462306]
RL と UDM を統合した最初のフレームワークである UDM-GRPO を提案する。
提案手法は2つの重要な知見により導かれる: (i) 最終クリーンサンプルをより正確で安定した最適化信号として扱い、 (ii) 拡散前処理による軌道の再構築により、予測経路と事前学習分布との整合性が向上する。
論文 参考訳(メタデータ) (2026-04-20T17:16:50Z) - MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation [24.618644100413018]
強化学習(RL)は自己回帰(AR)と拡散モデルにうまく応用されている。
RLをハイブリッドAR拡散フレームワークに拡張することは、インターリーブ推論とノイズの多いログ確率推定のために依然として難しい。
本研究では,マスク付き自己回帰モデル(MAR)について検討し,拡散ヘッドが運動学のトレーニングにおいて重要な役割を担っていることを示す。
論文 参考訳(メタデータ) (2026-04-08T11:30:35Z) - Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling [58.59644539594293]
DiNa-LRMは、雑音拡散状態に基づいて好み学習を直接定式化する拡散ネイティブ潜在報酬モデルである。
本手法は拡散ノイズ依存の不確実性を伴う雑音校正サーストンの可能性を導入する。
画像アライメントベンチマーク全体において、DiNa-LRMは既存の拡散ベースの報酬ベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2026-02-11T18:57:29Z) - Data-regularized Reinforcement Learning for Diffusion Models at Scale [99.01056178660538]
データ正規化拡散強化学習(Data-regularized Diffusion Reinforcement Learning, DDRL)は, フォワードKLの分散を利用して, 政策を非政治データ分布に固定する新しいフレームワークである。
100万時間以上のGPU実験と1万回の二重盲検評価により、DDRLは、RLで見られる報酬ハックを緩和しながら、報酬を大幅に改善することを示した。
論文 参考訳(メタデータ) (2025-12-03T23:45:07Z) - Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency [60.74505433956616]
連続時間一貫性モデル(sCM)は理論的に原理化され、学術規模の拡散を加速するために実証的に強力である。
まず並列性互換なFlashAttention-2 JVPカーネルを開発し、100億以上のパラメータと高次元ビデオタスクを持つモデル上でsCMトレーニングを可能にする。
本稿では, スコア蒸留を長軸正則化器として組み込んだスコア規則化連続時間一貫性モデル(rCM)を提案する。
論文 参考訳(メタデータ) (2025-10-09T16:45:30Z) - Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization [44.14678335188207]
拡散大言語モデル(dLLM)は自己回帰大言語モデル(AR-LLM)の代替として有望である
強化学習(RL)は、推論などの重要なタスクにおいて、AR-LLMと同等のパフォーマンスを達成するために、dLLMにとって重要なコンポーネントである。
本稿では,原理的かつ理論的に基礎付けられたRL微調整法である分散マッチングポリシー最適化(DMPO)を提案する。
論文 参考訳(メタデータ) (2025-10-09T13:59:50Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z) - Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video Synthesis [65.77083310980896]
本稿では, 実測値と偽測値の間に潜時予測を整列させる適応分布マッチング (ADM) を提案する。
提案手法は,DMD2と比較してSDXLの1ステップ性能に優れ,GPU時間が少ない。
SD3-Medium, SD3.5-Large, CogVideoX に多段階の ADM 蒸留を適用した実験では, 画像と映像の効率的な合成に向けた新しいベンチマークが設定された。
論文 参考訳(メタデータ) (2025-07-24T16:45:05Z) - VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL [28.95582264086289]
VAlue-based Reinforced Diffusion (VARD) は、中間状態から報酬の期待を予測する値関数を初めて学習する新しい手法である。
提案手法は,バックプロパゲーションによる効果的な,安定したトレーニングを可能にしつつ,事前訓練されたモデルに近づき続ける。
論文 参考訳(メタデータ) (2025-05-21T17:44:37Z) - Flow-GRPO: Training Flow Matching Models via Online RL [80.62659379624867]
本稿では,オンライン政策強化学習をフローマッチングモデルに統合する最初の方法であるFlow-GRPOを提案する。
提案手法では,(1)決定論的正規微分方程式を同値な微分方程式に変換するODE-to-SDE変換と,(2)推論ステップの数を維持しながらトレーニングの段階を短縮するDenoising Reduction戦略の2つの主要な戦略を用いる。
論文 参考訳(メタデータ) (2025-05-08T17:58:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。