論文の概要: Two Halves are More than One: Phase-wise Velocity Distillation for Fast and High-Quality Image Generation
- arxiv url: http://arxiv.org/abs/2610.08070v1
- Date: Tue, 06 Oct 2026 10:03:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.926831
- Title: Two Halves are More than One: Phase-wise Velocity Distillation for Fast and High-Quality Image Generation
- Title(参考訳): 2つのハーフは1つ以上の:高速かつ高品質な画像生成のための位相ワイド速度蒸留
- Abstract要約: 単一のフルバックボーンフォワード計算予算内での高品質な画像生成は依然として困難である。
生成タイムラインを粗大かつ微細な位相に分割する相速度蒸留(PVD)を提案する。
2つの位相特化専門家の使用は、1人のフルサイズのモノリシックな学生より優れていることを示す。
- 参考スコア(独自算出の注目度): 23.916269607539686
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent diffusion-based image generation backbones have grown substantially in scale, making the network inference cost increase rapidly. While diffusion distillation techniques can reduce the number of inference steps, high-quality image generation within a single full-backbone-forward compute budget remains challenging. Existing one-step methods typically allocate this budget to a single evaluation of a monolithic student. However, approximating the heterogeneous coarse-to-fine transport with a single monolithic mapping is difficult and often leads to over-smoothed outputs. To address this issue, we propose Phase-wise Velocity Distillation (PVD), which partitions the generation timeline into a coarse and a fine phase, and models the transition within each phase via the average velocity. A dedicated half-sized expert is assigned to each phase, decoupling structural composition from detail refinement while keeping the cumulative computation equivalent to one full-backbone forward pass. We show that the use of two half-sized phase-specific experts outperforms a single full-size monolithic student. On class-conditional image generation, PVD achieves an FID of 1.48 on ImageNet 256 x 256. On more complex text-to-image (T2I) tasks, PVD-distilled models (Stable Diffusion 3.5-Medium, FLUX.1-dev, Qwen-Image) produce results competitive with their multi-step teachers, significantly outperforming prior distillation methods. Moreover, across the evaluated T2I backbones, PVD reduces active parameters by 49.10-50.89% and peak VRAM by 45.76-48.36% compared to the corresponding teachers. Source code and distilled models are available at https://github.com/PolyU-VCLab/PVD.
- Abstract(参考訳): 近年,拡散型画像生成バックボーンの大規模化が進み,ネットワーク推論コストが急速に向上している。
拡散蒸留技術は推論ステップの数を削減できるが、1つのフルバックボーンフォワード計算予算内での高品質な画像生成は依然として困難である。
既存のワンステップの手法は、通常、この予算をモノリシックな学生の1つの評価に割り当てる。
しかし、単一モノリシックマッピングで不均一な粗粒輸送を近似することは困難であり、しばしば過度に滑らかに出力される。
この問題に対処するため, 生成タイムラインを粗大かつ微細な位相に分割し, 平均速度による各位相内遷移をモデル化するPVDを提案する。
専用ハーフサイズのエキスパートが各フェーズに割り当てられ、1つのフルバックボーンフォワードパスに相当する累積計算を維持しながら、詳細な精細化から構造組成を分離する。
2つの位相特化専門家の使用は、1人のフルサイズのモノリシックな学生より優れていることを示す。
クラス条件の画像生成では、PVD は ImageNet 256 x 256 上で 1.48 の FID を達成する。
より複雑なテキスト・トゥ・イメージ(T2I)タスクでは、PVDで蒸留したモデル(安定拡散3.5-Medium、FLUX.1-dev、Qwen-Image)が、多段階の教師と競合する結果をもたらし、蒸留前の方法よりも大幅に優れている。
さらに、評価されたT2Iバックボーン全体で、PVDは活性パラメータを49.10-50.89%、ピークVRAMを45.76-48.36%削減する。
ソースコードと蒸留されたモデルはhttps://github.com/PolyU-VCLab/PVDで入手できる。
関連論文リスト
- One-step Latent-free Image Generation with Pixel Mean Flows [22.294629970410508]
ネットワーク出力空間と損失空間を別々に定式化する「ピクセル平均フロー」(pMF)を提案する。
pMFは、256x256解像度 (2.22 FID) と512x512解像度 (2.48 FID) でImageNet上の1ステップの潜時生成の強力な結果を得る
論文 参考訳(メタデータ) (2026-01-29T18:59:56Z) - Few-Step Diffusion via Score identity Distillation [67.07985339442703]
拡散蒸留は, テキスト・ツー・イメージ(T2I)拡散モデルを促進するための有望な戦略として浮上している。
既存の方法は、高分解能T2I拡散モデルを蒸留する際に、実像や教師合成画像に頼っている。
教師のCFGを無効にし、偽スコアネットワークでテキストコンディショニングを除去するZero-CFGと、偽スコアネットワークで否定的なCFGを適用するAnti-CFGの2つの新しいガイダンス戦略を提案する。
論文 参考訳(メタデータ) (2025-05-19T03:45:16Z) - Improved Distribution Matching Distillation for Fast Image Synthesis [54.72356560597428]
この制限を解除し、MDDトレーニングを改善する一連の技術であるMDD2を紹介する。
まず、回帰損失と高価なデータセット構築の必要性を排除します。
第2に, GAN損失を蒸留工程に統合し, 生成した試料と実画像との識別を行う。
論文 参考訳(メタデータ) (2024-05-23T17:59:49Z) - One-step Diffusion with Distribution Matching Distillation [54.723565605974294]
本稿では,拡散モデルを1ステップ画像生成器に変換する手法である分散マッチング蒸留(DMD)を紹介する。
約KLの発散を最小化することにより,拡散モデルと分布レベルで一致した一段階画像生成装置を強制する。
提案手法は,イメージネット64x64では2.62 FID,ゼロショットCOCO-30kでは11.49 FIDに到達した。
論文 参考訳(メタデータ) (2023-11-30T18:59:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。