論文の概要: Bridging Diffusion Pruning and Step Distillation with Teacher-Aligned Repair
- arxiv url: http://arxiv.org/abs/2607.06335v1
- Date: Tue, 07 Jul 2026 14:30:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.553004
- Title: Bridging Diffusion Pruning and Step Distillation with Teacher-Aligned Repair
- Title(参考訳): 教師が指定した補修作業によるブリッジング拡散処理とステップ蒸留
- Abstract要約: 拡散モデルは高品質な画像を生成するが、その推論コストは2つの情報源から来ている。
本稿では, 再運転後の再訓練を段階蒸留に置き換えるかどうかを問う。
- 参考スコア(独自算出の注目度): 3.683306782278835
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion models generate high-quality images, but their inference cost comes from two sources: large denoising networks and repeated denoising steps. Existing compression pipelines usually attack these costs separately. Pruning reduces the network, but most pruning methods still rely on a long post-pruning retraining stage to recover a many-step sampler. Step distillation reduces the number of denoising steps, but it usually assumes a student that can already follow the teacher well enough to receive useful distillation gradients. This paper asks whether post-pruning retraining can be replaced by step distillation. We find that the direct replacement fails: after pruning an EDM2-XS teacher, starting SiDA from the pruned checkpoint produces unusable samples. We introduce a short teacher-alignment repair stage as a bridge between pruning and step distillation. The bridge matches the pruned generator to the teacher on noisy real-image latents, then hands the repaired checkpoint to one-step distillation. On ImageNet-512, the original EDM2-XS baseline uses 124.713M parameters and 63 network evaluations, reaching an FID of 3.53. With a suitable distillation objective, our 20% pruned one-step generator uses 98.826M parameters and one network evaluation, reaching an FID of 3.12. With 30% pruning, the model uses 88.029M parameters and one network evaluation, with an FID of 4.26.
- Abstract(参考訳): 拡散モデルは高品質な画像を生成するが、その推論コストは2つの情報源から来ている。
既存の圧縮パイプラインは通常、これらのコストを別々に攻撃する。
プルーニングはネットワークを減少させるが、ほとんどのプルーニング手法は、多くのステップのサンプルを回収するために長い再訓練段階に依存している。
ステップ蒸留は、デノナイジングステップの数を減少させるが、通常は、教師に十分追随できる学生が、有用な蒸留勾配を得られると仮定する。
本稿では, 再運転後の再訓練を段階蒸留に置き換えるかどうかを問う。
EDM2-XS教師をプルーニングした後、プルーニングチェックポイントからSiDAを開始すると、使用不能なサンプルが生成される。
本研究では, プルーニングとステップ蒸留の橋梁として, 短時間の教師調整修復段階を導入する。
橋は、刈り取られた発電機をノイズの多い実像の潜伏者で教師と一致させ、修理されたチェックポイントを1段階の蒸留に渡す。
ImageNet-512では、オリジナルのEDM2-XSベースラインは124.713Mパラメータと63のネットワーク評価を使用し、FIDは3.53に達した。
適度な蒸留を目標とし,20%の精製1段階発生装置は98.826Mパラメータと1つのネットワーク評価を用い,FIDは3.12である。
30%のプルーニングで88.029Mパラメータと1つのネットワーク評価を使用し、FIDは4.26である。
関連論文リスト
- Better Starts, Better Ends: Bootstrapped Iterative Self-Reasoning Distillation for Compressed Reasoning [27.08087977200613]
BIRD(Bootstrapped Iterative Self-Reasoning Distillation)は、2段階の自己焼成蒸留法である。
まず、簡潔な指示の下でベースモデルから簡潔な解をサンプリングし、答えの正しいトレースのみを保持し、軽量なプロンプトスイッチSFTステップを実行する。
MATH-500 や AIME のベンチマーク上でのオンライン蒸留やコールドスタートよりも高い精度・効率のトレードオフを実現している。
論文 参考訳(メタデータ) (2026-07-17T08:15:35Z) - Reference-Based Distillation Detection in LLMs [17.877444310396758]
本稿では,参照型メンバシップ推論に基づく蒸留検出手法を提案する。
制御された蒸留実験と実世界のモデルの両方にまたがるハイブリッド評価を開発した。
この手法を現代モデルに適用すると、QwQ、DeepSeek-R1、GPT-OSSを含む蒸留関係に関する新たな証拠が得られる。
論文 参考訳(メタデータ) (2026-06-19T06:59:19Z) - High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation [66.19462276967869]
4-8段階の拡散蒸留は徐々に成熟していったが、さらに2段階に推し進めるのは難しい。
8ステップのZ画像ターボ教師から抽出した高品質な2ステップ画像生成モデルであるZ画像Turbo++を紹介する。
論文 参考訳(メタデータ) (2026-06-10T18:24:50Z) - Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation [8.736935937857192]
Trajectory-Shaped Discrete Flow Matchingは、ブラインドジャンプをガイドナビゲーションに置き換える。
170M-024言語モデリングでは、8ステップの形状の学生は1,024ステップの教師よりも32%低い難易度を達成する。
論文 参考訳(メタデータ) (2026-05-08T15:58:22Z) - Teacher-Feature Drifting: One-Step Diffusion Distillation with Pretrained Diffusion Representations [48.0169045294604]
また, 一段蒸留を簡略化するために, 一段のドリフト損失を直接利用できることが示唆された。
追加の事前訓練された特徴抽出器に依存するオリジナルのドリフトモデルとは異なり、事前訓練された教師モデルの中間的隠れ状態が特徴表現として使用される。
提案手法は、画像品質と多様性の競争力のあるワンステップ生成を実現し、ImageNet-64$times$64およびSDXL18.4のFIDスコアを1.58とする。
論文 参考訳(メタデータ) (2026-05-08T06:33:33Z) - When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models [18.966595547209824]
我々はGenDistillと組み合わせたハイブリッドKimi Delta Attention (Hybrid-KDA)アーキテクチャを提案する。
ログライクリフに基づく評価は,教師と学生のギャップを過小評価する。
論文 参考訳(メタデータ) (2026-03-27T16:16:23Z) - Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video Synthesis [65.77083310980896]
本稿では, 実測値と偽測値の間に潜時予測を整列させる適応分布マッチング (ADM) を提案する。
提案手法は,DMD2と比較してSDXLの1ステップ性能に優れ,GPU時間が少ない。
SD3-Medium, SD3.5-Large, CogVideoX に多段階の ADM 蒸留を適用した実験では, 画像と映像の効率的な合成に向けた新しいベンチマークが設定された。
論文 参考訳(メタデータ) (2025-07-24T16:45:05Z) - Adversarial Score identity Distillation: Rapidly Surpassing the Teacher in One Step [64.53013367995325]
生成品質と蒸留効率を向上させるSiDA(SiD with Adversarial Loss)を導入する。
SiDAは実画像と敵対的損失を取り入れており、実画像とSiDによって生成された画像を区別することができる。
SiDAは、スクラッチから蒸留した場合、前者よりもかなり早く収束する。
論文 参考訳(メタデータ) (2024-10-19T00:33:51Z) - Unleashing the Power of One-Step Diffusion based Image Super-Resolution via a Large-Scale Diffusion Discriminator [81.81748032199813]
拡散モデルは実世界の超解像(Real-ISR)に優れた性能を示した
SRのための大規模textbfDiscriminator を用いた One-Step textbfDiffusion モデルを提案する。
我々の判別器は、潜伏空間における拡散モデルの任意の時間ステップからノイズのある特徴を抽出することができる。
論文 参考訳(メタデータ) (2024-10-05T16:41:36Z) - Improved Distribution Matching Distillation for Fast Image Synthesis [54.72356560597428]
この制限を解除し、MDDトレーニングを改善する一連の技術であるMDD2を紹介する。
まず、回帰損失と高価なデータセット構築の必要性を排除します。
第2に, GAN損失を蒸留工程に統合し, 生成した試料と実画像との識別を行う。
論文 参考訳(メタデータ) (2024-05-23T17:59:49Z) - Pacemaker: Intermediate Teacher Knowledge Distillation For On-The-Fly
Convolutional Neural Network [8.78292475234588]
飛行中のシステムで畳み込みニューラルネットワークを使用するための中間アンサンブル教師としてのペースメーカー知識蒸留。
提案手法が性能(精度)を大幅に向上することを示す実験を行った。
論文 参考訳(メタデータ) (2020-03-09T06:45:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。