論文の概要: An End-to-End Latent-Rollout Approach for Pushing Few-Step ImageNet-$256$ Generation to FID $1.11$ without Fréchet Losses
- arxiv url: http://arxiv.org/abs/2609.32376v1
- Date: Sat, 26 Sep 2026 08:52:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 17:21:11.447072
- Title: An End-to-End Latent-Rollout Approach for Pushing Few-Step ImageNet-$256$ Generation to FID $1.11$ without Fréchet Losses
- Title(参考訳): FIDにFew-Step ImageNet-$256$をFréchet Lossesなしで1.11$にプッシュするエンド・ツー・エンドラテント・ロールアウトアプローチ
- Abstract要約: 蒸留は教師の軌道に沿って選択された状態に教師力の回帰を適用する。
監督の強化は 敵意と補助的な 分類の目的に置き換わる
ImageNetのクラス条件生成では,FID 1.11(IS 282)を3段階,FID 1.15(IS 280)を2段階で達成した。
- 参考スコア(独自算出の注目度): 9.431422086533344
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Iterative generation poses a joint optimization problem across steps, as intermediate predictions shape subsequent computations and ultimately determine the final output distribution. Few-step generators distilled from pretrained diffusion and flow-matching models make such optimization computationally practical end to end. We build on this opportunity with a distill-then-refine approach that uses teacher imitation to establish a strong initialization for a few-step rollout in latent space, then shifts to end-to-end refinement of the complete latent rollout against real data. We introduce FiST (Flow-in-Stage Transformer), an architecture that composes learned latent-state transitions in a few stages using a shared Transformer, with optional cross-stage hidden communication. Distillation applies teacher-forced regression to selected states along teacher trajectories; refinement replaces this supervision with adversarial and auxiliary classification objectives on the final latent output. A trainable discriminator module operates on semantically rich features extracted from clean real and generated latents by a frozen SiT backbone pretrained with REPA. All training takes place in latent space, without image decoding. During refinement, FiST consumes its own intermediate predictions, and endpoint gradients pass through every generation stage. For class-conditional generation on ImageNet at $256\times256$, our approach achieves FID 1.11 (IS 282) with three stages and FID 1.15 (IS 280) with two. These results demonstrate competitive few-step generation through learned distribution-level supervision, without explicit Fréchet-distance minimization. Ablations characterize how distillation, pretrained checkpoint choices, refinement supervision, and cross-stage hidden communication affect generation quality.
- Abstract(参考訳): 反復生成は、中間予測がその後の計算を形作り、最終的な出力分布を決定するため、ステップ間で共同最適化の問題を引き起こす。
事前訓練された拡散・流れマッチングモデルから抽出した数ステップのジェネレータは、そのような最適化を実用的・実用的に実現している。
この機会を、教師の模倣を利用して、潜伏空間における数ステップのロールアウトの強力な初期化を確立し、その後、実際のデータに対する完全な潜伏ロールアウトのエンドツーエンドの洗練へとシフトする蒸留精製アプローチで構築する。
共有トランスフォーマを用いて学習した潜在状態遷移を構成するアーキテクチャであるFiST(Flow-in-Stage Transformer)を導入する。
蒸留法は教師の軌跡に沿った選択された状態に教師の強制回帰を適用し,教師の監督を最終潜在出力の対角的および補助的分類目的に置き換える。
トレーニング可能な識別モジュールは、REPAで事前訓練された凍結したSiTバックボーンによってクリーンリアルおよび生成された潜伏剤から抽出された意味的にリッチな特徴で動作する。
すべてのトレーニングは、イメージデコードなしで、遅延空間で行われる。
改良の間、FiSTは独自の中間予測を消費し、エンドポイント勾配は世代毎に通過する。
ImageNet のクラス条件生成では,FID 1.11 (IS 282) を3段階,FID 1.15 (IS 280) を2段階で達成した。
これらの結果は,Fréchet-Distanceの最小化を伴わずに,学習された分布レベルの監視を通じて,競争力のある数ステップ生成を示す。
アブレーションは、蒸留、事前訓練されたチェックポイントの選択、精製監督、およびステージ間の隠れコミュニケーションが生成品質にどのように影響するかを特徴づける。
関連論文リスト
- Rethinking Pixel Mean Flows via Interval Denoiser [95.11499828543344]
潜在自由生成のためのフレームワークであるInterval Denoiserを提案する。
その結果,FIDは1ステップ (1-NFE) で4.55, 2ステップ (2-NFE) で3.98であった。
論文 参考訳(メタデータ) (2026-08-05T13:22:43Z) - Latent Reward Registers for Diffusion Preference Alignment [46.49072106092868]
本稿では,中間雑音の遅延から端末の好みを推定するメカニズムであるLatent Reward Registersを提案する。
この独立した読み出し機構は、発電機の隠された状態や速度場を変えることなく、潜伏した報酬証拠を抽出する。
トレーニングのために、Reward-Gradient On-Policy Distillation (RG-OPD) は、標準的な政策勾配の計算的に高価なロールアウトを回避し、報酬誘導された更新をオンライン軌道に沿って蒸留する。
推論のためには、Reward-Guided Sampling (RGS) はパラメータ更新なしで大小マッチングされた報酬勾配を経由する。
論文 参考訳(メタデータ) (2026-08-04T17:00:52Z) - OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models [39.15861870749305]
OPTD, On-Policy Transition Distillation with consistency-guided Adaptive compression。
これは、数段階の学生自身の軌跡から部分的な状態をサンプリングし、凍結した質問のみの教師を使用して結果に整合した将来の候補者を特定し、現状の信頼でそれらを注文する。
品質効率のトレードオフを継続的に改善し、評価された数ステップのベースラインの中で、全体的な品質に制約のあるAUPを最強に達成します。
論文 参考訳(メタデータ) (2026-08-03T23:09:43Z) - One-Step Distillation of Discrete Diffusion Image Generators via Fixed-Point Iteration [20.457786704615454]
Fixed-Point Distillation (FPD) は、学生の1段階のドラフトを部分的に破損させ、1段階の教師ステップで修正することで、局所的な修正ターゲットを構築するエンドツーエンドのフレームワークである。
FPDは、単一の推論ステップにおいて、競争力のある視覚的忠実度と構造的整合性を達成し、マルチステップの教師とのギャップを狭める。
論文 参考訳(メタデータ) (2026-05-20T17:59:10Z) - Trajectory as the Teacher: Few-Step Discrete Flow Matching via Energy-Navigated Distillation [8.736935937857192]
Trajectory-Shaped Discrete Flow Matchingは、ブラインドジャンプをガイドナビゲーションに置き換える。
170M-024言語モデリングでは、8ステップの形状の学生は1,024ステップの教師よりも32%低い難易度を達成する。
論文 参考訳(メタデータ) (2026-05-08T15:58:22Z) - Self-Adversarial One Step Generation via Condition Shifting [11.426065945265647]
APEXは、フローモデルから不均一に抽出された逆補正信号のフレームワークである。
私たちの0.6BモデルはFLUX-Schnell 12B(20$times$ more parameters)を1ステップ品質で上回ります。
Qwen-Image 20BのLoRAチューニングにより、APEXは6時間でNFE=1のGenEvalスコア0.89に達し、最初の50ステップの教師(0.87)を超え、15.33$times$推論スピードアップを提供する。
論文 参考訳(メタデータ) (2026-04-14T05:54:33Z) - MeanFlow Transformers with Representation Autoencoders [71.45823902973349]
MeanFlow(MF)は、ノイズからデータへのジャンプを直接学習することで、効率的な数ステップ生成を可能にする拡散動機付き生成モデルである。
我々は、表現オートエンコーダ(RAE)の潜在空間におけるMFの効率的なトレーニングとサンプリング手法を開発する。
1ステップのFIDが2.03であり,バニラMFの3.43を上回っ,GFLOPSのサンプリングを38%削減し,ImageNet 256のトレーニングコストを83%削減した。
論文 参考訳(メタデータ) (2025-11-17T06:17:08Z) - Few-Step Diffusion via Score identity Distillation [67.07985339442703]
拡散蒸留は, テキスト・ツー・イメージ(T2I)拡散モデルを促進するための有望な戦略として浮上している。
既存の方法は、高分解能T2I拡散モデルを蒸留する際に、実像や教師合成画像に頼っている。
教師のCFGを無効にし、偽スコアネットワークでテキストコンディショニングを除去するZero-CFGと、偽スコアネットワークで否定的なCFGを適用するAnti-CFGの2つの新しいガイダンス戦略を提案する。
論文 参考訳(メタデータ) (2025-05-19T03:45:16Z) - Improved Distribution Matching Distillation for Fast Image Synthesis [54.72356560597428]
この制限を解除し、MDDトレーニングを改善する一連の技術であるMDD2を紹介する。
まず、回帰損失と高価なデータセット構築の必要性を排除します。
第2に, GAN損失を蒸留工程に統合し, 生成した試料と実画像との識別を行う。
論文 参考訳(メタデータ) (2024-05-23T17:59:49Z) - The Surprising Effectiveness of Skip-Tuning in Diffusion Sampling [78.6155095947769]
Skip-Tuningは、スキップ接続上でシンプルだが驚くほど効果的にトレーニング不要なチューニング方法である。
ImageNet 64 では 19 NFE (1.75) で事前訓練された EDM に対して100% FID の改善が可能である。
Skip-Tuningは画素空間におけるスコアマッチング損失を増加させる一方、特徴空間における損失は減少する。
論文 参考訳(メタデータ) (2024-02-23T08:05:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。