論文の概要: CrossDistill: Balancing Quality and Diversity via Trajectory-Level Hybrid Few-Step Distillation
- arxiv url: http://arxiv.org/abs/2609.14725v2
- Date: Sun, 20 Sep 2026 16:31:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 03:38:27.342656
- Title: CrossDistill: Balancing Quality and Diversity via Trajectory-Level Hybrid Few-Step Distillation
- Title(参考訳): Cross Distill: 軌道レベルハイブリッドフットステップ蒸留による品質と多様性のバランス
- Abstract要約: クロスオーバー点におけるサンプリング軌道を分割するトラジェクトリレベルのハイブリッド蒸留フレームワークを提案する。
ノイズレジームに依存した方法でこのテンションを活用できることが示される。
テキスト間拡散モデルと質的画像間拡散実験により、CrossDistillは数段階の品質・多様性フロンティアを拡張していることが示された。
- 参考スコア(独自算出の注目度): 23.029634451778417
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Few-step distillation accelerates diffusion models but must balance diversity and fidelity: trajectory-based distillation preserves mode coverage, while distribution matching sharpens samples but can reduce diversity. We show that this tension can be exploited in a noise-regime-dependent way: high-noise steps largely determine global modes, whereas low-noise steps refine local details. We propose CrossDistill, a trajectory-level hybrid distillation framework that splits the sampling trajectory at a crossover point, applies a trajectory-preserving objective on the high-noise interval and a distribution-matching objective on the low-noise interval, and couples the two stages through the crossover state. In contrast to loss-level mixing, and complementarily to training-time two-stage recipes, CrossDistill explicitly assigns complementary objectives along the noise axis, so that global branching is preserved before local statistics are sharpened. CrossDistill is a noise-level scheduling policy: PCM and DMD are plug-in instantiations, while the noise partition, crossover coupling, and objective ordering are the key design elements. Experiments on text-to-video diffusion models and qualitative image-to-video results show that CrossDistill expands the few-step quality-diversity frontier, retaining seed-level variation while achieving competitive visual fidelity.
- Abstract(参考訳): 数段階の蒸留は拡散モデルを加速させるが、多様性と忠実さのバランスをとる必要がある: 軌跡に基づく蒸留はモードカバレッジを保ち、分布の一致はサンプルを鋭くするが、多様性を減少させる。
ハイノイズステップはグローバルモードを決定するが、低ノイズステップはローカルディテールを洗練させる。
クロスオーバー点にサンプリング軌道を分割し, 高雑音区間に軌道保存目標, 低雑音区間に分布整合目標を適用し, クロスオーバー状態を通じて2段階を結合する, トラジェクトリレベルのハイブリッド蒸留フレームワークであるCrossDistillを提案する。
損失レベルの混合とは対照的に、トレーニング時の2段階のレシピと相補的に、CrossDistillはノイズ軸に沿った補完的な目的を明示的に割り当て、局所統計がシャープされる前にグローバルブランチが保存される。
CrossDistillはノイズレベルのスケジューリングポリシーであり、PCMとDMDはプラグインインスタンスであり、ノイズ分割、クロスオーバー結合、客観的順序付けは重要な設計要素である。
テキスト間拡散モデルと質的画像間拡散実験により、CrossDistillは数ステップの画質・多様性フロンティアを拡張し、種レベルの変動を維持しながら、競争力のある視覚的忠実性を達成することを示した。
関連論文リスト
- Reinforcing Few-step Generators via Reward-Tilted Distribution Matching [34.875805803270524]
RTDMD (Reward-Tilted Distribution Matching Distillation) を提案する。
報奨型教師分布へのKL分散の最小化は,自然に分布マッチング項と報奨項に分解されることを示す。
SD3、SD3.5、FLUX.2の実験は、RTDMDが嗜好、美学、作曲のメトリクスをまたいだ新しい最先端の結果を確立することを示した。
論文 参考訳(メタデータ) (2026-05-25T17:59:21Z) - Continuous-Time Distribution Matching for Few-Step Diffusion Distillation [57.28746398500951]
本稿では,CDM(Continuous-Time Distribution Matching)を導入し,DMDフレームワークを個別アンカーから連続最適化へ移行する。
まず、固定離散スケジュールをランダム長の動的連続スケジュールに置き換える。
第二に、学生の速度場を介して外挿された潜伏者に対してアクティブな軌道外マッチングを行う連続時間アライメント目的を提案する。
論文 参考訳(メタデータ) (2026-05-07T14:56:39Z) - Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals [48.14879329270912]
フェーズドDMDは、Mixture-of-Expertsでフェーズワイド蒸留のアイデアを橋渡しする多段階蒸留フレームワークである。
位相MDDはプログレッシブな分布マッチングとサブインターバル内のスコアマッチングという2つの主要なアイデアに基づいて構築されている。
実験結果から,第2相DMDはDMDよりも出力の多様性を保ちつつ,重要な生成能力を保っていることが明らかとなった。
論文 参考訳(メタデータ) (2025-10-31T17:55:10Z) - SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment [76.60024640625478]
拡散ベースまたはフローベースモデルは、ビデオ合成において大きな進歩を遂げているが、複数の反復サンプリングステップが必要である。
本稿では, トラジェクトリ保存と分散マッチングの利点を組み合わせた, 統一かつ安定な蒸留フレームワークを提案する。
提案手法は高品質なビデオ生成を維持しつつ,推論ステップの数を著しく削減する。
論文 参考訳(メタデータ) (2025-08-08T07:26:34Z) - Few-Step Diffusion via Score identity Distillation [67.07985339442703]
拡散蒸留は, テキスト・ツー・イメージ(T2I)拡散モデルを促進するための有望な戦略として浮上している。
既存の方法は、高分解能T2I拡散モデルを蒸留する際に、実像や教師合成画像に頼っている。
教師のCFGを無効にし、偽スコアネットワークでテキストコンディショニングを除去するZero-CFGと、偽スコアネットワークで否定的なCFGを適用するAnti-CFGの2つの新しいガイダンス戦略を提案する。
論文 参考訳(メタデータ) (2025-05-19T03:45:16Z) - Latent Swap Joint Diffusion for 2D Long-Form Latent Generation [38.434225760834146]
Swap Forward (SaFa) は、シームレスでコヒーレンスな長いスペクトルとパノラマを生成するためのモダリティに依存しない効率的な方法である。
SaFaは、既存のジョイント拡散法や、オーディオ生成におけるトレーニングベースの方法よりも大幅に優れています。
また、パノラマ生成にも適しており、2$sim$20$times$高速でモデル一般化性の向上で同等のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-02-07T18:02:47Z) - Noisy Cyclic Quantum Random Walk [0.0]
等質巡回グラフ上の離散的量子ランダムウォークにおける静的ノイズを探索する。
退化スペクトルは正弦波確率分布を生じ、非退化スペクトルは平坦なプロファイルを生成する。
現場の静相雑音を解析し,その影響を2つの伝搬系で解析する。
論文 参考訳(メタデータ) (2024-11-30T17:02:38Z) - Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion [61.03681839276652]
拡散強制(Diffusion Forcing)は、拡散モデルをトレーニングし、トークンの集合に独立した音レベルを付与する、新たなトレーニングパラダイムである。
因果的次トーケン予測モデルを訓練して1つまたは複数の未来のトークンを生成することで、シーケンス生成モデルに拡散強制を適用する。
論文 参考訳(メタデータ) (2024-07-01T15:43:25Z) - Straighter Flow Matching via a Diffusion-Based Coupling Prior [29.38872850098043]
フローマッチング(StraightFM)のストレートトラジェクトリを提案する。
分散レベル全体からの結合戦略でトラジェクトリを直線化する。
画素空間と潜伏空間の実験結果から、StraightFMは5段階以内で魅力的なサンプルが得られることが示された。
論文 参考訳(メタデータ) (2023-11-28T06:19:30Z) - Density Ratio Estimation via Infinitesimal Classification [85.08255198145304]
そこで我々は, DRE-inftyを提案する。 DRE-inftyは, 密度比推定(DRE)を, より簡単なサブプロブレムに還元する手法である。
モンテカルロ法にインスパイアされ、中間ブリッジ分布の無限連続体を介して2つの分布の間を滑らかに補間する。
提案手法は,複雑な高次元データセット上での相互情報推定やエネルギーベースモデリングなどの下流タスクにおいて良好に動作することを示す。
論文 参考訳(メタデータ) (2021-11-22T06:26:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。