論文の概要: Uncertainty DMD: Restoring Diversity in Few-Step Autoregressive Video Distillation
- arxiv url: http://arxiv.org/abs/2609.11265v1
- Date: Thu, 10 Sep 2026 08:59:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.275906
- Title: Uncertainty DMD: Restoring Diversity in Few-Step Autoregressive Video Distillation
- Title(参考訳): 不確実性MDD:数ステップの自己回帰ビデオ蒸留における多様性の回復
- Abstract要約: 少ない段階の蒸留は自己回帰(AR)ビデオ生成の効率を向上させるが、しばしば多様性の崩壊を引き起こす。
分散マッチング蒸留 (DMD) 蒸留ARビデオジェネレータのこの劣化を分析し, 自己回帰環境では, 構造的不確かさの崩壊の形をとる。
- 参考スコア(独自算出の注目度): 52.34982929108336
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Few-step distillation improves the efficiency of autoregressive (AR) video generation, but often causes diversity collapse: under the same prompt, different noise samples tend to produce highly similar videos with weakened motion dynamics. We analyze this degradation in Distribution Matching Distillation (DMD)-distilled AR video generators and find that, in the autoregressive setting, it takes the form of a structured uncertainty collapse: the mode-seeking bias of DMD maps different noise samples to nearly identical first chunks, and the deterministic AR cache then propagates this collapsed state to all subsequent chunks, turning a local loss of stochasticity at the rollout root into a global suppression of temporal variation. Based on this analysis, we propose Uncertainty DMD, a simple uncertainty-injection framework that restores stochasticity at two key stages of AR generation: a timestep perturbation for the first chunk to increase first-chunk diversity, and a stochastic cache-writing mechanism for later chunks to preserve uncertainty in autoregressive conditioning. The method requires no architectural changes and introduces only lightweight perturbation operations. The same perturbation mechanisms are used during both training and inference. Experiments show that Uncertainty DMD consistently improves diversity and motion dynamics while maintaining comparable per-sample visual quality.
- Abstract(参考訳): 少ない段階の蒸留により、自己回帰(AR)ビデオ生成の効率が向上するが、しばしば多様性の崩壊を引き起こす。
DMDのモード探索バイアスは、異なるノイズサンプルをほぼ同じ第1のチャンクにマッピングし、決定論的ARキャッシュは、この崩壊状態をその後のすべてのチャンクに伝播させ、ロールアウトルートにおける確率の局所的損失を時間的変動のグローバルな抑制に変換する。
この分析に基づいて,AR生成の2つの重要な段階において確率性を復元する単純な不確実性注入フレームワークである不確実性MDDを提案し,第1チャンクの時間的摂動を第1チャンクの多様性を増大させるとともに,後チャンクの確率的キャッシュ書き込み機構を用いて自己回帰条件下での不確実性を維持する。
この方法はアーキテクチャの変更を必要とせず、軽量な摂動操作のみを導入する。
同じ摂動機構は、トレーニングと推論の両方で使用される。
実験により、不確実性MDDは、サンプルごとの視覚的品質を維持しながら、多様性と動きのダイナミクスを一貫して改善することが示された。
関連論文リスト
- AAD-1: Asymmetric Adversarial Distillation for One-Step Autoregressive Video Generation [66.55343616132005]
AAD-1は、一段階の自己回帰画像-ビデオ生成のための非対称な対数蒸留フレームワークである。
AAD-1は1ステップの自己回帰ビデオ生成において最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-06-02T17:55:30Z) - Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation [43.89162138967428]
本稿では,ビデオ拡散モデルに適した新しい蒸留フレームワークを提案する。
その中核となる革新は,(1)空間監督重量を動的に調整し,過度な分布シフトに起因するアーティファクトを防止する適応回帰損失,(2)スムーズで物理的に妥当なサンプリング軌道を促進する時間正規化損失,(3)知覚的品質を維持しながらサンプリングオーバーヘッドを低減する推論時間枠戦略である。
VBench と VBench2 ベンチマークの実験およびアブレーション実験により,本手法は安定した数段階のビデオ合成を実現し,知覚的忠実度と運動リアリズムを著しく向上させることを示した。
論文 参考訳(メタデータ) (2026-03-23T11:54:33Z) - Diversity-Preserved Distribution Matching Distillation for Fast Visual Synthesis [33.341277146439275]
分散整合蒸留(DMD)は、低推論コストで高品質な生成を可能にするために、多段階発生器をその数段階と整列させる。
本稿では, 蒸留工程の役割を明示的に解消する役割分離蒸留フレームワークを提案する。
本手法は, 単純さに拘わらず, サンプルの多様性を保ちながら, テキスト・画像実験における最先端の手法と同等の視覚的品質を維持しながら, 標本の多様性を保っている。
論文 参考訳(メタデータ) (2026-02-03T05:45:25Z) - Improving Temporal Consistency and Fidelity at Inference-time in Perceptual Video Restoration by Zero-shot Image-based Diffusion Models [5.61537470581101]
ゼロショット画像ベース拡散モデルを用いたビデオ再生における時間的コヒーレンス向上の課題に対処する。
本稿では,PSG(Perceptual Straightening Guidance)とMPES(Ensemble Sampling)の2つの補完的推論時間戦略を提案する。
論文 参考訳(メタデータ) (2025-10-29T11:40:06Z) - Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency [60.74505433956616]
連続時間一貫性モデル(sCM)は理論的に原理化され、学術規模の拡散を加速するために実証的に強力である。
まず並列性互換なFlashAttention-2 JVPカーネルを開発し、100億以上のパラメータと高次元ビデオタスクを持つモデル上でsCMトレーニングを可能にする。
本稿では, スコア蒸留を長軸正則化器として組み込んだスコア規則化連続時間一貫性モデル(rCM)を提案する。
論文 参考訳(メタデータ) (2025-10-09T16:45:30Z) - Restoration Score Distillation: From Corrupted Diffusion Pretraining to One-Step High-Quality Generation [82.39763984380625]
Score Distillation (DSD) の原理的一般化である textitRestoration Score Distillation (RSD) を提案する。
RSDは、ぼやけた画像、不完全画像、低解像度画像など、広範囲の汚職タイプに対応している。
自然と科学の両方のデータセットの様々な復元作業において、教師モデルを一貫して上回っている。
論文 参考訳(メタデータ) (2025-05-19T17:21:03Z) - DiffusionAD: Norm-guided One-step Denoising Diffusion for Anomaly Detection [80.20339155618612]
DiffusionADは、再構成サブネットワークとセグメンテーションサブネットワークからなる、新しい異常検出パイプラインである。
高速なワンステップデノゲーションパラダイムは、同等の再現品質を維持しながら、数百倍の加速を達成する。
異常の出現の多様性を考慮し、複数のノイズスケールの利点を統合するためのノルム誘導パラダイムを提案する。
論文 参考訳(メタデータ) (2023-03-15T16:14:06Z) - DR2: Diffusion-based Robust Degradation Remover for Blind Face
Restoration [66.01846902242355]
ブラインド顔復元は通常、トレーニングのための事前定義された劣化モデルで劣化した低品質データを合成する。
トレーニングデータに現実のケースをカバーするために、あらゆる種類の劣化を含めることは、高価で実現不可能である。
本稿では、まず、劣化した画像を粗いが劣化不変な予測に変換し、次に、粗い予測を高品質な画像に復元するために拡張モジュールを使用するロバスト劣化再帰法(DR2)を提案する。
論文 参考訳(メタデータ) (2023-03-13T06:05:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。