論文の概要: VDOT++: Unified Few-Step Video Generation via Unbalanced Optimal Transport Distillation
- arxiv url: http://arxiv.org/abs/2610.03221v1
- Date: Fri, 02 Oct 2026 12:37:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.370288
- Title: VDOT++: Unified Few-Step Video Generation via Unbalanced Optimal Transport Distillation
- Title(参考訳): VDOT++: 最適輸送蒸留による一元化ビデオ生成
- Abstract要約: ビデオ作成は、テキスト・トゥ・ビデオ(T2V)、画像・トゥ・ビデオ(I2V)、条件ベースの生成にまたがる。
3つのタスクファミリ用のジェネレータに対して,同じトレーニングレシピを別々に適用する統合蒸留フレームワークであるVDOT++を提案する。
- 参考スコア(独自算出の注目度): 68.00823860612421
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video creation spans text-to-video (T2V), image-to-video (I2V), and condition-based generation, yet video diffusion models remain costly because they repeatedly evaluate large backbones during sampling. Distribution matching distillation (DMD) reduces this cost, but its reverse Kullback--Leibler (KL) objective can provide unstable or incomplete guidance when the student and teacher distributions have limited overlap. VDOT addressed this issue by adding optimal transport distillation (OTD), whose explicit coupling supplies geometric directions for condition-based generation. Balanced OTD, however, performs full-mass matching between the spatial tokens of each corresponding student--teacher frame pair. This assumption weakens for T2V and I2V, where one condition admits many valid outputs and spatial content need not align across different realizations. We present VDOT++, a unified distillation framework that applies the same training recipe separately to generators for the three task families. It makes OTD robust to output diversity through an asymmetric unbalanced formulation that allows unreliable student tokens to carry less mass while maintaining coverage of the teacher tokens. An $\ell_1$ ground cost further replaces mean-based aggregation with a more mode-preserving weighted median that limits the influence of distant transport targets. The two changes respectively determine whom to match and how the selected targets should be aggregated. We additionally combine distribution matching and adversarial refinement through sequential backward passes, and exploit the decoupled score networks for cross-scale distillation, where larger score networks improve a compact generator. Experiments on UVCBench, VBench, VBench-I2V, and the VACE benchmark show that the resulting four-step generators are competitive with many-step teachers and strong few-step baselines across all three task families.
- Abstract(参考訳): ビデオ作成は、テキスト・トゥ・ビデオ(T2V)、画像・トゥ・ビデオ(I2V)、条件ベースの生成にまたがるが、サンプリング中に大きなバックボーンを何度も評価するため、ビデオ拡散モデルはコストがかかる。
分散マッチング蒸留(DMD)は、このコストを低減させるが、その逆のKL(Kullback--Leibler)の目的は、生徒と教師の分布の重複が限定されている場合、不安定または不完全なガイダンスを提供することができる。
VDOTは最適輸送蒸留 (OTD) を追加することでこの問題に対処した。
しかし、バランスの取れたOTDは、各生徒と教師のフレームペアの空間トークン間の全質量マッチングを行う。
この仮定は T2V と I2V を弱め、一つの条件が多くの有効な出力を許容し、空間的内容は異なる実現をまたいで整合する必要はない。
3つのタスクファミリーのジェネレータに対して,同じトレーニングレシピを別々に適用する統合蒸留フレームワークであるVDOT++を提案する。
OTDは非対称な不均衡な定式化によって多様性を出力し、教師トークンのカバレッジを維持しながら、信頼できない学生トークンがより少ない質量を運ぶことができる。
さらに$$\ell_1$の地上費用は、平均的なアグリゲーションを、遠方の輸送目標の影響を制限する、よりモード保存の重み付き中央値に置き換える。
2つの変更はそれぞれ、誰がマッチするか、選択したターゲットをどのように集約するかを決定する。
さらに, 逐次後方通過による分布マッチングと逆補正を併用し, 大規模蒸留のための分離されたスコアネットワークを利用して, より大きなスコアネットワークがコンパクトなジェネレータを改良する。
UVCBench、VBench、VBench-I2V、VACEベンチマークの実験では、結果の4ステップジェネレータは、多くのステップの教師と強力な数ステップのベースラインが3つのタスクファミリで競合している。
関連論文リスト
- Interactive-Policy Distillation with Bidirectional Propose-and-Verify [15.832994594431776]
インタラクティブ・ポリシィ蒸留(IPD)は、学生のロールアウトに適応的な教師の介入を適用する。
IPDは、より高性能な蒸留法であるだけでなく、オン・ポリティズムとオフ・ポリティズムのパラダイムの間の統一されたブリッジでもある。
数学推論タスクと複数の教師と学生のモデルペアにおいて、PDで訓練された学生モデルは、PDで訓練された生徒よりも優れているだけでなく、より高いデータ効率を示す。
論文 参考訳(メタデータ) (2026-09-29T02:32:39Z) - AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation [20.113831634562743]
共同音声・ビデオ生成のためのモダリティ対応オンライン拡散RLフレームワークを提案する。
AV-GRPOは3つの重要なモジュールを含む: 学習信号のアンコレッドロールアウトと難易度を安定させる; (2) トラジェクトリロックされたフリーズ・トウワーの最適化によりコストと再割り当てを低減; (3) 適応目的と摂動強度をモダリティ固有力学に合わせて調整する。
JavisBench と VABench の実験では、AV-GRPO が LTX-2.3 の生成品質、セマンティックアライメント、LoRA 下でのクロスモーダル同期、およびフル微調整で優れていることを示した。
論文 参考訳(メタデータ) (2026-09-24T13:53:05Z) - Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation [52.10062792673558]
自動ストリーミングビデオ拡散モデルを実用化するために、蒸留ベースの加速が基礎となっている。
既存の方法は、すべてのロールアウト、フレーム、ピクセルを同様に信頼できる監視として扱う。
本稿では,信頼性に配慮したリワード蒸留フレームワークStream-R1を提案する。
論文 参考訳(メタデータ) (2026-05-05T15:15:30Z) - DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving [65.7087560656003]
エンドツーエンドの自動運転のための生成拡散モデルは、しばしばモード崩壊に悩まされる。
強化学習を利用して低品質モードを制約し,優れた軌道探索を行うDiffusionDriveV2を提案する。
これにより、そのコアであるガウス混合モデル固有の多重モード性を維持しながら、全体的な出力品質が大幅に向上する。
論文 参考訳(メタデータ) (2025-12-08T17:29:52Z) - Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video Synthesis [65.77083310980896]
本稿では, 実測値と偽測値の間に潜時予測を整列させる適応分布マッチング (ADM) を提案する。
提案手法は,DMD2と比較してSDXLの1ステップ性能に優れ,GPU時間が少ない。
SD3-Medium, SD3.5-Large, CogVideoX に多段階の ADM 蒸留を適用した実験では, 画像と映像の効率的な合成に向けた新しいベンチマークが設定された。
論文 参考訳(メタデータ) (2025-07-24T16:45:05Z) - Few-Step Diffusion via Score identity Distillation [67.07985339442703]
拡散蒸留は, テキスト・ツー・イメージ(T2I)拡散モデルを促進するための有望な戦略として浮上している。
既存の方法は、高分解能T2I拡散モデルを蒸留する際に、実像や教師合成画像に頼っている。
教師のCFGを無効にし、偽スコアネットワークでテキストコンディショニングを除去するZero-CFGと、偽スコアネットワークで否定的なCFGを適用するAnti-CFGの2つの新しいガイダンス戦略を提案する。
論文 参考訳(メタデータ) (2025-05-19T03:45:16Z) - Transform-Equivariant Consistency Learning for Temporal Sentence
Grounding [66.10949751429781]
ビデオ毎により差別的な表現を学習するために,新しい同変一貫性規則学習フレームワークを導入する。
私たちのモチベーションは、クエリ誘導アクティビティの時間的境界を一貫して予測することにある。
特に,ビデオの完全性と滑らか性を高めるために,自己教師付き一貫性損失モジュールを考案した。
論文 参考訳(メタデータ) (2023-05-06T19:29:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。