論文の概要: LiveVVT: High-Fidelity Video Virtual Try-On in Real Time
- arxiv url: http://arxiv.org/abs/2608.26714v2
- Date: Fri, 28 Aug 2026 04:29:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 15:11:36.092978
- Title: LiveVVT: High-Fidelity Video Virtual Try-On in Real Time
- Title(参考訳): LiveVVT:高精細度ビデオのバーチャルトライオンをリアルタイムで行う
- Authors: Yushe Cao, Shikun Feng, Ruxiang Duan, Liyong Wang, Dianxi Shi, Chun Yu, Junliang Xing,
- Abstract要約: Video Virtual Try-On (VVT) は双方向モデリングにより高視力を実現する。
本稿では,双方向境界モデルを保存するローリングストリーミング拡散フレームワークLiveVVTを紹介する。
ペアとペアの長いシーケンスのベンチマークによる実験は、同様のサイズのモデルよりも優れた生成品質を示す。
- 参考スコア(独自算出の注目度): 36.4434648528291
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Diffusion-based Video Virtual Try-On (VVT) achieves high visual fidelity through bidirectional spatio-temporal modeling, but complete-clip dependence incurs prohibitive latency and computational overhead in practical continuous deployment. Naively enforcing causality disrupts pretrained bidirectional priors and substantially degrades synthesis quality. We introduce LiveVVT, a rolling streaming diffusion framework that preserves bounded bidirectional modeling within causal recurrent generation. Within a fixed-size window, LiveVVT jointly denoises multiple video chunks under bounded look-ahead, preserving local bidirectional interactions while emitting one clean chunk per iteration. Beyond the window, two complementary memories sustain long-term consistency: a bounded temporal memory propagates recent dynamics and occlusion context, whereas a persistent global appearance memory, constructed once from the target garment and a frontal try-on keyframe, anchors garment details and dressed appearance throughout the stream. We further introduce a progressive distillation framework integrating bidirectional VVT learning, teacher-trajectory regression for causal few-step adaptation, and Collaborative Matching Distillation, which couples teacher-distribution matching with rolling flow matching on real videos to align optimization with recurrent inference. Experiments on paired and unpaired long-sequence benchmarks demonstrate superior generation quality over similarly sized models, with $26\times$ lower latency and $11\times$ higher throughput, enabling high-fidelity real-time streaming VVT.
- Abstract(参考訳): 拡散に基づくビデオ仮想トライ-オン (VVT) は双方向時空間モデリングにより高い視覚的忠実度を実現するが、完全クリップ依存は実用的な継続的展開において遅延や計算オーバーヘッドを禁ずる。
因果関係を自然に強制することは、事前訓練された双方向の先行性を阻害し、合成品質を著しく低下させる。
因果リカレント・ジェネレーション内での有界双方向モデリングを格納するローリングストリーミング拡散フレームワークであるLiveVVTを紹介する。
固定サイズのウィンドウ内でLiveVVTは、バウンドされたルックアヘッドの下で複数のビデオチャンクを共同で識別し、ローカルな双方向インタラクションを保持しながら、イテレーション毎に1つのクリーンチャンクを出力する。
ウィンドウの向こうでは、2つの補完記憶が長期的一貫性を維持している: 有界時記憶は最近のダイナミクスと排他的文脈を伝播するが、一方、永続的グローバルな外見記憶は、標的の衣服と正面の試着キーフレームから一度構築され、衣服の詳細をアンカーし、ストリーム全体を通して着替える。
さらに, 双方向VVT学習, 因果的少数段階適応のための教師軌道回帰, 実ビデオ上での転動流マッチングと教師分布マッチングを結合した協調マッチング蒸留を併用し, 繰り返し推論と最適化を一致させる, 進行蒸留フレームワークを導入する。
ペアとペアの長いシーケンスのベンチマークの実験は、同様のサイズのモデルよりも優れた生成品質を示し、26\times$低レイテンシと11\times$高スループットを実現し、高忠実なリアルタイムストリーミングVVTを可能にした。
関連論文リスト
- RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling [51.279397568734424]
Diffusion Transformers (DiTs) に基づく映像生成モデルは,映像合成において顕著な性能を発揮している。
DiTは3次元の注意の二次的な複雑さのために、高い推論遅延と計算コストに悩まされる。
我々はbftextRhymeFlowを紹介した。bftextRhymeFlowはトレーニング不要のフレームワークで、異なるフレームの認知軌道を分離する。
論文 参考訳(メタデータ) (2026-06-04T15:49:37Z) - FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching [68.01498128172214]
本稿では,アーキテクチャに依存しない,追加のトレーニングを必要としない長大なビデオ生成のための,斬新でシンプルな推論時間アプローチを提案する。
提案手法では,隣接するウィンドウからのクリーンサンプルをemphTweedieマッチングでブレンドし,テキストbfmanifoldの制約と重複領域間の時間的一貫性を強制する。
本手法は, 時間的一貫性と視覚的品質において, トレーニング不要, 自己回帰ベースラインを両立させながら, ネイティブウィンドウ長よりも数倍長大のビデオを生成する。
論文 参考訳(メタデータ) (2026-05-20T08:55:37Z) - Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation [16.611062315689306]
本稿では,時間的情報保持と計算効率を協調的に最適化するハイブリッド・フォースを提案する。
我々のモデルは、量子化やモデル圧縮なしで、単一のNVIDIA H100 GPU上で29.5 FPSでリアルタイムな832x480ビデオ生成を実現する。
論文 参考訳(メタデータ) (2026-04-11T08:54:07Z) - OmniForcing: Unleashing Real-time Joint Audio-Visual Generation [51.031726911410594]
最近のジョイントオーディオ・視覚拡散モデルは、優れた生成品質を実現するが、高いレイテンシーに悩まされる。
OmniForcingは、オフラインの双方向拡散モデルを高忠実度ストリーミングオートレジェネレータに蒸留する最初のフレームワークである。
論文 参考訳(メタデータ) (2026-03-12T08:17:36Z) - USV: Unified Sparsification for Accelerating Video Diffusion Models [11.011602744993942]
ビデオ拡散モデルのための統一スパシフィケーションは、エンドツーエンドのトレーニング可能なフレームワークである。
モデルの内部計算とサンプリングプロセスの両方でスパーシフィケーションをオーケストレーションする。
最大83.3%のスピードアップと22.7%のエンドツーエンドの加速を実現し、高い視力を維持している。
論文 参考訳(メタデータ) (2025-12-05T14:40:06Z) - Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation [69.57572900337176]
本稿では,効率的なストリーミングビデオ生成のための新しいフレームワークであるReward Forcingを紹介する。
EMA-Sinkトークンは、長期コンテキストと最近のダイナミクスの両方をキャプチャし、初期フレームコピーを防ぐ。
Re-DMDは、視覚言語モデルにより評価されたより大きなダイナミックスを持つサンプルを優先順位付けすることで、モデル出力分布を高逆領域にバイアスする。
論文 参考訳(メタデータ) (2025-12-04T11:12:13Z) - Rolling Forcing: Autoregressive Long Video Diffusion in Real Time [86.40480237741609]
Rolling Forcingは、エラーの最小限の蓄積で長いビデオをストリーミングできる、新しいビデオ生成技術である。
転がり強制力には3つの新しい設計が伴う。第一に、エラー伝播を加速する個別のフレームを反復的にサンプリングする代わりに、共同演示方式を設計する。
第2に,アテンションシンク機構を長軸ストリームビデオ生成タスクに導入し,初期フレームのキー値状態をグローバルなコンテキストアンカーとして保持する。
第3に,大半が拡張された遮音窓上での無段蒸留を可能にする効率的な訓練アルゴリズムを設計する。
論文 参考訳(メタデータ) (2025-09-29T17:57:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。