論文の概要: UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on
- arxiv url: http://arxiv.org/abs/2608.05745v1
- Date: Thu, 06 Aug 2026 08:29:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.855033
- Title: UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on
- Title(参考訳): UniVVT: 高精細ビデオバーチャルトライオンのための統一エンドツーエンドフレームワーク
- Abstract要約: Video Virtual Try-On (VVT)は、ターゲットの服装を身に着けている人の映像を合成し、アイデンティティ、モーション、シーンのダイナミクスを保存している。
伝統的なアプローチでは、VVTはマスク付きビデオのインペイントとして使われ、人間のパース、ポーズ推定、衣料品のワープのための別個のモジュールに依存していた。
我々は、VVTをセマンティック条件付きビデオ生成として再構成する統合エンドツーエンドフレームワークUniVVTを提案する。
- 参考スコア(独自算出の注目度): 21.69586852578892
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video Virtual Try-On (VVT) synthesizes a video of a person wearing a target garment while preserving identity, motion, and scene dynamics. Dominant approaches cast VVT as mask-conditioned video inpainting and rely on separate modules for human parsing, pose estimation, and garment warping. This multi-stage design complicates deployment and, more critically, allows errors in explicit geometric priors to propagate irreversibly into the generated video. We present UniVVT, a unified end-to-end framework that reframes VVT as semantically conditioned video generation, eliminating mask, pose, and warping modules at inference. At its core, a scene-task perceiver built on a Multimodal Large Language Model jointly encodes the source video, target garment, and task instruction into compact, task-aware latent tokens, implicitly capturing what to transfer and where and how to transfer it. A lightweight semantic bridge then aligns these tokens with the conditioning space of a diffusion-based video generator, enabling coherent garment transfer. To robustly couple the heterogeneous components, we devise a three-stage progressive training strategy comprising semantic alignment, joint task adaptation, and flexible-resolution refinement. Extensive experiments demonstrate that UniVVT achieves state-of-the-art performance across multiple benchmarks, validating implicit semantic guidance as a simple and effective alternative to fragile geometric preprocessing for end-to-end virtual try-on.
- Abstract(参考訳): Video Virtual Try-On (VVT)は、ターゲットの服装を身に着けている人の映像を合成し、アイデンティティ、モーション、シーンのダイナミクスを保存している。
支配的なアプローチは、VVTをマスク付きビデオ塗装とし、人間のパース、ポーズ推定、衣服のワープのために別々のモジュールに依存した。
このマルチステージ設計は、展開を複雑にし、より重要なことは、明示的な幾何学的事前のエラーが生成したビデオに不可逆的に伝播することを可能にすることである。
提案するUniVVTは,VVTを意味的条件付きビデオ生成として再構成し,マスクやポーズ,推論時のモジュールのワープを行う,統一的なエンドツーエンドフレームワークである。
その中核となるのは、マルチモーダル大言語モデル上に構築されたシーンタスク知覚器で、ソースビデオ、ターゲットウェア、タスク命令をコンパクトでタスク対応の潜在トークンに共同でエンコードし、何を転送するか、どこでどのように転送するかを暗黙的にキャプチャする。
軽量なセマンティックブリッジは、これらのトークンを拡散ベースのビデオジェネレータの条件空間と整列し、コヒーレントな衣服転送を可能にする。
異種成分を頑健に結合するために,意味的アライメント,共同作業適応,フレキシブル・レゾリューション・リファインメントを含む3段階のプログレッシブ・トレーニング・ストラテジーを考案した。
広汎な実験により、UniVVTは複数のベンチマークで最先端のパフォーマンスを達成し、暗黙的なセマンティックガイダンスを、エンドツーエンドの仮想試行のための脆弱な幾何学的前処理の単純かつ効果的な代替手段として検証した。
関連論文リスト
- BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data [16.374416879388352]
ビデオバーチャルトライオン(VVT)は、ターゲットの服を着ている人のリアルなビデオを生成することを目的としている。
近年の手法では、a-drivenビデオ生成のパラダイムを利用して、Wildのパフォーマンスを改善するが、トライオン領域のローカライズにはマスクを頼っている。
本稿では,このパラダイムに基づくマスクフリーVVTフレームワークBoo-M-VVTを提案する。
論文 参考訳(メタデータ) (2026-09-03T17:22:33Z) - Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment [20.811984469709508]
Auraは、高忠実でアイデンティティに一貫性のあるビデオ生成のための統一されたフレームワークである。
本稿では,映像コンテンツの密度と構造を記述したAIディレクターレベルのキャプションを紹介する。
専用データ構築パイプラインを通じて高品質なビデオオブジェクト画像データセットを構築する。
論文 参考訳(メタデータ) (2026-07-05T13:54:33Z) - iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance [51.550949809895975]
Video Virtual Try-On(VVT)は、ビデオの中の人の衣服を新しい服にシームレスに置き換えることを目的としている。
対話型ビデオバーチャルトライ-オン(Interactive VVT)では,映像中の被験者が衣服に積極的に関与する。
大規模ビデオ拡散変換器上に構築された新しいフレームワークiTryOnを提案する。
論文 参考訳(メタデータ) (2026-05-20T17:23:32Z) - DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer [21.788582116033684]
Video Face Swapping (VFS)は、ターゲットのビデオにソースIDをシームレスに注入する必要がある。
既存の方法は、時間的一貫性を維持しながら、アイデンティティの類似性と属性の保存を維持するのに苦労する。
本稿では,画像顔スワッピングの優位性をビデオ領域にシームレスに転送するための包括的フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-04T08:07:11Z) - The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection [90.30501870268911]
KeyTailorは、リアルな試用ビデオのための新しいフレームワークだ。
インストラクション誘導サンプリング戦略を用いて、入力ビデオから情報フレームをフィルタリングする。
我々のデータセットViT-HDは、15,070の高品質なビデオサンプルを810*1080の解像度で構成し、多様な衣服をカバーしている。
論文 参考訳(メタデータ) (2025-12-23T13:15:31Z) - V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping [42.87624197744494]
V-Warperは、トランスフォーマーベースのビデオ拡散モデルのためのトレーニング不要な粗いパーソナライズフレームワークである。
追加のビデオトレーニングを必要とせずに、きめ細かいアイデンティティの忠実度を高める。
即時アライメントと動きのダイナミクスを保ちながら、外観の忠実度を著しく向上させる。
論文 参考訳(メタデータ) (2025-12-13T16:05:52Z) - DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework [26.661935208583756]
VVT(Virtual try-on)技術は、eコマース広告やエンターテイメントに将来性があるとして、学術的な関心を集めている。
本研究では,現実のシナリオにおける適応性を高めるために,多種多様な人間中心データを活用することが可能なDreamVVTを提案する。
第1段階では、入力ビデオから代表フレームをサンプリングし、視覚言語モデル(VLM)と統合された多フレーム試行モデルを用いて、高忠実で意味論的に整合した試行画像を合成する。
第2段階では、微粒な動きと外観記述とともに骨格図が作成される。
論文 参考訳(メタデータ) (2025-08-04T18:27:55Z) - LoViC: Efficient Long Video Generation with Context Compression [68.22069741704158]
百万単位のオープンドメインビデオに基づいてトレーニングされたDiTベースのフレームワークであるLoViCを紹介する。
当社のアプローチの核心はFlexFormerです。ビデオとテキストを統合された潜在表現に共同で圧縮する表現型オートエンコーダです。
論文 参考訳(メタデータ) (2025-07-17T09:46:43Z) - WildVidFit: Video Virtual Try-On in the Wild via Image-Based Controlled Diffusion Models [132.77237314239025]
ビデオ仮想トライオンは、衣料品のアイデンティティを維持し、ソースビデオにおける人のポーズと身体の形に適応する現実的なシーケンスを生成することを目的としている。
従来の画像ベースの手法は、ワープとブレンディングに依存しており、複雑な人間の動きや閉塞に苦しむ。
衣料品の説明や人間の動きを条件とした映像生成のプロセスとして,映像試行を再認識する。
私たちのソリューションであるWildVidFitは、画像ベースで制御された拡散モデルを用いて、一段階の合理化を図っている。
論文 参考訳(メタデータ) (2024-07-15T11:21:03Z) - VIOLET : End-to-End Video-Language Transformers with Masked Visual-token
Modeling [88.30109041658618]
ビデオ言語(VidL)モデリングにおける大きな課題は、画像/映像理解モデルから抽出された固定されたビデオ表現と、下流のVidLデータとの切り離しにある。
我々は、ビデオ入力の時間的ダイナミクスを明示的にモデル化するビデオトランスを採用した、完全なエンドツーエンドVIdeO-LanguagE変換器であるVIOLETを提案する。
論文 参考訳(メタデータ) (2021-11-24T18:31:20Z) - Contrastive Transformation for Self-supervised Correspondence Learning [120.62547360463923]
野生のラベルのない動画を用いて,視覚的対応の自己監督学習について検討する。
本手法は,信頼性の高い対応推定のための映像内および映像間表現関連を同時に検討する。
我々のフレームワークは、近年の視覚的タスクにおける自己監督型対応手法よりも優れています。
論文 参考訳(メタデータ) (2020-12-09T14:05:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。