論文の概要: FlowVVTON: Flow-Guided Mask-Free Video Virtual Try-On
- arxiv url: http://arxiv.org/abs/2608.30450v1
- Date: Mon, 31 Aug 2026 08:37:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.318947
- Title: FlowVVTON: Flow-Guided Mask-Free Video Virtual Try-On
- Title(参考訳): FlowVVTON: Flow-Guided Mask-free Video Virtual Try-On
- Authors: Shengyao Chen, Xianbing Sun, Liqing Zhang, Jianfu Zhang,
- Abstract要約: FlowVVTONは、マスク依存を完全に排除するマスクフリーフレームワークである。
2段階のトレーニング戦略は、フロー誘導時間監視を導入する前にマスクのない空間アライメントを確立する。
TikTokDressの実験によると、FlowVVTONはベースラインをかなり上回っている。
- 参考スコア(独自算出の注目度): 13.050523870282374
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Video virtual try-on aims to transfer a target garment onto a moving person across video frames. Current methods rely on human parsing masks or pose keypoints that frequently fail under large motions and occlusions, causing boundary artifacts and temporal inconsistency. A further limitation is that most approaches rely solely on attention mechanisms for temporal modeling, providing no explicit motion supervision. We propose FlowVVTON, a mask-free framework that eliminates parsing mask dependency entirely. Optical flow is used solely as a training-time supervision signal: a flow-warped latent loss, applied across all layers of the generation model, enforces multi-scale temporal consistency by aligning adjacent-frame features under explicit physical motion constraints. A two-stage training strategy establishes mask-free spatial alignment before introducing flow-guided temporal supervision. Experiments on TikTokDress show that FlowVVTON outperforms baselines by substantial margins, particularly in temporal consistency (5.7$\times$ VFID-R improvement over SwiftTry), while requiring no segmentation masks, pose keypoints, or region annotations at any stage.
- Abstract(参考訳): Video Virtual try-onは、ターゲットの衣服を動画フレームを介して動く人に転送することを目的としている。
現在の方法は、人間のパーシングマスクや、大きな動きや閉塞の下で頻繁に失敗するキーポイントのポーズに依存しており、境界アーチファクトと時間的矛盾を引き起こしている。
さらなる制限は、ほとんどのアプローチが時間的モデリングの注意機構のみに依存しており、明確な動きの監督を提供していないことである。
マスク依存を完全に排除するマスフリーフレームワークであるFlowVVTONを提案する。
光フローはトレーニング時監視信号としてのみ使用される: 生成モデルのすべての層に適用されるフローワート遅延損失は、隣接するフレームの特徴を明示的な物理運動制約の下で整列させることで、マルチスケールの時間的一貫性を強制する。
2段階のトレーニング戦略は、フロー誘導時間監視を導入する前にマスクのない空間アライメントを確立する。
TikTokDressの実験によると、FlowVVTONは、特に時間的一貫性(SwiftTryよりも5.7$\times$VFID-Rの改善)において、セグメンテーションマスク、キーポイントのポーズ、リージョンアノテーションを必要とせず、ベースラインをかなり上回っている。
関連論文リスト
- MASQ: Mask-Aware Spatiotemporal Quantization for Unsupervised Skeleton Action Segmentation [3.245685960209373]
非トリミング骨格に基づく時間的行動セグメンテーションは、長い教師なし配列における人間の行動を理解するための重要なタスクである。
近年のアプローチは、運動表現から行動境界を発見するために離散量子化に依存することが多い。
本研究では,新しいマスク対応時空間量子化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-30T16:40:32Z) - Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency [74.90075313101933]
本稿では、より局所的な監視設計により、同じ光フロープリミティブを再考する。
我々は隣接フレームのユーレアン運動場を用いて生成を誘導し、そこでは運動信号が常に短い時間ホップを記述する。
隣接するフレーム生成に共通するドリフトアーティファクトを軽減するために,双方向幾何整合機構を導入する。
論文 参考訳(メタデータ) (2026-05-07T13:53:31Z) - RAFT-MSF++: Temporal Geometry-Motion Feature Fusion for Self-Supervised Monocular Scene Flow [51.43025173196566]
単眼のシーンフロー推定は画像列から高密度な3次元動きを復元することを目的としている。
RAFT-MSF++は,時間的特徴を融合して深度とシーンフローを推定する自己教師型マルチフレームフレームワークである。
実験の結果、RAFT-MSF++はKITTI Scene Flowベンチマークで24.14%のSF-allを達成した。
論文 参考訳(メタデータ) (2026-04-21T11:32:49Z) - Characterizing Motion Encoding in Video Diffusion Timesteps [50.13907856401258]
本研究では,映像拡散時間ステップにおける動きのエンコードについて,外観編集と動作保存のトレードオフによって検討する。
動作優位の早期体制と,その後に出現優位の体制を同定し,時間空間における動作優位の境界を導出する。
論文 参考訳(メタデータ) (2025-12-18T21:20:54Z) - PEMF-VTO: Point-Enhanced Video Virtual Try-on via Mask-free Paradigm [21.1235226974745]
Video Virtual Try-onは、ビデオ内の対象人物に参照服をシームレスに転送することを目的としている。
既存の手法は通常、試着領域を定義するために塗装マスクに依存している。
そこで我々は,PEMF-VTO(Point-Enhanced Mask-Free Video Virtual Try-On)を提案する。
論文 参考訳(メタデータ) (2024-12-04T04:24:15Z) - Motion-inductive Self-supervised Object Discovery in Videos [99.35664705038728]
本稿では,連続的なRGBフレームの処理モデルを提案し,層状表現を用いて任意のフレーム間の光の流れを推定する。
3つの公開ビデオセグメンテーションデータセットにおいて,従来の最先端手法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2022-10-01T08:38:28Z) - A Deep Temporal Fusion Framework for Scene Flow Using a Learnable Motion
Model and Occlusions [17.66624674542256]
複数フレーム構成におけるシーンフロー推定の時間的融合のための新しいデータ駆動手法を提案する。
第2のステップでは、ニューラルネットワークが共通の参照フレームから双方向のシーンフロー推定値を合成し、洗練された推定値を生成する。
このようにして、本手法は、複数のシーンフロー推定器に対して高速なマルチフレーム拡張を提供し、基礎となるデュアルフレームアプローチよりも優れている。
論文 参考訳(メタデータ) (2020-11-03T10:14:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。