論文の概要: WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment
- arxiv url: http://arxiv.org/abs/2607.19923v1
- Date: Wed, 22 Jul 2026 08:55:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.034449
- Title: WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment
- Title(参考訳): WearWow:Adaptive Token PackingとPreference Alignmentによるネイティブ2Kマルチガーメントバーチャルトライオン
- Abstract要約: 超高分解能マルチガーメント合成の先駆者であるWearWowについて述べる。
メモリ爆発を緩和するために,適応型2DToken Packing (ATP)を提案する。
テクスチャ劣化の是正のために,多次元トライオン・リワード(MTR)を導入する。
- 参考スコア(独自算出の注目度): 50.39311913179626
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Synthesizing native 2K multi-garment virtual try-on is a formidable frontier in digital fashion, critically bottlenecked by two fundamental limitations: the O(N^2) memory explosion induced by 2k conditions, and the spectral bias of diffusion models that over-smooths high-frequency fabric details. We present WearWow, an end-to-end, mask-free generative framework that pioneers ultra-high-resolution multi-garment synthesis. To mitigate the memory explosion , we propose Adaptive 2D Token Packing (ATP). ATP leverages inherent garment sparsity to algorithmically pack heterogeneous items onto a unified 2D canvas and prune uninformative background tokens, minimizing the effective sequence length and subsequent memory overhead while rigorously preserving 2D spatial priors. To rectify texture degradation, we introduce the Multi-dimensional Try-on Reward (MTR) system. MTR synergizes a Semantic Guidance Reward to explicitly drive tactile restoration with a Cloth Distribution Reward to implicitly anchor the physical distribution, a joint formulation that effectively mitigates the severe reward hacking. Furthermore, we curate WearWow-2K, an extreme-quality dataset comprising native 2K triplets, providing physically correct spatial interactions that naturally empower the model's mask-free generation. Extensive experiments demonstrate that WearWow establishes a new state-of-the-art, exceeding existing commercial baselines in native 2K multi-garment synthesis.
- Abstract(参考訳): ネイティブな2Kマルチガーメント仮想トライオンの合成は、デジタル方式の強大なフロンティアであり、2k条件によって引き起こされるO(N^2)メモリの爆発と、高周波ファブリックの詳細を過度に滑らかにする拡散モデルのスペクトルバイアスという2つの基本的な制限によって、重要なボトルネックとなっている。
超高分解能マルチガーメント合成の先駆者であるWearWowについて述べる。
メモリ爆発を軽減するため,Adaptive 2D Token Packing (ATP)を提案する。
ATPは固有の衣服の空間性を生かし、不均一なアイテムを統一された2Dキャンバスとプーン不定形背景トークンにアルゴリズムでパックし、有効配列の長さとその後のメモリオーバーヘッドを最小限に抑えながら2D空間の先行を厳格に保存する。
テクスチャ劣化の是正のために,多次元トライ・オン・リワード (MTR) システムを導入する。
MTRは、セマンティック・ガイダンス・リワード(Semantic Guidance Reward)をシナジし、暗黙的に物理分布をアンカーするために布地分布・リワード(Cloth Distribution Reward)で触覚回復を明示的に駆動する。
さらに、ネイティブな2Kトリガからなる超高品質データセットであるWearWow-2Kをキュレートし、物理的に正しい空間相互作用を提供し、モデルの自由な生成を自然に促進する。
大規模な実験により、WearWowは2Kのネイティブなマルチガーメント合成において、既存の商用ベースラインを超える新しい最先端技術を確立していることが示されている。
関連論文リスト
- Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks [54.32016216994156]
本稿では,DINOv3特徴を生成対象として用い,視覚ノイズから相互作用意味を乱す因果潜在世界モデル(CLWM)を提案する。
メモリスケーリングを克服するため、CLWMはDual-State Test-Time Training (TTT)メモリを備えている。
EmbodiChainは、トレーニング中に物理基底軌道の無限の流れを注入することによって効率法を確立するオンラインフレームワークである。
論文 参考訳(メタデータ) (2026-04-13T03:19:36Z) - Generative Video Compression with One-Dimensional Latent Representation [59.29493435530304]
1次元(1次元)遅延表現(GVC1D)による生成ビデオ圧縮について紹介する。
GVC1Dはビデオデータを、短期と長期の両方の文脈で条件付けられた極端にコンパクトな1D潜在トークンにエンコードする。
実験結果から,GVC1Dの圧縮効率は従来の圧縮法よりも優れていた。
論文 参考訳(メタデータ) (2026-03-16T14:02:17Z) - A Two-Stage Dual-Modality Model for Facial Emotional Expression Recognition [5.014305646574725]
本稿では,第10回ABAWワークショップおよびコンペティションにおけるEXPR認識課題について論じる。
拘束されていないビデオから8つの顔の感情表現をフレームレベルで分類する必要がある。
これらの問題に対処する2段階のデュアルモーダル(音響・視覚)モデルを提案する。
論文 参考訳(メタデータ) (2026-03-12T17:45:12Z) - StdGEN++: A Comprehensive System for Semantic-Decomposed 3D Character Generation [57.06461272772509]
StdGEN++は、多種多様な入力から高忠実で意味的に分解された3D文字を生成するための、新しく包括的なシステムである。
最先端の性能を達成し、幾何学的精度と意味的絡み合いにおいて既存の手法を著しく上回っている。
結果として、非破壊的な編集、物理学に準拠したアニメーション、視線追跡など、より進んだ下流の機能をアンロックする。
論文 参考訳(メタデータ) (2026-01-12T15:41:27Z) - One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation [33.56782043207013]
Feature Auto-Encoder (FAE) は、学習済みの視覚表現を、単一の注意層としてほとんど使用せずに生成に適した低次元の潜伏子に適応させる。
FAEはクラス条件とテキスト・ツー・イメージのベンチマークで高いパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-12-08T18:57:26Z) - DS-VTON: An Enhanced Dual-Scale Coarse-to-Fine Framework for Virtual Try-On [33.05238077456732]
仮想試行のための拡張デュアルスケール粗大化フレームワークDS-VTONを提案する。
DS-VTONは2つの段階から構成される: 第一は、衣服と身体の間の意味的対応を捉えるために、低解像度の試行結果を生成する。
第2段階では、混合精製拡散過程は、スケール間の残留物を精製することによって高分解能出力を再構成する。
論文 参考訳(メタデータ) (2025-06-01T08:52:57Z) - MF-VITON: High-Fidelity Mask-Free Virtual Try-On with Minimal Input [69.33864837012202]
本研究では,一人のイメージとターゲット衣服のみを用いて,現実的なVITONを実現するMask-Free VITONフレームワークを提案する。
既存のMaskベースのVITONモデルを利用して高品質なデータセットを合成する。
このデータセットには、多様で現実的な人物画像とそれに対応する衣服が含まれており、背景も様々で、現実世界のシナリオを模倣している。
論文 参考訳(メタデータ) (2025-03-11T17:40:59Z) - $λ$-ECLIPSE: Multi-Concept Personalized Text-to-Image Diffusion Models by Leveraging CLIP Latent Space [61.091910046492345]
$lambda$-ECLIPSEは、拡散UNetモデルに頼ることなく、事前訓練されたCLIPモデルの潜在空間で動作する。
$lambda$-ECLIPSEは、たった34Mパラメータでマルチオブジェクト駆動のP-T2Iを実行し、わずか74GPU時間でトレーニングされる。
論文 参考訳(メタデータ) (2024-02-07T19:07:10Z) - AliasNet: Alias Artefact Suppression Network for Accelerated
Phase-Encode MRI [4.752084030395196]
スパース再構成はMRIの重要な側面であり、取得時間を短縮し、空間時間分解能を改善するのに役立つ。
1D AliasNetモジュールと既存の2Dディープラーニング(DL)リカバリ技術を組み合わせることで、画像の品質が向上することが実証された。
論文 参考訳(メタデータ) (2023-02-17T13:16:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。