論文の概要: UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
- arxiv url: http://arxiv.org/abs/2605.00658v1
- Date: Fri, 01 May 2026 13:40:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 17:43:28.970935
- Title: UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
- Title(参考訳): UniVidX: 拡散プリミティブによるヴァーサタイルビデオ生成のための統一マルチモーダルフレームワーク
- Authors: Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing Xiao, Yuwei Guo, Chongjie Ye, Lvmin Zhang, Hao Zhao, Anyi Rao,
- Abstract要約: ビデオ生成にVDMプリエントを活用する統合フレームワークUniVidXを提案する。
UniVidXは、共有マルチモーダル空間における条件生成としてピクセル整列タスクを定式化する。
バックボーンのネイティブな前駆体を保ちながら、モダリティ特異的な分布に適応する。
- 参考スコア(独自算出の注目度): 26.743983108253943
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Recent progress has shown that video diffusion models (VDMs) can be repurposed for diverse multimodal graphics tasks. However, existing methods often train separate models for each problem setting, which fixes the input-output mapping and limits the modeling of correlations across modalities. We present UniVidX, a unified multimodal framework that leverages VDM priors for versatile video generation. UniVidX formulates pixel-aligned tasks as conditional generation in a shared multimodal space, adapts to modality-specific distributions while preserving the backbone's native priors, and promotes cross-modal consistency during synthesis. It is built on three key designs. Stochastic Condition Masking (SCM) randomly partitions modalities into clean conditions and noisy targets during training, enabling omni-directional conditional generation instead of fixed mappings. Decoupled Gated LoRA (DGL) introduces per-modality LoRAs that are activated when a modality serves as the generation target, preserving the strong priors of the VDM. Cross-Modal Self-Attention (CMSA) shares keys and values across modalities while keeping modality-specific queries, facilitating information exchange and inter-modal alignment. We instantiate UniVidX in two domains: UniVid-Intrinsic, for RGB videos and intrinsic maps including albedo, irradiance, and normal; and UniVid-Alpha, for blended RGB videos and their constituent RGBA layers. Experiments show that both models achieve performance competitive with state-of-the-art methods across distinct tasks and generalize robustly to in-the-wild scenarios, even when trained on fewer than 1,000 videos. Project page: https://houyuanchen111.github.io/UniVidX.github.io/
- Abstract(参考訳): 近年の進歩により,ビデオ拡散モデル(VDM)は多様なマルチモーダルグラフィクスタスクに再利用可能であることが示されている。
しかし、既存の手法では、各問題設定ごとに個別のモデルを訓練し、入力出力マッピングを修正し、モダリティ間の相関のモデリングを制限する。
我々は、VDMプリエントを多目的ビデオ生成に活用する統合マルチモーダルフレームワークUniVidXを提案する。
UniVidXは、共有マルチモーダル空間における条件生成としてピクセル整列タスクを定式化し、バックボーンのネイティブな事前保存を保ちながら、モダリティ固有の分布に適応し、合成中のクロスモーダル一貫性を促進する。
3つの鍵となる設計を踏襲している。
確率的条件マスキング(SCM)は、トレーニング中にモダリティをクリーンな条件とノイズの多い目標にランダムに分割し、固定されたマッピングの代わりに全方向の条件生成を可能にする。
Decoupled Gated LoRA (DGL) は、モダリティが生成ターゲットとなるときに活性化されるモダリティごとのLORAを導入し、VDMの強い先行を保っている。
Cross-Modal Self-Attention (CMSA)は、モダリティを横断するキーと値を共有し、モダリティ固有のクエリを保持し、情報交換とモダリティ間のアライメントを容易にする。
我々はUniVidXを2つの領域にインスタンス化する: UniVid-Intrinsic、RGBビデオ用、アルベド、照射、正常を含む固有マップ用、UniVid-Alpha、ブレンドされたRGBビデオとその構成RGBA層用。
実験によると、どちらのモデルも、異なるタスクにわたる最先端の手法と性能を競い合っており、1000本未満のビデオでトレーニングされた場合でも、現場のシナリオにしっかりと適応している。
プロジェクトページ:https://houyuanchen111.github.io/UniVidX.github.io/
関連論文リスト
- VINO: A Unified Visual Generator with Interleaved OmniModal Context [36.71641694179164]
VINOは、単一のフレームワーク内で画像とビデオの生成と編集を行う統合ビジュアルジェネレータである。
タスク固有のモデルやモジュールを各モダリティに依存するのではなく、VINOは共有拡散バックボーンを使用する。
論文 参考訳(メタデータ) (2026-01-05T18:56:34Z) - X-ReID: Multi-granularity Information Interaction for Video-Based Visible-Infrared Person Re-Identification [79.37768038337971]
本稿では,VVI-ReIDのためのX-ReIDという新しいクロスモーダル特徴学習フレームワークを提案する。
具体的には、まずクロスモダリティプロトタイプコラボレーション(CPC)を提案する。
次に, 隣接フレームからの短期的相互作用, 長期的クロスフレーム情報融合, クロスモダリティ特徴アライメントを組み込んだMII(Multi-granularity Information Interaction)を設計する。
論文 参考訳(メタデータ) (2025-11-22T07:57:15Z) - UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models [12.21686773633269]
広範なコーパスで訓練された大規模言語モデルは、単一の生成フレームワーク内で多様な言語タスクを統一することに成功した。
このようなモデリングには、モダリティやソースをまたいだタスク固有の事前トレーニングが必要です。
タスク固有の変更なしに様々な視覚タスクを処理するために,ビデオ拡散変換器を微調整するフレームワークであるUniVidを提案する。
論文 参考訳(メタデータ) (2025-09-26T01:43:40Z) - Unified Multimodal Discrete Diffusion [78.48930545306654]
複数のモードをまたいだ理解と生成が可能なマルチモーダル生成モデルは、自己回帰(AR)アプローチによって支配される。
共同テキストと画像領域の統一的な生成形式としての離散拡散モデルについて検討する。
テキストと画像の共同理解・生成が可能なUnified Multimodal Discrete Diffusion (UniDisc) モデルを提案する。
論文 参考訳(メタデータ) (2025-03-26T17:59:51Z) - Multi-Pair Temporal Sentence Grounding via Multi-Thread Knowledge Transfer Network [57.72095897427665]
時間文グラウンドディング(TSG)は、ビデオ中のクエリ関連セグメントを見つけることを目的としている。
従来のメソッドは、異なるペアを一緒にトレーニングできないシングルスレッドフレームワークに従っていた。
我々はこれらのペアを協調訓練することを目的としたMulti-Pair TSGを提案する。
論文 参考訳(メタデータ) (2024-12-20T08:50:11Z) - FM-ViT: Flexible Modal Vision Transformers for Face Anti-Spoofing [88.6654909354382]
本稿では,顔のアンチ・スプーフィングのためのフレキシブル・モーダル・ビジョン・トランス (FM-ViT) と呼ばれる,純粋なトランスフォーマーベースのフレームワークを提案する。
FM-ViTは、利用可能なマルチモーダルデータの助けを借りて、任意の単一モーダル(すなわちRGB)攻撃シナリオを柔軟にターゲットすることができる。
実験により、FM-ViTに基づいてトレーニングされた単一モデルは、異なるモーダルサンプルを柔軟に評価できるだけでなく、既存のシングルモーダルフレームワークよりも大きなマージンで優れていることが示された。
論文 参考訳(メタデータ) (2023-05-05T04:28:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。