論文の概要: MoRoute: Dynamic Routing for In-Context Multimodal Video Generation
- arxiv url: http://arxiv.org/abs/2607.29545v1
- Date: Fri, 31 Jul 2026 15:38:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.784117
- Title: MoRoute: Dynamic Routing for In-Context Multimodal Video Generation
- Title(参考訳): MoRoute: インコンテキストマルチモーダルビデオ生成のための動的ルーティング
- Authors: Chong Gao, Jie Ma, Zhan Peng, Chongxiao Wang, Haoxue Wu, Jun Liang, Guanbin Li, Jing Li,
- Abstract要約: マルチモーダルビデオ生成は、テキスト、画像、ビデオの任意の組み合わせを前提としたビデオの生成と編集を目的としている。
我々は,凍結VLMと事前訓練ビデオDiTを定式化する統合マルチモーダルビデオ生成フレームワークであるMoRouteを紹介する。
IntelligentVBench、OpenVE-Bench、RefVIE-Benchの実験は、MoRouteが各ベンチマークで最高の競合メソッドを一貫して上回っていることを示している。
- 参考スコア(独自算出の注目度): 45.64272608275956
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal video generation aims to generate and edit videos conditioned on arbitrary combinations of text, images, and videos within a single model, allowing diverse tasks to share complementary data and generative priors. Unifying these tasks requires multimodal understanding of diverse conditions, which is typically provided by a pretrained vision-language model (VLM). A key challenge is how to connect the VLM's hierarchical multimodal representations with a pretrained video diffusion transformer (DiT). Existing methods either inject features from only the final or a few manually selected VLM layers, or jointly train architecture-matched understanding and generation streams, making it difficult to reuse heterogeneous pretrained backbones. We introduce MoRoute, a unified multimodal video generation framework that formulates a frozen VLM and a pretrained video DiT with different architectures as heterogeneous experts connected through dynamic layer routing. For each input, a lightweight block-wise router enables every DiT block to select the VLM layer most relevant to its generation stage, thereby learning an adaptive correspondence between multimodal understanding and video synthesis. MoRoute further incorporates reference images and source videos directly into the DiT token sequence through unified in-context conditioning, preserving fine-grained visual details across diverse generation and editing tasks. Experiments on IntelligentVBench, OpenVE-Bench, and RefVIE-Bench show that MoRoute consistently surpasses the best competing method on each benchmark, improving the average score by 0.15, 0.18, and 0.34 on a 1-5 scale, respectively.
- Abstract(参考訳): マルチモーダルビデオ生成は、テキスト、画像、ビデオの任意の組み合わせを1つのモデルで生成し、編集することを目的としている。
これらのタスクを統合するには、様々な条件のマルチモーダルな理解が必要であり、通常は事前訓練された視覚言語モデル(VLM)によって提供される。
重要な課題は、VLMの階層的マルチモーダル表現を事前訓練されたビデオ拡散変換器(DiT)に接続する方法である。
既存の手法では、最終層または少数の手動で選択されたVLM層からのみ機能を注入するか、アーキテクチャに適合した理解と生成ストリームを共同で訓練することで、不均一な事前訓練されたバックボーンの再利用が困難になる。
動的層ルーティングによって接続された異種の専門家として,凍結VLMと事前学習ビデオDiTを異なるアーキテクチャで定式化する,統合マルチモーダルビデオ生成フレームワークであるMoRouteを紹介する。
各入力に対して、軽量なブロックワイドルータにより、各DiTブロックがその生成段階に最も関係のあるVLM層を選択することができ、これにより、マルチモーダル理解とビデオ合成の適応対応を学習することができる。
MoRouteはさらに、参照画像とソースビデオを直接DiTトークンシーケンスに組み込む。
IntelligentVBench、OpenVE-Bench、RefVIE-Benchの実験では、MoRouteはベンチマーク毎の最高の競合手法を一貫して上回り、平均スコアをそれぞれ1-5スケールで0.15、0.18、0.34改善している。
関連論文リスト
- Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing [93.8111348452324]
Tele-Omniはビデオ生成と編集のための統合されたフレームワークで、マルチモーダルな指示に従う。
テキスト・ツー・ビデオ生成、画像・ビデオ生成、ファースト・ラスト・フレーム・ビデオ生成、イン・コンテクスト・ビデオ生成、およびイン・コンテクスト・ビデオ編集をサポートする。
論文 参考訳(メタデータ) (2026-02-10T10:01:16Z) - VINO: A Unified Visual Generator with Interleaved OmniModal Context [36.71641694179164]
VINOは、単一のフレームワーク内で画像とビデオの生成と編集を行う統合ビジュアルジェネレータである。
タスク固有のモデルやモジュールを各モダリティに依存するのではなく、VINOは共有拡散バックボーンを使用する。
論文 参考訳(メタデータ) (2026-01-05T18:56:34Z) - DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation [54.30327187663316]
DiTCtrlは、MM-DiTアーキテクチャの下で初めてトレーニング不要なマルチプロンプトビデオ生成手法である。
MM-DiTの注意機構を解析し、3次元のフルアテンションがUNetのような拡散モデルにおけるクロス/セルフアテンションブロックと同様の振る舞いを示す。
我々の注意深い設計に基づいて、DiTCtrlによって生成されたビデオは、複数のシーケンシャルプロンプトが与えられた滑らかな遷移と一貫した物体の動きを達成する。
論文 参考訳(メタデータ) (2024-12-24T18:51:19Z) - VIMI: Grounding Video Generation through Multi-modal Instruction [89.90065445082442]
既存のテキスト間拡散モデルは、事前訓練のためにテキストのみのエンコーダにのみ依存する。
検索手法を用いて大規模マルチモーダル・プロンプト・データセットを構築し,テキスト・プロンプトとテキスト・プロンプトのペア化を行う。
マルチモーダル命令を組み込んだ3つのビデオ生成タスクにおいて,第1ステージからモデルを微調整する。
論文 参考訳(メタデータ) (2024-07-08T18:12:49Z) - Tuning Large Multimodal Models for Videos using Reinforcement Learning from AI Feedback [38.708690624594794]
ビデオとテキストのマルチモーダルアライメントは、主にマルチモーダル命令・チューンデータのボリュームと品質が不足しているため、依然として困難である。
本稿では,AIフィードバックからの強化学習(Reinforcement Learning from AI Feedback, RLAIF)と呼ばれる,マルチモーダルAIシステムを用いた新たなアライメント戦略を提案する。
具体的には、嗜好フィードバックの生成中に、詳細な映像記述を文脈として提供することによって、文脈対応報酬モデルを提案する。
論文 参考訳(メタデータ) (2024-02-06T06:27:40Z) - Hierarchical Multimodal Transformer to Summarize Videos [103.47766795086206]
変換器の大成功とビデオの自然な構造(フレームショットビデオ)に触発された階層変換器は,映像要約のために開発された。
2種類の情報を統合するために、2ストリーム方式で符号化し、階層変換器に基づいて多モード融合機構を開発する。
実際、広範な実験により、HMTは従来のRNNベースおよび注意に基づくビデオ要約手法のほとんどを超越していることが示された。
論文 参考訳(メタデータ) (2021-09-22T07:38:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。