論文の概要: CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration
- arxiv url: http://arxiv.org/abs/2605.22996v1
- Date: Thu, 21 May 2026 19:51:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-25 17:29:20.084024
- Title: CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration
- Title(参考訳): CoMoGen:Controllable Motion Dynamics and Interactions with Mask-Guided Video GENeration
- Authors: Adil Meric, Lin Geng Foo, Mert Kiray, Benjamin Busam, Rishabh Dabral, Christian Theobalt,
- Abstract要約: CoMoGenは、入力画像上に条件付けられた単一のバイナリマスクシーケンスからリアルなインタラクティブなダイナミクスを生成する、制御可能なビデオ生成フレームワークである。
CoMoGenは、制御可能なビデオ生成手法を一貫して上回り、動きの忠実さと知覚的リアリズムにおける最先端のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 66.81078857385698
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We present CoMoGen, a controllable video generation framework that generates realistic interactive dynamics from a single binary mask sequence conditioned on an input image. CoMoGen introduces a lightweight MaskAdapter that encodes binary mask sequences into a latent residual signal, injected into the Multi Modal Diffusion Transformer (MMDiT) model through a cosine-weighted schedule. Unlike the hierarchical coarse-to-fine design of UNet architectures, MMDiT operates as a sequence of uniform transformer blocks, making it difficult to identify which layers are responsible for the motion generation. Therefore, we propose a novel way to determine "Motion Layers" operating in the attention space of MMDiT. We fine-tune the model by using Low-Rank Adaptation (LoRA) to the Motion Layers, without requiring any architecture change in the MMDiT. This selective adaptation enables our method to focus on motion-critical components, yielding reduced computational cost. Despite its simplicity, CoMoGen enables precise subject motion and plausible interactions with surrounding humans, objects, and scenes. Comprehensive experiments on different datasets show that CoMoGen consistently outperforms prior controllable video generation methods and achieves state-of-the-art performance in motion fidelity and perceptual realism. Project page: mericadil.github.io/CoMoGen.
- Abstract(参考訳): 本稿では,入力画像上に条件付き単一バイナリマスクシーケンスからリアルな動的ダイナミクスを生成する,制御可能なビデオ生成フレームワークCoMoGenを提案する。
CoMoGenは、マルチモーダル拡散変換器(MMDiT)モデルにコサイン重み付きスケジュールで注入された、バイナリマスクシーケンスを遅延残留信号に符号化する軽量なMaskAdapterを導入している。
UNetアーキテクチャの階層的粗大な設計とは異なり、MMDiTは一様トランスフォーマーブロックのシーケンスとして動作するため、どの層がモーション生成に責任を持つかを特定することは困難である。
そこで本稿では,MMDiT の注意領域で動作する「移動層」を決定する新しい手法を提案する。
MMDiTのアーキテクチャ変更を必要とせずに、ローランド適応(LoRA)をモーション層に微調整する。
この選択的適応により、動作クリティカルなコンポーネントに焦点を合わせることができ、計算コストを削減できる。
そのシンプルさにもかかわらず、CoMoGenは周囲の人間、物体、シーンと正確な主題の動きとプラプシブルな相互作用を可能にする。
異なるデータセットに対する包括的実験により、CoMoGenは従来から制御可能なビデオ生成手法を一貫して上回り、動きの忠実さと知覚的リアリズムにおける最先端のパフォーマンスを達成することが示された。
プロジェクトページ:mericadil.github.io/CoMoGen。
関連論文リスト
- Not All Frames Are Equal: Complexity-Aware Masked Motion Generation via Motion Spectral Descriptors [10.685712212496753]
仮面生成モデルは、テキストとモーションの合成において強力なパラダイムとなっているが、それでも動きのフレームを不均一に扱う。
本研究では,現在のマスク型モーションジェネレータが動的に複雑な動きに対して不均等に劣化していることを示す。
このミスマッチに触発された運動スペクトル記述子(MSD)は,局所的動的複雑性の単純かつパラメータフリーな尺度である。
論文 参考訳(メタデータ) (2026-03-31T12:18:57Z) - DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding [25.254783224309488]
マスク付きモデリングからテキスト-モーション理解と生成まで拡張した,離散拡散スタイルのフレームワークであるDiMoを提案する。
動きをトークン化し、順次デコードするGPTスタイルの自己回帰アプローチとは異なり、DiMoは繰り返しマスク付きトークン精錬を行う。
HumanML3DとKIT-MLの実験は、強い運動品質と競合する双方向理解を示す。
論文 参考訳(メタデータ) (2026-02-04T04:01:02Z) - EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer [64.69014756863331]
本研究では,外見と人間の動作の同時分布をモデル化するフレームワークであるEchoMotionを紹介する。
また,ビデオトークンとモーショントークンの両方に3次元位置符号化を統一したMVS-RoPEを提案する。
以上の結果から,人間の動きを明示的に表現することは出現することであり,人間中心のビデオ生成のコヒーレンスと妥当性を著しく向上させることが判明した。
論文 参考訳(メタデータ) (2025-12-21T17:08:14Z) - MoSa: Motion Generation with Scalable Autoregressive Modeling [41.75643989500953]
テキスト駆動型3次元モーション生成のための新しい階層型モーション生成フレームワークであるMoSaを紹介する。
MoSaは最先端の生成品質と効率を達成し、忠実さとスピードの両方で先行手法より優れています。
MoSaはモーション編集などの下流タスクを一般化し、追加の微調整を必要としない。
論文 参考訳(メタデータ) (2025-11-03T03:47:58Z) - CoMo: Compositional Motion Customization for Text-to-Video Generation [40.446146411270156]
CoMoは、textbfcompositional motion customization$の新たなフレームワークである。
これは、モーションマージの絡み合いと非効率なマルチモーションブレンディングの課題に対処する。
CoMoは最先端のパフォーマンスを実現し、制御可能なビデオ生成能力を大幅に向上させる。
論文 参考訳(メタデータ) (2025-10-27T04:57:09Z) - FineMoGen: Fine-Grained Spatio-Temporal Motion Generation and Editing [56.29102849106382]
FineMoGenは拡散ベースのモーション生成および編集フレームワークである。
微細な動きを合成し、ユーザの指示に時空間の合成を施す。
FineMoGenはさらに、現代の大規模言語モデルの助けを借りて、ゼロショットモーション編集機能を可能にする。
論文 参考訳(メタデータ) (2023-12-22T16:56:02Z) - Interactive Character Control with Auto-Regressive Motion Diffusion Models [18.727066177880708]
リアルタイム動作合成のためのA-MDM(Auto-Regressive Motion Diffusion Model)を提案する。
我々の条件拡散モデルは初期ポーズを入力とし、前者のフレームに条件付けられた連続した動きフレームを自動回帰的に生成する。
本稿では,タスク指向サンプリング,インペインティング,階層的強化学習など,対話型制御をA-MDMに組み込む一連の手法を紹介する。
論文 参考訳(メタデータ) (2023-06-01T07:48:34Z) - MoDi: Unconditional Motion Synthesis from Diverse Data [51.676055380546494]
多様な動きを合成する無条件生成モデルであるMoDiを提案する。
我々のモデルは、多様な、構造化されていない、ラベルなしのモーションデータセットから完全に教師なしの設定で訓練されている。
データセットに構造が欠けているにもかかわらず、潜在空間は意味的にクラスタ化可能であることを示す。
論文 参考訳(メタデータ) (2022-06-16T09:06:25Z) - Unsupervised Motion Representation Learning with Capsule Autoencoders [54.81628825371412]
Motion Capsule Autoencoder (MCAE) は、2レベル階層のモーションをモデル化する。
MCAEは、新しいTrajectory20モーションデータセットと、様々な現実世界の骨格に基づく人間のアクションデータセットで評価されている。
論文 参考訳(メタデータ) (2021-10-01T16:52:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。