論文の概要: M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming
- arxiv url: http://arxiv.org/abs/2607.14005v1
- Date: Wed, 15 Jul 2026 16:36:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.83318
- Title: M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming
- Title(参考訳): M$^\text{4}$World:対話型オブジェクト操作と分長ストリーミングのためのマルチビューマルチモーダル駆動世界モデル
- Abstract要約: M$text4$Worldはマルチビューおよびマルチモーダル生成駆動世界モデルである。
微粒なオブジェクト操作はフレキシブルなコンディショニングインタフェースによって実現される。
安定した分長ストリーミングは、マルチステージのトレーニングフレームワークを通じて実現される。
- 参考スコア(独自算出の注目度): 26.912855667055307
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Driving-world generation has emerged as a core capability for scalable autonomous-driving simulation, yet existing methods remain limited in object-level controllability and long-horizon stability. We present M$^\text{4}$World, a Multi-view and Multimodal generative driving world model that synthesizes future surround-view video streams and synchronized LiDAR scans while supporting interactive object Manipulation and stable Minute-long streaming. Fine-grained object manipulation is realized through a flexible conditioning interface that supports explicit control over both the spatial layout and visual appearance of individual objects. Stable minute-long streaming, on the other hand, is achieved through a multi-stage training framework that enables online causal generation in only four denoising steps while maintaining coherent world dynamics throughout extended rollouts. Building on these components, we introduce an efficient few-clip post-training as well as a suite of visual reference-conditioned generation models, preserving general generation ability while allowing rare-case customization for long-tail controllability. To assess controllability beyond realism, we further introduce an automated VLM-based judging pipeline that evaluates scene-level condition adherence, view-wise object controllability, and cross-view object consistency. Comprehensive experiments show that M$^\text{4}$World consistently delivers high generation quality, precise controllability, and stable minute-long streaming. Together with downstream long-tail augmentation and scene editing, these results demonstrate the potential of M$^\text{4}$World for controllable, scalable driving simulation.
- Abstract(参考訳): 運転世界生成は、スケーラブルな自動運転シミュレーションのコア機能として登場したが、既存の手法は、オブジェクトレベルの制御性と長期の安定性に制限されている。
M$^\text{4}$Worldは、将来のサラウンドビュービデオストリームと同期LiDARスキャンを合成し、インタラクティブなオブジェクト操作と安定なMinute-longストリーミングをサポートするマルチビューおよびマルチモーダル生成駆動世界モデルである。
個々のオブジェクトの空間的レイアウトと視覚的外観の両方を明示的に制御できるフレキシブルな条件付けインタフェースによって、きめ細かいオブジェクト操作を実現する。
一方、安定的な分長ストリーミングは、オンライン因果生成をわずか4ステップで可能とし、拡張されたロールアウトを通じてコヒーレントな世界ダイナミクスを維持しながら、マルチステージのトレーニングフレームワークによって達成される。
これらのコンポーネントをベースとして,視覚的参照条件付き生成モデルと効率的な数クリック後トレーニングを導入し,長いテール制御性を考慮したレアケースのカスタマイズを実現した。
リアリズムを超えた制御性を評価するために,シーンレベルの条件適合性,ビューワイドオブジェクト制御性,ビューオブジェクトの相互整合性を評価する,VLMに基づく自動判断パイプラインを導入する。
総合的な実験により、M$^\text{4}$Worldは、常に高品質、正確な制御性、安定した分長ストリーミングを提供することが示された。
これらの結果から,制御可能でスケーラブルな運転シミュレーションのためのM$^\text{4}$Worldの可能性が示された。
関連論文リスト
- EchoWM: Open and Enterable Omnimodal World Models [71.49148067556887]
EchoWMは、入力可能な生成メディアのための一様世界モデルである。
720pのビデオ、環境音、音楽、音声を共同生成しながら、継続的なナビゲーションに反応する。
論文 参考訳(メタデータ) (2026-08-24T12:39:59Z) - Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control [31.020641426071293]
我々は、スケーラブルな異種アクション制御のためのMixture-of-Experts世界モデルであるWorldscape-MoEを紹介する。
私たちのキーとなる観察は、異なるコントロールが、同じ基礎となる世界に対して異なるインターフェースを指定していることです。
Worldscape-MoEは、この観察をモダリティ対応制御インジェクション、共有および制御固有の専門家、およびプログレッシブなMoEチューニング戦略を通じて運用する。
論文 参考訳(メタデータ) (2026-07-04T17:45:38Z) - WOLF-VLA: Whole-Body Humanoid Optimal Locomotion Framework for Vision-Language-Action Learning [4.427336047705734]
VLA(Vision-Language-Action)モデルは最近、ロボット操作の強力な一般化を実証している。
この研究は、全身最適制御(OC)モーション合成と大規模マルチモーダルデータセットを統合する統合フレームワークWOLF-VLAを導入する。
我々は6つの移動関連タスクファミリにまたがって動的に実現可能なヒューマノイドトラジェクトリの包括的データセットを構築した。
我々は,収集された共同軌跡,エゴ中心の視覚観察,自然言語指導を用いてVLAモデルを訓練し,初期条件変動に対する強い推論と堅牢性を示す政策を導出する。
論文 参考訳(メタデータ) (2026-06-24T08:59:59Z) - DisCo: World Models with Discrete Camera Motion Control [79.86256515640231]
本研究では、離散アクションプリミティブのコンパクトなセットで生成し、アクション分離性を改善する制御可能なビデオワールドモデルであるDisCoを提案する。
DisCoは、視覚的品質を維持しながら、はるかに信頼性の高いアクションを達成する。
論文 参考訳(メタデータ) (2026-06-06T03:50:45Z) - MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data [125.43597497646444]
MetaWorldは、マルチエージェントビデオワールドモデルをシングルビュービデオから直接オープンドメイン環境にスケールする新しいフレームワークである。
クロスビューの一貫性とアイデンティティの整合性を向上し、マルチエージェントビデオワールドモデリングのための高度にスケーラブルで物理駆動のパラダイムを確立する。
論文 参考訳(メタデータ) (2026-06-01T18:20:20Z) - X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving [45.260296714057766]
我々は,アクション条件付きマルチカメラ生成世界モデルであるX-Worldを紹介し,ビデオ空間における将来の観測を直接シミュレートする。
X-Worldは動的トラフィックエージェントと静的道路要素のオプションコントロールをサポートし、外観レベルの制御のためのテキストプロンプトインターフェイスを保持する。
実験により,X-Worldは高画質のマルチビュービデオ生成を実現し,カメラ間の高精細性を実現した。
論文 参考訳(メタデータ) (2026-03-20T14:23:32Z) - TeleWorld: Towards Dynamic Multimodal Synthesis with a 4D World Model [53.555353366322464]
我々は,映像生成,動的シーン再構成,長期記憶をクローズドループシステム内で統合するリアルタイム多モード4DワールドモデリングフレームワークTeleWorldを提案する。
提案手法は,動的オブジェクトモデリングと静的シーン表現のシームレスな統合を実現し,現実的でインタラクティブで計算可能な合成システムに向けて世界モデルを推し進める。
論文 参考訳(メタデータ) (2025-12-31T18:31:46Z) - GEM: A Generalizable Ego-Vision Multimodal World Model for Fine-Grained Ego-Motion, Object Dynamics, and Scene Composition Control [122.65089441381741]
一般化可能なエゴビジョン・マルチモーダル世界モデルであるGEMについて述べる。
参照フレーム、スパース機能、人間のポーズ、エゴ軌道を使って将来のフレームを予測する。
私たちのデータセットは、自律運転、エゴセントリックな人間活動、ドローン飛行など、複数の領域にまたがる4000時間以上のマルチモーダルデータで構成されています。
論文 参考訳(メタデータ) (2024-12-15T14:21:19Z) - Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention [61.3281618482513]
高品質なマルチビュー駆動ビデオの合成を目的とした,新しいネットワークであるCogDrivingについて紹介する。
CogDriving は Diffusion Transformer アーキテクチャと holistic-4D attention module を活用し、次元間の同時結合を可能にする。
CogDrivingは、nuScenesバリデーションセットで強力なパフォーマンスを示し、FVDスコア37.8を達成し、リアルなドライビングビデオを生成する能力を強調している。
論文 参考訳(メタデータ) (2024-12-04T18:02:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。