論文の概要: X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving
- arxiv url: http://arxiv.org/abs/2603.19979v1
- Date: Fri, 20 Mar 2026 14:23:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:39.17925
- Title: X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving
- Title(参考訳): X-World: スケーラブルエンド・ツー・エンド駆動のための制御可能なエゴ中心多カメラ世界モデル
- Authors: Chaoda Zheng, Sean Li, Jinhao Deng, Zhennan Wang, Shijia Chen, Liqiang Xiao, Ziheng Chi, Hongbin Lin, Kangjie Chen, Boyang Wang, Yu Zhang, Xianming Liu,
- Abstract要約: 我々は,アクション条件付きマルチカメラ生成世界モデルであるX-Worldを紹介し,ビデオ空間における将来の観測を直接シミュレートする。
X-Worldは動的トラフィックエージェントと静的道路要素のオプションコントロールをサポートし、外観レベルの制御のためのテキストプロンプトインターフェイスを保持する。
実験により,X-Worldは高画質のマルチビュービデオ生成を実現し,カメラ間の高精細性を実現した。
- 参考スコア(独自算出の注目度): 45.260296714057766
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scalable and reliable evaluation is increasingly critical in the end-to-end era of autonomous driving, where vision--language--action (VLA) policies directly map raw sensor streams to driving actions. Yet, current evaluation pipelines still rely heavily on real-world road testing, which is costly, biased toward limited scenario coverage, and difficult to reproduce. These challenges motivate a real-world simulator that can generate realistic future observations under proposed actions, while remaining controllable and stable over long horizons. We present X-World, an action-conditioned multi-camera generative world model that simulates future observations directly in video space. Given synchronized multi-view camera history and a future action sequence, X-World generates future multi-camera video streams that follow the commanded actions. To ensure reproducible and editable scene rollouts, X-World further supports optional controls over dynamic traffic agents and static road elements, and retains a text-prompt interface for appearance-level control (e.g., weather and time of day). Beyond world simulation, X-World also enables video style transfer by conditioning on appearance prompts while preserving the underlying action and scene dynamics. At the core of X-World is a multi-view latent video generator designed to explicitly encourage cross-view geometric consistency and temporal coherence under diverse control signals. Experiments show that X-World achieves high-quality multi-view video generation with (i) strong view consistency across cameras, (ii) stable temporal dynamics over long rollouts, and (iii) high controllability with strict action following and faithful adherence to optional scene controls. These properties make X-World a practical foundation for scalable and reproducible evaluation.
- Abstract(参考訳): 視覚-言語-アクション(VLA)ポリシーは、生のセンサストリームを直接駆動アクションにマッピングする。
しかし、現在の評価パイプラインは依然として実際の道路テストに大きく依存しており、コストがかかり、限られたシナリオカバレッジに偏りがあり、再現が難しい。
これらの課題は現実のシミュレータを動機付け、提案された行動の下で現実的な将来の観測を生成できる一方で、長い地平線上で制御可能で安定なままである。
我々は,アクション条件付きマルチカメラ生成世界モデルであるX-Worldを紹介し,ビデオ空間における将来の観測を直接シミュレートする。
X-Worldは、同期マルチビューカメラの歴史と将来のアクションシーケンスを考慮し、命令されたアクションに従う将来のマルチカメラビデオストリームを生成する。
再現性と編集可能なシーンロールアウトを保証するため、X-Worldはさらに動的トラフィックエージェントと静的道路要素のオプションコントロールをサポートし、外観レベルのコントロール(例えば、天気と時刻)のためのテキストプロンプトインターフェイスを保持する。
X-Worldは、世界シミュレーション以外にも、アクションやシーンのダイナミクスを保ちながら、外観プロンプトを条件付けることで、ビデオスタイルの転送を可能にしている。
X-Worldのコアとなるのは、多視点ラテントビデオジェネレータで、多様な制御信号の下で、クロスビューの幾何的一貫性と時間的コヒーレンスを明示的に促進するように設計されている。
X-Worldが高品質なマルチビュービデオ生成を実現することを示す実験
(i)カメラ間の強い視界の整合性
(二)長期ロールアウト上の安定時相ダイナミクス、及び
三 厳格な行為の追従及びオプションのシーンコントロールへの忠実な遵守を伴う高い制御性。
これらの特性により、X-Worldはスケーラブルで再現可能な評価のための実践的な基盤となる。
関連論文リスト
- LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models [32.92934803081681]
近年の世代別ビデオワールドモデルは、視覚環境の進化をシミュレートすることを目的としており、観察者はカメラ制御によってシーンをインタラクティブに探索することができる。
彼らは、世界は観察者の視野内でしか進化しないと暗黙的に仮定している。
オブジェクトがオブザーバの視点を離れると、その状態はメモリ内で"凍結"され、その後同じ領域を再考しても、その間に発生すべき出来事を反映できないことがしばしばある。
永続的な世界進化をサポートするために,ビデオワールドモデルを拡張する新しいフレームワークであるLiveWorldを提案する。
論文 参考訳(メタデータ) (2026-03-07T10:31:39Z) - DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving [49.11389494068169]
我々は、生成駆動世界モデルのための最初の総合的なベンチマークであるDrivingGenを提示する。
DrivingGenは、駆動データセットとインターネットスケールのビデオソースの両方から収集されたさまざまな評価データセットを組み合わせる。
一般的なモデルは良く見えるが物理を破るが、運転に特化したものは現実的に動きを捉えているが、視界の質は遅れている。
論文 参考訳(メタデータ) (2026-01-04T13:36:21Z) - Astra: General Interactive World Model with Autoregressive Denoising [73.6594791733982]
Astraはインタラクティブな汎用世界モデルであり、多様なシナリオのために現実世界の未来を生成する。
本稿では,自己回帰型認知型アーキテクチャを提案し,時間的因果的注意を用いて過去の観測を集約する。
Astraはインタラクティブで一貫性があり、一般的な長期的なビデオ予測を実現し、様々な形式のインタラクションをサポートする。
論文 参考訳(メタデータ) (2025-12-09T18:59:57Z) - Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence [4.778564042492516]
本稿では,映像の描画と人体動作制御を統合して,多視点運転シナリオにおける歩行者映像編集のためのフレームワークを提案する。
我々のアプローチは、複数のカメラビューにまたがる歩行者領域を特定し、一定の比率で境界ボックスを検知し、これらの領域を統一されたキャンバスに変えて縫い合わせることから始まる。
実験により, 視覚的リアリズムのコヒーレンスと視線横断的整合性により, 高品質な歩行者編集を実現することが実証された。
論文 参考訳(メタデータ) (2025-08-01T03:56:57Z) - X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability [49.4647778989539]
X-Sceneは大規模ドライビングシーン生成のための新しいフレームワークである。
幾何的複雑度と外観の忠実度の両方を実現し、フレキシブルな制御性を提供する。
X-Sceneは、大規模な運転シーン生成のための制御性と忠実性を大幅に向上させる。
論文 参考訳(メタデータ) (2025-06-16T14:43:18Z) - Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention [61.3281618482513]
高品質なマルチビュー駆動ビデオの合成を目的とした,新しいネットワークであるCogDrivingについて紹介する。
CogDriving は Diffusion Transformer アーキテクチャと holistic-4D attention module を活用し、次元間の同時結合を可能にする。
CogDrivingは、nuScenesバリデーションセットで強力なパフォーマンスを示し、FVDスコア37.8を達成し、リアルなドライビングビデオを生成する能力を強調している。
論文 参考訳(メタデータ) (2024-12-04T18:02:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。