論文の概要: UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation
- arxiv url: http://arxiv.org/abs/2607.05133v1
- Date: Mon, 06 Jul 2026 14:18:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.190261
- Title: UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation
- Title(参考訳): UNIVERSE:フレキシブルマスク変調モード生成による自律走行のための統合ビデオアクションモデル
- Authors: Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Francesco Nex, Hao Cheng, Michael Ying Yang,
- Abstract要約: 世界行動モデル(WAM)は、自律運転における行動一般化を改善する強力な可能性を示している。
既存のカスケードまたはデュアルDiTは、アクション予測からビデオイマジネーションを分離する。
マスク変調トランス上に構築された統合ビデオアクションモデルであるUNIVERSEを提案する。
- 参考スコア(独自算出の注目度): 23.675212404889805
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: World Action Models (WAMs) have shown strong potential for improving action generalization in autonomous driving by using future video prediction as dense supervision for scene dynamics and temporal causality. However, it remains unclear which architecture better transfers video-modeling benefits to trajectory generation. Existing cascaded or dual-DiT designs separate video imagination from action prediction, weakening the transfer of video-learned world dynamics to the trajectory branch: the action model may still overfit dataset-specific driving priors, while the video model only indirectly regularizes planning. We propose UNIVERSE, a unified video-action model built upon a single mask-modulated Diffusion Transformer. By co-training future video latents and ego-trajectory tokens within shared generative parameters, UNIVERSE allows dense video supervision to directly shape trajectory denoising, leading to stronger cross-domain action generalization. To ensure causal validity and efficient deployment, we introduce a Modality-Decoupling Visibility Mask, which shares historical context across modalities while blocking mutual attention between future video and trajectory tokens. This prevents future-target leakage and enables trajectory-only inference by removing future-video denoising at test time, achieving a $4.3\times$ speedup over joint video-action rollout while maintaining comparable planning accuracy. The same model also supports video-only and joint video-action rollouts. Experiments show that UNIVERSE achieves 91.0 PDMS on NAVSIM (vs. 89.6 for the Two-DiT variant), and demonstrates strong zero-shot transfer to nuScenes and Bench2Drive without fine-tuning, while ablations confirm the importance of single-DiT unification, video co-training, and mask-based modality decoupling.
- Abstract(参考訳): 世界行動モデル(WAM)は、将来の映像予測をシーンダイナミクスと時間的因果関係の密接な監視として利用することにより、自律運転における行動一般化を改善する強力な可能性を示している。
しかし、どのアーキテクチャがビデオモデリングの利点を軌道生成にもたらすかは定かではない。
既存のカスケードまたは双対DiTは、アクション予測からビデオイマジネーションを分離し、ビデオ学習されたワールドダイナミクスをトラジェクトリブランチへの転送を弱める。
マスク変調拡散変換器上に構築された統合ビデオアクションモデルであるUNIVERSEを提案する。
UNIVERSEは、共有生成パラメータ内で、将来的なビデオ遅延とエゴトラジェクトリトークンを共同トレーニングすることにより、高密度なビデオ監視がトラジェクトリデノイングを直接形成し、より強力なクロスドメインアクションの一般化をもたらす。
因果的妥当性と効率的な展開を確保するため,モータリティ・デカップリング・ビジュアライゼーション・マスクを導入する。
これにより、将来のターゲットの漏れを防止し、テスト時に将来のビデオノイズを取り除くことで軌道のみの推論を可能にし、同等の計画精度を維持しながら、共同ビデオアクションのロールアウトよりも4.3\times$のスピードアップを達成することができる。
同じモデルでは、ビデオのみのロールアウトとジョイントビデオアクションのロールアウトもサポートしている。
UNIVERSE は NAVSIM 上で 91.0 PDMS (vs. 89.6) を達成し、微調整なしでnuScenes や Bench2Drive への強力なゼロショット転送を実証している。
関連論文リスト
- Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation [80.18527639791074]
世界アクションモデルは、自動運転と都市ナビゲーションに非常に有望だ。
既存のアプローチには、重要な制限がある。
我々は,映像生成とアクション予測を分離するエンドツーエンドのWAMフレームワークであるMetisを提案する。
論文 参考訳(メタデータ) (2026-06-14T15:40:49Z) - DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving [19.231942908215174]
本稿では、事前学習したビデオ拡散変換器を自己回帰型ビデオアクションポリシーに適応させる駆動ワールドアクションモデルDriveWAMを提案する。
DriveWAMは、ビデオストリームとアクションストリームを統合された時間トークンシーケンスに編成し、それらをジョイントフローマッチングの目的の下でトレーニングする。
NAVSIMとPhysicalAI-Autonomous-Vehiclesベンチマークの実験は、DriveWAMが強力な計画性能を発揮することを示している。
論文 参考訳(メタデータ) (2026-05-27T14:36:26Z) - VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis [35.55805069125473]
視覚・言語条件下でビデオとアクションを協調的に生成する,フローマッチングに基づく統合型デュアルストリームフレームワークを提案する。
シミュレーションと実世界の両方の設定で、VAGは競合予測品質を備えた協調したビデオアクションペアを生成し、実行可能な軌道再生をサポートし、有用な合成事前学習データを提供する。
論文 参考訳(メタデータ) (2026-04-10T13:59:54Z) - HMPDM: A Diffusion Model for Driving Video Prediction with Historical Motion Priors [8.987844576502054]
本稿では,動きの理解と時間的コヒーレンスを高めるために,過去の動きを利用した映像予測モデルであるHMPDMを紹介する。
Cityscapes と KITTI ベンチマークの大規模な実験により、HMPDM は最先端のビデオ予測手法よりも効率が良いことが示された。
論文 参考訳(メタデータ) (2026-03-28T18:37:08Z) - SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing [76.349958946335]
本稿では,映像編集をセマンティックアンカーとモーションモデリングに分解するフレームワークであるSAMA(factorized Semantic Anchoring and Motion Alignment)を提案する。
まずセマンティックアンカリング(Semantic Anchoring)を導入し、スパースアンカフレームでのセマンティックトークンとビデオ潜在者を共同で予測することで、信頼性の高い視覚アンカを確立する。
第2に、モーションアライメントは同じバックボーンをモーション中心のビデオ復元のプリテキストタスクで事前トレーニングする。
論文 参考訳(メタデータ) (2026-03-19T17:59:51Z) - MAD: Motion Appearance Decoupling for efficient Driving World Models [94.40548866741791]
本稿では,一般的な映像モデルを制御可能な運転世界モデルに変換する,効率的な適応フレームワークを提案する。
鍵となるアイデアは、外見合成からモーションラーニングを分離することである。
私たちのMAD-LTXモデルであるLTXへのスケーリングは、すべてのオープンソース競合より優れています。
論文 参考訳(メタデータ) (2026-01-14T12:52:23Z) - Real-Time Motion-Controllable Autoregressive Video Diffusion [79.32730467857535]
本稿では,AR-Dragを提案する。このAR-Dragは,多様なモーション制御を備えたリアルタイム画像・ビデオ生成のための,RLで拡張された最初の数ステップのARビデオ拡散モデルである。
まず,基本動作制御をサポートするためのベースI2Vモデルを微調整し,さらに軌道ベース報酬モデルによる強化により改良する。
本設計では、自己学習機構を通じてマルコフ特性を保存し、ステップを選択的に分解することで訓練を加速する。
論文 参考訳(メタデータ) (2025-10-09T12:17:11Z) - VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical Prior [88.51778468222766]
近年,映像拡散モデル (VDM) が大幅に進歩し,映像のリアル化が進んでいる。
VDMは物理の理解の欠如のため、物理的にもっともらしいビデオを作ることができないことが多い。
本稿では,物理を視覚と言語に明示的に組み込んだ新しい2段階画像・映像生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-30T09:03:09Z) - Learning Variational Motion Prior for Video-based Motion Capture [31.79649766268877]
ビデオに基づくモーションキャプチャーのための新しい変分動作先行学習手法(VMP)を提案する。
我々のフレームワークはフレームワイドポーズ推定における時間的ジッタリングと障害モードを効果的に削減できる。
公開データセットとインザワイルドビデオの両方を用いた実験により、我々のフレームワークの有効性と一般化能力が実証された。
論文 参考訳(メタデータ) (2022-10-27T02:45:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。