論文の概要: WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models
- arxiv url: http://arxiv.org/abs/2604.07957v1
- Date: Thu, 09 Apr 2026 08:21:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 18:34:05.796236
- Title: WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models
- Title(参考訳): WorldMAP: 生成世界モデルを用いたブートストラップ視線ナビゲーション軌道予測
- Authors: Hongjin Chen, Shangyun Jiang, Tonghua Su, Chen Gao, Xinlei Chen, Yong Li, Zhibo Chen,
- Abstract要約: 視覚言語モデル(VLM)とジェネレーティブワールドモデル(ジェネレーティブワールドモデル)は、ナビゲーションを具現化する新たな機会を開きつつある。
本稿では,世界モデルが生み出す未来を永続的な意味空間構造に変換するフレームワークWorldMAPについて述べる。
- 参考スコア(独自算出の注目度): 32.71152441572375
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models (VLMs) and generative world models are opening new opportunities for embodied navigation. VLMs are increasingly used as direct planners or trajectory predictors, while world models support look-ahead reasoning by imagining future views. Yet predicting a reliable trajectory from a single egocentric observation remains challenging. Current VLMs often generate unstable trajectories, and world models, though able to synthesize plausible futures, do not directly provide the grounded signals needed for navigation learning. This raises a central question: how can generated futures be turned into supervision for grounded trajectory prediction? We present WorldMAP, a teacher--student framework that converts world-model-generated futures into persistent semantic-spatial structure and planning-derived supervision. Its world-model-driven teacher builds semantic-spatial memory from generated videos, grounds task-relevant targets and obstacles, and produces trajectory pseudo-labels through explicit planning. A lightweight student with a multi-hypothesis trajectory head is then trained to predict navigation trajectories directly from vision-language inputs. On Target-Bench, WorldMAP achieves the best ADE and FDE among compared methods, reducing ADE by 18.0% and FDE by 42.1% relative to the best competing baseline, while lifting a small open-source VLM to DTW performance competitive with proprietary models. More broadly, the results suggest that, in embodied navigation, the value of world models may lie less in supplying action-ready imagined evidence than in synthesizing structured supervision for navigation learning.
- Abstract(参考訳): 視覚言語モデル(VLM)とジェネレーティブワールドモデル(ジェネレーティブワールドモデル)は、ナビゲーションを具現化する新たな機会を開きつつある。
VLMは直接計画立案者や軌道予測者として、世界モデルは将来の展望を想像してルックアヘッド推論をサポートする。
しかし、一つの自我中心の観測から信頼できる軌道を予測することは依然として困難である。
現在のVLMは不安定な軌道を生成することが多く、世界モデルは可視な未来を合成できるが、ナビゲーション学習に必要な基底信号を直接提供しない。
これが中心的な疑問を提起する: 生成した未来はどのようにして基底軌道予測の監督を行うことができるのか?
我々は,世界モデルが生み出す未来を永続的な意味空間構造に変換し,計画に基づく監督を行う教師主導のフレームワークであるWorldMAPを提案する。
その世界モデル駆動の教師は、生成されたビデオからセマンティック空間記憶を構築し、タスク関連ターゲットと障害を基盤とし、明示的な計画を通じて軌道上の擬似ラベルを生成する。
次に、多相軌道ヘッドを持つ軽量の学生が訓練され、視覚言語入力から直接ナビゲーション軌跡を予測する。
Target-Bench では、WorldMAP は比較手法の中で最高のADEとFDEを達成し、ADEを18.0%減らし、FDEを42.1%減らした。
より広範に、この結果は、具体化ナビゲーションにおいて、世界モデルの価値は、ナビゲーション学習のための構造化された監督を合成するよりも、行動可能な想像上の証拠を供給できることを示唆している。
関連論文リスト
- ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving [19.081114003415863]
我々は,意味のある探索と密集した監視を実現するために,統合された理解・生成の枠組みを提案する。
我々は、高密度世界モデリングの目的として、将来のRGBと深度画像生成による軌道予測を強化した。
我々は、この探索信号を安全性の高い報酬に組み込んで、ポリシーを最適化する。
論文 参考訳(メタデータ) (2026-04-03T04:14:13Z) - DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning [44.543763428623976]
DriveDreamer-Policyは、深度生成、将来のビデオ生成、モーションプランニングを統合した統合運転ワールドアクションモデルである。
提案したモデルは、モジュラリティと遅延制御性を維持しながら、より一貫性のある未来とより情報のある駆動動作を生成する。
論文 参考訳(メタデータ) (2026-04-02T08:33:18Z) - Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving [52.04950569530877]
我々は、将来のフレーム予測と軌道計画の密接なインターリーブを行う統合視覚言語行動モデルUni-World VLAを提案する。
提案手法は,高忠実度将来のフレーム予測を行いながら,競合する閉ループ計画性能を実現する。
論文 参考訳(メタデータ) (2026-03-28T14:39:51Z) - Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space [48.19308247102762]
本稿では,過去のフレームや行動に照らされた将来の視覚的観察を予測する航空ナビゲーションワールドモデルANWMを提案する。
ANWMは4-DoF UAV軌道で訓練され、物理学にインスパイアされたモジュールであるFuture Frame Projectionを導入した。
実験により、ANWMは長距離視覚予測において既存の世界を著しく上回り、大規模環境でのUAV航法成功率を向上させることが示された。
論文 参考訳(メタデータ) (2025-12-26T06:22:39Z) - From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction [57.56072009935036]
政策世界モデル(PWM)と呼ばれる新しい運転パラダイムを導入する。
PWMは、統一アーキテクチャ内での世界モデリングと軌道計画を統合する。
提案手法は,マルチビューおよびマルチモーダル入力に依存する最先端の手法に適合するか,あるいは超越する。
論文 参考訳(メタデータ) (2025-10-22T14:57:51Z) - Can World Models Benefit VLMs for World Dynamics? [59.73433292793044]
本研究では,世界モデル先行モデルがビジョンランゲージモデルに移行した場合の能力について検討する。
最高の性能を持つDynamic Vision Aligner (DyVA) と名付けます。
DyVAはオープンソースとプロプライエタリの両方のベースラインを超え、最先端または同等のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2025-10-01T13:07:05Z) - World4Drive: End-to-End Autonomous Driving via Intention-aware Physical Latent World Model [18.56171397212777]
We present World4Drive, a end-to-end autonomous driving framework that using vision foundation model to build latent world model。
World4Driveは、オープンループのnuScenesとクローズループのNavSimベンチマークに手動の認識アノテーションなしで、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-07-01T09:36:38Z) - VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning [77.34267241692706]
Vision-Language Navigation(VLN)は、エージェントが自然言語命令を使用して現実世界の環境をナビゲートする必要がある、AIの実施における中核的な課題である。
本稿では、LVLM(Large Vision-Language Models)を利用して、エゴセントリックな動画ストリームを連続的なナビゲーションアクションに変換するエンドツーエンドフレームワークであるVLN-R1を提案する。
論文 参考訳(メタデータ) (2025-06-20T17:59:59Z) - Learning World Models for Unconstrained Goal Navigation [4.549550797148707]
本研究では,世界モデル学習のための目標指向探索アルゴリズムであるMUNを紹介する。
MUNは、リプレイバッファ内の任意のサブゴール状態間の状態遷移をモデル化することができる。
その結果、MUNは世界モデルの信頼性を高め、政策の一般化能力を大幅に改善することを示した。
論文 参考訳(メタデータ) (2024-11-03T01:35:06Z) - Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous Driving [15.100104512786107]
Drive-OccWorldは、自動運転のエンドツーエンド計画にビジョン中心の4D予測ワールドモデルを適用する。
制御可能な生成を可能にするために,速度,操舵角度,軌道,指令などの柔軟な動作条件を世界モデルに注入することを提案する。
本手法は,多目的かつ制御可能な4D占有率を創出し,次世代の運転とエンド・ツー・エンド・プランニングの進歩への道を開く。
論文 参考訳(メタデータ) (2024-08-26T11:53:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。