論文の概要: FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation
- arxiv url: http://arxiv.org/abs/2606.30367v1
- Date: Mon, 29 Jun 2026 14:33:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.280739
- Title: FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation
- Title(参考訳): FutureNav: ビジョン・アンド・ランゲージナビゲーションのための統合ワールド・アクション・モデリング
- Abstract要約: FutureNavは、視覚・言語ナビゲーションのためのVLMベースの統合ワールドアクションモデリングフレームワークである。
本論文では,FutureNavが複数のVLNベンチマークで最先端性能を実現し,従来のVLN手法よりも大幅に優れていることを示す。
- 参考スコア(独自算出の注目度): 22.882723669402026
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-and-language navigation (VLN) in continuous environments requires an agent to ground instructions in egocentric observations while maintaining spatial understanding across long action sequences. Recent navigation foundation models have shown strong progress by scaling vision-language models, but they often learn navigation primarily as direct action generation, without explicitly modeling world states or predicting their future evolution. We introduce FutureNav, a VLM-based unified world-action modeling framework for vision-and-language navigation. Specifically, FutureNav jointly encodes text, visual, and spatial features and feeds them into the LLM, and optimizes four objectives for simultaneous world and action modeling: an action policy objective for navigation action prediction, inverse and forward dynamics objectives for modeling state transitions, and a future generation objective for predicting future spatial states. This unified architecture strengthens action prediction while explicitly modeling the world, without sacrificing inference speed. Extensive experiments show that, with only a 4B-scale backbone, FutureNav achieves state-of-the-art performance on multiple VLN benchmarks and substantially outperforms prior VLN methods, paving the way toward future world-action models for VLN. We will release the code and models to support future research.
- Abstract(参考訳): 連続した環境下での視覚・言語ナビゲーション(VLN)は、エージェントが長い行動シーケンスの空間的理解を維持しながら、自我中心の観察において指示を下す必要がある。
近年のナビゲーション基礎モデルは、視覚言語モデルを拡張することによって大きな進歩を見せているが、ナビゲーションは、世界を明示的にモデル化したり、将来の進化を予測することなく、直接アクション生成として学習することが多い。
本稿では、視覚・言語ナビゲーションのためのVLMベースの統合ワールドアクションモデリングフレームワークFutureNavを紹介する。
具体的には、FutureNavはテキスト、視覚的、空間的特徴を共同で符号化し、LLMに供給し、同時に世界と行動モデリングのための4つの目的を最適化する。
この統合されたアーキテクチャは、推論速度を犠牲にすることなく、世界を明示的にモデル化しながらアクション予測を強化する。
大規模な実験により、FutureNavは4Bスケールのバックボーンしか持たず、複数のVLNベンチマークで最先端のパフォーマンスを達成し、VLNの将来の世界アクションモデルへの道を開いた。
将来の研究をサポートするためのコードとモデルをリリースします。
関連論文リスト
- WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN [53.419929910272735]
連続VLNのための3次元シーン条件付き生成ワールドナビゲーションモデルWNM-3Dを提案する。
凍結フィードフォワード幾何エンコーダは、過去の観測を永続的なシーンコンテキストに統合するために、単眼の自我中心のRGB履歴から幾何認識表現を抽出する。
ブロック因果的注意を通じて、この接頭辞は将来のビデオアクションブロックの全てを条件とし、将来のビューとアクション生成の両方のための共有幾何学的コンテキストを提供する。
論文 参考訳(メタデータ) (2026-08-07T14:29:00Z) - NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation [41.592946383221566]
ナビゲーションワールドモデルはこのような視覚的な展望を提供するが、予測された未来をクローズドループ制御に変換するために外部プランナーを必要とする予測モジュールは残る。
ナビゲーションワールドモデル予測を実行可能なアクションに変換する拡散変換器ポリシーであるナビゲーションワールドアクションモデル(NavWAM)を提案する。
我々は,シミュレーション事前学習と実ロボット適応によりNavWAMを構築し,計画に基づく世界モデルに対するイメージゴールナビゲーションと代表的ダイレクトナビゲーションポリシーについて評価する。
論文 参考訳(メタデータ) (2026-06-11T15:44:36Z) - Learning Vision-Language-Action World Models for Autonomous Driving [15.103497388527943]
VLA(Vision-Language-Action)モデルは最近、エンドツーエンドの自動運転において顕著な進歩を遂げている。
VLAモデルは時相力学と世界整合性の明示的なモデリングを欠いていることが多い。
VLA-World(VLA-World)は、予測的想像力と反射的推論を統一する、シンプルで効果的なVLA世界モデルである。
論文 参考訳(メタデータ) (2026-04-10T07:38:05Z) - WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models [32.71152441572375]
視覚言語モデル(VLM)とジェネレーティブワールドモデル(ジェネレーティブワールドモデル)は、ナビゲーションを具現化する新たな機会を開きつつある。
本稿では,世界モデルが生み出す未来を永続的な意味空間構造に変換するフレームワークWorldMAPについて述べる。
論文 参考訳(メタデータ) (2026-04-09T08:21:58Z) - DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning [44.543763428623976]
DriveDreamer-Policyは、深度生成、将来のビデオ生成、モーションプランニングを統合した統合運転ワールドアクションモデルである。
提案したモデルは、モジュラリティと遅延制御性を維持しながら、より一貫性のある未来とより情報のある駆動動作を生成する。
論文 参考訳(メタデータ) (2026-04-02T08:33:18Z) - Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving [52.04950569530877]
我々は、将来のフレーム予測と軌道計画の密接なインターリーブを行う統合視覚言語行動モデルUni-World VLAを提案する。
提案手法は,高忠実度将来のフレーム予測を行いながら,競合する閉ループ計画性能を実現する。
論文 参考訳(メタデータ) (2026-03-28T14:39:51Z) - Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation [66.7879424097418]
We present WorldDrive, a holistic framework that couples scene generation and real-time planning through unified vision and motion representation。
動きの表現、視覚的表現、エゴ状態の間の単純な相互作用は、高品質でマルチモーダルな軌道を生成することができる。
NAVSIM、NAVSIM-v2、nuScenesベンチマークの実験は、WorldDriveが視覚のみの手法で主要な計画性能を達成することを示した。
論文 参考訳(メタデータ) (2026-03-16T07:59:39Z) - Aerial World Model for Long-horizon Visual Generation and Navigation in 3D Space [48.19308247102762]
本稿では,過去のフレームや行動に照らされた将来の視覚的観察を予測する航空ナビゲーションワールドモデルANWMを提案する。
ANWMは4-DoF UAV軌道で訓練され、物理学にインスパイアされたモジュールであるFuture Frame Projectionを導入した。
実験により、ANWMは長距離視覚予測において既存の世界を著しく上回り、大規模環境でのUAV航法成功率を向上させることが示された。
論文 参考訳(メタデータ) (2025-12-26T06:22:39Z) - Can World Models Benefit VLMs for World Dynamics? [59.73433292793044]
本研究では,世界モデル先行モデルがビジョンランゲージモデルに移行した場合の能力について検討する。
最高の性能を持つDynamic Vision Aligner (DyVA) と名付けます。
DyVAはオープンソースとプロプライエタリの両方のベースラインを超え、最先端または同等のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2025-10-01T13:07:05Z) - Navigation World Models [68.58459393846461]
本稿では,過去の観測とナビゲーション行動に基づいて,将来の視覚観測を予測できる制御可能な映像生成モデルを提案する。
慣れ親しんだ環境では、NWMはナビゲーションの軌道をシミュレートし、目的を達成するかどうかを評価することで計画することができる。
実験は、スクラッチからの軌道計画や、外部ポリシーからサンプリングされた軌道のランク付けにおいて、その効果を実証する。
論文 参考訳(メタデータ) (2024-12-04T18:59:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。