論文の概要: SPAN-Nav: Generalized Spatial Awareness for Versatile Vision-Language Navigation
- arxiv url: http://arxiv.org/abs/2603.09163v1
- Date: Tue, 10 Mar 2026 03:59:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:42.141954
- Title: SPAN-Nav: Generalized Spatial Awareness for Versatile Vision-Language Navigation
- Title(参考訳): SPAN-Nav:Versatile Vision-Language Navigationのための空間認識の一般化
- Authors: Jiahang Liu, Tianyu Xu, Jiawei Chen, Lu Yue, Jiazhao Zhang, Zhiyong Wang, Minghan Li, Qisheng Zhao, Anqi Li, Qi Su, Zhizheng Zhang, He Wang,
- Abstract要約: SPAN-Navは、エンボディナビゲーションを普遍的な3次元空間認識に注入するエンド・ツー・エンドの基礎モデルである。
SPAN-Navは、占有予測タスクを通じて、多様なシーンにまたがる空間的先行情報を抽出する。
屋内および屋外の両方の場面をカバーする420万の占有アノテーションの大規模なデータセットを提示する。
- 参考スコア(独自算出の注目度): 26.52802135982273
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent embodied navigation approaches leveraging Vision-Language Models (VLMs) demonstrate strong generalization in versatile Vision-Language Navigation (VLN). However, reliable path planning in complex environments remains challenging due to insufficient spatial awareness. In this work, we introduce SPAN-Nav, an end-to-end foundation model designed to infuse embodied navigation with universal 3D spatial awareness using RGB video streams. SPAN-Nav extracts spatial priors across diverse scenes through an occupancy prediction task on extensive indoor and outdoor environments. To mitigate the computational burden, we introduce a compact representation for spatial priors, finding that a single token is sufficient to encapsulate the coarse-grained cues essential for navigation tasks. Furthermore, inspired by the Chain-of-Thought (CoT) mechanism, SPAN-Nav utilizes this single spatial token to explicitly inject spatial cues into action reasoning through an end-to end framework. Leveraging multi-task co-training, SPAN-Nav captures task-adaptive cues from generalized spatial priors, enabling robust spatial awareness to generalize even to the task lacking explicit spatial supervision. To support comprehensive spatial learning, we present a massive dataset of 4.2 million occupancy annotations that covers both indoor and outdoor scenes across multi-type navigation tasks. SPAN-Nav achieves state-of-the-art performance across three benchmarks spanning diverse scenarios and varied navigation tasks. Finally, real-world experiments validate the robust generalization and practical reliability of our approach across complex physical scenarios.
- Abstract(参考訳): 視覚言語モデル(VLM)を利用した最近の実施ナビゲーション手法は、多目的視覚言語ナビゲーション(VLN)において強力な一般化を示している。
しかし,空間認識が不十分なため,複雑な環境下での信頼性の高い経路計画は依然として困難である。
本研究では,RGBビデオストリームを用いた3次元空間認識によるエンボディナビゲーションの実現を目的とした,エンド・ツー・エンドのファンデーションモデルであるSPAN-Navを紹介する。
SPAN-Navは、広範囲の屋内および屋外環境における占有率予測タスクを通じて、多様なシーンにわたる空間的先行情報を抽出する。
計算負担を軽減するために,単一トークンがナビゲーションタスクに不可欠な粗粒度キューをカプセル化するのに十分であることを示す,空間的先行のコンパクト表現を導入する。
さらに、Chain-of-Thought(CoT)メカニズムにインスパイアされたSPAN-Navは、この単一の空間トークンを使用して、エンドツーエンドのフレームワークを通じて、行動推論に空間的手がかりを明示的に注入する。
マルチタスクのコトレーニングを活用することで、SPAN-Navは、一般化された空間的事前からタスク適応的キューをキャプチャし、空間的監督が欠如しているタスクに対しても、堅牢な空間的認識を一般化することができる。
総合的な空間学習を支援するために,室内および屋外の両方の場面をカバーする420万件の占有アノテーションの大規模なデータセットを複数種類のナビゲーションタスクで提示する。
SPAN-Navは、さまざまなシナリオとさまざまなナビゲーションタスクにまたがる3つのベンチマークで、最先端のパフォーマンスを実現している。
最後に、実世界の実験は、複雑な物理シナリオにまたがる我々のアプローチの堅牢な一般化と実用的信頼性を検証する。
関連論文リスト
- SignNav: Leveraging Signage for Semantic Visual Navigation in Large-Scale Indoor Environments [57.79171900005793]
人間は、大規模屋内環境内の目的地に向かうために、手話によって提供される意味的ヒントを日常的に活用する。
本稿では,手話からの意味的ヒントを解釈し,現在の観察に基づくその後の行動の推論を行うための,新しい具体的ナビゲーションタスクSignNavを紹介する。
空間認識モジュールは物理的世界へのサインの意味的ヒントを基盤として,時間認識モジュールは歴史的状態と現在の観測との長距離依存性を捉えている。
論文 参考訳(メタデータ) (2026-03-17T06:36:26Z) - OpenFrontier: General Navigation with Visual-Language Grounded Frontiers [54.661157616245966]
オープンワールドナビゲーションでは、複雑な日常環境においてロボットが意思決定を行う必要がある。
近年の視覚-言語ナビゲーション(VLN)と視覚-言語-アクション(VLA)モデルは、自然言語で条件付けられたエンドツーエンドのポリシーを実現する。
多様な視覚をシームレスに統合するトレーニングフリーナビゲーションフレームワークであるOpenFrontierを提案する。
論文 参考訳(メタデータ) (2026-03-05T17:02:22Z) - SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation [48.17712857341527]
エージェント中心の空間マップ,コンパス対応の視覚表現,効率的なナビゲーションのためのリモートオブジェクトローカライゼーション戦略を統合したゼロショットビジョン・アンド・ランゲージナビゲーション(VLN)エージェントを提案する。
離散的および連続的な環境での実験では、SpatialNavは既存のゼロショットエージェントを著しく上回り、最先端の学習手法とのギャップをはっきりと狭めている。
論文 参考訳(メタデータ) (2026-01-11T08:39:19Z) - History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation [64.51891404034164]
Aerial Vision-and-Language Navigation (AVLN) は、大規模都市環境でターゲットをローカライズするために無人航空機(UAV)のエージェントを必要とする。
既存のUAVエージェントは通常、これらの2つの側面のバランスに苦しむ単粒度フレームワークを採用する。
この研究は、粗いナビゲーションパイプラインを通じて2つの側面を統合するヒストリ強化2段階トランスフォーマー(HETT)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-16T09:16:07Z) - From reactive to cognitive: brain-inspired spatial intelligence for embodied agents [50.99942960312313]
Brain-inspired Space Cognition for Navigation (BSC-Nav) は、エンボディエージェントにおける構造化空間メモリの構築と活用のための統合されたフレームワークである。
BSC-Navは、エゴセントリックな軌跡と文脈的手がかりからアロセントリックな認知マップを構築し、意味的目標に沿った空間的知識を動的に回収する。
論文 参考訳(メタデータ) (2025-08-24T03:20:48Z) - Cog-GA: A Large Language Models-based Generative Agent for Vision-Language Navigation in Continuous Environments [19.818370526976974]
VLN-CE(Vision Language Navigation in Continuous Environments)は、AIのフロンティアである。
本稿では,VLN-CEタスクに適した大規模言語モデル(LLM)に基づく生成エージェントであるCog-GAを紹介する。
Cog-GAは、人間のような認知過程をエミュレートするための二重戦略を採用している。
論文 参考訳(メタデータ) (2024-09-04T08:30:03Z) - Occupancy Anticipation for Efficient Exploration and Navigation [97.17517060585875]
そこで我々は,エージェントが自我中心のRGB-D観測を用いて,その占有状態を可視領域を超えて推定する,占有予測を提案する。
エゴセントリックなビューとトップダウンマップの両方でコンテキストを活用することで、私たちのモデルは環境のより広いマップを予測できます。
われわれのアプローチは、2020 Habitat PointNav Challengeの優勝だ。
論文 参考訳(メタデータ) (2020-08-21T03:16:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。