論文の概要: DA-Nav: Direction-Aware City-Scale Vision-Language Navigation
- arxiv url: http://arxiv.org/abs/2607.11638v2
- Date: Tue, 14 Jul 2026 03:00:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 12:51:44.723083
- Title: DA-Nav: Direction-Aware City-Scale Vision-Language Navigation
- Title(参考訳): DA-Nav: 方向対応型都市型ビジョンランゲージナビゲーション
- Abstract要約: 本稿では,商用ナビゲーションツールの方向指示を活用するための新しいパラダイムを提案する。
本研究では,方向認識型視覚言語ナビゲーションフレームワークであるDA-Navを提案する。
CARLAの実験では、DA-Navが56.16%の都市環境で高い成功率を達成したことが示されている。
- 参考スコア(独自算出の注目度): 39.38337824377708
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: City-scale outdoor navigation is currently hindered by the heavy reliance on dense maps or costly navigation supervision. In this work, we introduce a novel paradigm for leveraging directional instructions from commercial navigation tools (e.g., Google Maps). To bridge the gap between commercial instructions and executable navigation actions, while mitigating long-horizon error accumulation through robust trajectory recovery, we propose DA-Nav, a Direction-Aware vision-language Navigation framework that reformulates navigation as a discrete spatial grounding problem on the egocentric 2D image plane. To achieve trajectory recovery, DA-Nav employs a Chain-of-Thought (CoT) reasoning process encompassing deviation assessment, action prediction, and target grid selection. We further introduce ReDA, a dataset that provides direction-aware instructions and recovery trajectories to enhance spatial grounding and support CoT recovery reasoning. Extensive experiments in CARLA demonstrate that DA-Nav achieves a high success rate of 56.16% in unseen urban environments, outperforming existing State-of-The-Art (SoTA) methods while maintaining a substantially stronger recovery capability. Furthermore, without fine-tuning, DA-Nav seamlessly adapts to both quadruped and humanoid robots, enabling stable kilometer-scale closed-loop outdoor navigation in complex real world environments.
- Abstract(参考訳): 都市規模の屋外ナビゲーションは現在、密集した地図や高価なナビゲーション監督に依存しているため妨げられている。
本研究では,商用ナビゲーションツール(Googleマップなど)の方向指示を活用するための新しいパラダイムを提案する。
そこで我々は,方向認識型視覚言語ナビゲーションフレームワークであるDA-Navを提案する。DA-Navは,エゴセントリックな2次元画像平面上でのナビゲーションを離散的な空間的接地問題として再構成する。
軌道回復を達成するため、DA-Navは偏差評価、アクション予測、ターゲットグリッド選択を含むChain-of-Thought (CoT)推論プロセスを採用している。
さらに、空間的接地性を高め、CoT回復推論を支援するために、方向対応の指示と回復軌道を提供するデータセットであるReDAを紹介する。
CARLAにおける大規模な実験は、DA-Navが56.16%という高い成功率を達成することを示した。
さらに、DA-Navは細調整なしで四足歩行ロボットとヒューマノイドロボットの両方にシームレスに適応し、複雑な現実世界環境で安定したキロスケールのクローズドループ屋外ナビゲーションを可能にする。
関連論文リスト
- HiPAN: Hierarchical Posture-Adaptive Navigation for Quadruped Robots in Unstructured 3D Environments [13.984002802852638]
非構造型3D環境における四足歩行ロボットの移動は、目標指向の動作、局所的なミニマから脱出するための効果的な探索、横幅の狭い高さ制限された空間への姿勢適応など、大きな課題を生んでいる。
本報告では,階層型姿勢適応ナビゲーション(HiPAN, Hierarchical Posture-Adaptive Navigation)を提案する。
HiPANは、古典的なリアクティブプランナーやエンドツーエンドのベースラインよりも、明度の高いナビゲーション成功率とパス効率を実現しています。
論文 参考訳(メタデータ) (2026-04-29T10:08:48Z) - NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions [31.144783513493433]
タスクカテゴリと1,228のトラジェクトリ-インストラクションペアを含むNavSpaceベンチマークを導入する。
我々は、最先端ナビゲーションモデルやマルチモーダル大言語モデルを含む22のナビゲーションエージェントを包括的に評価する。
本稿では,空間知的なナビゲーションモデルSNavを提案する。
論文 参考訳(メタデータ) (2025-10-09T12:59:19Z) - DORAEMON: Decentralized Ontology-aware Reliable Agent with Enhanced Memory Oriented Navigation [55.888688171010365]
DORAEMONは、人間のナビゲーション機能を模倣したVentralとDorsal Streamsで構成される、認知にインスパイアされたフレームワークである。
我々は,DORAEMONをHM3D,MP3D,GOATのデータセット上で評価し,成功率(SR)と成功度(SPL)の測定値の両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-05-28T04:46:13Z) - Long-distance Geomagnetic Navigation in GNSS-denied Environments with Deep Reinforcement Learning [62.186340267690824]
既存の地磁気航法の研究は、事前保存された地図や広範囲な探索に依存しており、探索されていない地域での適用性や航法効率の低下に繋がる。
本稿では,特に長距離地磁気航法における深部強化学習(DRL)に基づくメカニズムについて述べる。
設計されたメカニズムは、プリストアドマップや広範囲で高価な探索アプローチではなく、地磁気ナビゲーションのための磁気受容能力を学ぶようにエージェントを訓練する。
論文 参考訳(メタデータ) (2024-10-21T09:57:42Z) - TOP-Nav: Legged Navigation Integrating Terrain, Obstacle and Proprioception Estimation [5.484041860401147]
TOP-Navは、包括的パスプランナーとTerran認識、Obstacle回避、クローズループプロプライオセプションを統合した、新しい脚付きナビゲーションフレームワークである。
そこで,TOP-Navは,従来の知識の分布を超えた地形や乱れをロボットが扱えるように,オープンワールドナビゲーションを実現する。
論文 参考訳(メタデータ) (2024-04-23T17:42:45Z) - Angle Robustness Unmanned Aerial Vehicle Navigation in GNSS-Denied
Scenarios [66.05091704671503]
本稿では、ポイントツーポイントナビゲーションタスクにおける飛行偏差に対処する新しい角度ナビゲーションパラダイムを提案する。
また、Adaptive Feature Enhance Module、Cross-knowledge Attention-guided Module、Robust Task-oriented Head Moduleを含むモデルを提案する。
論文 参考訳(メタデータ) (2024-02-04T08:41:20Z) - Confidence-Controlled Exploration: Efficient Sparse-Reward Policy Learning for Robot Navigation [72.24964965882783]
強化学習(RL)はロボットナビゲーションにおいて有望なアプローチであり、ロボットは試行錯誤を通じて学習することができる。
現実世界のロボットタスクは、しばしばまばらな報酬に悩まされ、非効率な探索と準最適政策に繋がる。
本稿では,RLに基づくロボットナビゲーションにおいて,報酬関数を変更せずにサンプル効率を向上させる新しい手法であるConfidence-Controlled Exploration (CCE)を紹介する。
論文 参考訳(メタデータ) (2023-06-09T18:45:15Z) - ETPNav: Evolving Topological Planning for Vision-Language Navigation in
Continuous Environments [56.194988818341976]
視覚言語ナビゲーションは、エージェントが環境中をナビゲートするための指示に従う必要があるタスクである。
本研究では,1)環境を抽象化し,長距離航法計画を生成する能力,2)連続環境における障害物回避制御能力の2つの重要なスキルに焦点を当てたETPNavを提案する。
ETPNavは、R2R-CEとRxR-CEデータセットの先行技術よりも10%以上、20%改善されている。
論文 参考訳(メタデータ) (2023-04-06T13:07:17Z) - Occupancy Anticipation for Efficient Exploration and Navigation [97.17517060585875]
そこで我々は,エージェントが自我中心のRGB-D観測を用いて,その占有状態を可視領域を超えて推定する,占有予測を提案する。
エゴセントリックなビューとトップダウンマップの両方でコンテキストを活用することで、私たちのモデルは環境のより広いマップを予測できます。
われわれのアプローチは、2020 Habitat PointNav Challengeの優勝だ。
論文 参考訳(メタデータ) (2020-08-21T03:16:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。