論文の概要: AgentVLN: Towards Agentic Vision-and-Language Navigation
- arxiv url: http://arxiv.org/abs/2603.17670v1
- Date: Wed, 18 Mar 2026 12:43:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-21 18:33:56.949927
- Title: AgentVLN: Towards Agentic Vision-and-Language Navigation
- Title(参考訳): AgentVLN:Agentic Vision-and-Language Navigationを目指して
- Abstract要約: VLN (Vision-and-Language Navigation) は、複雑な自然言語命令を、見えない環境での長距離ナビゲーションに接地するために、エンボディエージェントを必要とする。
本稿では,エッジコンピューティングプラットフォーム上に展開可能な,新規かつ効率的なナビゲーションフレームワークであるAgentVLNを提案する。
- 参考スコア(独自算出の注目度): 78.739525400071
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Vision-and-Language Navigation (VLN) requires an embodied agent to ground complex natural-language instructions into long-horizon navigation in unseen environments. While Vision-Language Models (VLMs) offer strong 2D semantic understanding, current VLN systems remain constrained by limited spatial perception, 2D-3D representation mismatch, and monocular scale ambiguity. In this paper, we propose AgentVLN, a novel and efficient embodied navigation framework that can be deployed on edge computing platforms. We formulate VLN as a Partially Observable Semi-Markov Decision Process (POSMDP) and introduce a VLM-as-Brain paradigm that decouples high-level semantic reasoning from perception and planning via a plug-and-play skill library. To resolve multi-level representation inconsistency, we design a cross-space representation mapping that projects perception-layer 3D topological waypoints into the image plane, yielding pixel-aligned visual prompts for the VLM. Building on this bridge, we integrate a context-aware self-correction and active exploration strategy to recover from occlusions and suppress error accumulation over long trajectories. To further address the spatial ambiguity of instructions in unstructured environments, we propose a Query-Driven Perceptual Chain-of-Thought (QD-PCoT) scheme, enabling the agent with the metacognitive ability to actively seek geometric depth information. Finally, we construct AgentVLN-Instruct, a large-scale instruction-tuning dataset with dynamic stage routing conditioned on target visibility. Extensive experiments show that AgentVLN consistently outperforms prior state-of-the-art methods (SOTA) on long-horizon VLN benchmarks, offering a practical paradigm for lightweight deployment of next-generation embodied navigation models. Code: https://github.com/Allenxinn/AgentVLN.
- Abstract(参考訳): VLN (Vision-and-Language Navigation) は、複雑な自然言語命令を、見えない環境での長距離ナビゲーションに接地するために、エンボディエージェントを必要とする。
Vision-Language Models (VLM) は強力な2Dセマンティック理解を提供するが、現在のVLNシステムは空間認識の制限や2D-3D表現ミスマッチ、モノクルスケールの曖昧さによって制約されている。
本稿では,エッジコンピューティングプラットフォーム上に展開可能な,新規かつ効率的なナビゲーションフレームワークであるAgentVLNを提案する。
我々は、VLNを部分観測可能なセミマルコフ決定プロセス(POSMDP)として定式化し、プラグイン・アンド・プレイスキル・ライブラリを通じて高レベルのセマンティック推論と認識と計画を分離するVLM-as-Brainパラダイムを導入する。
マルチレベル表現の不整合を解決するために,3次元トポロジカル・ウェイポイントを画像平面に投影し,VLMの画素アラインな視覚的プロンプトを生成するクロススペース表現マッピングを設計する。
本橋を架け橋として,閉鎖から回復し,長い軌道上での誤差蓄積を抑制するために,文脈認識型自己補正・能動的探索戦略を統合した。
非構造化環境における命令の空間的あいまいさにさらに対処するために,メタ認知能力を持つエージェントが幾何学的深度情報を積極的に探すことのできるクエリ駆動型知覚的連鎖(QD-PCoT)スキームを提案する。
最後に,ターゲット可視性を考慮した動的ステージルーティングを備えた大規模命令チューニングデータセットであるAgentVLN-Instructを構築した。
大規模な実験により、AgentVLNは長期のVLNベンチマークにおいて常に最先端のSOTA(State-of-the-art Method)よりも優れており、次世代のエンボディドナビゲーションモデルの軽量展開のための実用的なパラダイムを提供する。
コード:https://github.com/Allenxinn/AgentVLN。
関連論文リスト
- Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation [5.0211517769291065]
本研究では,2次元画素空間におけるナビゲーション操作を直接学習するための微調整型視覚言語モデルを提案する。
我々のモデルは一連の画素座標を逐次予測し、現在の観測の中心から軌道を引いた。
論文 参考訳(メタデータ) (2026-07-12T12:54:44Z) - Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation [32.02017382315305]
Vision-Language Navigation (VLN) は、エンボディエージェントが言語命令に従うことで、見えない環境でターゲットの場所に到達することを可能にする。
近年の視覚言語モデル(VLM)の進歩にもかかわらず、重要な意味幾何学的ギャップが残っている。
本稿では3次元幾何学情報をVLMと互換性のある構造化表現に変換する階層型意味幾何学マップ(HSGM)を提案する。
論文 参考訳(メタデータ) (2026-05-25T08:53:21Z) - AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation [78.80536515102305]
VLN(Vision-and-Language Navigation)は、エージェントが視覚環境内の自身の動きに言語命令を接地する必要がある。
本稿では,ナビゲーションモデルに自己認識推論機構を備えた新しいフレームワークであるAwareVLNを提案する。
提案手法は,(1)空間的およびタスク指向の自己認識を促進する構造的推論モジュール,(2)効果的な学習のための進歩分担付き自動データエンジンの2つの重要な革新を特徴とする。
論文 参考訳(メタデータ) (2026-05-21T17:58:26Z) - SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation [19.9336847486232]
SEDualVLNは空間的に拡張されたデュアルシステムビジョンランゲージナビゲーションフレームワークである。
System 1は、グローバルな空間認識とローカルな空間認識の両方で拡張されたVLMモデルであり、アクション生成に使用される。
System 2は一般的なMLLMとマッピングモジュールを統合し、MLLMはリアルタイム3Dマップのトップダウンビューを活用することで、経路ポイントを計画する。
論文 参考訳(メタデータ) (2026-05-17T04:12:56Z) - DyGeoVLN: Infusing Dynamic Geometry Foundation Model into Vision-Language Navigation [19.94547112119204]
視覚言語ナビゲーション(VLN)は、視覚的な観察と、見えない環境でのナビゲーションを行うための言語指示を理解するエージェントを必要とする。
既存のアプローチのほとんどは静的シーンの仮定に依存しており、動的で現実的なシナリオを一般化するのに苦労している。
動的幾何学を意識したVLNフレームワークであるDyGeoVLNを提案する。
論文 参考訳(メタデータ) (2026-03-22T14:56:59Z) - OmniVLN: Omnidirectional 3D Perception and Token-Efficient LLM Reasoning for Visual-Language Navigation across Air and Ground Platforms [33.40889181799252]
言語誘導型エンボディナビゲーションでは、エージェントがオブジェクト参照命令を解釈し、複数の部屋を探索し、参照されたターゲットをローカライズし、それに対する信頼できる動きを実行する必要がある。
OmniVLNは、全方位3次元知覚とトークン効率の高い階層的推論を、空中と地上の両方で組み合わせたゼロショット視覚言語ナビゲーションフレームワークである。
実験により、提案した階層インタフェースは空間参照精度を77.27%から93.18%に改善し、マルチルームの乱雑な設定で累積的なプロンプトトークンを61.7%削減し、フラットで最大11.68%のナビゲーション成功率向上を実現した。
論文 参考訳(メタデータ) (2026-03-18T04:26:30Z) - TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation [70.23578202012048]
Vision-Language Navigation (VLN) は、アーキテクチャ上のミスマッチのため、大きなビジョン-Language Models (VLM) に固有の課題を提示している。
我々は,VLMのバックボーンにトポロジ構造を明示的に注入するエンドツーエンドフレームワークであるTagaVLM(トポロジ・アウェア・グローバルアクション推論)を提案する。
トポロジ的ノード情報を強化するため、Interleaved Navigation Promptはノードレベルのビジュアルテキストアライメントを強化する。
埋め込みトポロジグラフでは、このモデルはグローバルな行動推論が可能であり、堅牢な経路補正を可能にする。
論文 参考訳(メタデータ) (2026-03-03T13:28:07Z) - 3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting [12.057873540714098]
3DGSNavは、3D Gaussian Splatting (3DGS)を視覚言語モデル(VLM)の永続メモリとして組み込んで空間推論を強化する新しいフレームワークである。
3DGSNavは環境の3DGS表現を段階的に構築し、フロンティア対応のファーストパーソンビューの軌跡誘導自由視点レンダリングを可能にする。
ナビゲーション中、リアルタイムオブジェクト検出器が潜在的なターゲットをフィルタリングし、VLM駆動のアクティブな視点スイッチングがターゲットを再検証する。
論文 参考訳(メタデータ) (2026-02-12T16:41:26Z) - A Navigation Framework Utilizing Vision-Language Models [0.0]
VLN(Vision-and-Language Navigation)は、AIを具現化した複雑な課題である。
CLIPやFlamingoのような大規模視覚言語モデル(LVLM)の最近の進歩は、マルチモーダル理解を大幅に改善した。
動作計画から視覚言語理解を分離するモジュラー・プラグ・アンド・プレイナビゲーション・フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-11T20:51:58Z) - Agentic 3D Scene Generation with Spatially Contextualized VLMs [67.31920821192323]
本稿では,複雑な3D環境の生成,理解,編集を可能にする新しいパラダイムを提案する。
我々は,VLMが空間コンテキストから反復的に読み取って更新するエージェント型3Dシーン生成パイプラインを開発した。
その結果,我々のフレームワークは多様かつ困難な入力を処理でき,事前の作業では観測できないような一般化のレベルを達成することができることがわかった。
論文 参考訳(メタデータ) (2025-05-26T15:28:17Z) - UnitedVLN: Generalizable Gaussian Splatting for Continuous Vision-Language Navigation [71.97405667493477]
我々は,UnitedVLNと呼ばれる,新しい汎用3DGSベースの事前学習パラダイムを導入する。
エージェントは、高忠実度360度ビジュアルイメージとセマンティック特徴を統一してレンダリングすることで、将来の環境をよりよく探索することができる。
UnitedVLNは既存のVLN-CEベンチマークで最先端の手法より優れている。
論文 参考訳(メタデータ) (2024-11-25T02:44:59Z) - BEVBert: Multimodal Map Pre-training for Language-guided Navigation [75.23388288113817]
視覚・言語ナビゲーション(VLN)における空間認識型マップベース事前学習パラダイムを提案する。
我々は,グローバルなトポロジカルマップにおけるナビゲーション依存性をモデル化しながら,不完全な観測を明示的に集約し,重複を取り除くための局所距離マップを構築した。
ハイブリッドマップをベースとして,マルチモーダルマップ表現を学習するための事前学習フレームワークを考案し,空間認識型クロスモーダル推論を強化し,言語誘導ナビゲーションの目標を導出する。
論文 参考訳(メタデータ) (2022-12-08T16:27:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。