論文の概要: ABot-N1: Toward a General Visual Language Navigation Foundation Model
- arxiv url: http://arxiv.org/abs/2607.10383v2
- Date: Tue, 14 Jul 2026 10:13:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 12:51:44.58712
- Title: ABot-N1: Toward a General Visual Language Navigation Foundation Model
- Title(参考訳): ABot-N1: 汎用ビジュアル言語ナビゲーション基盤モデルを目指して
- Abstract要約: ABot-N1は、一般的なVisual Language Navigation基盤モデルへのステップである。
スロービジョン言語推論器は、画素ゴールを生成しながら明示的なChain-of-Thought推論を行う。
新しいベンチマークは、都市規模のナビゲーションの分野を前進させるためにオープンソースとしてリリースされている。
- 参考スコア(独自算出の注目度): 26.725166770221843
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual Language Navigation foundation models aim to unify deep reasoning for grounded spatial decisions with broad versatility for diverse embodied tasks. Current approaches typically achieve this integration via monolithic policies that map observations directly to actions, yet they often suffer from coordinate drift and poor handling of long-tail semantics. Furthermore, these black-box mappings lack interpretability, hindering the simultaneous achievement of generality, robustness, and transparency. We present ABot-N1, a step toward a general Visual Language Navigation foundation model, that addresses these challenges by decoupling cognition from control via a slow-fast architecture guided by dual visual-language signals. More specifically, a slow vision-language reasoner performs explicit Chain-of-Thought reasoning while producing a pixel goal. This compact set of image-space anchor points serves as a universal interface for diverse tasks, including point-goal, object-goal, poi-goal, instruction-following, and person-following. Subsequently, a fast action expert leverages both the textual cues and the pixel guidance to generate continuous waypoints at the native control frequency. By bridging high-level intents and low-level control through pixel-grounded anchors paired with explicit linguistic traces, our approach ensures robust, generalizable, and interpretable navigation across simulation and real-world benchmarks. ABot-N1 establishes new state-of-the-art records, delivering massive gains specifically in urban-scale navigation: boosting POI arrival by 35.0% (to 77.3%) and achieving 95.4%/92.9% SR in complex indoor and outdoor scenes. It also maintains superior robustness across object-reaching, person-following, and instruction-following tasks. New Point-Goal/POI-Goal benchmarks are released as open source to advance the field of urban-scale navigation.
- Abstract(参考訳): ビジュアル言語ナビゲーション基礎モデルは,多様な具体的タスクに対して幅広い汎用性を備えた空間決定のための深い推論を統一することを目的としている。
現在のアプローチは一般的に、観測を直接アクションにマッピングするモノリシックなポリシーを通じてこの統合を実現するが、多くの場合、座標のドリフトと長い尾の意味論の扱いに悩まされる。
さらに、これらのブラックボックスマッピングは解釈可能性に欠け、一般性、堅牢性、透明性の同時達成を妨げる。
ABot-N1は、一般的なビジュアル言語ナビゲーション基盤モデルに向けたステップであり、二重視覚言語信号で案内される遅いアーキテクチャを通して、制御から認識を分離することで、これらの課題に対処する。
より具体的には、スロービジョン言語推論器は、ピクセルゴールを生成しながら明示的なChain-of-Thought推論を実行する。
このコンパクトなイメージスペースアンカーポイントは、ポイントゴール、オブジェクトゴール、ポイゴール、命令フォロー、パーソナライズといった様々なタスクのための普遍的なインターフェースとして機能する。
その後、高速アクションエキスパートは、テキストキューと画素ガイダンスの両方を活用して、ネイティブ制御周波数で連続的なウェイポイントを生成する。
高レベルな意図と低レベルな制御を、明示的な言語的トレースと組み合わせたピクセルグラウンドのアンカーを通じてブリッジすることにより、シミュレーションや実世界のベンチマークを通じて、堅牢で、一般化可能で、解釈可能なナビゲーションを実現する。
ABot-N1は新たな最先端記録を樹立し、都市規模の航法に特化してPOIの到着率を35.0%(77.3%)押し上げ、複雑な屋内と屋外のシーンで95.4%/92.9%のSRを達成した。
また、オブジェクト取得、人物追跡、命令追従といったタスクにまたがる優れた堅牢性も維持する。
新しいPoint-Goal/POI-Goalベンチマークがオープンソースとしてリリースされた。
関連論文リスト
- Multi-Task Visual Perception Network with LLM Conditioning for Autonomous Navigation [4.075320514790725]
サービスロボットの長期ナビゲーションは、計測ドリフトの蓄積やセンサーエラーといった課題に直面している。
本稿では,グローバルな一貫した地図への依存を解消する,ユーザフレンドリでインタラクティブなフレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-13T05:38:52Z) - Goal-oriented Navigation Instruction Generation with Tour Video Priors [3.3906611506156916]
ナビゲーション命令生成(NIG)は、ナビゲーションガイダンスのためのステップバイステップの自然言語命令を生成することを目的としている。
我々は,エゴ中心のツアービデオからナビゲーション命令を生成する,ゴール指向のビデオグラウンドNIGタスクであるVideoNIGを紹介する。
本稿では,学習を基本動作知覚と長距離ナビゲーション推論に分解する2段階のカリキュラム学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-09T09:21:47Z) - ViTL: Temporal Logic-Guided Zero-Shot Natural Language Navigation via Vision-Language Models [7.354500239997416]
ロボットが自然言語コマンドを追従し、ゼロショットのロングホライゾンタスクを完了するためのフレームワークであるViTLを提案する。
ナビゲーションレベルでは、視野全体にわたって方向に依存しない値を生成するのではなく、方向スコアを導入する。
Habitat-Matterport 3Dの実験では、自然言語ナビゲーションタスクのゼロショット長水平補完を可能にする完全なフレームワークが示されている。
論文 参考訳(メタデータ) (2026-06-29T02:22:31Z) - WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation [31.539730066120374]
視覚ナビゲーションは、複雑な幾何学的および物理的制約の下で滑らかで衝突のない軌道を生成する必要がある。
WAM-Navは,視覚ナビゲーションを具体化した潜在世界行動モデルであり,行動生成と潜時視予知を共同で学習する。
論文 参考訳(メタデータ) (2026-06-03T14:05:19Z) - LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation [96.09246387639006]
LookasideVLNは、より正確な空間推論とより高い計算効率を達成するために、自然言語の方向の手がかりを利用する。
LookasideVLNは、シングルレベルのルックアヘッドでも、最先端のCityNavAgentよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-04-19T01:36:53Z) - HaltNav: Reactive Visual Halting over Lightweight Topological Priors for Robust Vision-Language Navigation [1.774434289475737]
VLN(Vision-and-Language Navigation)は、厳格なステップバイステップの指示から、オープンな語彙、ゴール指向の自律性へとシフトしている。
本稿では,OsmAGのロバストなグローバルプランニングと,VLNの局所探索と命令グラウンド機能を組み合わせた階層型ナビゲーションフレームワークHaltNavを提案する。
論文 参考訳(メタデータ) (2026-03-13T06:22:35Z) - OpenFrontier: General Navigation with Visual-Language Grounded Frontiers [54.661157616245966]
オープンワールドナビゲーションでは、複雑な日常環境においてロボットが意思決定を行う必要がある。
近年の視覚-言語ナビゲーション(VLN)と視覚-言語-アクション(VLA)モデルは、自然言語で条件付けられたエンドツーエンドのポリシーを実現する。
多様な視覚をシームレスに統合するトレーニングフリーナビゲーションフレームワークであるOpenFrontierを提案する。
論文 参考訳(メタデータ) (2026-03-05T17:02:22Z) - AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild [62.47761809929869]
視覚言語ナビゲーション(VLN)は、視覚的観察とともに言語指示を解釈することで、知的エージェントが環境をナビゲートする必要がある。
無人航空機(UAV)の現在のVLN研究は、所定のルートに沿ってUAVを誘導するための詳細な指示に依存している。
本稿では,自律型UAVナビゲーションのためのエンド・ツー・エンドのビジョン・ランゲージ・アクションモデルであるAutoFlyを提案する。
論文 参考訳(メタデータ) (2026-02-10T11:08:07Z) - GoViG: Goal-Conditioned Visual Navigation Instruction Generation [69.79110149746506]
本稿では,Goal-Conditioned Visual Navigation Instruction Generation (GoViG)を紹介する。
GoViGは生のエゴセントリックな視覚データのみを活用し、目に見えない非構造環境への適応性を大幅に改善する。
論文 参考訳(メタデータ) (2025-08-13T07:05:17Z) - GOAT-Bench: A Benchmark for Multi-Modal Lifelong Navigation [65.71524410114797]
GOAT-BenchはユニバーサルナビゲーションタスクGO to AnyThing(GOAT)のベンチマークである。
GOATでは、エージェントはカテゴリ名、言語記述、イメージによって指定されたターゲットのシーケンスにナビゲートするように指示される。
我々はGOATタスク上でモノリシックなRLおよびモジュラーメソッドをベンチマークし、その性能をモダリティにわたって分析する。
論文 参考訳(メタデータ) (2024-04-09T20:40:00Z) - How To Not Train Your Dragon: Training-free Embodied Object Goal
Navigation with Semantic Frontiers [94.46825166907831]
Embodied AIにおけるオブジェクトゴールナビゲーション問題に対処するためのトレーニング不要のソリューションを提案する。
本手法は,古典的な視覚的同時ローカライゼーションとマッピング(V-SLAM)フレームワークに基づく,構造化されたシーン表現を構築する。
本手法は,言語先行情報とシーン統計に基づいてシーングラフのセマンティクスを伝搬し,幾何学的フロンティアに意味知識を導入する。
論文 参考訳(メタデータ) (2023-05-26T13:38:33Z) - Bridging the Gap Between Learning in Discrete and Continuous
Environments for Vision-and-Language Navigation [41.334731014665316]
ヴィジュアル・アンド・ランゲージ・ナビゲーション(VLN)における既存の作業のほとんどは、離散的または連続的な環境に焦点を当てている。
ナビゲーション中に候補となるウェイポイントの集合を生成するための予測器を提案する。
予測された経路点を持つ連続環境を航行するエージェントは,低レベル動作を使用するエージェントよりも有意に優れた性能を示す。
論文 参考訳(メタデータ) (2022-03-05T14:56:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。