論文の概要: PlatonicNav: Unveiling Semantic Correspondence in Navigation with Platonic Topological Maps
- arxiv url: http://arxiv.org/abs/2606.01788v1
- Date: Mon, 01 Jun 2026 07:08:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:31.48124
- Title: PlatonicNav: Unveiling Semantic Correspondence in Navigation with Platonic Topological Maps
- Title(参考訳): PlatonicNav:Platonic Topological Mapsを用いたナビゲーションにおける意味対応の展開
- Abstract要約: 身体的な視覚ナビゲーションは、家庭用サービスロボティクス、補助ロボティクス、大規模自律探査など、幅広い応用を支えている。
我々は,Platonic Topological Mapが自己教師付き視覚エンコーダから幾何学的および意味的ノード距離を融合する学習自由フレームワークであるPlatonicNavを紹介し,視覚言語データをペア化せずにブラインドマッチングによって言語目標をグラウンド化する。
- 参考スコア(独自算出の注目度): 14.35568539633215
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Embodied visual navigation, where an agent perceives a complex environment and acts to reach a goal from raw sensory input, underpins a wide range of applications such as household service robotics, assistive robotics, and large-scale autonomous exploration. However, recent attempts to unify vision-and-language navigation (VLN) and object goal navigation (ObjNav) remain at the level of architectural fusion, mixed-task training, and large vision-language pretraining, without examining whether independently trained vision and language encoders may already share a common semantic structure. Moreover, even object-centric topological maps still ground language goals through explicit cross-modal supervision such as CLIP or large vision-language models, leaving open whether such grounding is possible from a purely vision-built map. To address these challenges, we extend the Platonic Representation Hypothesis to embodied navigation and recast vision-only ObjNav, cross-modal ObjNav, and VLN as three different interfaces to the same object-centric semantic manifold. We further introduce PlatonicNav, a training-free framework whose Platonic Topological Map fuses geometric and semantic node distances from a self-supervised visual encoder, and grounds language goals via blind matching without any paired vision-language data. Extensive experiments on simulation benchmarks including HM3D-IIN, OVON, and R2R-CE on MP3D, together with deployment on Unitree Go2, demonstrate that PlatonicNav generalizes across tasks, modalities, and embodiments without explicit cross-modal training. Code: https://github.com/AIGeeksGroup/PlatonicNav. Website: https://aigeeksgroup.github.io/PlatonicNav.
- Abstract(参考訳): エージェントが複雑な環境を認識し、生の感覚入力から目標を達成するために機能する視覚ナビゲーションは、家庭用サービスロボティクス、アシストロボティクス、大規模自律探査など、幅広い応用を支えている。
しかし、近年の視覚・言語ナビゲーション(VLN)とオブジェクトゴールナビゲーション(ObjNav)の統合の試みは、独立に訓練された視覚と言語エンコーダがすでに共通の意味構造を共有しているかどうかを調べることなく、アーキテクチャ融合、混合タスクトレーニング、大規模視覚言語事前訓練のレベルに留まっている。
さらに、オブジェクト中心のトポロジマップでさえ、CLIPや大規模視覚言語モデルのような明示的なクロスモーダルな監督を通じて、言語目標を定めている。
これらの課題に対処するため、Platonic Representation hypothesisを具体化したナビゲーションに拡張し、同じオブジェクト中心のセマンティック多様体に対する3つの異なるインターフェースとして、視覚のみのObjNav、クロスモーダルのObjNav、VLNを再キャストする。
さらに、PlatonicNavは、Platonic Topological Mapが自己教師付きビジュアルエンコーダから幾何学的および意味的ノード距離を融合し、ペアの視覚言語データを使わずにブラインドマッチングによって言語目標を確定する学習自由フレームワークである。
HM3D-IIN、OVON、R2R-CEといったMP3D上のシミュレーションベンチマークに関する広範な実験は、Unitree Go2へのデプロイとともに、PlatonicNavが明示的なクロスモーダルトレーニングなしでタスク、モダリティ、実施を一般化することを実証している。
コード:https://github.com/AIGeeksGroup/PlatonicNav。
Webサイト: https://aigeeksgroup.github.io/PlatonicNav.com
関連論文リスト
- Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation [32.02017382315305]
Vision-Language Navigation (VLN) は、エンボディエージェントが言語命令に従うことで、見えない環境でターゲットの場所に到達することを可能にする。
近年の視覚言語モデル(VLM)の進歩にもかかわらず、重要な意味幾何学的ギャップが残っている。
本稿では3次元幾何学情報をVLMと互換性のある構造化表現に変換する階層型意味幾何学マップ(HSGM)を提案する。
論文 参考訳(メタデータ) (2026-05-25T08:53:21Z) - AgentVLN: Towards Agentic Vision-and-Language Navigation [78.739525400071]
VLN (Vision-and-Language Navigation) は、複雑な自然言語命令を、見えない環境での長距離ナビゲーションに接地するために、エンボディエージェントを必要とする。
本稿では,エッジコンピューティングプラットフォーム上に展開可能な,新規かつ効率的なナビゲーションフレームワークであるAgentVLNを提案する。
論文 参考訳(メタデータ) (2026-03-18T12:43:47Z) - OpenFrontier: General Navigation with Visual-Language Grounded Frontiers [54.661157616245966]
オープンワールドナビゲーションでは、複雑な日常環境においてロボットが意思決定を行う必要がある。
近年の視覚-言語ナビゲーション(VLN)と視覚-言語-アクション(VLA)モデルは、自然言語で条件付けられたエンドツーエンドのポリシーを実現する。
多様な視覚をシームレスに統合するトレーニングフリーナビゲーションフレームワークであるOpenFrontierを提案する。
論文 参考訳(メタデータ) (2026-03-05T17:02:22Z) - ImagineNav++: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination [36.489349671649045]
VLM(Vision-Language Models)は、オンボードのRGB/RGB-Dストリームのみを使用してマップレスなビジュアルナビゲーションを実現し、空間的な知覚と計画の可能性を解き放つ。
我々はこれを、想像力によるナビゲーションフレームワークImagineNav++で実現している。
空間的整合性を維持するため,スパース・トゥ・デンス・フレームワークによる観測を階層的に統合する選択的葉形成記憶機構を開発した。
論文 参考訳(メタデータ) (2025-12-19T10:40:16Z) - Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation [54.04601077224252]
身近なシーン理解には、視覚空間情報の理解だけでなく、3D物理世界における次の探索場所の決定も必要である。
アンダーラインテキストbf3D視覚言語学習は、エンボディエージェントが環境を効果的に探索し理解することを可能にする。
モデルの汎用性は、カテゴリ、言語記述、参照イメージなど、多様な入力モダリティを使ったナビゲーションを可能にする。
論文 参考訳(メタデータ) (2025-07-05T14:15:52Z) - Co-NavGPT: Multi-Robot Cooperative Visual Semantic Navigation Using Vision Language Models [8.668211481067457]
Co-NavGPTは、ビジョン言語モデル(VLM)をグローバルプランナーとして統合する新しいフレームワークである。
Co-NavGPTは、多様な視点を持つ複数のロボットのサブマップを統一されたグローバルマップに集約する。
VLMはこの情報を使って、ロボット全体のフロンティアを割り当て、協調的で効率的な探索を容易にする。
論文 参考訳(メタデータ) (2023-10-11T23:17:43Z) - LangNav: Language as a Perceptual Representation for Navigation [63.90602960822604]
視覚・言語ナビゲーション(VLN)における知覚表現としての言語の利用について検討する。
提案手法では,画像キャプションや物体検出に市販の視覚システムを用いて,エージェントのエゴセントリックなパノラマビューを各ステップで自然言語記述に変換する。
論文 参考訳(メタデータ) (2023-10-11T20:52:30Z) - Learning Navigational Visual Representations with Semantic Map
Supervision [85.91625020847358]
エージェントの自我中心のビューとセマンティックマップを対比してナビゲーション固有の視覚表現学習法を提案する。
Ego$2$-Map学習は、オブジェクト、構造、遷移などのコンパクトでリッチな情報を、ナビゲーションのためのエージェントのエゴセントリックな表現に転送する。
論文 参考訳(メタデータ) (2023-07-23T14:01:05Z) - LM-Nav: Robotic Navigation with Large Pre-Trained Models of Language,
Vision, and Action [76.71101507291473]
本稿では,無注釈の大規模軌跡データに対するトレーニングの恩恵を享受するロボットナビゲーションシステムLM-Navを提案する。
本研究では,ナビゲーション(ViNG),画像言語アソシエーション(CLIP),言語モデリング(GPT-3)の事前学習モデルから構築可能なシステムについて述べる。
論文 参考訳(メタデータ) (2022-07-10T10:41:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。