論文の概要: MarvisNav: Making Memory Visible on Route Choices for Zero-Shot Object Navigation
- arxiv url: http://arxiv.org/abs/2610.06510v1
- Date: Mon, 05 Oct 2026 15:28:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 07:54:46.749342
- Title: MarvisNav: Making Memory Visible on Route Choices for Zero-Shot Object Navigation
- Title(参考訳): MarvisNav: ゼロショットオブジェクトナビゲーションのためのルート選択によるメモリ可視化
- Abstract要約: MarvisNavはZSONフレームワークで、候補ノードをエゴセントリックなビューに、メモリを含む視覚的なルート選択として投影する。
MarvisNavは、各視覚的候補に直接探索状態を結合することにより、VLMが目標の関連性と探索状態を共同で評価することを可能にする。
- 参考スコア(独自算出の注目度): 16.931193339547086
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When searching for an object, people choose their next move by considering both likely target locations and places already explored. The current view can cue place-associated memories, bringing target relevance and prior exploration into the same spatial context. In many zero-shot object navigation (ZSON) methods, however, vision-language models (VLMs) infer promising search areas from egocentric images, while exploration history is represented separately, e.g., as text or maps. This separation either requires an additional fusion step or leaves the correspondence between memory and route choices implicit for the VLM to recover. We instead make exploration memory directly visible on visual route choices. We propose MarvisNav, a ZSON framework that maintains a topological graph and projects candidate nodes together with their exploration states onto egocentric views as memory-bearing visual route choices. These states capture local exploration progress beyond binary visitation. By binding exploration state directly to each visual candidate, MarvisNav enables the VLM to jointly evaluate target relevance and exploration state without a separate post-hoc fusion or reranking stage. Without policy training, MarvisNav achieves state-of-the-art performance on HM3D (81.2% SR and 42.5% SPL), while remaining competitive on MP3D. It also outperforms representative VLM-based methods with far fewer VLM calls (e.g., 7.5% of WMNav). Real-robot experiments across diverse scenes further validate its practical deployability. Beyond MarvisNav, our study shows that memory representation shapes VLM decisions and ZSON performance, highlighting that effective memory use depends not only on its availability, but also on how it is represented. Code and project page will be available at \url{https://wangjincheng1998.github.io/MarvisNav/}.
- Abstract(参考訳): 対象物を探す際には、既に探索されている可能性のある場所と場所の両方を考慮し、次の行動を選択する。
現在のビューは、場所関連記憶をクローズし、ターゲットの関連性と、同じ空間コンテキストへの事前探索をもたらす。
しかし、多くのゼロショットオブジェクトナビゲーション(ZSON)手法では、視覚言語モデル(VLM)は、エゴセントリックな画像から有望な検索領域を推測する一方、探索履歴はテキストや地図として別々に表現される。
この分離は、追加の融合ステップを必要とするか、VLMが回復する暗黙のメモリとルートの選択との対応を残している。
代わりに、探索メモリを視覚的な経路選択で直接見えるようにします。
本稿では,ZSON フレームワークである MarvisNav を提案する。このフレームワークはトポロジカルグラフを維持し,その探索状態とともに候補ノードを,メモリを含む視覚経路選択としてエゴセントリックな視点に投影する。
これらの州は二国間訪問を超えた地域探検の進展を捉えている。
MarvisNavは、各視覚的候補に直接探索状態を結合することにより、VLMが個別のホット後の融合や再ランクステージなしに、目標の関連性と探索状態を共同で評価することを可能にする。
マーヴィスナブは政策訓練なしでHM3D(81.2%のSRと42.5%のSPL)で最先端のパフォーマンスを達成し、MP3Dでは競争力を維持している。
また、VLMベースの代表手法よりもはるかに少ない(例えば、WMNavの7.5%)。
様々な場面での実際のロボット実験は、その実際の展開可能性をさらに検証する。
MarvisNav以外の研究では、メモリ表現がVLM決定とZSON性能を形作っていることを示し、効果的なメモリ使用は、その可用性だけでなく、どのように表現されるかにも依存していることを強調した。
コードとプロジェクトページは \url{https://wangjincheng1998.github.io/MarvisNav/} で入手できる。
関連論文リスト
- VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation [55.45263611374435]
エージェントが同じシーンで繰り返し操作し、自己獲得経験のみを保持し、モデルパラメータを固定するクロスエポソードオブジェクトゴールナビゲーションを提案する。
経験の再利用を支援するために,永続的階層型ビジュアルトポロジカルメモリ(VTM)を用いたトレーニング不要なVLMナビゲーションフレームワークを提案する。
提案手法は,3つのベンチマークすべてで最高のパフォーマンスを実現し,データセット間の構造化視覚トポロジカルエクスペリエンスの再利用の有効性と堅牢性を示す。
論文 参考訳(メタデータ) (2026-07-16T03:11:37Z) - AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness [5.851139427049915]
連続環境(VLN-CE)におけるゼロショット視覚言語ナビゲーションは,近年,大規模視覚言語モデル(VLM)で実現可能になった。
本稿では,ゼロショットVLN-CEを,VLMと環境とのエージェントインタフェースとして再考する。
我々は、アクション、深さ、メモリを呼び出し可能なツールとして公開する軽量なナビゲーションハーネスであるAgenticNavを紹介します。
論文 参考訳(メタデータ) (2026-06-09T08:43:05Z) - IntentNav: Learning Spatial-Visual Object Navigation from Human Demonstrations [58.921283404811085]
我々は,人間のようなObjectNavポリシーを人間のデモから学習するフレームワークを提案する。
IntentNavはMP3D、HM3D-v1、HM3D-v2 ObjectNavベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-06-06T07:45:19Z) - EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation [81.54723508469617]
EvoMemNavは、ゼロショットエンボディナビゲーションのための効率的で自己進化的できめ細かいメモリフレームワークである。
VSMGraphは、セマンティックキューとトポロジ的関係を持つビューをルームビューオブジェクト階層に整理する。
GOAT-BenchとHM3Dのオブジェクト、テキスト記述、画像ゴールのモダリティによる実験は、SR/SPLにおいて一貫した利得を示している。
論文 参考訳(メタデータ) (2026-06-02T11:27:44Z) - ReMemNav: A Rethinking and Memory-Augmented Framework for Zero-Shot Object Navigation [35.416693138335354]
ゼロショットオブジェクトナビゲーションでは、エージェントは未知のターゲットオブジェクトを未知の環境で見つける必要がある。
視覚言語モデルの最近の進歩は、このタスクに有望な常識推論機能を提供する。
本稿では,パノラマ的セマンティック先行とエピソード記憶をシームレスに統合するReMemNavという新しい階層型ナビゲーションフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-25T09:07:32Z) - ImagineNav++: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination [36.489349671649045]
VLM(Vision-Language Models)は、オンボードのRGB/RGB-Dストリームのみを使用してマップレスなビジュアルナビゲーションを実現し、空間的な知覚と計画の可能性を解き放つ。
我々はこれを、想像力によるナビゲーションフレームワークImagineNav++で実現している。
空間的整合性を維持するため,スパース・トゥ・デンス・フレームワークによる観測を階層的に統合する選択的葉形成記憶機構を開発した。
論文 参考訳(メタデータ) (2025-12-19T10:40:16Z) - TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation [52.422619828854984]
MLLMをベースとしたTopV-Navを提案する。
MLLMの空間推論能力をトップビューで完全に解き放つために,適応型視覚プロンプト生成法(AVPG)を提案する。
論文 参考訳(メタデータ) (2024-11-25T14:27:55Z) - GaussNav: Gaussian Splatting for Visual Navigation [92.13664084464514]
インスタンスイメージゴールナビゲーション(IIN)では、エージェントが探索されていない環境で、目標画像に描かれた特定のオブジェクトを見つける必要がある。
視覚ナビゲーションのためのガウススティング(GaussNav)であるIINの新しいフレームワークを提案し、3次元ガウススティング(DGS)に基づく新しい地図表現を構築した。
当社のGaussNavフレームワークは,Habitat-Matterport 3D(HM3D)データセットにおいて,SPL(Path Length)によるSuccessの重み付けを0.347から0.578に増加させ,大幅なパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2024-03-18T09:56:48Z) - MemoNav: Working Memory Model for Visual Navigation [47.011190883888446]
イメージゴールナビゲーションは、不慣れな環境でイメージによって示されるゴールにエージェントがナビゲートする必要がある、困難なタスクである。
様々な場面の記憶を利用する既存の手法は、すべての歴史的観察を意思決定に用いているため、非効率な探索に苦しむ。
動作メモリにインスパイアされたパイプラインを用いてナビゲーション性能を向上させる,イメージゴールナビゲーションのための新しいメモリモデルであるMemoNavを提案する。
論文 参考訳(メタデータ) (2024-02-29T13:45:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。