論文の概要: HAM-VLN: Harnessing Hierarchical Agentic Memory for Zero-Shot Vision-and-Language Navigation
- arxiv url: http://arxiv.org/abs/2607.29600v1
- Date: Fri, 31 Jul 2026 16:32:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.796587
- Title: HAM-VLN: Harnessing Hierarchical Agentic Memory for Zero-Shot Vision-and-Language Navigation
- Title(参考訳): HAM-VLN:ゼロショットビジョン・ランゲージナビゲーションのための階層型エージェントメモリのハーネス化
- Abstract要約: ヴィジュアル・アンド・ランゲージ・ナビゲーション(VLN)は、ロボットがこれまで見えなかった環境で指示に従うことを可能にする。
Ham-VLNは決定結合型エージェントによるメモリで、ロボットに永続的で深度の高い世界グラフを装備する。
Ham-VLNはVLN-CE R2Rで61.0%の成功率(SR)、VLN-CE RxRで52.7%、HM3D-v2 ObjectNavで79.7%を達成している。
- 参考スコア(独自算出の注目度): 19.550897283368894
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-and-language navigation (VLN) enables robots to follow instructions in previously unseen environments. Recently, a training-free paradigm has emerged: the robot queries a multimodal LLM to understand its observations and plan the next action. However, long-horizon navigation based on either image streams or dense map inevitably introduces a growing memory and reasoning bottleneck. We present HAM-VLN, a decision-coupled, agent-authored memory that equips the robot with a persistent, depth-grounded world graph. In the same model call used to select the next action, HAM-VLN also records semantic and reflective information---including room type, objects, navigation progress, and failure notes. Recent waypoints remain verbatim within a bounded window, while older history re-enters the context only through retrieval scored by relevance, recency, and salience, together with one-hop topological expansion. This design requires no additional LLM calls beyond the per-waypoint decision. Compared to previous methods, HAM-VLN not only improves various navigation metrics but also reduces the context length by more than 65%. Specifically, HAM-VLN achieves 61.0% Success Rate (SR) on VLN-CE R2R, 52.7% SR on VLN-CE RxR, and 79.7% SR on HM3D-v2 ObjectNav without any training.
- Abstract(参考訳): ヴィジュアル・アンド・ランゲージ・ナビゲーション(VLN)は、ロボットがこれまで見えなかった環境で指示に従うことを可能にする。
ロボットは、その観察を理解して次のアクションを計画するために、マルチモーダル LLM をクエリする。
しかし、画像ストリームまたは高密度マップに基づく長距離ナビゲーションは、必然的にメモリ増加と推論ボトルネックをもたらす。
HAM-VLNは、決定結合型エージェントオーサリングメモリで、ロボットに永続的な深度グラウンドのワールドグラフを装備する。
次のアクションを選択するのと同じモデルコールで、HAM-VLNは、ルームタイプ、オブジェクト、ナビゲーションの進捗、障害ノートを含む、セマンティックおよび反射的な情報も記録する。
近年のウェイポイントは有界な窓の中で冗長なままであり、古い歴史は1ホップのトポロジカル展開とともに、関連性、相対性、およびサリエンスによって得られた検索によってのみコンテキストを再入力する。
この設計では、ウェイポイントごとの判断以外のLCM呼び出しは必要としない。
従来の手法と比較して、HAM-VLNは様々なナビゲーション指標を改善するだけでなく、コンテキスト長を65%以上削減する。
具体的には、HAM-VLNはVLN-CE R2Rで61.0%の成功率(SR)、VLN-CE RxRで52.7%、HM3D-v2 ObjectNavで79.7%となる。
関連論文リスト
- AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness [5.851139427049915]
連続環境(VLN-CE)におけるゼロショット視覚言語ナビゲーションは,近年,大規模視覚言語モデル(VLM)で実現可能になった。
本稿では,ゼロショットVLN-CEを,VLMと環境とのエージェントインタフェースとして再考する。
我々は、アクション、深さ、メモリを呼び出し可能なツールとして公開する軽量なナビゲーションハーネスであるAgenticNavを紹介します。
論文 参考訳(メタデータ) (2026-06-09T08:43:05Z) - IntentNav: Learning Spatial-Visual Object Navigation from Human Demonstrations [58.921283404811085]
我々は,人間のようなObjectNavポリシーを人間のデモから学習するフレームワークを提案する。
IntentNavはMP3D、HM3D-v1、HM3D-v2 ObjectNavベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-06-06T07:45:19Z) - EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation [81.54723508469617]
EvoMemNavは、ゼロショットエンボディナビゲーションのための効率的で自己進化的できめ細かいメモリフレームワークである。
VSMGraphは、セマンティックキューとトポロジ的関係を持つビューをルームビューオブジェクト階層に整理する。
GOAT-BenchとHM3Dのオブジェクト、テキスト記述、画像ゴールのモダリティによる実験は、SR/SPLにおいて一貫した利得を示している。
論文 参考訳(メタデータ) (2026-06-02T11:27:44Z) - Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation [60.07205156194741]
身体的なナビゲーションでは、エージェントが言語や視覚的な観察を、実際に見たことのない環境を通して実際のロボットを駆動する空間的な行動の流れにマッピングする必要がある。
統合エージェントアーキテクチャであるUni-LaViRAを4つのタスクファミリと4つの異種実ロボットに拡張する。
論文 参考訳(メタデータ) (2026-05-26T18:52:04Z) - ReMemNav: A Rethinking and Memory-Augmented Framework for Zero-Shot Object Navigation [35.416693138335354]
ゼロショットオブジェクトナビゲーションでは、エージェントは未知のターゲットオブジェクトを未知の環境で見つける必要がある。
視覚言語モデルの最近の進歩は、このタスクに有望な常識推論機能を提供する。
本稿では,パノラマ的セマンティック先行とエピソード記憶をシームレスに統合するReMemNavという新しい階層型ナビゲーションフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-25T09:07:32Z) - GoalVLM: VLM-driven Object Goal Navigation for Multi-Agent System [0.0]
ゼロショットでオープンなオブジェクトナビゲーションのための協調型マルチエージェントフレームワークであるGoalVLMを提案する。
GoalVLMは、VLM(Vision-Language Model)を直接決定ループに統合し、SAM3はテキストプロンプト検出とセグメンテーション、SpaceOMは空間推論を行う。
GOAT-Bench val_unseenにおけるGoalVLMの評価を行った。
論文 参考訳(メタデータ) (2026-03-18T18:59:33Z) - History-Augmented Vision-Language Models for Frontier-Based Zero-Shot Object Navigation [5.343932820859596]
本稿では、動的履歴認識プロンプトの利用を先駆する新しいゼロショットObjectNavフレームワークを提案する。
私たちの中心となるイノベーションは、VLMにアクション履歴コンテキストを提供し、ナビゲーションアクションのセマンティックガイダンススコアを生成することです。
また、検出対象に対する最終アプローチを洗練するためのVLM支援のウェイポイント生成機構も導入する。
論文 参考訳(メタデータ) (2025-06-19T21:50:16Z) - DORAEMON: Decentralized Ontology-aware Reliable Agent with Enhanced Memory Oriented Navigation [55.888688171010365]
DORAEMONは、人間のナビゲーション機能を模倣したVentralとDorsal Streamsで構成される、認知にインスパイアされたフレームワークである。
我々は,DORAEMONをHM3D,MP3D,GOATのデータセット上で評価し,成功率(SR)と成功度(SPL)の測定値の両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-05-28T04:46:13Z) - NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning [97.88246428240872]
Embodied AIの重要な研究課題であるVision-and-Language Navigation (VLN)は、自然言語の指示に従って複雑な3D環境をナビゲートするために、エンボディエージェントを必要とする。
近年の研究では、ナビゲーションの推論精度と解釈可能性を改善することにより、VLNにおける大きな言語モデル(LLM)の有望な能力を強調している。
本稿では,自己誘導型ナビゲーション決定を実現するために,パラメータ効率の高いドメイン内トレーニングを実現する,Navigational Chain-of-Thought (NavCoT) という新しい戦略を提案する。
論文 参考訳(メタデータ) (2024-03-12T07:27:02Z) - Structured Scene Memory for Vision-Language Navigation [155.63025602722712]
視覚言語ナビゲーション(VLN)のための重要なアーキテクチャを提案する。
ナビゲーション中に知覚を正確に記憶できるほど区画化されている。
また、環境内の視覚的および幾何学的な手がかりを捉え、取り除く、構造化されたシーン表現としても機能する。
論文 参考訳(メタデータ) (2021-03-05T03:41:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。