論文の概要: HRO: Hierarchical Room-to-Object Framework for Zero-Shot Object Goal Navigation with Large Language Models
- arxiv url: http://arxiv.org/abs/2607.13072v1
- Date: Sun, 12 Jul 2026 06:28:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.519727
- Title: HRO: Hierarchical Room-to-Object Framework for Zero-Shot Object Goal Navigation with Large Language Models
- Title(参考訳): HRO:大規模言語モデルを用いたゼロショットオブジェクトゴールナビゲーションのための階層型ルームツーオブジェクトフレームワーク
- Abstract要約: ゼロショットのオブジェクトゴールナビゲーションは、知的エージェントが特定の目標トレーニングなしで未知のカテゴリのオブジェクトを探索し、ナビゲートできるようにすることを目的としている。
既存のゼロショットのオブジェクトゴールナビゲーション手法は、大きな言語モデル(LLM)に基づいており、単にオブジェクトやリージョンを直接関連付けるためのフラットな推論ツールとしてLLMを使用するだけである。
本稿では,ゼロショットオブジェクトゴールナビゲーションのためのLLM駆動型階層型ルーム・トゥ・オブジェクト(HRO)フレームワークを提案する。
- 参考スコア(独自算出の注目度): 2.5209477824050954
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Zero-shot object-goal navigation aims to enable an intelligent agent to explore and navigate to objects of unknown categories in an unfamiliar environment without specific target training. In zero-shot navigation tasks, pre-trained large models are usually employed to leverage their prior knowledge for guiding the agent's navigation. However, existing zero-shot object-goal navigation methods based on large language models (LLMs) merely utilize LLMs as flat reasoning tools to directly associate objects or regions. They lack the hierarchical spatial cognition modeling of human-like room semantics to object localization, which leads to strong blindness in exploration, insufficient accuracy in semantic association, and failure to fully unleash the common-sense reasoning potential of LLMs. This paper proposes an LLM-driven hierarchical room-to-object (HRO) framework for zero-shot object-goal navigation, which guides the agent to explore and navigate to the target object in a coarse-to-fine manner. Experiments on Gibson and HM3D datasets verify that our HRO framework achieves superior success rate and generalization over existing LLM-based methods, underscoring LLMs' strong potential for zero-shot object-goal navigation.
- Abstract(参考訳): ゼロショットのオブジェクトゴールナビゲーションは、知的エージェントが特定の目標トレーニングなしで未知のカテゴリのオブジェクトを探索し、ナビゲートできるようにすることを目的としている。
ゼロショットナビゲーションタスクでは、エージェントのナビゲーションを導くための以前の知識を活用するために、訓練済みの大型モデルが使用される。
しかし、既存のゼロショットのオブジェクトゴールナビゲーション手法は、大きな言語モデル(LLM)に基づいており、単にLLMをフラットな推論ツールとして使うだけで、オブジェクトやリージョンを直接関連付けることができる。
それらは、人間のような部屋のセマンティクスの階層的空間認知モデリングをオブジェクトの局所化に欠いているため、探索における強い盲目、意味的関連性の不十分な正確性、LLMの常識的推論可能性を完全に解き放たない。
本稿では,ゼロショットオブジェクトゴールナビゲーションのためのLLM駆動型階層型ルーム・トゥ・オブジェクト(HRO)フレームワークを提案する。
Gibson と HM3D データセットの実験により、我々の HRO フレームワークは既存の LLM ベースの手法よりも優れた成功率と一般化を実現し、ゼロショットのオブジェクトゴールナビゲーションに対する LLM の強いポテンシャルを裏付ける。
関連論文リスト
- CLUE: Adaptively Prioritized Contextual Cues by Leveraging a Unified Semantic Map for Effective Zero-Shot Object-Goal Navigation [8.756342403405204]
部屋や物体からの文脈的手がかりは重要であるが、それらの相対的重要性はターゲットに依存している。
本稿では,コンテキスト空間やオブジェクトの利用を適応的にバランスさせる新しいナビゲーションフレームワークであるCLUEを紹介する。
我々のフレームワークは、両方の種類の文脈情報を統合した統合意味値マップを構築する。
論文 参考訳(メタデータ) (2026-05-19T00:15:26Z) - ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation [53.95797153529148]
身体的エージェントは、主に部分的な自我中心の観測に依存するため、効率的なナビゲーションに苦しむことが多い。
本稿では,マルチモーダル大規模言語モデル(MLLM)と決定論的プランナを結合することにより,この理由に基づくパラダイムを運用する,人間にインスパイアされたフレームワークであるReasonNaviを紹介する。
論文 参考訳(メタデータ) (2026-01-26T19:09:20Z) - FOM-Nav: Frontier-Object Maps for Object Goal Navigation [65.76906445210112]
FOM-Navはフロンティアオブジェクトマップと視覚言語モデルによる探索効率を高めるフレームワークである。
FOM-Navをトレーニングするために,実環境から大規模ナビゲーションデータセットを自動構築する。
FOM-NavはMP3DとHM3Dのベンチマーク、特にナビゲーション効率の指標SPLで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-11-30T18:16:09Z) - History-Augmented Vision-Language Models for Frontier-Based Zero-Shot Object Navigation [5.343932820859596]
本稿では、動的履歴認識プロンプトの利用を先駆する新しいゼロショットObjectNavフレームワークを提案する。
私たちの中心となるイノベーションは、VLMにアクション履歴コンテキストを提供し、ナビゲーションアクションのセマンティックガイダンススコアを生成することです。
また、検出対象に対する最終アプローチを洗練するためのVLM支援のウェイポイント生成機構も導入する。
論文 参考訳(メタデータ) (2025-06-19T21:50:16Z) - SemNav: A Model-Based Planner for Zero-Shot Object Goal Navigation Using Vision-Foundation Models [10.671262416557704]
Vision Foundation Models (VFM) は視覚的理解と推論に強力な機能を提供する。
本稿では,VFMの知覚的強度をモデルベースプランナと統合したゼロショットオブジェクトゴールナビゲーションフレームワークを提案する。
本研究では,Habitatシミュレータを用いてHM3Dデータセットに対するアプローチを評価し,提案手法が最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2025-06-04T03:04:54Z) - Navigating Motion Agents in Dynamic and Cluttered Environments through LLM Reasoning [69.5875073447454]
本稿では,大規模言語モデル(LLM)によって強化された動作エージェントを,動的・乱雑な環境における自律的なナビゲーションに向けて前進させる。
トレーニング不要なフレームワークは、マルチエージェント調整、クローズドループ計画、動的障害物回避を、リトレーニングや微調整なしでサポートしています。
論文 参考訳(メタデータ) (2025-03-10T13:39:09Z) - TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation [52.422619828854984]
MLLMをベースとしたTopV-Navを提案する。
MLLMの空間推論能力をトップビューで完全に解き放つために,適応型視覚プロンプト生成法(AVPG)を提案する。
論文 参考訳(メタデータ) (2024-11-25T14:27:55Z) - SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigation [83.4599149936183]
既存のゼロショットオブジェクトナビゲーション手法は、空間的に閉じたオブジェクトのテキストでLCMをプロンプトする。
本稿では,3次元シーングラフを用いて観察されたシーンを表現することを提案する。
我々は,MP3D,HM3D,RoboTHOR環境において,SG-Navが従来のゼロショット法を10%以上のSRで上回る大規模な実験を行った。
論文 参考訳(メタデータ) (2024-10-10T17:57:19Z) - Can an Embodied Agent Find Your "Cat-shaped Mug"? LLM-Guided Exploration
for Zero-Shot Object Navigation [58.3480730643517]
言語駆動型ゼロショットオブジェクトゴールナビゲーション(L-ZSON)のための新しいアルゴリズムLGXを提案する。
このアプローチでは、このタスクにLarge Language Models(LLM)を使用します。
現状のゼロショットオブジェクトナビゲーションをRoboTHOR上で実現し,現在のベースラインよりも27%以上の成功率(SR)向上を実現した。
論文 参考訳(メタデータ) (2023-03-06T20:19:19Z) - Object Goal Navigation using Goal-Oriented Semantic Exploration [98.14078233526476]
本研究は,未確認環境における対象カテゴリーのインスタンスにナビゲートするオブジェクトゴールナビゲーションの問題を研究する。
本稿では,表層的なセマンティックマップを構築し,効率的に環境を探索する「ゴール指向セマンティック探索」というモジュールシステムを提案する。
論文 参考訳(メタデータ) (2020-07-01T17:52:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。