論文の概要: Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation
- arxiv url: http://arxiv.org/abs/2606.31071v1
- Date: Tue, 30 Jun 2026 03:01:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.049767
- Title: Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation
- Title(参考訳): 階層型3次元シーングラフの構築とセマンティックナビゲーションのための信念に基づく計画
- Abstract要約: エンボディエージェントのためのゼロショットセマンティックナビゲーションフレームワークを提案する。
本手法は,オブジェクト,ゾーン,領域を網羅したオンライン階層型3次元シーングラフ(HSG)を漸進的に維持し,グローバルプランニングのためのコンパクトな状態抽象化として機能する。
このメモリ上に構築された階層的信念に基づく計画フレームワークは,HSGの探索証拠とセマンティック先行を融合させ,HSGベースのシミュレータ上で有限水平ロールアウトを行い,候補マクロアクションの長期的リターンを明示的に推定する。
- 参考スコア(独自算出の注目度): 34.08516675160383
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Semantic navigation is a fundamental task for embodied agents operating in unseen environments, requiring both semantic understanding and long-term decision-making. Recent foundation models have empowered agents with rich semantic priors for this task. However, without structured global representations, decision-making often falls back on local observations and greedy strategies, resulting in inefficient exploration and myopic behaviors, especially in long-distance navigation. To address these challenges, we propose a zero-shot semantic navigation framework. Our method incrementally maintains an online Hierarchical 3D Scene Graph (HSG) to form a multi-granular semantic topology over objects, zones, and regions, serving as a compact state abstraction for global planning. Building on this memory, we introduce a hierarchical belief-based planning framework that fuses semantic priors with exploration evidence on the HSG, and performs finite-horizon rollouts on an HSG-based simulator to explicitly estimate the long-term expected returns of candidate macro-actions. This enables globally consistent decisions and reduces redundant backtracking. Extensive experiments in high-fidelity simulation environments across multiple tasks and datasets demonstrate that our method outperforms existing state-of-the-art methods, particularly in long-distance scenarios, where our approach improves SR and SPL by an average of 9.4\% and 5.0\%, respectively.
- Abstract(参考訳): セマンティックナビゲーションは、意味的理解と長期的な意思決定の両方を必要とする、目に見えない環境で動作しているエージェントの基本的なタスクである。
最近の基礎モデルは、このタスクに豊富なセマンティックな優先順位を持つエージェントに権限を与えている。
しかし、構造化されたグローバルな表現がなければ、意思決定はしばしば局所的な観察と欲張りの戦略に反し、特に長距離航法において非効率な探索と筋電図的行動をもたらす。
これらの課題に対処するため、ゼロショットセマンティックナビゲーションフレームワークを提案する。
本手法は,階層型3次元シーングラフ(HSG)を段階的に維持し,オブジェクト,ゾーン,領域上の多粒質意味的トポロジを形成し,グローバルプランニングのためのコンパクトな状態抽象化として機能する。
このメモリ上に構築された階層的信念に基づく計画フレームワークは,HSGの探索証拠とセマンティック先行を融合させ,HSGベースのシミュレータ上で有限水平ロールアウトを行い,候補マクロアクションの長期的リターンを明示的に推定する。
これにより、グローバルに一貫した決定が可能になり、冗長なバックトラックを削減できる。
複数のタスクやデータセットにわたる高忠実度シミュレーション環境における大規模な実験により、我々の手法は既存の最先端手法、特に長距離シナリオにおいて、平均9.4\%と5.0\%でSRとSPLを改善している。
関連論文リスト
- Prior-SG: Task and Prior Driven Region Segmentation for Scene Graphs in Arbitrarily-Structured Environments [20.027960785504586]
確率的アライメント問題としてシーングラフを生成するタスク駆動および事前駆動のフレームワークであるPreside-SGを提案する。
我々は、多様なシミュレーションされた住宅データセットと、大規模でオープンな実環境にまたがるこのアプローチを検証する。
論文 参考訳(メタデータ) (2026-08-06T15:36:12Z) - SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation [26.212246536363363]
Object-Goal Navigation (Nav)は、エゴセントリックな視覚的観察のみを使用して、特定のターゲットを自律的に特定するエンボディエージェントを必要とする。
SAGE-Navは,Large Language Models(LLM)の推論機能と動的シーングラフを統合した,新しい階層型フレームワークである。
SAGE-Navは,物理ロボット展開に必要な低制御遅延を維持しつつ,ナビゲーション効率とゼロショット一般化の大幅な向上を実現していることを示す。
論文 参考訳(メタデータ) (2026-06-24T07:24:39Z) - STEM: Semantic Target Search and Exploration using MAVs in Cluttered Environments [17.009653719709213]
本稿では,目的探索時間と探索時間を最小限に抑えるために,意味誘導型視点プランナを用いた新しいフレームワークを提案する。
具体的には,対象に繋がる可能性のある視点を優先順位付けすることで,効率的な意味探索計画を生成するプランナーを開発する。
論文 参考訳(メタデータ) (2026-05-30T15:00:58Z) - GeoMamba: A Geometry-driven MambaVision Framework and Dataset for Fine-grained Optical-SAR Object Retrieval [54.741349848771144]
GeoMambaは光学SAR微細検索のための幾何学駆動フレームワークである。
GFIモジュールは、クロスモーダルな機能相互作用を強化し、構造的な事前を組み込む。
GeoMambaは既存の手法を上回り、全検索環境で63.3% mAPと77.0% Rank-1の精度を達成した。
論文 参考訳(メタデータ) (2026-05-19T12:08:09Z) - AgentVLN: Towards Agentic Vision-and-Language Navigation [78.739525400071]
VLN (Vision-and-Language Navigation) は、複雑な自然言語命令を、見えない環境での長距離ナビゲーションに接地するために、エンボディエージェントを必要とする。
本稿では,エッジコンピューティングプラットフォーム上に展開可能な,新規かつ効率的なナビゲーションフレームワークであるAgentVLNを提案する。
論文 参考訳(メタデータ) (2026-03-18T12:43:47Z) - SignNav: Leveraging Signage for Semantic Visual Navigation in Large-Scale Indoor Environments [57.79171900005793]
人間は、大規模屋内環境内の目的地に向かうために、手話によって提供される意味的ヒントを日常的に活用する。
本稿では,手話からの意味的ヒントを解釈し,現在の観察に基づくその後の行動の推論を行うための,新しい具体的ナビゲーションタスクSignNavを紹介する。
空間認識モジュールは物理的世界へのサインの意味的ヒントを基盤として,時間認識モジュールは歴史的状態と現在の観測との長距離依存性を捉えている。
論文 参考訳(メタデータ) (2026-03-17T06:36:26Z) - RAGNav: A Retrieval-Augmented Topological Reasoning Framework for Multi-Goal Visual-Language Navigation [1.7508558850131373]
Vision-Language Navigation (VLN) は、シングルポイントパスフィンディングからより挑戦的なMulti-Goal VLNへと進化している。
RAGNavは意味論的推論と物理的構造の間のギャップを埋めるフレームワークである。
論文 参考訳(メタデータ) (2026-03-04T05:31:33Z) - USS-Nav: Unified Spatio-Semantic Scene Graph for Lightweight UAV Zero-Shot Object Navigation [10.934912400963588]
USS-Navは、Unified Spatio-Semanticのシーングラフをインクリメンタルに構築する軽量フレームワークである。
未知環境での効率的なLarge Language Model (LLM)拡張Zero-Shot Object Navigationを可能にする。
我々のフレームワークは、計算効率とリアルタイム更新頻度の点で最先端の手法より優れています。
論文 参考訳(メタデータ) (2026-01-31T13:10:02Z) - Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation [22.876516699004814]
VLN-CE(Vision-Language Navigation in Continuous Environments)は、高レベルの言語命令を正確で安全で長期の空間行動に基礎付けるという、中核的な課題を提示している。
露骨なトポロジカルマップは、そのようなタスクにおいて堅牢な空間記憶を提供するための重要な解決策であることが証明されている。
既存のトポロジカルプランニング手法は、"Granularity Rigidity"問題に悩まされている。
本研究では,動的トポロジカルナビゲーションのためのフレームワークであるDGNavを提案する。
論文 参考訳(メタデータ) (2026-01-29T14:06:23Z) - RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning [61.84363374647606]
リモートセンシングビジュアルグラウンドディング(RSVG)は、自然言語記述に基づく大規模空中画像における対象物体のローカライズを目的としている。
これらの記述はしばしば位置的手がかりに大きく依存しており、空間的推論においてMLLM(Multimodal Large Language Models)に固有の課題を提起している。
空間理解の高度化を図るために,textbfRSGround-R1 と呼ばれる推論誘導型位置認識後学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T12:35:57Z) - STRIDER: Navigation via Instruction-Aligned Structural Decision Space Optimization [73.98141357780032]
VLN-CEタスクでは、エージェントはシーン固有のトレーニングなしで自然言語命令を使用して3D環境をナビゲートする必要がある。
既存の方法は、構造化された意思決定の欠如と、以前の行動からのフィードバックの不十分な統合のために、堅牢なナビゲーションを達成できないことが多い。
STRIDERは,空間配置先と動的タスクフィードバックを統合し,エージェントの決定空間を体系的に最適化する新しいフレームワークである。
提案手法では,1)空間構造を介して行動空間を制約する構造的ウェイポイントジェネレータ,2)タスクの進行に応じて行動を調整するタスク調整レギュレータ,そしてナビゲーション全体を通して意味的アライメントを確保する。
論文 参考訳(メタデータ) (2025-10-27T04:37:21Z) - Affordances-Oriented Planning using Foundation Models for Continuous Vision-Language Navigation [64.84996994779443]
本稿では,連続視覚言語ナビゲーション(VLN)タスクのためのAffordances-Oriented Plannerを提案する。
我々のAO-Plannerは、様々な基礎モデルを統合して、アベイランス指向の低レベルな動き計画とハイレベルな意思決定を実現する。
挑戦的なR2R-CEデータセットとRxR-CEデータセットの実験は、AO-Plannerが最先端のゼロショットのパフォーマンスを達成したことを示している。
論文 参考訳(メタデータ) (2024-07-08T12:52:46Z) - TAS: A Transit-Aware Strategy for Embodied Navigation with Non-Stationary Targets [55.09248760290918]
非定常目標を持つ動的シナリオにおけるナビゲーションのための新しいアルゴリズムを提案する。
我々の新しいTAS(Transit-Aware Strategy)は、具体化されたナビゲーションポリシーをオブジェクトパス情報で強化する。
TASは、ターゲットルートとルートを同期させるエージェントを報酬することで、非定常環境での性能を改善する。
論文 参考訳(メタデータ) (2024-03-14T22:33:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。