論文の概要: ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments
- arxiv url: http://arxiv.org/abs/2607.21025v1
- Date: Thu, 23 Jul 2026 08:07:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.330214
- Title: ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments
- Title(参考訳): ZONDA:マルチフロア環境における動的回避によるゼロショットオブジェクトナビゲーション
- Abstract要約: ZONDAは動的回避フレームワークを備えたゼロショットオブジェクトナビゲーションである。
マルチフロア計画、マルチビューターゲット検証、動的歩行者回避を統合している。
ZONDAは動的ベンチマークHM3D-DYNA上で堅牢なナビゲーションを維持できる。
- 参考スコア(独自算出の注目度): 11.230838019667795
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In Object Goal Navigation task, existing methods are typically restricted to static and single-floor environments, ignoring cross-floor topologies and dynamic pedestrian, which limits their real-world deployment. To address these limitations, we propose ZONDA, a zero-shot object navigation with dynamic avoidance framework. In particular, ZONDA integrates three core components: (i) Heuristic multi-floor planning: from height-difference traversable maps, enables stair traversal and cross-floor exploration without a platform-specific learned controller; (ii) Multi-view target verification: cross-checks multi-scale observations with a vision-language model, significantly reducing false positives; and (iii) Dynamic pedestrian avoidance: explicitly tracks and predicts moving pedestrians to generate anticipatory behaviors. Evaluated on a real Direct Drive Tech TITA biped robot and extensive simulations on HM3D and MP3D, ZONDA achieves significantly improved results. Moreover, ZONDA can maintain robust navigation on the dynamic benchmark HM3D-DYNA compared to the existing baseline.
- Abstract(参考訳): Object Goal Navigationタスクでは、既存のメソッドは通常、静的および単一フロア環境に制限され、クロスフロアトポロジや動的歩行者を無視し、実際のデプロイメントを制限する。
これらの制約に対処するため,動的回避フレームワークを備えたゼロショットオブジェクトナビゲーションであるZONDAを提案する。
特にZONDAは3つのコアコンポーネントを統合している。
(i)ヒューリスティックなマルチフロア計画:高さ差トラバース可能な地図から、プラットフォーム固有の学習コントローラを使わずに、階段横断及びクロスフロア探索を可能にする。
(二)多視点目標検証:視覚言語モデルによる多視点観測をクロスチェックし、偽陽性を著しく低減する。
三 動的な歩行者回避:移動歩行者が予測行動を起こすことを明示的に追跡し、予測すること。
実のDirect Drive Tech TITA二足歩行ロボットとHM3DとMP3Dの広範囲なシミュレーションにより、ZONDAは大幅に改善された結果を得る。
さらに、ZONDAは、既存のベースラインと比較して、動的ベンチマークHM3D-DYNA上で堅牢なナビゲーションを維持できる。
関連論文リスト
- TravExplorer: Cross-Floor Embodied Exploration via Traversability-Aware 3-D Planning [17.54520943622758]
この記事では、クロスフロアで具体化された探索フレームワークであるTravExplorerを紹介します。
ゼロショットセマンティックガイダンスとトラバーサビリティを意識した3Dプランニングを結合する。
ユニツリーGo2の現実世界での50の試行は、シングルフロアとクロスフロアの屋内環境におけるオープンボキャブラリターゲット探索をさらに検証している。
論文 参考訳(メタデータ) (2026-05-19T15:11:29Z) - SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation [18.453985392979785]
SleepWalk(スリープウォーク)は、単一シーンの3Dワールドにおいて、命令付き軌道予測を評価するためのベンチマークである。
2,472個の3次元環境上での3つのフロンティア・ビジョン・ランゲージ・モデルの評価を行った。
論文 参考訳(メタデータ) (2026-05-11T11:20:14Z) - HiPAN: Hierarchical Posture-Adaptive Navigation for Quadruped Robots in Unstructured 3D Environments [13.984002802852638]
非構造型3D環境における四足歩行ロボットの移動は、目標指向の動作、局所的なミニマから脱出するための効果的な探索、横幅の狭い高さ制限された空間への姿勢適応など、大きな課題を生んでいる。
本報告では,階層型姿勢適応ナビゲーション(HiPAN, Hierarchical Posture-Adaptive Navigation)を提案する。
HiPANは、古典的なリアクティブプランナーやエンドツーエンドのベースラインよりも、明度の高いナビゲーション成功率とパス効率を実現しています。
論文 参考訳(メタデータ) (2026-04-29T10:08:48Z) - 3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting [12.057873540714098]
3DGSNavは、3D Gaussian Splatting (3DGS)を視覚言語モデル(VLM)の永続メモリとして組み込んで空間推論を強化する新しいフレームワークである。
3DGSNavは環境の3DGS表現を段階的に構築し、フロンティア対応のファーストパーソンビューの軌跡誘導自由視点レンダリングを可能にする。
ナビゲーション中、リアルタイムオブジェクト検出器が潜在的なターゲットをフィルタリングし、VLM駆動のアクティブな視点スイッチングがターゲットを再検証する。
論文 参考訳(メタデータ) (2026-02-12T16:41:26Z) - D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation [66.7166217399105]
エージェントは、エンドツーエンドモデルには解釈可能性や明示的な3D推論が欠けているという、重要なジレンマに直面します。
1) 計画,グラウンド,ナビゲーション,質問応答を単一の3D-VLMパイプラインとCoTパイプラインで統一する動的3Dチェーン(3D CoT) ; 2) フラグメンテッド・スーパービジョン(SLFS)戦略からのシナジスティック学習 マスク付き自己回帰損失を用いて,大規模かつ部分的に注釈付けされたハイブリッドデータから学習する。
論文 参考訳(メタデータ) (2025-12-14T09:53:15Z) - FOM-Nav: Frontier-Object Maps for Object Goal Navigation [65.76906445210112]
FOM-Navはフロンティアオブジェクトマップと視覚言語モデルによる探索効率を高めるフレームワークである。
FOM-Navをトレーニングするために,実環境から大規模ナビゲーションデータセットを自動構築する。
FOM-NavはMP3DとHM3Dのベンチマーク、特にナビゲーション効率の指標SPLで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-11-30T18:16:09Z) - Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation [54.04601077224252]
身近なシーン理解には、視覚空間情報の理解だけでなく、3D物理世界における次の探索場所の決定も必要である。
アンダーラインテキストbf3D視覚言語学習は、エンボディエージェントが環境を効果的に探索し理解することを可能にする。
モデルの汎用性は、カテゴリ、言語記述、参照イメージなど、多様な入力モダリティを使ったナビゲーションを可能にする。
論文 参考訳(メタデータ) (2025-07-05T14:15:52Z) - NOVA: Navigation via Object-Centric Visual Autonomy for High-Speed Target Tracking in Unstructured GPS-Denied Environments [56.35569661650558]
我々はNOVAというオブジェクト中心のフレームワークを導入し、ロバストな目標追跡と衝突認識ナビゲーションを可能にした。
グローバルマップを構築するのではなく、NOVAはターゲットの参照フレーム内での知覚、推定、制御を定式化する。
我々は,都市迷路や森林の小道,間欠的なGPS損失を伴う建物内の繰り返し遷移など,現実の挑戦的なシナリオにまたがってNOVAを検証する。
論文 参考訳(メタデータ) (2025-06-23T14:28:30Z) - Street Gaussians without 3D Object Tracker [84.89933388445185]
既存のほとんどの方法は、オブジェクトポーズの労働集約的な手動ラベリングに依存している。
本研究では,3次元オブジェクト融合戦略における2次元ディープトラッカーの関連性を利用して,安定なオブジェクト追跡モジュールを提案する。
我々は、軌道誤差を自律的に補正し、見逃した検出を回復する暗黙の特徴空間に、モーションラーニング戦略を導入することで、避けられないトラッキングエラーに対処する。
論文 参考訳(メタデータ) (2024-12-07T05:49:42Z) - Monocular Quasi-Dense 3D Object Tracking [99.51683944057191]
周囲の物体の将来の位置を予測し、自律運転などの多くのアプリケーションで観測者の行動を計画するためには、信頼性と正確な3D追跡フレームワークが不可欠である。
移動プラットフォーム上で撮影された2次元画像のシーケンスから,移動物体を時間とともに効果的に関連付け,その全3次元バウンディングボックス情報を推定するフレームワークを提案する。
論文 参考訳(メタデータ) (2021-03-12T15:30:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。