論文の概要: Room-Mediated Co-occurrence for Zero-Shot Object-Centric Semantic Navigation via Frontier Scoring
- arxiv url: http://arxiv.org/abs/2607.25448v1
- Date: Tue, 28 Jul 2026 08:36:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.777226
- Title: Room-Mediated Co-occurrence for Zero-Shot Object-Centric Semantic Navigation via Frontier Scoring
- Title(参考訳): フロンティアスコーリングによるゼロショット物体中心のセマンティックナビゲーションのためのルーム媒介共起
- Abstract要約: ゼロショットのObjectNavメソッドは、視覚言語に先立って使われることが多いが、潜在空間における直接オブジェクトの類似性は、しばしば空間的共起の弱いプロキシである。
本稿では,コンパクトな部屋辞書を通じてオブジェクト関係を仲介する,分析・学習不要なセマンティックナビゲーションパイプラインを提案する。
- 参考スコア(独自算出の注目度): 3.9457043990895895
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Zero-shot ObjectNav methods increasingly use vision-language priors, but direct object-object similarity in the latent space is often a weak proxy for spatial co-occurrence. We present an analytical, training-free semantic navigation pipeline that mediates object relationships through a compact room lexicon. Each object label is mapped to a CLIP-derived Room Probability Vector (RPV), and object-target co-occurrence is computed from RPV distribution overlap. These scores are projected onto a value map using geodesic flood-fill propagation (Fast Marching Method), with adaptive signal decay, and are used to rank frontiers by semantic score for navigation. Together, these components form an integrated, training-free, object-centric pipeline for open-vocabulary zero-shot navigation. Results show that our object-centric approach improves Success Rate (SR) and Success by weighted inverse Path Length (SPL) by a relative 3% and 1.3%, respectively, compared to image-holistic baselines on the HM3D dataset validation split, while preserving interpretability and open-vocabulary flexibility. Code is available at: uts-ri.github.io/RPV-SemNav.
- Abstract(参考訳): ゼロショットのObjectNavメソッドは、視覚言語に先立って使われることが多いが、潜在空間における直接オブジェクトの類似性は、しばしば空間的共起の弱いプロキシである。
本稿では,コンパクトな部屋辞書を通じてオブジェクト関係を仲介する,分析・学習不要なセマンティックナビゲーションパイプラインを提案する。
各オブジェクトラベルは、CLIP由来のRoom Probability Vector(RPV)にマッピングされ、RPV分布重なりからオブジェクト-ターゲット共起が計算される。
これらのスコアは、適応的な信号減衰を伴う測地学的浸水伝播(Fast Marching Method)を用いて値マップ上に投影され、ナビゲーションのセマンティックスコアによってフロンティアのランク付けに使用される。
これらのコンポーネントは、オープンボキャブラリゼロショットナビゲーションのための、統合された、トレーニング不要の、オブジェクト中心のパイプラインを形成する。
その結果,HM3Dデータセット検証における画像の全体的ベースラインを分割し,解釈可能性とオープンボキャブラリの柔軟性を保ちながら,対象中心のアプローチでは相対3%と1.3%の重み付き逆経路長(SPL)による成功率(SR)と成功率(SPL)が向上することがわかった。
コードは、uts-ri.github.io/RPV-SemNavで入手できる。
関連論文リスト
- SimFuse3D: Source-Guided Target Simulation and Confidence-Guided Multi-Stage Localization Reweighting for Cross-Platform 3D Object Detection [14.526062661334437]
センサ高さと視点の変化は、オブジェクトレベルの点分布を変化させ、クロスプラットフォームのLiDAR非教師なし領域適応を困難にする。
そこで,SimFuse3Dを導入し,ラベル付きソーススキャンから計測した幾何を用いて,対象の配置を保存し,関連する擬似オブジェクトを修復する。
論文 参考訳(メタデータ) (2026-09-04T08:41:56Z) - VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation [55.45263611374435]
エージェントが同じシーンで繰り返し操作し、自己獲得経験のみを保持し、モデルパラメータを固定するクロスエポソードオブジェクトゴールナビゲーションを提案する。
経験の再利用を支援するために,永続的階層型ビジュアルトポロジカルメモリ(VTM)を用いたトレーニング不要なVLMナビゲーションフレームワークを提案する。
提案手法は,3つのベンチマークすべてで最高のパフォーマンスを実現し,データセット間の構造化視覚トポロジカルエクスペリエンスの再利用の有効性と堅牢性を示す。
論文 参考訳(メタデータ) (2026-07-16T03:11:37Z) - Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory [69.51256305550844]
PSC-AVDNは3段階のParsing-Search-Confirmation推論パイプラインを構造化空間記憶と密結合する学習自由フレームワークである。
PSC-AVDNは、トレーニング不要の設定、マッチング、あるいはいくつかの微調整されたメソッドの超越において、新しい最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2026-07-13T13:14:20Z) - OmniVLN: Omnidirectional 3D Perception and Token-Efficient LLM Reasoning for Visual-Language Navigation across Air and Ground Platforms [33.40889181799252]
言語誘導型エンボディナビゲーションでは、エージェントがオブジェクト参照命令を解釈し、複数の部屋を探索し、参照されたターゲットをローカライズし、それに対する信頼できる動きを実行する必要がある。
OmniVLNは、全方位3次元知覚とトークン効率の高い階層的推論を、空中と地上の両方で組み合わせたゼロショット視覚言語ナビゲーションフレームワークである。
実験により、提案した階層インタフェースは空間参照精度を77.27%から93.18%に改善し、マルチルームの乱雑な設定で累積的なプロンプトトークンを61.7%削減し、フラットで最大11.68%のナビゲーション成功率向上を実現した。
論文 参考訳(メタデータ) (2026-03-18T04:26:30Z) - GoalSwarm: Multi-UAV Semantic Coordination for Open-Vocabulary Object Navigation [0.0]
GoalSwarmは、ゼロショットセマンティックなオブジェクトゴールナビゲーションのための、完全に分散化されたマルチUAVフレームワークである。
それぞれのUAVは、共有された軽量な2Dトップダウンセマンティック占有マップを共同で構築する。
GoalSwarmのコアコントリビューションは,(1)ゼロショット基盤モデルの統合 – オープン語彙検出とピクセルレベルのセグメンテーションのためのSAM3,(2)複数視点検出の信頼性を画素ごとのゴール関連分布に融合するベイズ値マップである。
論文 参考訳(メタデータ) (2026-03-13T11:23:53Z) - Context-Nav: Context-Driven Exploration and Viewpoint-Aware 3D Spatial Reasoning for Instance Navigation [4.039245878626346]
Text-goal instance navigation (TGIN)は、エージェントに単一の自由形式の記述を正しいオブジェクトインスタンスに到達するアクションに解決するよう要求する。
局所的なキューからグローバルな探索までの長い文脈的キャプションを増大させるtextitContext-Navを提案する。
論文 参考訳(メタデータ) (2026-03-10T11:08:35Z) - Nav-$R^2$ Dual-Relation Reasoning for Generalizable Open-Vocabulary Object-Goal Navigation [67.68165784193556]
Nav-$R2$は、ターゲット環境モデリングと環境行動計画という2つのタイプの関係を明示的にモデル化するフレームワークである。
我々のSA-Memは、時間的・意味的両面から最も標的に関連し、現在の観測関連の特徴を保っている。
Nav-R2は、合理化され効率的なパイプラインを通して見えないオブジェクトをローカライズする、最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-12-02T04:21:02Z) - Exploring Efficient Open-Vocabulary Segmentation in the Remote Sensing [55.291219073365546]
Open-Vocabulary Remote Sensing Image (OVRSIS)は、OVS(Open-Vocabulary)をリモートセンシング(RS)ドメインに適応させる新しいタスクである。
textbfRSKT-Segは、リモートセンシングに適した新しいオープン語彙セグメンテーションフレームワークである。
RSKT-Segは高いOVSベースラインを+3.8 mIoUと+5.9 mACCで上回り、効率的なアグリゲーションによって2倍高速な推論を実現している。
論文 参考訳(メタデータ) (2025-09-15T15:24:49Z) - RSRNav: Reasoning Spatial Relationship for Image-Goal Navigation [57.197881161006904]
近年のイメージゴールナビゲーション(ImageNav)手法は,目標と自我中心の画像の意味的特徴を別々に捉え,知覚行動ポリシーを学習している。
本稿では,目標と現在の観測値の空間的関係をナビゲーションガイダンスとして考慮する,シンプルで効果的な手法であるRSRNavを提案する。
論文 参考訳(メタデータ) (2025-04-25T00:22:17Z) - PEANUT: Predicting and Navigating to Unseen Targets [18.87376347895365]
新しい環境における効率的なObjectGoalナビゲーション(ObjectNav)は、環境レイアウトにおける空間的および意味的規則性を理解する必要がある。
不完全なセマンティックマップから観測対象の位置を予測し,これらの規則性を学習する手法を提案する。
我々の予測モデルは軽量であり、比較的少量の受動的収集データを用いて教師付きで訓練することができる。
論文 参考訳(メタデータ) (2022-12-05T18:58:58Z) - Ret3D: Rethinking Object Relations for Efficient 3D Object Detection in
Driving Scenes [82.4186966781934]
Ret3Dと呼ばれるシンプルで効率的で効果的な2段階検出器を導入する。
Ret3Dの中核は、新しいフレーム内およびフレーム間関係モジュールの利用である。
無視できる余分なオーバーヘッドにより、Ret3Dは最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-08-18T03:48:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。