論文の概要: SuperMap: A Spatio-Temporal SLAM System for Visual-Language Navigation
- arxiv url: http://arxiv.org/abs/2608.22896v1
- Date: Mon, 24 Aug 2026 07:25:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.932019
- Title: SuperMap: A Spatio-Temporal SLAM System for Visual-Language Navigation
- Title(参考訳): SuperMap:ビジュアルランゲージナビゲーションのための時空間SLAMシステム
- Abstract要約: 言語誘導ナビゲーションのための4次元時空間マッピングフレームワークであるSuperMapを提案する。
私たちのコアコントリビューションは,3D対応インスタンスアソシエーション/ラベルリアクティベーションと,安定なオブジェクトの同一性を維持するための信頼度更新を組み合わせた,一貫性駆動型マッピングエンジンです。
SuperMapは、Vision-Language Modelsと自然に相互作用するクエリ可能な4Dシーングラフ表現を生成する。
- 参考スコア(独自算出の注目度): 13.431320718523017
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Robotic navigation in human environments requires a spatio-temporal semantic representation that can rec- oncile open-vocabulary perception with long-term environmental changes. While foundation models provide strong zero-shot recognition, their predictions are intermittent and view-dependent, and naively integrating them into mapping pipelines leads to identity drift and stale semantics over time. We present SuperMap, a 4D spatio-temporal mapping framework for language-guided navigation that integrates high-frequency geometric SLAM with asynchronous open-vocabulary perception. Our core contribution is a consistency-driven mapping engine that combines 3D-aware instance association/re-activation with a principled existence-and-label confidence update to maintain stable object identities and prune outdated map content under occlusions and scene changes. SuperMap produces a queryable 4D scene-graph representation that interfaces naturally with Vision-Language Models by supporting compositional queries over object semantics, relations, We demonstrate SuperMap on benchmarks and real robots, including dynamic scenes with appearance/disappearance and relocation, and provide ablations and runtime analysis. We release the full system as open-source to provide the community with a deployable baseline for open-vocabulary spatio-temporal mapping. Project website: superodometry.com/supermap.
- Abstract(参考訳): 人間環境におけるロボットナビゲーションは、長期の環境変化を伴ってオープン語彙認識を再開できる時空間的意味表現を必要とする。
基礎モデルは強力なゼロショット認識を提供するが、それらの予測は断続的でビューに依存しており、それらをマッピングパイプラインに統合することは、時間とともにアイデンティティのドリフトと古いセマンティクスをもたらす。
我々は,高頻度幾何学的SLAMと非同期な開語彙認識を統合した,言語誘導ナビゲーションのための4次元時空間マッピングフレームワークSuperMapを提案する。
私たちのコアコントリビューションは,3D対応インスタンスアソシエーション/リアクティベーションと基本的存在・ラベル信頼更新を組み合わせて,安定したオブジェクトのアイデンティティと,隠蔽やシーン変更による古いマップコンテンツを維持する,一貫性駆動型マッピングエンジンです。
SuperMapは、オブジェクトのセマンティクスや関係性に関するコンポジションクエリをサポートし、自然に視覚-言語モデルと相互作用するクエリ可能な4Dシーングラフ表現を生成します。
オープン語彙時空間マッピングのためのデプロイ可能なベースラインをコミュニティに提供するために,全システムをオープンソースとしてリリースします。
プロジェクトウェブサイト: Superodometry.com/supermap
関連論文リスト
- A hybrid pipeline for dynamic ontology-based semantic mapping [0.0]
意味マッピングの最も一般的なパイプラインは、幾何学的マッピングと局所化(SLAM)、知覚、意味融合、意味表現である。
本稿では,セマンティックマッピングのためのハイブリッドパイプラインを提案する。
本システムでは, 物体検出, オブジェクト追跡, セマンティック・アップデートと合わせて, ホログラフィー・プロジェクションを用いた外部キャリブレーション・カメラを組み込んでいる。
オントロジーは、その階層構造、意味表現性、動的世界モデリングのサポートにより、知識表現の形式として選択される。
論文 参考訳(メタデータ) (2026-09-03T14:11:21Z) - Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis [59.527737790821305]
本稿では,3次元シーングラフを用いてオープンな3次元理解を促進する関係認識フレームワークを提案する。
本手法は,物体関係の推測に視覚言語推論を活用することで,多視点観測からリレーショナルシーングラフを構築する。
ScanNetV2、ScanNet200、ScanNet$++$、Replicaの実験は、強力なパフォーマンスと一般化能力を示している。
論文 参考訳(メタデータ) (2026-07-06T17:29:49Z) - PanopticQuery: Unified Query-Time Reasoning for 4D Scenes [53.672906752290665]
4Dシーンでクエリ時間推論を統一するフレームワークであるPanopticQueryを紹介した。
提案手法は高忠実度動的再構成のための4次元ガウススプラッティングに基づいている。
動的シーンにおける言語ベースのクエリのための新しいベンチマークであるPanoptic-L4Dを提案する。
論文 参考訳(メタデータ) (2026-04-07T09:40:05Z) - OVI-MAP:Open-Vocabulary Instance-Semantic Mapping [108.66131262110095]
OVI-MAPは、RGB-D入力から漸進的に構築される、クラスに依存しない3Dインスタンスマップである。
意味的特徴は、視覚言語モデルを用いて、選択された少数のビューからのみ抽出される。
我々のシステムはリアルタイムに動作し、標準ベンチマークで最先端のオープン語彙マッピングのベースラインを上回ります。
論文 参考訳(メタデータ) (2026-03-27T15:50:59Z) - Multimodal Spatial Language Maps for Robot Navigation and Manipulation [32.852583241593436]
マルチモーダル空間言語マップは、事前訓練されたマルチモーダル特徴と環境の3次元再構成を融合する空間地図表現である。
視覚言語マップ(VLMaps)と音声視覚言語マップ(AVLMaps)の拡張の2つの例を示す。
これらの機能は、移動ロボットやテーブルトップマニピュレータに拡張され、視覚、オーディオ、空間的手がかりによって案内されるナビゲーションとインタラクションをサポートする。
論文 参考訳(メタデータ) (2025-06-07T17:02:13Z) - RAZER: Robust Accelerated Zero-Shot 3D Open-Vocabulary Panoptic Reconstruction with Spatio-Temporal Aggregation [10.067978300536486]
我々は,GPUで加速した幾何再構成をオープン語彙の視覚言語モデルとシームレスに統合するゼロショットフレームワークを開発した。
トレーニングフリーシステムは、インクリメンタル処理と統合幾何系列更新により、優れた性能を実現する。
論文 参考訳(メタデータ) (2025-05-21T11:07:25Z) - FindAnything: Open-Vocabulary and Object-Centric Mapping for Robot Exploration in Any Environment [16.987872206495897]
FindAnythingは、視覚言語情報を高密度のボリュームサブマップに組み込むオープンワールドマッピングフレームワークである。
当社のシステムは,MAVなどのリソース制約されたデバイスにデプロイされる最初のシステムである。
論文 参考訳(メタデータ) (2025-04-11T15:12:05Z) - Hierarchical Temporal Context Learning for Camera-based Semantic Scene Completion [57.232688209606515]
カメラによるセマンティックシーンの補完を改善するための,新たな時間的文脈学習パラダイムであるHTCLを提案する。
提案手法は,Semantic KITTIベンチマークで1st$をランク付けし,mIoUの点でLiDARベースの手法を超えている。
論文 参考訳(メタデータ) (2024-07-02T09:11:17Z) - Object Goal Navigation with Recursive Implicit Maps [92.6347010295396]
対象目標ナビゲーションのための暗黙的な空間マップを提案する。
提案手法は, 挑戦的なMP3Dデータセット上での技量を著しく上回る。
我々は、実際のロボットにモデルをデプロイし、実際のシーンでオブジェクトゴールナビゲーションの結果を奨励する。
論文 参考訳(メタデータ) (2023-08-10T14:21:33Z) - ConceptFusion: Open-set Multimodal 3D Mapping [91.23054486724402]
ConceptFusionは基本的にオープンセットのシーン表現である。
これは、閉じた概念や本質的にはマルチモーダル以上の推論を可能にする。
実世界の多くのデータセット上でConceptFusionを評価する。
論文 参考訳(メタデータ) (2023-02-14T18:40:26Z) - BEVBert: Multimodal Map Pre-training for Language-guided Navigation [75.23388288113817]
視覚・言語ナビゲーション(VLN)における空間認識型マップベース事前学習パラダイムを提案する。
我々は,グローバルなトポロジカルマップにおけるナビゲーション依存性をモデル化しながら,不完全な観測を明示的に集約し,重複を取り除くための局所距離マップを構築した。
ハイブリッドマップをベースとして,マルチモーダルマップ表現を学習するための事前学習フレームワークを考案し,空間認識型クロスモーダル推論を強化し,言語誘導ナビゲーションの目標を導出する。
論文 参考訳(メタデータ) (2022-12-08T16:27:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。