論文の概要: LOCUS: Landmark-Oriented Container Discrimination Using Spatial Graphs
- arxiv url: http://arxiv.org/abs/2610.02803v1
- Date: Fri, 02 Oct 2026 04:50:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.211617
- Title: LOCUS: Landmark-Oriented Container Discrimination Using Spatial Graphs
- Title(参考訳): LOCUS:空間グラフを用いたランドマーク指向コンテナ識別
- Abstract要約: 空間グラフ(LOCUS)を用いたランドマーク指向のコンテナ識別を提案する。
ノード間の埋め込み情報を渡すことで,全環境シーングラフ上のCLIP埋め込みを更新するように,GNNをトレーニングする。
シミュレータメタデータからノイズレスグラフのシミュレーションを行い,そのアプローチを非依存にする。
- 参考スコア(独自算出の注目度): 2.3559161556025887
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: As robots are increasingly deployed in unstructured, real-world environments, the ability to reason about complex spatial and semantic relationships among objects remains a fundamental challenge in enabling robust and generalizable manipulation and navigation. For example, deciding where to search for an object that is not in plain sight depends on where it is physically plausible as well as semantically likely. Popular methods such as cosine similarity with CLIP struggle to disambiguate between spatially and semantically similar objects that could contain a target object. We propose Landmark-Oriented Container Discrimination Using Spatial Graphs (LOCUS). To jointly reason about spatial information and semantics, we train a GNN to update CLIP embeddings on a full environment scene graph by passing embedding information between nodes based on proximity. CLIP embeddings, augmented by semantic knowledge from a fusion of household ontologies provide a robust semantic signal. We evaluate in simulation on a noiseless scene graph from simulator metadata, making the approach detection-agnostic. Our approach outperforms random, CLIP, Tidybot, and an LLM planner in the majority of room classes and configurations in simulation. To show our approach is robust to scene graph node placement and label noise, we demonstrate a physical mobile manipulator running in an exploration pipeline start-to-finish including scene graph labels from Detic.
- Abstract(参考訳): ロボットは、非構造的で現実世界の環境にますます配置されているため、オブジェクト間の複雑な空間的および意味的な関係を推論する能力は、堅牢で汎用的な操作とナビゲーションを可能にするための根本的な課題である。
例えば、通常の視界にない物体をどこで探すかは、物理的に妥当な位置と意味論的に可能性に依存する。
CLIPとのコサイン類似性のような一般的な手法は、ターゲットオブジェクトを含むことができる空間的および意味的に類似したオブジェクトの曖昧さに苦慮している。
空間グラフ(LOCUS)を用いたランドマーク指向のコンテナ識別を提案する。
空間情報とセマンティクスを共同で考えるため,我々はGNNに,近接性に基づいてノード間の埋め込み情報を渡すことで,全環境シーングラフ上のCLIP埋め込みを更新するように訓練する。
CLIP埋め込みは、家庭のオントロジーの融合から意味知識によって強化され、堅牢な意味シグナルを提供する。
シミュレータメタデータからノイズレスシーングラフのシミュレーションを行い,そのアプローチを非依存にする。
提案手法は,シミュレーションにおける部屋のクラスや構成の大部分において,ランダム,CLIP,Tidybot,LLMプランナよりも優れている。
提案手法は,シーングラフノード配置やラベルノイズに対して堅牢であることを示すため,Deticのシーングラフラベルを含む探索パイプラインで動作している物理移動マニピュレータを実演する。
関連論文リスト
- EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories [16.996900088118412]
エボディメント・セマンティック(EmbodimentSemantic)は、空間的シーングラフのデータセットと、エンボディード操作における関係グラウンドの評価のためのベンチマークである。
データセットには、低コストのSO101ロボットアームで収集された現実世界の操作観察が含まれている。
また,60K以上の操作フレームと120K以上のカメラ固有のシーングラフを3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人称3人
論文 参考訳(メタデータ) (2026-06-06T18:58:54Z) - Articulated 3D Scene Graphs for Open-World Mobile Manipulation [55.97942733699124]
本報告では, セマンティックな3次元シーングラフを構築するためのフレームワークであるMoMa-SGについて述べる。
新たな統合的ツイスト推定法を用いて調音モデルを推定する。
また,Arti4D-Semanticデータセットについても紹介する。
論文 参考訳(メタデータ) (2026-02-18T10:40:35Z) - Open-Vocabulary Indoor Object Grounding with 3D Hierarchical Scene Graph [0.0]
OVIGo-3DHSGは階層的なシーングラフ上の広い屋内環境を表す。
階層的表現は、床、部屋、場所、オブジェクト間の空間関係を明示的にモデル化する。
提案手法は,既存の手法と比較して,効率的なシーン理解とロバストなオブジェクトグラウンド化を実証する。
論文 参考訳(メタデータ) (2025-07-16T10:47:12Z) - Open-Vocabulary Octree-Graph for 3D Scene Understanding [54.11828083068082]
Octree-Graphはオープンな3Dシーン理解のための新しいシーン表現である。
セマンティクスを記憶し、その形状に応じてオブジェクトの占有度を調節するアダプティブ・オクツリー構造を開発する。
論文 参考訳(メタデータ) (2024-11-25T10:14:10Z) - Hierarchical Graph Interaction Transformer with Dynamic Token Clustering for Camouflaged Object Detection [57.883265488038134]
本稿では,HGINetと呼ばれる階層的なグラフ相互作用ネットワークを提案する。
このネットワークは、階層的トークン化機能間の効果的なグラフ相互作用を通じて、知覚不能なオブジェクトを発見することができる。
本実験は,既存の最先端手法と比較して,HGINetの優れた性能を示すものである。
論文 参考訳(メタデータ) (2024-08-27T12:53:25Z) - ZoomNeXt: A Unified Collaborative Pyramid Network for Camouflaged Object Detection [70.11264880907652]
最近のオブジェクト(COD)は、現実のシナリオでは極めて複雑で難しい、視覚的にブレンドされたオブジェクトを周囲に分割しようと試みている。
本研究では,不明瞭な画像を観察したり,ズームインしたりアウトしたりする際の人間の行動を模倣する,効果的な統合協調ピラミッドネットワークを提案する。
我々のフレームワークは、画像とビデオのCODベンチマークにおいて、既存の最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2023-10-31T06:11:23Z) - How To Not Train Your Dragon: Training-free Embodied Object Goal
Navigation with Semantic Frontiers [94.46825166907831]
Embodied AIにおけるオブジェクトゴールナビゲーション問題に対処するためのトレーニング不要のソリューションを提案する。
本手法は,古典的な視覚的同時ローカライゼーションとマッピング(V-SLAM)フレームワークに基づく,構造化されたシーン表現を構築する。
本手法は,言語先行情報とシーン統計に基づいてシーングラフのセマンティクスを伝搬し,幾何学的フロンティアに意味知識を導入する。
論文 参考訳(メタデータ) (2023-05-26T13:38:33Z) - Semantic Graph Based Place Recognition for 3D Point Clouds [22.608115489674653]
本稿では,位置認識のためのセマンティックグラフに基づく新しいアプローチを提案する。
まず、ポイントクラウドシーンのための新しいセマンティックグラフ表現を提案する。
次に、その類似性を計算するために、高速で効果的なグラフ類似性ネットワークを設計する。
論文 参考訳(メタデータ) (2020-08-26T09:27:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。