論文の概要: SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching
- arxiv url: http://arxiv.org/abs/2605.21788v1
- Date: Wed, 20 May 2026 22:30:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.011094
- Title: SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching
- Title(参考訳): SceneGraphGrounder:構造化Scene Graph Matchingによるゼロショット3Dビジュアルグラウンド
- Authors: Xuefei Sun, Xujia Zhang, Brendan Crowe, Doncey Albin, Christoffer Heckman,
- Abstract要約: SceneGrapherは,再構成された3次元シーングラフ上の構造化グラフマッチングとして3次元グラウンドを再構成するフレームワークである。
我々は,移動ロボットによる実世界展開によるフレームワークの実証を行い,長距離物理環境における堅牢な空間推論を実証した。
- 参考スコア(独自算出の注目度): 2.4737219202679808
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Zero-shot 3D visual grounding requires localizing objects in unstructured environments from free-form natural language. Recent vision-language model (VLM) approaches achieve promising results but rely on view-dependent reasoning or implicit representations, limiting spatial consistency and interpretability for compositional queries. We propose SceneGraphGrounder, a framework that reformulates 3D grounding as structured graph matching over a reconstructed 3D scene graph. To enable this formulation, we introduce a visual marker prompting strategy that enables a VLM to infer object-object relationships from 2D views, which are subsequently lifted into a persistent 3D scene graph encoding both spatial and semantic relations. Given a query, we construct a query graph and perform constrained alignment with the scene graph, ensuring multi-view consistency and interpretable reasoning. Experiments on the ScanRefer benchmark demonstrate that our method achieves competitive performance among zero-shot approaches, using only RGB-D inputs. We further validate our framework through real-world deployment on a mobile robot, demonstrating robust spatial reasoning in long-horizon physical environments. We will make our code publicly available upon acceptance.
- Abstract(参考訳): ゼロショット3Dビジュアルグラウンドでは、自由形式の自然言語から非構造化環境でオブジェクトをローカライズする必要がある。
近年の視覚言語モデル (VLM) のアプローチは有望な結果を得るが、ビュー依存の推論や暗黙的な表現に依存し、空間的一貫性と合成クエリの解釈可能性を制限する。
SceneGraphGrounderは、再構成された3Dシーングラフ上での構造化グラフマッチングとして3Dグラウンドを再構成するフレームワークである。
この定式化を実現するために,VLMは2次元ビューからオブジェクトとオブジェクトの関係を推測し,その後空間的および意味的関係を符号化した永続的な3次元シーングラフへと持ち上げる視覚的マーカープロンプト戦略を導入する。
クエリが与えられた場合、クエリグラフを構築し、シーングラフとの制約付きアライメントを実行し、マルチビューの一貫性と解釈可能な推論を保証する。
ScanReferベンチマーク実験により,RGB-D入力のみを用いて,ゼロショットアプローチ間の競合性能を実証した。
我々は,移動ロボットの現実的な展開を通じて,我々の枠組みをさらに検証し,長期の物理的環境における堅牢な空間推論を実証する。
受け入れ次第、コードを公開します。
関連論文リスト
- ReLaGS: Relational Language Gaussian Splatting [20.136674901612334]
本稿では,階層型言語で区切られたガウシアンシーンと,シーン固有の訓練を伴わない3Dセマンティックシーングラフを構築する新しいフレームワークを提案する。
この階層の上に、視覚言語由来のアノテーションとグラフニューラルネットワークに基づくリレーショナル推論を備えたオープンな3Dシーングラフを構築します。
本手法は,階層的セマンティクスとオブジェクト間の相互関係を共同でモデル化することにより,効率的でスケーラブルな3次元推論を可能にする。
論文 参考訳(メタデータ) (2026-03-18T11:18:23Z) - SceneLinker: Compositional 3D Scene Generation via Semantic Scene Graph from RGB Sequences [12.771171646896468]
SceneLinkerはRGBシーケンスからセマンティックシーングラフによって構成的な3Dシーンを生成するフレームワークである。
我々の研究により、ユーザーはシーングラフを通して物理的な環境から一貫した3D空間を生成でき、空間的混合現実感(MR)コンテンツを作成することができる。
論文 参考訳(メタデータ) (2026-02-03T01:22:07Z) - VIZOR: Viewpoint-Invariant Zero-Shot Scene Graph Generation for 3D Scene Reasoning [1.9190955990713918]
3次元シーン推論(VIZOR)のための視点不変ゼロショットシーングラフ生成を提案する。
VIZORは、生の3Dシーンから直接、密集した視点不変の3Dシーングラフを構築する、トレーニングフリーでエンドツーエンドのフレームワークである。
注釈付きトレーニングデータを必要とすることなく、シーンオブジェクト間の空間的および近接的な関係を記述するオープン語彙関係を推論する。
論文 参考訳(メタデータ) (2026-01-31T10:11:27Z) - Open-Vocabulary Octree-Graph for 3D Scene Understanding [54.11828083068082]
Octree-Graphはオープンな3Dシーン理解のための新しいシーン表現である。
セマンティクスを記憶し、その形状に応じてオブジェクトの占有度を調節するアダプティブ・オクツリー構造を開発する。
論文 参考訳(メタデータ) (2024-11-25T10:14:10Z) - Multiview Scene Graph [7.460438046915524]
適切なシーン表現は、空間知性の追求の中心である。
未提示画像からマルチビューシーングラフ(MSG)を構築することを提案する。
MSGは、場所とオブジェクトノードを相互接続したシーンをトポロジ的に表現する。
論文 参考訳(メタデータ) (2024-10-15T02:04:05Z) - Generating Visual Spatial Description via Holistic 3D Scene
Understanding [88.99773815159345]
視覚空間記述(VSD)は、画像内の対象物の空間的関係を記述するテキストを生成することを目的としている。
外部の3Dシーン抽出器を用いて,入力画像の3Dオブジェクトとシーン特徴を抽出する。
対象物の中心となる3次元空間シーングラフ(Go3D-S2G)を構築し,対象物の空間意味を総合的な3次元シーン内にモデル化する。
論文 参考訳(メタデータ) (2023-05-19T15:53:56Z) - Incremental 3D Semantic Scene Graph Prediction from RGB Sequences [86.77318031029404]
RGB画像列が与えられたシーンの一貫性のある3Dセマンティックシーングラフをインクリメンタルに構築するリアルタイムフレームワークを提案する。
提案手法は,新たなインクリメンタルエンティティ推定パイプラインとシーングラフ予測ネットワークから構成される。
提案するネットワークは,シーンエンティティから抽出した多視点および幾何学的特徴を用いて,反復的メッセージパッシングを用いた3次元セマンティックシーングラフを推定する。
論文 参考訳(メタデータ) (2023-05-04T11:32:16Z) - Learning 3D Semantic Scene Graphs from 3D Indoor Reconstructions [94.17683799712397]
我々は、グラフ内のシーンのエンティティを整理するデータ構造であるシーングラフに焦点を当てる。
本研究では,シーンの点雲からシーングラフを回帰する学習手法を提案する。
本稿では,3D-3Dおよび2D-3Dマッチングの中間表現としてグラフが機能するドメインに依存しない検索タスクにおける本手法の適用について述べる。
論文 参考訳(メタデータ) (2020-04-08T12:25:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。