論文の概要: Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs
- arxiv url: http://arxiv.org/abs/2606.31471v1
- Date: Tue, 30 Jun 2026 10:49:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.184129
- Title: Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs
- Title(参考訳): 地図作成中:インクリメンタルな3Dシーングラフのための非同期ビジュアルランゲージエージェント
- Abstract要約: Open-vocabulary 3D scene graph method は通常、2つの段階で機能する: 最初は再構成し、次に視覚言語モデルに富む。
本稿では,軽量なオンラインマッピングと重み付きセマンティックリファインメントを同時に行う非同期アーキテクチャを提案する。
本手法は, セマンティックセグメンテーションにおいて, 既存のオープンボキャブラリ3次元シーングラフ法に適合するか, 性能を向上する。
- 参考スコア(独自算出の注目度): 10.390999817790425
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-vocabulary 3D scene graph methods typically operate in two stages: first reconstruct, then enrich with vision-language models, leaving the graph unqueryable during exploration. We argue that this sequential coupling is unnecessary and propose an asynchronous architecture in which lightweight online mapping runs concurrently with heavyweight semantic refinement. A probabilistic voxel-based backbone maintains stable object identities incrementally, while background VLM agents progressively enrich the graph. This framework resolves duplicate object tracks through semantic loop closure, attaches fine-grained visual attributes and derives spatial relations between objects. A multi-target frame scheduler amortizes VLM cost by selecting a small set of informative frames that jointly cover multiple targets. The resulting scene graph is queryable during exploration and grows in semantic richness over time. Our method matches or outperforms existing open-vocabulary 3D scene graph methods on semantic segmentation (ScanNet, Replica) and surpasses the prior state-of-the-art across three visual grounding benchmarks (Sr3D+, Nr3D, ScanRefer) by 15.3 to 18.8 A@0.25. Project page: https://denizbickici.github.io/thinkgraphs/
- Abstract(参考訳): Open-vocabulary 3D scene graph method は通常、2つの段階で機能する: 最初は再構成し、次に視覚言語モデルに富み、探索中にグラフはクエリーできない。
この逐次結合は不要であり、軽量なオンラインマッピングと重み付きセマンティックリファインメントを同時に実行する非同期アーキテクチャを提案する。
確率的ボクセルベースのバックボーンは安定したオブジェクトのアイデンティティを漸進的に維持し、バックグラウンドのVLMエージェントはグラフを徐々に豊かにする。
このフレームワークは、セマンティックループのクロージャを通じて重複したオブジェクトトラックを解決し、きめ細かい視覚属性を付加し、オブジェクト間の空間的関係を導出する。
マルチターゲットフレームスケジューラは、複数のターゲットを共同でカバーする情報フレームの小さなセットを選択して、VLMコストを償却する。
結果のシーングラフは探索中にクエリ可能になり、時間とともに意味的な豊かさが増す。
提案手法はセマンティックセグメンテーション(ScanNet, Replica)における既存のオープンな3Dシーングラフ手法に適合し, 従来の3つのビジュアルグラウンドベンチマーク(Sr3D+, Nr3D, ScanRefer)を15.3から18.8A@0.25で上回っている。
プロジェクトページ: https://denizbickici.github.io/thinkgraphs/
関連論文リスト
- Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis [59.527737790821305]
本稿では,3次元シーングラフを用いてオープンな3次元理解を促進する関係認識フレームワークを提案する。
本手法は,物体関係の推測に視覚言語推論を活用することで,多視点観測からリレーショナルシーングラフを構築する。
ScanNetV2、ScanNet200、ScanNet$++$、Replicaの実験は、強力なパフォーマンスと一般化能力を示している。
論文 参考訳(メタデータ) (2026-07-06T17:29:49Z) - SG2Loc: Sequential Visual Localization on 3D Scene Graphs [108.42363585468458]
本稿では,3次元シーングラフを用いたシーケンシャルな視覚的ローカライゼーションのための,新しい軽量なアプローチを提案する。
コンパクトなシーングラフと効率的なセマンティックマッチングを活用することで,実世界のデータセットの性能を維持しながら,ストレージを大幅に削減する。
論文 参考訳(メタデータ) (2026-06-10T10:03:21Z) - AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models [0.0]
3Dビジュアルグラウンド(3DVG)は、AIを具現化する上で不可欠な機能であり、自然言語の記述に基づいて、エージェントがオブジェクトを3Dシーンにローカライズする必要がある。
タスク固有の3Dトレーニングを必要とせずに,色のついた点クラウド上で直接動作する,ゼロショットの3Dビジュアルグラウンドティングフレームワークである。
論文 参考訳(メタデータ) (2026-05-25T14:29:04Z) - SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching [2.4737219202679808]
SceneGrapherは,再構成された3次元シーングラフ上の構造化グラフマッチングとして3次元グラウンドを再構成するフレームワークである。
我々は,移動ロボットによる実世界展開によるフレームワークの実証を行い,長距離物理環境における堅牢な空間推論を実証した。
論文 参考訳(メタデータ) (2026-05-20T22:30:51Z) - ReLaGS: Relational Language Gaussian Splatting [20.136674901612334]
本稿では,階層型言語で区切られたガウシアンシーンと,シーン固有の訓練を伴わない3Dセマンティックシーングラフを構築する新しいフレームワークを提案する。
この階層の上に、視覚言語由来のアノテーションとグラフニューラルネットワークに基づくリレーショナル推論を備えたオープンな3Dシーングラフを構築します。
本手法は,階層的セマンティクスとオブジェクト間の相互関係を共同でモデル化することにより,効率的でスケーラブルな3次元推論を可能にする。
論文 参考訳(メタデータ) (2026-03-18T11:18:23Z) - KeySG: Hierarchical Keyframe-Based 3D Scene Graphs [1.5134439544218246]
KeySGは3Dシーンを、床、部屋、オブジェクト、機能要素からなる階層的なグラフとして表現している。
我々はVLMを利用してシーン情報を抽出し、オブジェクト間の関係エッジを明示的にモデル化する必要性を緩和する。
我々のアプローチは、大規模シーングラフに関連するスケーラビリティ問題を緩和しながら、複雑であいまいなクエリを処理できる。
論文 参考訳(メタデータ) (2025-10-01T15:53:27Z) - Open-Vocabulary Octree-Graph for 3D Scene Understanding [54.11828083068082]
Octree-Graphはオープンな3Dシーン理解のための新しいシーン表現である。
セマンティクスを記憶し、その形状に応じてオブジェクトの占有度を調節するアダプティブ・オクツリー構造を開発する。
論文 参考訳(メタデータ) (2024-11-25T10:14:10Z) - Incremental 3D Semantic Scene Graph Prediction from RGB Sequences [86.77318031029404]
RGB画像列が与えられたシーンの一貫性のある3Dセマンティックシーングラフをインクリメンタルに構築するリアルタイムフレームワークを提案する。
提案手法は,新たなインクリメンタルエンティティ推定パイプラインとシーングラフ予測ネットワークから構成される。
提案するネットワークは,シーンエンティティから抽出した多視点および幾何学的特徴を用いて,反復的メッセージパッシングを用いた3次元セマンティックシーングラフを推定する。
論文 参考訳(メタデータ) (2023-05-04T11:32:16Z) - SGAligner : 3D Scene Alignment with Scene Graphs [84.01002998166145]
3Dシーングラフの構築は、いくつかの具体的AIアプリケーションのためのシーン表現のトピックとして登場した。
オーバーラップ可能な3次元シーングラフのペアをゼロから部分的に整列させるという基本的な問題に着目する。
そこで我々はSGAlignerを提案する。SGAlignerは3次元シーングラフのペアを組合わせるための最初の方法であり、その組込みシナリオに対して堅牢である。
論文 参考訳(メタデータ) (2023-04-28T14:39:22Z) - Learning 3D Semantic Scene Graphs from 3D Indoor Reconstructions [94.17683799712397]
我々は、グラフ内のシーンのエンティティを整理するデータ構造であるシーングラフに焦点を当てる。
本研究では,シーンの点雲からシーングラフを回帰する学習手法を提案する。
本稿では,3D-3Dおよび2D-3Dマッチングの中間表現としてグラフが機能するドメインに依存しない検索タスクにおける本手法の適用について述べる。
論文 参考訳(メタデータ) (2020-04-08T12:25:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。