論文の概要: DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors
- arxiv url: http://arxiv.org/abs/2607.00889v1
- Date: Wed, 01 Jul 2026 12:55:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.895949
- Title: DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors
- Title(参考訳): DeWorldSG:ワールドモデルプライオリティによる3Dセマンティックグラフ生成
- Authors: Seok-Young Kim, Abdelrahman Elskhawy, Taewook Ha, Dooyoung Kim, Eunjae Shin, Benjamin Busam, Woontack Woo,
- Abstract要約: 既存の手法は、不安定な3次元オブジェクト表現とフレームワイズ推論による欠落の関係により、信頼できる3次元シーングラフを構築するのに苦労することが多い。
DeWorldSGは、例えば深さ誘導フィルタリングにより幾何学レベルの3次元ガウス分布を推定することでこれらの問題に対処する。
3DSSGとReplicaSSSGデータセットの実験は、オブジェクトと予測の両方で最先端(SoTA)のパフォーマンスを示している。
- 参考スコア(独自算出の注目度): 22.5705525097147
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: We present DeWorldSG, a novel framework that generates spatio-temporally robust 3D Semantic Scene Graphs from RGB-D sequences. Existing methods often struggle to construct reliable 3D scene graphs due to unstable 3D object representations and missing relations caused by frame-wise inference. DeWorldSG addresses these issues by estimating instance-level geometric 3D Gaussian distributions through depth-guided filtering and representing each object as a probabilistic 3D node rather than a single projected point. To mitigate relational sparsity from frame-wise inference, our framework further aggregates spatiotemporal evidence across object pairs and refines relations using contextual priors derived from a world model (V-JEPA 2). Experiments on the 3DSSG and ReplicaSSG datasets demonstrate state-of-the-art (SoTA) performance in both object and predicate prediction, while producing temporally consistent scene structures. In particular, our method improves triplet recall by 77.4% and predicate recall by 23.2% over prior SoTA approaches, making it suitable for robotic manipulation and AR applications. Our code and models are open-sourced.
- Abstract(参考訳): 本稿では,RGB-Dシークエンスから時空間的に堅牢な3Dセマンティックシーングラフを生成する新しいフレームワークであるDeWorldSGを提案する。
既存の手法は、不安定な3次元オブジェクト表現とフレームワイズ推論による欠落の関係により、信頼できる3次元シーングラフを構築するのに苦労することが多い。
DeWorldSGは、深度誘導フィルタリングによりインスタンスレベルの幾何学的3Dガウス分布を推定し、各オブジェクトを単一の射影点ではなく確率的3Dノードとして表現することで、これらの問題に対処する。
フレームワイド推論からリレーショナル・スペシャリティを緩和するため,本フレームワークでは,オブジェクトペア間の時空間的証拠をさらに集約し,世界モデル(V-JEPA2)から派生した文脈的先行情報を用いて関係を洗練する。
3DSSGとReplicaSSGデータセットの実験は、時間的に一貫したシーン構造を生成しながら、オブジェクトと述語の両方で最先端(SoTA)のパフォーマンスを示す。
特に,本手法では,従来のSoTA手法よりも3重項リコールを77.4%改善し,23.2%のリコールを予測し,ロボット操作やAR応用に適している。
私たちのコードとモデルはオープンソースです。
関連論文リスト
- NoPA: Non-Parametric Online 3D Scene Graph Generation [57.15076373014265]
NoPAは各オブジェクトを別の非パラメトリック分布として表現する。
カーネル密度推定における平均誤差の最大化を利用して、オブジェクト候補のロバストなマージを可能にする。
NoPAは、リアルタイムの推論速度を犠牲にすることなく、現在の手法を大幅に上回る。
論文 参考訳(メタデータ) (2026-07-01T07:18:07Z) - Graph-GSReg: Leveraging 3D Scene Graphs for Gaussian Splatting Registration [21.225937272344968]
複数の3Dガウススティング(3DGS)シーンを単一の統一表現にマージすることは、大規模な3Dマッピングとマップ管理に不可欠である。
従来の手法はガウス原始体間の直接対応を試み、大規模な3DGSの訓練を必要とする。
本手法は3DGSとそのレンダリング画像から3次元シーングラフを構築し,グラフ登録問題としての3DGS登録をテキスト化する。
論文 参考訳(メタデータ) (2026-06-29T04:58:44Z) - 3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image [26.04490259188974]
合成3Dシーン生成のための新しいインプレース・コンプリート・パラダイムである3D-Fixerを紹介する。
明示的なポーズアライメントを必要とする以前の作品とは異なり、3D-Fixerはレイアウトの忠実さを維持するために空間アンカーとして断片化された幾何学を使用している。
これまでで最大のシーンレベルのデータセットであるARSG-110Kについて述べる。
論文 参考訳(メタデータ) (2026-04-06T04:11:09Z) - GSD: View-Guided Gaussian Splatting Diffusion for 3D Reconstruction [52.04103235260539]
単一視点からの3次元オブジェクト再構成のためのガウススプティング表現に基づく拡散モデル手法を提案する。
モデルはGS楕円体の集合で表される3Dオブジェクトを生成することを学習する。
最終的な再構成されたオブジェクトは、高品質な3D構造とテクスチャを持ち、任意のビューで効率的にレンダリングできる。
論文 参考訳(メタデータ) (2024-07-05T03:43:08Z) - Incremental 3D Semantic Scene Graph Prediction from RGB Sequences [86.77318031029404]
RGB画像列が与えられたシーンの一貫性のある3Dセマンティックシーングラフをインクリメンタルに構築するリアルタイムフレームワークを提案する。
提案手法は,新たなインクリメンタルエンティティ推定パイプラインとシーングラフ予測ネットワークから構成される。
提案するネットワークは,シーンエンティティから抽出した多視点および幾何学的特徴を用いて,反復的メッセージパッシングを用いた3次元セマンティックシーングラフを推定する。
論文 参考訳(メタデータ) (2023-05-04T11:32:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。