論文の概要: CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting
- arxiv url: http://arxiv.org/abs/2608.11150v2
- Date: Wed, 12 Aug 2026 06:41:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 14:28:20.668063
- Title: CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting
- Title(参考訳): CausalSplat:3次元ガウススプラッティングにおける包括的階層的推論を目指して
- Abstract要約: CausalSplatは視覚言語モデルと3Dシーングラフを統合するフレームワークで、暗黙の論理的推論から明示的な構造的知覚を解き放つ。
我々のベンチマークは、常識、空間、余裕、そして対実的推論を評価する。
CausalSplatが私たちの推論ベンチマークでアートパフォーマンスの状態を達成していることを示す実験結果が得られた。
- 参考スコア(独自算出の注目度): 19.87557814775208
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: While 3D Gaussian Splatting (3DGS) has advanced open vocabulary scene understanding, existing methods remain confined to explicit queries. They struggle to interpret implicit intents, complex spatial constraints, and commonsense reasoning required for practical embodied interactions. To address this gap, we introduce the task of reasoning 3D Gaussian segmentation and construct two benchmarks, Causal-LERF and Causal-ScanNet. These benchmarks systematically evaluate commonsense, spatial, affordance, and counterfactual reasoning. Evaluations reveal that current state of the art methods perform poorly on these reasoning challenges. Therefore, we propose CausalSplat, a framework that integrates vision-language models with 3D scene graphs to disentangle explicit structural perception from implicit logical inference. Extensive experiments demonstrate that CausalSplat achieves state of the art performance on our reasoning benchmarks while showing strong generalizability on standard referring and open vocabulary 3D segmentation tasks. Project Page: https://jiayuding031020.github.io/CausalSplat
- Abstract(参考訳): 3D Gaussian Splatting (3DGS)は、オープンな語彙シーンの理解が進んでいるが、既存の手法は明示的なクエリに限られている。
彼らは暗黙の意図、複雑な空間的制約、そして実践的な具体的相互作用に必要な常識的推論を解釈するのに苦労した。
このギャップに対処するため、我々は3次元ガウス分割を推論するタスクを導入し、Causal-LERFとCausal-ScanNetという2つのベンチマークを構築した。
これらのベンチマークは、常識、空間、余裕、および対実的推論を体系的に評価する。
評価の結果、現在の最先端の手法はこれらの推論の課題に対して不十分であることが明らかとなった。
そこで我々は,視覚言語モデルと3次元シーングラフを統合するフレームワークCausalSplatを提案する。
大規模な実験により,CausalSplatは標準的な参照およびオープンな3次元セグメンテーションタスクに強い一般化性を示しながら,我々の推論ベンチマーク上で最先端のパフォーマンスを達成することが示された。
Project Page: https://jiayuding031020.github.io/CausalSplat
関連論文リスト
- ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting [2.1327328379130885]
本稿では,GR3DGS(Generalized Referring 3D Gaussian Splatting)タスクを紹介する。
GR3DGSタスクは任意の数のターゲット(0、1、または$N$)をセグメント化する必要がある
我々はZeroSplatという新しいトレーニングフリーでゼロ機能フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-21T07:27:10Z) - Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis [59.527737790821305]
本稿では,3次元シーングラフを用いてオープンな3次元理解を促進する関係認識フレームワークを提案する。
本手法は,物体関係の推測に視覚言語推論を活用することで,多視点観測からリレーショナルシーングラフを構築する。
ScanNetV2、ScanNet200、ScanNet$++$、Replicaの実験は、強力なパフォーマンスと一般化能力を示している。
論文 参考訳(メタデータ) (2026-07-06T17:29:49Z) - Ilov3Splat: Instance-Level Open-Vocabulary 3D Scene Understanding in Gaussian Splatting [32.46353940664006]
Ilov3Splatは3Dガウススプラッティング(3D-GS)上に構築されたインスタンスレベルのオープンな3Dシーン理解のためのフレームワーク
言語対応のCLIP機能を効率的にエンコードするために,マルチレゾリューションハッシュ埋め込みを活用している。
推論時に、CLIPエンコードされたクエリは学習した機能と一致し、続いて関連するガウスグループを取得するための2段階の3Dクラスタリングが続く。
論文 参考訳(メタデータ) (2026-05-06T05:23:41Z) - GaussExplorer: 3D Gaussian Splatting for Embodied Exploration and Reasoning [55.826192239140596]
GaussExplorerは3D Gaussian Splatting(3DGS)上に構築されたボディード探索と推論のためのフレームワークである
3DGS上に視覚言語モデル(VLM)を導入し、3Dシーン内で質問駆動探索と推論を可能にする。
論文 参考訳(メタデータ) (2026-01-19T15:17:58Z) - Think Visually, Reason Textually: Vision-Language Synergy in ARC [94.15522924153264]
ARC-AGIは、概念ルールの誘導と新しいタスクへの転送のための厳格なテストベッドである。
既存のほとんどの手法は、ARC-AGIを純粋にテキストによる推論タスクとして扱い、人間が視覚的抽象化に強く依存しているという事実を見落としている。
VLSR(Vision-Language Synergy Reasoning)とMSSC(Modality-Switch Self-Correction)の2つの相乗的戦略を導入する。
本研究は,視覚的抽象と言語的推論を一体化させることが,汎用的な人間的な知性を実現するための重要なステップであることを示唆している。
論文 参考訳(メタデータ) (2025-11-19T18:59:04Z) - ReferSplat: Referring Segmentation in 3D Gaussian Splatting [60.73702075842278]
3次元ガウス散乱(R3DGS)を参照
Taskは、自然言語の記述に基づいて、ターゲットオブジェクトを3Dガウスシーンにセグメントすることを目的としている。
これらの課題に対処するため,自然言語表現を用いて3次元ガウス点を明示的にモデル化するフレームワークReferSplatを提案する。
論文 参考訳(メタデータ) (2025-08-11T17:59:30Z) - CAGS: Open-Vocabulary 3D Scene Understanding with Context-Aware Gaussian Splatting [18.581169318975046]
3D Gaussian Splatting (3DGS) はシーン再構築のための強力な表現を提供するが、相互視の粒度の不整合は問題である。
空間コンテキストを3DGSに組み込んだ新しいフレームワークCAGSを提案する。
CAGSは3Dインスタンスのセグメンテーションを大幅に改善し、LERF-OVSやScanNetといったデータセットのフラグメンテーションエラーを低減する。
論文 参考訳(メタデータ) (2025-04-16T09:20:03Z) - ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning [68.4209681278336]
Open-vocabulary 3D visual grounding and reasoningは、暗黙の言語記述に基づくシーン内のオブジェクトのローカライズを目的としている。
現在の方法は、3Dアノテーションとマスクの提案による微調整に大きく依存しているため、苦労している。
適応グルーピングのための階層型3次元特徴ガウス場を用いたLVLM誘導フレームワークであるReasonGrounderを提案する。
論文 参考訳(メタデータ) (2025-03-30T03:40:35Z) - Occam's LGS: An Efficient Approach for Language Gaussian Splatting [57.00354758206751]
言語3Dガウススプラッティングのための複雑なパイプラインは、単純に不要であることを示す。
我々は,オッカムのカミソリを手作業に適用し,高効率な重み付き多視点特徴集約技術を実現する。
論文 参考訳(メタデータ) (2024-12-02T18:50:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。