論文の概要: GoDeep: Annotation-Free Open-Vocabulary 3D Scene Understanding via Language-Space Lifting
- arxiv url: http://arxiv.org/abs/2609.09082v1
- Date: Tue, 08 Sep 2026 17:31:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.705023
- Title: GoDeep: Annotation-Free Open-Vocabulary 3D Scene Understanding via Language-Space Lifting
- Title(参考訳): GoDeep: 言語空間リフティングによるアノテーションのないオープン語彙3Dシーン理解
- Abstract要約: 私たちは純粋に視覚言語モデルをトランスレータとして使用します。
各ポーズ画像の構造化されたエンティティレベルの記述を生成する。
ScanNet++では、当社のパイプラインはScanNetでトレーニングされた強力なアノテーションのないベースラインと競合しています。
- 参考スコア(独自算出の注目度): 1.2234742322758418
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Open vocabulary 3D semantic segmentation methods typically lift CLIP features into 3D. This embeds points in a joint vision-language space known to behave like a bag-of-words on compositional tasks. Furthermore, even annotation free variants often require a large 3D training corpus and a dedicated 3D encoder per domain. Instead we use a vision-language model purely as a translator. It produces structured, entity-level descriptions of each posed image. These descriptions are grounded, projected, and aggregated directly in a general-purpose, language-only embedding space, with no 3D training corpus or encoder required. On ScanNet++, our pipeline is competitive with strong annotation free baselines trained on ScanNet. On a 5-building cultural heritage benchmark, raw scores initially favor a CLIP-based variant, but a single systematic vocabulary correction reverses this ranking. An effect confirmed by a second, independent correction on a different class, indicating that language-space embeddings track physical content more faithfully. This fidelity extends to genuinely out-of-vocabulary (OOV) objects on ScanNet++ proving that language-space embeddings separate presence from absence objects far more sharply than CLIP-based embeddings do. GoDeep also localize these OOV objects within the scene, all without any 2D-3D annotation. Because every representation remains discrete text, predictions are also explainable at the point level. Finally, exploiting both a heuristic weighting, that favors precise over merely frequent observations and GoDeep's explainability property, we propose an aggregation strategy, as a proof of concept, that favors finer elements localization.
- Abstract(参考訳): オープンな3Dセマンティックセグメンテーションメソッドは、通常、CLIP機能を3Dに引き上げる。
これは、作曲作業において言葉の袋のように振る舞うことで知られている共同視覚言語空間にポイントを埋め込む。
さらに、アノテーションのない変種でさえ、大きな3Dトレーニングコーパスとドメインごとに専用の3Dエンコーダを必要とすることが多い。
代わりに、純粋にトランスレータとして視覚言語モデルを使用します。
各ポーズ画像の構造化されたエンティティレベルの記述を生成する。
これらの記述は、3Dトレーニングコーパスやエンコーダを必要とせず、汎用的な言語のみの埋め込み空間に接地され、投影され、直接集約される。
ScanNet++では、当社のパイプラインはScanNetでトレーニングされた強力なアノテーションのないベースラインと競合しています。
5階建ての文化遺産のベンチマークでは、生スコアはCLIPベースの変種を好むが、単一の体系的な語彙補正はこのランキングを覆している。
言語空間の埋め込みは、物理的コンテンツをより忠実に追跡することを示している。
この忠実さは、ScanNet++上の真に外語彙(OOV)オブジェクトにまで拡張され、言語空間の埋め込みはCLIPベースの埋め込みよりもはるかにシャープに、不在オブジェクトから独立した存在を証明している。
GoDeepはまた、これらのOOVオブジェクトをシーン内にローカライズする。
全ての表現は離散テキストのままなので、予測はポイントレベルでも説明できる。
最後に、単に頻繁な観測よりも正確なヒューリスティックな重み付けと、GoDeepの説明可能性特性の両方を利用して、より微細な要素の局所化を好む概念実証として集約戦略を提案する。
関連論文リスト
- Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis [59.527737790821305]
本稿では,3次元シーングラフを用いてオープンな3次元理解を促進する関係認識フレームワークを提案する。
本手法は,物体関係の推測に視覚言語推論を活用することで,多視点観測からリレーショナルシーングラフを構築する。
ScanNetV2、ScanNet200、ScanNet$++$、Replicaの実験は、強力なパフォーマンスと一般化能力を示している。
論文 参考訳(メタデータ) (2026-07-06T17:29:49Z) - Ilov3Splat: Instance-Level Open-Vocabulary 3D Scene Understanding in Gaussian Splatting [32.46353940664006]
Ilov3Splatは3Dガウススプラッティング(3D-GS)上に構築されたインスタンスレベルのオープンな3Dシーン理解のためのフレームワーク
言語対応のCLIP機能を効率的にエンコードするために,マルチレゾリューションハッシュ埋め込みを活用している。
推論時に、CLIPエンコードされたクエリは学習した機能と一致し、続いて関連するガウスグループを取得するための2段階の3Dクラスタリングが続く。
論文 参考訳(メタデータ) (2026-05-06T05:23:41Z) - GALA: Guided Attention with Language Alignment for Open Vocabulary Gaussian Splatting [74.56128224977279]
GALAは3次元ガウススプラッティングを用いたオープンな3次元シーン理解のための新しいフレームワークである(3DGS)。
GALAは、自己教師付きコントラスト学習を通じてシーン固有の3Dインスタンス特徴フィールドを蒸留する。
シームレスな2Dおよび3Dオープン語彙クエリをサポートし、ガウス単位の高次元特徴学習を回避してメモリ消費を削減する。
論文 参考訳(メタデータ) (2025-08-19T21:26:49Z) - A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding [78.99798110890157]
Open-vocabulary 3D visual groundingは、自由形式の言語クエリに基づいてターゲットオブジェクトをローカライズすることを目的としている。
既存の言語フィールド手法は、言語クエリにおける空間的関係を利用してインスタンスを正確にローカライズするのに苦労する。
本研究では,大規模言語モデル(LLM)に基づく空間推論を用いたニューラル表現に基づく新しいフレームワークであるSpatialReasonerを提案する。
論文 参考訳(メタデータ) (2025-07-09T10:20:38Z) - PGOV3D: Open-Vocabulary 3D Semantic Segmentation with Partial-to-Global Curriculum [20.206273757144547]
PGOV3Dはオープンな3Dセマンティックセマンティックセグメンテーションを改善するための部分言語カリキュラムを導入した新しいフレームワークである。
我々は、密接な意味情報を提供する部分的なシーンでモデルを事前訓練するが、比較的単純な幾何学である。
第2段階では、よりスペーサーで構造的に複雑である、完全なシーンレベルの点雲上でモデルを微調整する。
論文 参考訳(メタデータ) (2025-06-30T08:13:07Z) - ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning [68.4209681278336]
Open-vocabulary 3D visual grounding and reasoningは、暗黙の言語記述に基づくシーン内のオブジェクトのローカライズを目的としている。
現在の方法は、3Dアノテーションとマスクの提案による微調整に大きく依存しているため、苦労している。
適応グルーピングのための階層型3次元特徴ガウス場を用いたLVLM誘導フレームワークであるReasonGrounderを提案する。
論文 参考訳(メタデータ) (2025-03-30T03:40:35Z) - 3D-AVS: LiDAR-based 3D Auto-Vocabulary Segmentation [20.7179907935644]
3D-AVSは3Dポイントクラウドのオートボキャブラリの手法で、ボキャブラリが未知であり、実行時に各入力に対して自動生成される。
3D-AVSはまずイメージまたはポイントクラウドデータからセマンティックエンティティを認識し、次に自動的に生成された語彙ですべてのポイントをセグメンテーションする。
本手法は、画像ベースと点ベースの両方の認識を取り入れ、難解な照明条件下で頑健さを向上する。
論文 参考訳(メタデータ) (2024-06-13T13:59:47Z) - Segment Any 3D Object with Language [58.471327490684295]
本稿では,Segment any 3D Object with LanguagE (SOLE)を紹介した。
具体的には、バックボーンとデコーダの両方にマルチモーダル意味を組み込むマルチモーダル融合ネットワークを提案する。
我々のSOLEは、ScanNetv2、ScanNet200、Replicaベンチマークにおいて、従来の方法よりも大きなマージンで優れている。
論文 参考訳(メタデータ) (2024-04-02T17:59:10Z) - Lowis3D: Language-Driven Open-World Instance-Level 3D Scene
Understanding [57.47315482494805]
オープンワールドのインスタンスレベルのシーン理解は、アノテーション付きデータセットに存在しない未知のオブジェクトカテゴリを特定し、認識することを目的としている。
モデルは新しい3Dオブジェクトをローカライズし、それらのセマンティックなカテゴリを推論する必要があるため、この課題は難しい。
本稿では,3Dシーンのキャプションを生成するために,画像テキストペアからの広範な知識を符号化する,事前学習型視覚言語基盤モデルを提案する。
論文 参考訳(メタデータ) (2023-08-01T07:50:14Z) - EDA: Explicit Text-Decoupling and Dense Alignment for 3D Visual
Grounding [4.447173454116189]
3Dビジュアルグラウンドティングは、リッチなセマンティックキューを備えた自由形式の自然言語記述によって言及されているポイントクラウド内のオブジェクトを見つけることを目的としている。
文中のテキスト属性を明示的に分離するEDAを提案する。
さらに、オブジェクト名を含まないオブジェクトを位置決めする新しい視覚的接地タスクを導入し、モデルの高密度アライメント能力を徹底的に評価する。
論文 参考訳(メタデータ) (2022-09-29T17:00:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。