論文の概要: Group3D: MLLM-Driven Semantic Grouping for Open-Vocabulary 3D Object Detection
- arxiv url: http://arxiv.org/abs/2603.21944v1
- Date: Mon, 23 Mar 2026 13:01:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.684041
- Title: Group3D: MLLM-Driven Semantic Grouping for Open-Vocabulary 3D Object Detection
- Title(参考訳): Group3D:オープンボキャブラリ3Dオブジェクト検出のためのMLLM駆動セマンティックグルーピング
- Authors: Youbin Kim, Jinho Park, Hogun Park, Eunbyung Park,
- Abstract要約: Group3Dはマルチビューオープンな3D検出フレームワークである。
セマンティック制約を直接インスタンス構築プロセスに統合する。
Group3Dは、多視点オープン3D検出において最先端の性能を達成する。
- 参考スコア(独自算出の注目度): 23.34626996348395
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-vocabulary 3D object detection aims to localize and recognize objects beyond a fixed training taxonomy. In multi-view RGB settings, recent approaches often decouple geometry-based instance construction from semantic labeling, generating class-agnostic fragments and assigning open-vocabulary categories post hoc. While flexible, such decoupling leaves instance construction governed primarily by geometric consistency, without semantic constraints during merging. When geometric evidence is view-dependent and incomplete, this geometry-only merging can lead to irreversible association errors, including over-merging of distinct objects or fragmentation of a single instance. We propose Group3D, a multi-view open-vocabulary 3D detection framework that integrates semantic constraints directly into the instance construction process. Group3D maintains a scene-adaptive vocabulary derived from a multimodal large language model (MLLM) and organizes it into semantic compatibility groups that encode plausible cross-view category equivalence. These groups act as merge-time constraints: 3D fragments are associated only when they satisfy both semantic compatibility and geometric consistency. This semantically gated merging mitigates geometry-driven over-merging while absorbing multi-view category variability. Group3D supports both pose-known and pose-free settings, relying only on RGB observations. Experiments on ScanNet and ARKitScenes demonstrate that Group3D achieves state-of-the-art performance in multi-view open-vocabulary 3D detection, while exhibiting strong generalization in zero-shot scenarios. The project page is available at https://ubin108.github.io/Group3D/.
- Abstract(参考訳): Open-vocabulary 3D object detectionは、固定された訓練分類を超えてオブジェクトをローカライズし、認識することを目的としている。
マルチビューRGB設定では、最近のアプローチは、しばしば幾何学ベースのインスタンス構築をセマンティックラベリングから切り離し、クラスに依存しないフラグメントを生成し、オープン語彙カテゴリをポストホックに割り当てる。
柔軟性はあるものの、このような分離は、統合中に意味的な制約なしに、主に幾何学的一貫性によって管理されるインスタンス構造を残します。
幾何学的エビデンスがビュー依存的で不完全である場合、この幾何のみのマージは、異なる対象の過剰なマージや単一のインスタンスの断片化を含む不可逆な関連エラーを引き起こす。
本稿では, セマンティック制約を直接インスタンス構築プロセスに統合する多視点オープン3D検出フレームワークであるGroup3Dを提案する。
Group3Dは、MLLM(Multimodal large language model)から派生したシーン適応語彙を維持し、それを有望なクロスビューカテゴリ等価性を符号化するセマンティック互換グループに編成する。
3次元フラグメントは、意味的整合性と幾何学的整合性の両方を満たす場合にのみ関連付けられる。
この意味的にゲートされたマージは、多視点のカテゴリの可変性を吸収しながら、幾何駆動のオーバーマージを緩和する。
Group3Dは、RGBの観測のみに依存する、ポーズ不明設定とポーズなし設定の両方をサポートしている。
ScanNetとARKitScenesの実験では、G3Dは、ゼロショットシナリオにおいて強力な一般化を示しながら、マルチビューのオープン3D検出において最先端のパフォーマンスを達成することを示した。
プロジェクトページはhttps://ubin108.github.io/Group3D/で公開されている。
関連論文リスト
- GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models [70.61152292499737]
このギャップは、幾何学的事前の不足から生じるものではなく、訓練パラダイムの誤った調整から生じるものである、と我々は主張する。
既存のアプローチでは、通常、特徴の結合を示唆し、幾何学的な監督なしに下流のタスクを直接最適化する。
本稿では,下流適応前の構造知覚を明示的に活性化する幾何学的事前学習パラダイムであるGAP-MLLMを提案する。
論文 参考訳(メタデータ) (2026-03-17T12:43:48Z) - Hierarchical Collaborative Fusion for 3D Instance-aware Referring Expression Segmentation [91.2768117730855]
一般化された3D参照式(3D-GRES)は、記述が複数またはゼロのターゲットと一致する場合でも、自然言語に基づいて3Dシーン内のオブジェクトをローカライズする。
既存の方法はスパース・ポイント・クラウドにのみ依存しており、きめ細かい説明のためのリッチ・ビジュアル・セマンティクスが欠如している。
HCF-RESは2つの重要なイノベーションを持つマルチモーダルフレームワークである。
論文 参考訳(メタデータ) (2026-03-06T13:09:29Z) - Instance Consistency Regularization for Semi-Supervised 3D Instance Segmentation [50.51125319374404]
ラベルのないデータから純粋なインスタンス知識を探索し活用するための,新たな自己学習ネットワークInsTeacher3Dを提案する。
複数の大規模データセットの実験結果から、InsTeacher3Dは最先端の半教師付きアプローチよりも大幅に優れていた。
論文 参考訳(メタデータ) (2024-06-24T16:35:58Z) - SAI3D: Segment Any Instance in 3D Scenes [68.57002591841034]
新規なゼロショット3Dインスタンスセグメンテーション手法であるSAI3Dを紹介する。
我々の手法は3Dシーンを幾何学的プリミティブに分割し、段階的に3Dインスタンスセグメンテーションにマージする。
ScanNet、Matterport3D、さらに難しいScanNet++データセットに関する実証的な評価は、我々のアプローチの優位性を示している。
論文 参考訳(メタデータ) (2023-12-17T09:05:47Z) - OpenMask3D: Open-Vocabulary 3D Instance Segmentation [84.58747201179654]
OpenMask3Dはオープンな3Dインスタンスセグメンテーションのためのゼロショットアプローチである。
私たちのモデルは、CLIPベースの画像埋め込みのマルチビュー融合により、マスクごとの特徴を集約する。
論文 参考訳(メタデータ) (2023-06-23T17:36:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。