論文の概要: Open-Vocabulary 3D Object Detection with Co-Distillation Discovery and Dual Guidance Robust Training
- arxiv url: http://arxiv.org/abs/2608.19973v1
- Date: Thu, 20 Aug 2026 12:47:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.564788
- Title: Open-Vocabulary 3D Object Detection with Co-Distillation Discovery and Dual Guidance Robust Training
- Title(参考訳): 共蒸留法によるオープンボキャブラリ3次元物体検出とデュアル誘導ロバストトレーニング
- Abstract要約: 3Dオブジェクト検出は、3Dシーンで見えないオブジェクトを検出する能力によって注目を集めている。
既存のアプローチでは、2段階のパイプラインを採用しており、まず基礎モデルを用いて新しい物体を発見し、3D-OVDモデルをこれらの発見オブジェクトに基づいて訓練する。
我々は、新しいオブジェクト発見の信頼性とモデルトレーニングの堅牢性の両方を改善し、革新的なフレームワークを提案する。
- 参考スコア(独自算出の注目度): 15.510191654885778
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recently, open-vocabulary 3D object detection (3D-OVD) has gained increasing attention for its ability to detect unseen objects in 3D scenes. Existing approaches typically adopt a two-stage pipeline that first discovers novel objects using foundation models and then trains a 3D-OVD model based on these discovered objects. Although effective, this pipeline often suffers from inaccurate localization and mismatched classification during the discovery stage, which subsequently limits the performance of the model training stage. To address these limitations, we advocate for improving both the reliability of novel object discovery and the robustness of model training, and propose an innovative framework. Specifically, for reliable discovery, our co-distillation strategy distills high-quality novel objects by applying Hungarian matching over a comprehensive score that incorporates geometric consistency, structural objectness, and semantic certainty. To enhance robust model training, we further propose a dual-guidance learning scheme, incorporating a scene-awareness-guided uncertainty regularization for the regression head and an LLM-guided hierarchical alignment for the classification head, effectively mitigating the negative effects of imprecise 3D bounding boxes and semantic ambiguity. Extensive experiments on SUN RGB-D and ScanNetV2 demonstrate that our method achieves significant performance gains over state-of-the-art approaches. Code is available at https://github.com/shangboyuan/Co-3DGT
- Abstract(参考訳): 近年,オープンな3次元物体検出(3D-OVD)が注目されている。
既存のアプローチでは、2段階のパイプラインを採用しており、まず基礎モデルを用いて新しい物体を発見し、3D-OVDモデルをこれらの発見オブジェクトに基づいて訓練する。
有効ではあるが、このパイプラインは発見段階で不正確なローカライゼーションとミスマッチした分類に悩まされ、モデルトレーニングステージのパフォーマンスが制限される。
これらの制約に対処するため、新しいオブジェクト発見の信頼性とモデルトレーニングの堅牢性の両方を改善し、革新的なフレームワークを提案する。
特に、信頼性の高い発見のために、我々の共蒸留戦略は、幾何学的整合性、構造的対象性、意味的確実性を含む総合的なスコアにハンガリーマッチングを適用して、高品質な新規物体を蒸留する。
頑健なモデルトレーニングを強化するために,回帰ヘッドのシーン認識型不確実性正規化と分類ヘッドのLCM誘導型階層的アライメントを取り入れ,不正確な3次元境界ボックスと意味あいまいさの負の効果を効果的に軽減する,二重誘導学習方式を提案する。
SUN RGB-D と ScanNetV2 の大規模実験により,本手法が最先端手法よりも高い性能向上を達成できることが実証された。
コードはhttps://github.com/shangboyuan/Co-3DGTで入手できる。
関連論文リスト
- IAENet: An Importance-Aware Ensemble Model for 3D Point Cloud-Based Anomaly Detection [2.08058961865456]
重要なボトルネックは、3Dで2Dに匹敵する強力な事前訓練された基盤のバックボーンがないことだ、と私たちは主張する。
本稿では,2次元事前学習エキスパートを3Dエキスパートモデルに相乗させるアンサンブルフレームワークであるImportance-Aware Ensemble Network (IAENet)を提案する。
IAENetは、明らかに偽陽性率の低い新しい最先端技術を実現し、産業展開における実用的価値を強調している。
論文 参考訳(メタデータ) (2025-08-28T07:19:07Z) - OV-SCAN: Semantically Consistent Alignment for Novel Object Discovery in Open-Vocabulary 3D Object Detection [6.449894994514711]
OV-SCANはオープンVocabulary 3Dフレームワークで、新規オブジェクト発見のためにセマンティック一貫性アライメントを強制する。
OV-SCANは、正確な3Dアノテーションを発見し、低品質または劣化したアライメントペアをフィルタリングする2つの中核戦略を採用している。
論文 参考訳(メタデータ) (2025-03-09T04:22:08Z) - GEAL: Generalizable 3D Affordance Learning with Cross-Modal Consistency [50.11520458252128]
既存の3Dアベイランス学習手法は、注釈付きデータに制限があるため、一般化と堅牢性に苦慮している。
本稿では,大規模事前学習型2Dモデルを活用することで,3次元アベイランス学習の一般化と堅牢性を高めるための新しいフレームワークであるGEALを提案する。
GEALは、既存のメソッドと、新しいオブジェクトカテゴリ、および破損したデータにおいて、一貫して優れています。
論文 参考訳(メタデータ) (2024-12-12T17:59:03Z) - Open Vocabulary Monocular 3D Object Detection [10.424711580213616]
RGB画像から3次元空間内の物体を検出しローカライズすることを目的とした新しい課題であるオープンボキャブラリモノクロ3Dオブジェクト検出の研究を開拓した。
オープンボキャブラリ2次元検出器を活用して2次元境界ボックスを3次元空間に持ち上げるクラス非依存的手法を提案する。
提案手法は,3次元境界ボックスを推定する作業から2次元の物体の認識と局所化を分離し,未知のカテゴリをまたいだ一般化を可能にする。
論文 参考訳(メタデータ) (2024-11-25T18:59:17Z) - Find n' Propagate: Open-Vocabulary 3D Object Detection in Urban Environments [67.83787474506073]
我々は,現在のLiDARに基づく3Dオブジェクト検出システムの限界に対処する。
本稿では,3次元OVタスクに対する汎用textscFind n' Propagate アプローチを提案する。
我々は、新しいオブジェクトクラスに対する平均精度(AP)を最大3.97倍に向上させる。
論文 参考訳(メタデータ) (2024-03-20T12:51:30Z) - FILP-3D: Enhancing 3D Few-shot Class-incremental Learning with Pre-trained Vision-Language Models [59.13757801286343]
クラス増分学習(class-incremental learning)は、モデルが限られたデータで漸進的にトレーニングされている場合、破滅的な忘れの問題を軽減することを目的としている。
本稿では,特徴空間の不整合のための冗長特徴除去器 (RFE) と,重要な雑音に対する空間ノイズ補償器 (SNC) の2つの新しいコンポーネントを備えたFILP-3Dフレームワークを紹介する。
論文 参考訳(メタデータ) (2023-12-28T14:52:07Z) - Diffusion-based 3D Object Detection with Random Boxes [58.43022365393569]
既存のアンカーベースの3D検出方法は、アンカーの実証的な設定に依存しており、アルゴリズムはエレガンスを欠いている。
提案するDiff3Detは,検出ボックスを生成対象として考慮し,拡散モデルから3次元オブジェクト検出のための提案生成へ移行する。
推論段階では、モデルは予測結果にランダムボックスのセットを徐々に洗練する。
論文 参考訳(メタデータ) (2023-09-05T08:49:53Z) - I3DOD: Towards Incremental 3D Object Detection via Prompting [31.75287371048825]
本稿では,新たなインクリメンタル3Dオブジェクト検出フレームワークを提案する。
具体的には、オブジェクトの局所化情報とカテゴリの意味情報とのマッチング関係を学習するためのタスク共有プロンプト機構を提案する。
本手法は,mAP@0.25における最先端物体検出法を0.6%~2.7%向上させる。
論文 参考訳(メタデータ) (2023-08-24T02:54:38Z) - Stereo Neural Vernier Caliper [57.187088191829886]
学習に基づくステレオ3Dオブジェクト検出のための新しいオブジェクト中心フレームワークを提案する。
初期3次元立方体推定値から改良された更新を予測する方法の問題に対処する。
提案手法は,KITTIベンチマークの最先端性能を実現する。
論文 参考訳(メタデータ) (2022-03-21T14:36:07Z) - SESS: Self-Ensembling Semi-Supervised 3D Object Detection [138.80825169240302]
具体的には、ラベルのない新しい未知のデータに基づくネットワークの一般化を促進するための、徹底的な摂動スキームを設計する。
我々のSESSは、50%のラベル付きデータを用いて、最先端の完全教師付き手法と比較して、競争性能を達成している。
論文 参考訳(メタデータ) (2019-12-26T08:48:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。