論文の概要: Training-Free Open-Vocabulary 3D Point-Cloud Segmentation on the Generalized Few-Shot Benchmark
- arxiv url: http://arxiv.org/abs/2607.15331v1
- Date: Thu, 16 Jul 2026 16:03:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.674719
- Title: Training-Free Open-Vocabulary 3D Point-Cloud Segmentation on the Generalized Few-Shot Benchmark
- Title(参考訳): 一般化Few-Shotベンチマークによる学習自由な3次元ポイントクラウドセグメンテーション
- Authors: Silas kwabla Gah, Ebenezer Owusu,
- Abstract要約: 汎用的な小ショットの3Dポイントクラウドセグメンテーション(GFS-PCS)は、トレーニング時に見られる多くのベースクラスと新しいクラスのセットにシーンを分割するようモデルに求める。
完全学習自由でオープンな語彙パイプラインは、トレーニング自由な高密度前よりも、新しいmIoUを+2.6で改善することを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generalized few-shot 3D point-cloud segmentation (GFS-PCS) asks a model to segment a scene into many base classes seen at training time and a set of novel classes. The state of the art reaches novel classes by reconciling a dense but noisy 3D vision-language prior with the few-shot support, but it pays for this with base 3D labels, per-episode training, and the support annotations themselves. We ask how far the same reconciliation can go with none of these: no training, no 3D labels, and not even the few-shot support. We pair a frozen 3D vision-language model (RegionPLC) as a dense prior with a frozen promptable concept segmenter (SAM3), prompted by the bare novel class names and lifted from posed RGB views, and reconcile the two by cross-view consistency: a point becomes novel only when enough of the views that see it agree. On the ScanNet200 GFS-PCS benchmark this fully training-free, open-vocabulary pipeline improves novel mIoU by +2.6 over the training-free dense prior while holding base accuracy within 0.5, and recovers a third (33%) of the novel-class gap to the trained state of the art that uses far more supervision. We further show that injecting the few-shot support into the pipeline, as a fusion gate and as a prototypical dense classifier, adds nothing over consistency alone and in fact degrades it through the classifier, which is why the method needs no support at all. On the harder ScanNet++ benchmark, where the dense prior is far weaker on novel classes, the same pipeline nearly doubles novel mIoU (+15.7, from 16.2 to 31.9) at a 1.7 base cost, lifting the harmonic mean from 21.5 to 31.1
- Abstract(参考訳): 汎用的な小ショットの3Dポイントクラウドセグメンテーション(GFS-PCS)は、トレーニング時に見られる多くのベースクラスと新しいクラスのセットにシーンを分割するようモデルに求める。
最新技術は、数発のサポートで高密度だがノイズの多い3Dビジョン言語を調整することによって、新しいクラスに到達するが、これにはベースとなる3Dラベル、エピソードごとのトレーニング、サポートアノテーション自体が支払われる。
トレーニングも3Dラベルもないし、数発のサポートもない。
フリーズド3次元視覚言語モデル(RegionPLC)とフリーズドプロシージャブル概念セグメンタ(SAM3)とを組み合わせて、裸の新規クラス名によって誘導され、提案されたRGBビューから持ち上げられ、これら2つのビューを相互に整合性で整合させる。
ScanNet200 GFS-PCSベンチマークでは、この完全にトレーニングのないオープンボキャブラリパイプラインは、ベース精度を0.5未満に保ったまま、トレーニングなしの高密度なトレーニングのない新しいmIoUを+2.6改善し、はるかに監督力のあるトレーニングされた最先端技術への新規クラスのギャップの3分の3(3%)を回復する。
さらに、パイプラインに数発のサポートを、融合ゲートとして、そして原型的な高密度な分類器として注入すると、一貫性だけでは何も加えず、実際に分類器によって分解されることが示される。
より厳密なScanNet++ベンチマークでは、新しいクラスではより厳密な事前がはるかに弱いが、同じパイプラインは1.7ベースのコストで新しいmIoU(+15.7、+16.2から31.9)をほぼ2倍にし、ハーモニック平均を21.5から31.1に引き上げている。
関連論文リスト
- Learning Hierarchical Orthogonal Prototypes for Generalized Few-Shot 3D Point Cloud Segmentation [5.923682154394584]
汎用的な数ショットの3Dポイントクラウドセグメンテーションは、いくつかのアノテーションから新しいクラスに適応しつつ、ベースクラス上での強力なパフォーマンスを維持することを目的としている。
本稿では,エントロピーベースの少数ショット正規化器を用いて階層型プロトタイプを学習する統一フレームワークであるHOP3Dを提案する。
ScanNet200とScanNet++の実験では、HOP3Dは一貫して最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-03-20T09:23:34Z) - SCOPE: Scene-Contextualized Incremental Few-Shot 3D Segmentation [51.48871964840347]
SCOPE (Scene-conised Prototype Enrichment) は、プラグ&プレイの背景誘導型プロトタイプエンリッチメントフレームワークである。
プロトタイプベースの3Dセグメンテーション手法と統合されている。
新規クラスのIoUを6.98%、IoUを3.61%、IoUを2.25%、IoUを1.70%向上させる。
論文 参考訳(メタデータ) (2026-03-06T18:59:36Z) - Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language Model [25.666715057529935]
汎用的な小ショットの3Dポイントクラウドセグメンテーション(GFS-PCS)は、ベースクラスセグメンテーションを維持しながら、サポートサンプルがほとんどない新しいクラスにモデルを適応させる。
GFS-PCS フレームワークを導入し,高密度だがノイズの多い擬似ラベルを高精度かつスパースなサンプルで合成し,両者の強度を最大化する。
論文 参考訳(メタデータ) (2025-03-20T16:10:33Z) - Bayesian Self-Training for Semi-Supervised 3D Segmentation [59.544558398992386]
3Dセグメンテーションはコンピュータビジョンの中核的な問題である。
完全に教師されたトレーニングを採用するために、3Dポイントクラウドを密にラベル付けすることは、労働集約的で高価です。
半教師付きトレーニングは、ラベル付きデータの小さなセットのみを付与し、より大きなラベル付きデータセットを伴って、より実用的な代替手段を提供する。
論文 参考訳(メタデータ) (2024-09-12T14:54:31Z) - 3D Annotation-Free Learning by Distilling 2D Open-Vocabulary Segmentation Models for Autonomous Driving [17.42913935045091]
2D textbf Open-textbfVocabulary セグメンテーションモデルを用いた新しい3D textbf Annotation-textbfFree フレームワーク AFOV を提案する。
第一段階では、2次元オープン語彙モデルの高品質テキストと画像の特徴を革新的に統合し、TMP(Tri-Modal contrastive Pre-training)を提案する。
第2段階では、点雲と画像の間の空間マッピングを利用して擬似ラベルを生成し、交差を可能にする。
論文 参考訳(メタデータ) (2024-05-24T07:18:09Z) - You Only Need One Thing One Click: Self-Training for Weakly Supervised
3D Scene Understanding [107.06117227661204]
私たちはOne Thing One Click''を提案する。つまり、アノテーションはオブジェクトごとに1つのポイントをラベル付けするだけです。
グラフ伝搬モジュールによって促進されるトレーニングとラベル伝搬を反復的に行う。
我々のモデルは、ポイントクラスタリング戦略を備えた3Dインスタンスセグメンテーションと互換性がある。
論文 参考訳(メタデータ) (2023-03-26T13:57:00Z) - Exploiting Unlabelled Photos for Stronger Fine-Grained SBIR [103.51937218213774]
本稿では,先行技術の11%をオーバーシュートする強力なベースラインを提示することにより,微細なスケッチベース画像検索(FG-SBIR)の文献化を推し進める。
本稿では,写真/スケッチインスタンス間の分離を明示的に実施する標準的な三重項損失の簡単な修正を提案する。
i) スケッチ間でのモダル内トリプルトロスを利用して、同じインスタンスのスケッチを他のインスタンスに近づけます。
論文 参考訳(メタデータ) (2023-03-24T03:34:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。