論文の概要: FoundObj: Self-supervised Foundation Models as Rewards for Label-free 3D Object Segmentation
- arxiv url: http://arxiv.org/abs/2605.27178v1
- Date: Tue, 26 May 2026 15:32:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:42.384946
- Title: FoundObj: Self-supervised Foundation Models as Rewards for Label-free 3D Object Segmentation
- Title(参考訳): FoundObj: ラベルのない3Dオブジェクトセグメンテーションのリワードとしての自己教師型ファンデーションモデル
- Authors: Zihui Zhang, Zhixuan Sun, Yafei Yang, Jinxi Li, Jiahao Chen, Bo Yang,
- Abstract要約: 我々は,隣接する幾何学的スーパーポイントを段階的にマージするスーパーポイントベースのオブジェクト発見エージェントを特徴とする新しいフレームワークFoundを提案する。
本手法はゼロショットとロングテールのシナリオにおいて強力な一般化を示し,スケーラブルでラベルのない3Dオブジェクトセグメンテーションの可能性を示している。
- 参考スコア(独自算出の注目度): 16.814652408859025
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We address the challenging task of 3D object segmentation in complex scene point clouds without relying on any scene-level human annotations during training. Existing methods are typically constrained to identifying simple objects, primarily due to insufficient object priors in the learning process. In this paper, we present FoundObj, a novel framework featuring a superpoint-based object discovery agent that incrementally merges suitable neighboring superpoints, guided by our innovative semantic and geometric reward modules. These modules synergistically leverage semantic and geometric priors from self-supervised 2D/3D foundation models, providing complementary feedback to the object discovery agent and enabling robust identification of multi-class objects through reinforcement learning. Extensive experiments on diverse benchmarks demonstrate that our approach consistently outperforms existing baselines. Notably, our method exhibits strong generalization in zero-shot and long-tail scenarios, underscoring its potential for scalable, label-free 3D object segmentation.
- Abstract(参考訳): 複雑なシーンポイントクラウドにおける3次元オブジェクトセグメンテーションの課題に対して、トレーニング中にシーンレベルの人間のアノテーションに頼ることなく対処する。
既存のメソッドは一般的に、学習プロセスにおいて不十分なオブジェクトの事前性のために、単純なオブジェクトを特定することに制約される。
本稿では,我々の革新的なセマンティックおよび幾何学的報酬モジュールによってガイドされた,隣接する最適なスーパーポイントを段階的にマージするスーパーポイントベースのオブジェクト発見エージェントを特徴とする,新しいフレームワークFoundObjを提案する。
これらのモジュールは、自己教師付き2D/3Dファンデーションモデルからのセマンティックおよび幾何学的先行を相乗的に利用し、オブジェクト発見エージェントに補完的なフィードバックを提供し、強化学習を通じて多クラスオブジェクトの堅牢な識別を可能にする。
多様なベンチマークに関する大規模な実験は、我々のアプローチが既存のベースラインを一貫して上回っていることを示している。
特に,ゼロショットとロングテールのシナリオにおいて,拡張性のあるラベルフリーな3Dオブジェクトセグメンテーションの可能性を示す。
関連論文リスト
- EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervision [16.459953869241595]
Evは教師なしの3Dインスタンスセグメンテーションシステムで、合成事前学習データと実世界の点雲の間の幾何学的領域ギャップを橋渡しする。
この問題を解決するためにEvは、(1)オブジェクト候補を動的に洗練し、対象ドメインに先立ってオブジェクトの継続的な適応を可能にするオブジェクト識別モジュール、(2)オブジェクト発見後に部分的なジオメトリを再構築するオブジェクト補完モジュールの2つの革新的なモジュールを統合する。
実世界のデータセットと合成データセットの両方で広範な実験を行い、全てのベースラインに対して優れた3次元オブジェクトセグメンテーション性能を示しながら、最先端の結果を得る。
論文 参考訳(メタデータ) (2026-05-13T08:17:45Z) - Object-X: Learning to Reconstruct Multi-Modal 3D Object Representations [114.57192386025373]
Object-Xは多目的なマルチモーダル3D表現フレームワークである。
リッチなオブジェクトの埋め込みをエンコードして、幾何学的および視覚的再構成に復号することができる。
シーンアライメント、シングルイメージの3Dオブジェクト再構成、ローカライゼーションなど、さまざまなダウンストリームタスクをサポートする。
論文 参考訳(メタデータ) (2025-06-05T09:14:42Z) - GrabS: Generative Embodied Agent for 3D Object Segmentation without Scene Supervision [7.511342491529451]
複雑な点雲における3次元物体のセグメンテーションの難しさについて,人間の3次元シーンのラベルを監督のために必要とせずに検討した。
事前訓練された2D特徴の類似性や3Dポイントをオブジェクトとしてグループ化する動きなどの外部信号に頼ることで、既存の教師なし手法は車のような単純な物体を識別することに限定される。
論文 参考訳(メタデータ) (2025-04-16T04:13:53Z) - IAAO: Interactive Affordance Learning for Articulated Objects in 3D Environments [56.85804719947]
IAAOは知的エージェントのための明示的な3Dモデルを構築するフレームワークで,対話を通して環境内の明瞭な物体の理解を得る。
マスク特徴とビュー一貫性ラベルを多視点画像から抽出し,まず3次元ガウススティング(3DGS)を用いて各オブジェクト状態の階層的特徴とラベルフィールドを構築する。
次に、3Dガウスプリミティブ上でオブジェクトと部分レベルのクエリを実行し、静的および明瞭な要素を識別し、大域的な変換と局所的な調音パラメータをアベイランスとともに推定する。
論文 参考訳(メタデータ) (2025-04-09T12:36:48Z) - SAI3D: Segment Any Instance in 3D Scenes [68.57002591841034]
新規なゼロショット3Dインスタンスセグメンテーション手法であるSAI3Dを紹介する。
我々の手法は3Dシーンを幾何学的プリミティブに分割し、段階的に3Dインスタンスセグメンテーションにマージする。
ScanNet、Matterport3D、さらに難しいScanNet++データセットに関する実証的な評価は、我々のアプローチの優位性を示している。
論文 参考訳(メタデータ) (2023-12-17T09:05:47Z) - Weakly-supervised Contrastive Learning for Unsupervised Object Discovery [52.696041556640516]
ジェネリックな方法でオブジェクトを発見できるため、教師なしのオブジェクト発見は有望である。
画像から高レベルな意味的特徴を抽出する意味誘導型自己教師学習モデルを設計する。
オブジェクト領域のローカライズのための主成分分析(PCA)を導入する。
論文 参考訳(メタデータ) (2023-07-07T04:03:48Z) - OGC: Unsupervised 3D Object Segmentation from Rigid Dynamics of Point
Clouds [4.709764624933227]
OGCと呼ばれる最初の教師なしの手法を提案し、同時に複数の3Dオブジェクトを1つの前方通過で識別する。
提案手法を5つのデータセット上で広範囲に評価し,オブジェクト部分のインスタンスセグメンテーションにおいて優れた性能を示す。
論文 参考訳(メタデータ) (2022-10-10T07:01:08Z) - Unsupervised Learning of 3D Object Categories from Videos in the Wild [75.09720013151247]
オブジェクトインスタンスの大規模なコレクションの複数のビューからモデルを学ぶことに重点を置いています。
再構成を大幅に改善するワープコンディショニングレイ埋め込み(WCR)と呼ばれる新しいニューラルネットワーク設計を提案する。
本評価は,既存のベンチマークを用いた複数の深部単眼再構成ベースラインに対する性能改善を示す。
論文 参考訳(メタデータ) (2021-03-30T17:57:01Z) - A Deep Learning Approach to Object Affordance Segmentation [31.221897360610114]
我々は,ビデオと静的画像の両方において,画素単位の価格ラベルを推定するオートエンコーダを設計する。
本モデルは,ソフトアテンション機構を用いて,オブジェクトラベルやバウンディングボックスの必要性を克服する。
本モデルは,SOR3D-AFF上での強い教師付き手法と比較して,競争力のある結果が得られることを示す。
論文 参考訳(メタデータ) (2020-04-18T15:34:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。