論文の概要: FAST3DIS: Feed-forward Anchored Scene Transformer for 3D Instance Segmentation
- arxiv url: http://arxiv.org/abs/2603.25993v1
- Date: Fri, 27 Mar 2026 00:45:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-30 21:49:48.318839
- Title: FAST3DIS: Feed-forward Anchored Scene Transformer for 3D Instance Segmentation
- Title(参考訳): FAST3DIS:3次元インスタンスセグメンテーションのためのフィードフォワードアンコール変換器
- Abstract要約: FAST3DISは、ホット後のクラスタリングを効果的にバイパスするエンドツーエンドのアプローチである。
本稿では,基礎的な奥行きバックボーン上に構築された3Dアンコール型クエリベースのTransformerアーキテクチャを提案する。
複雑な屋内3次元データセットを用いた実験により,本手法が競合セグメンテーション精度を実現することを示す。
- 参考スコア(独自算出の注目度): 15.271467111162714
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While recent feed-forward 3D reconstruction models provide a strong geometric foundation for scene understanding, extending them to 3D instance segmentation typically relies on a disjointed "lift-and-cluster" paradigm. Grouping dense pixel-wise embeddings via non-differentiable clustering scales poorly with the number of views and disconnects representation learning from the final segmentation objective. In this paper, we present a Feed-forward Anchored Scene Transformer for 3D Instance Segmentation (FAST3DIS), an end-to-end approach that effectively bypasses post-hoc clustering. We introduce a 3D-anchored, query-based Transformer architecture built upon a foundational depth backbone, adapted efficiently to learn instance-specific semantics while retaining its zero-shot geometric priors. We formulate a learned 3D anchor generator coupled with an anchor-sampling cross-attention mechanism for view-consistent 3D instance segmentation. By projecting 3D object queries directly into multi-view feature maps, our method samples context efficiently. Furthermore, we introduce a dual-level regularization strategy, that couples multi-view contrastive learning with a dynamically scheduled spatial overlap penalty to explicitly prevent query collisions and ensure precise instance boundaries. Experiments on complex indoor 3D datasets demonstrate that our approach achieves competitive segmentation accuracy with significantly improved memory scalability and inference speed over state-of-the-art clustering-based methods.
- Abstract(参考訳): 最近のフィードフォワード3D再構成モデルは、シーン理解のための強力な幾何学的基盤を提供するが、それらを3Dインスタンスセグメンテーションに拡張することは、通常、分離された「リフト・アンド・クラスタ」パラダイムに依存している。
非微分可能なクラスタリングによる高密度画素の埋め込みは、最終的なセグメンテーション目標からの表現学習の回数や切り離しの数に劣る。
本稿では,ポストホッククラスタリングを効果的に回避するエンドツーエンドアプローチであるFAST3DIS(Feed-forward Anchored Scene Transformer for 3D Instance Segmentation)を提案する。
基本深度バックボーン上に構築された3Dアンコール型クエリベースのトランスフォーマーアーキテクチャを導入し,そのゼロショット幾何学的先行性を維持しつつ,インスタンス固有のセマンティクスを効率的に学習する。
学習した3Dアンカージェネレータと、ビュー一貫性を持つ3Dインスタンスセグメンテーションのためのアンカーサンプリング・クロスアテンション機構を結合する。
3Dオブジェクトクエリを直接マルチビュー機能マップに投影することで,メソッドサンプルのコンテキストを効率的に表現する。
さらに、マルチビューコントラスト学習と動的にスケジュールされた空間重なり合うペナルティを結合して、クエリの衝突を明示的に防止し、正確なインスタンス境界を確保するデュアルレベル正規化戦略を導入する。
複雑な屋内3Dデータセットを用いた実験により,我々の手法は,最先端クラスタリング法よりもメモリスケーラビリティと推論速度を大幅に向上し,競合セグメンテーションの精度が向上することを示した。
関連論文リスト
- Consistent Scene Understanding in 3D Gaussian Splatting via Multi-Cue Mask Refinement [13.986963122264633]
本稿では,3次元ガウス散乱(3DGS)特徴場の最適化を導くために,一貫した2次元マスクを生成する新しいフレームワークを提案する。
視点特異的セグメントをコヒーレントな3Dプリミティブに変換することで、安定した3Dインスタンスセグメント化と効果的な下流編集作業が可能になる。
論文 参考訳(メタデータ) (2026-07-02T05:00:38Z) - SCOPE: Scale-Consistent One-Pass Estimation of 3D Geometry [69.89196162649091]
SCOPE (Scale-Consistent One-Pass Estimation of 3D Geometry) は、拡張された単眼ビデオシーケンスから3次元幾何学を推定するための新しいアプローチである。
提案手法では,アフィン不変な3次元点マップを全列に共通パラメータで生成し,一貫したスケール不変表現を実現する。
論文 参考訳(メタデータ) (2026-06-19T10:23:25Z) - GVC-Seg: Training-Free 3D Instance Segmentation via Geometric Visual Correspondence [50.10864740041483]
幾何学的視覚対応(GVC-Seg)による学習不要な3Dインスタンスセグメンテーション手法を提案する。
GVC-Segは3次元幾何学的手がかりと2次元視覚的手がかりの対応を利用して、信頼性バイアスを緩和する。
提案手法は,いくつかの挑戦的ベンチマークにおいて最先端の性能を実現するとともに,オープン語彙セマンティックセマンティックセマンティックスセグメンテーション設定に強い可能性を示す。
論文 参考訳(メタデータ) (2026-06-06T07:09:15Z) - Hierarchical Image-Guided 3D Point Cloud Segmentation in Industrial Scenes via Multi-View Bayesian Fusion [4.679314646805623]
3Dセグメンテーションは、高密度なレイアウトとマルチスケールオブジェクトを持つ複雑なシーンを理解するために重要である。
既存の3Dポイントベースの手法はコストのかかるアノテーションを必要とするが、画像誘導方式はビュー間のセマンティックな不整合に悩まされることが多い。
本稿では,階層的な画像誘導型3次元セグメンテーションフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-07T15:15:52Z) - IGGT: Instance-Grounded Geometry Transformer for Semantic 3D Reconstruction [82.53307702809606]
人間は自然に3次元世界の幾何学的構造と意味的内容を中間次元として知覚する。
本稿では,空間再構成とインスタンスレベルの文脈理解の両面での知識を統合するために,IGGT (InstanceGrounded Geometry Transformer) を提案する。
論文 参考訳(メタデータ) (2025-10-26T14:57:44Z) - Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge [45.19482892758984]
Affordance segmentationは、3Dオブジェクトを機能的に異なる部分にパースすることを目的としている。
我々は,3次元エンコーダを昇降した2次元意味論と整合させ,再現,親和性,多様性を共同で最適化し,意味的に整理された表現を得るための事前学習戦略であるCross-Modal Affinity Transfer (CMAT)を導入する。
さらに,マルチモーダルプロンプトとCMAT対応機能を統合し,高精度かつ迅速なセグメンテーションマップを生成するCAST (Cross-modal Affordance Transformer) を設計する。
論文 参考訳(メタデータ) (2025-10-09T15:01:26Z) - T-3DGS: Removing Transient Objects for 3D Scene Reconstruction [83.05271859398779]
映像シーケンスにおける過渡的オブジェクトは、3Dシーン再構成の品質を著しく低下させる可能性がある。
我々は,ガウススプラッティングを用いた3次元再構成において,過渡的障害を頑健に除去する新しいフレームワークT-3DGSを提案する。
論文 参考訳(メタデータ) (2024-11-29T07:45:24Z) - AutoInst: Automatic Instance-Based Segmentation of LiDAR 3D Scans [41.17467024268349]
3D環境を理解するには、きめ細かい風景を理解する必要がある。
教師なしの方法で3次元シーンのインスタンスセグメンテーションを予測することを提案する。
平均精度は13.3%,F1スコアは9.1%向上した。
論文 参考訳(メタデータ) (2024-03-24T22:53:16Z) - SAI3D: Segment Any Instance in 3D Scenes [68.57002591841034]
新規なゼロショット3Dインスタンスセグメンテーション手法であるSAI3Dを紹介する。
我々の手法は3Dシーンを幾何学的プリミティブに分割し、段階的に3Dインスタンスセグメンテーションにマージする。
ScanNet、Matterport3D、さらに難しいScanNet++データセットに関する実証的な評価は、我々のアプローチの優位性を示している。
論文 参考訳(メタデータ) (2023-12-17T09:05:47Z) - PointInst3D: Segmenting 3D Instances by Points [136.7261709896713]
本稿では,ポイント単位の予測方式で機能する,完全畳み込み型3Dポイントクラウドインスタンスセグメンテーション手法を提案する。
その成功の鍵は、各サンプルポイントに適切なターゲットを割り当てることにある。
提案手法はScanNetとS3DISのベンチマークで有望な結果が得られる。
論文 参考訳(メタデータ) (2022-04-25T02:41:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。