論文の概要: PePESeg3D: Perception Prior Enhances Multi-Scale Segmentation for 3D Gaussian Splatting
- arxiv url: http://arxiv.org/abs/2609.28645v1
- Date: Wed, 23 Sep 2026 18:00:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.467989
- Title: PePESeg3D: Perception Prior Enhances Multi-Scale Segmentation for 3D Gaussian Splatting
- Title(参考訳): PePESeg3D:3次元ガウス平滑化のためのマルチスケールセグメンテーションの事前認識
- Abstract要約: マルチスケールな3次元ガウス分割パイプラインに知覚先行を注入する新しいフレームワークであるPePESeg3Dを提案する。
PePESeg3Dはマルチスケールセグメンテーションとシーン再構成の両方において最先端の性能を達成する。
- 参考スコア(独自算出の注目度): 9.069947789133396
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advancements in 3D Gaussian Splatting (3DGS) have extended its capabilities to multi-scale segmentation. Existing methods reconstruct a scene with Gaussian primitives and learn multi-scale segmentation features separately, which leaves the geometry unaware of semantic structure and the feature learning dependent on incomplete mask supervision. To address these limitations, we present PePESeg3D, a novel framework that injects perception priors into a multi-scale 3D Gaussian segmentation pipeline. To fully exploit perception priors, we integrate them not only into contrastive feature learning but also into the upstream geometry reconstruction. Specifically, PePE Reconstruction incorporates monocular depth and mask constraints to ensure semantically coherent object structures. Building on this aligned geometry, PePE Contrastive Learning leverages dense depth-color cues and view-consistent centroid supervision to compensate for the incompleteness of multi-scale masks obtained from a 2D foundation model. Extensive experiments on the SPIn-NeRF, LERF-Mask, and NVOS benchmarks demonstrate that PePESeg3D achieves state-of-the-art performance in both multi-scale segmentation and scene reconstruction, highlighting the importance of integrating perception priors into both geometry optimization and feature learning for accurate multi-scale 3D segmentation. Our code is available at https://github.com/BeCow5X5/PePESeg3D.
- Abstract(参考訳): 3Dガウススプラッティング(3DGS)の最近の進歩は、その能力をマルチスケールセグメンテーションにまで拡張した。
既存の手法はガウス原始体を用いてシーンを再構築し、複数の大規模セグメンテーション特徴を別々に学習する。
これらの制約に対処するため,マルチスケールな3次元ガウス分割パイプラインに知覚先行を注入する新しいフレームワークであるPePESeg3Dを提案する。
認識の先行性をフル活用するために、コントラスト的特徴学習だけでなく、上流の幾何再構成にも統合する。
特に、PePEレコンストラクションは、意味的コヒーレントなオブジェクト構造を保証するために、単眼の深さとマスクの制約を取り入れている。
この整合した幾何学に基づいて、PePE Contrastive Learningは2次元基礎モデルから得られたマルチスケールマスクの不完全性を補うために、濃密な奥行き色のキューとビュー一貫性のセントロイド監督を利用する。
SPIn-NeRF, LERF-Mask, NVOSベンチマークの広範な実験により, PePESeg3Dは多スケールセグメンテーションとシーン再構成の両方において最先端の性能を達成し, 正確なマルチスケール3次元セグメンテーションのための幾何最適化と特徴学習の両方に知覚事前を統合することの重要性を強調した。
私たちのコードはhttps://github.com/BeCow5X5/PePESeg3Dで利用可能です。
関連論文リスト
- Consistent Scene Understanding in 3D Gaussian Splatting via Multi-Cue Mask Refinement [13.986963122264633]
本稿では,3次元ガウス散乱(3DGS)特徴場の最適化を導くために,一貫した2次元マスクを生成する新しいフレームワークを提案する。
視点特異的セグメントをコヒーレントな3Dプリミティブに変換することで、安定した3Dインスタンスセグメント化と効果的な下流編集作業が可能になる。
論文 参考訳(メタデータ) (2026-07-02T05:00:38Z) - Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images [81.94999489820974]
UniSplat (UniSplat) は、未提示のマルチビュー画像から3D表現を学習するためのフィードフォワードフレームワークである。
エンコーダにおける幾何誘導を強化するデュアルマスキング戦略を導入する。
第2に,外見のセマンティックな矛盾を解消する粗大なガウス的スプレイティング戦略を開発する。
第3に、予測された3次元点と意味マップを画像平面に相互に関連付ける、ポーズ条件の補正機構を導入する。
論文 参考訳(メタデータ) (2026-04-12T10:36:18Z) - Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning [10.542346290671114]
明示的な3次元再構成を基礎としたビジュアル・チェーン・オブ・ソート・メカニズムを導入したテクスティングフリーなフレームワークを提案する。
このフレームワークは、3DSRBenchやRel3Dといった主要なベンチマークにおいて、特別な空間モデルや汎用MLLMよりも優れている。
論文 参考訳(メタデータ) (2026-04-08T06:47:55Z) - UniSem: Generalizable Semantic 3D Reconstruction from Sparse Unposed Images [10.080087958100552]
2つのキーコンポーネントによる深度精度とセマンティックな一般化を改善する統合フレームワークUniSemを提案する。
Error-aware Gaussian Dropout (EGD) は冗長性のあるGaussianを抑えることでエラー誘導容量制御を行う。
第2に、2Dセグメンタリフトセマンティクスと、モデル独自の創発的な3DセマンティクスをブレンドするMix-training Curriculum(MTC)を導入する。
論文 参考訳(メタデータ) (2026-03-18T09:26:25Z) - GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models [70.61152292499737]
このギャップは、幾何学的事前の不足から生じるものではなく、訓練パラダイムの誤った調整から生じるものである、と我々は主張する。
既存のアプローチでは、通常、特徴の結合を示唆し、幾何学的な監督なしに下流のタスクを直接最適化する。
本稿では,下流適応前の構造知覚を明示的に活性化する幾何学的事前学習パラダイムであるGAP-MLLMを提案する。
論文 参考訳(メタデータ) (2026-03-17T12:43:48Z) - IGGT: Instance-Grounded Geometry Transformer for Semantic 3D Reconstruction [82.53307702809606]
人間は自然に3次元世界の幾何学的構造と意味的内容を中間次元として知覚する。
本稿では,空間再構成とインスタンスレベルの文脈理解の両面での知識を統合するために,IGGT (InstanceGrounded Geometry Transformer) を提案する。
論文 参考訳(メタデータ) (2025-10-26T14:57:44Z) - SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting [85.87902260102652]
本稿では, 連続3次元ガウシアン・アフラマンス推論の課題について紹介する。
次に,SeqSplatNetを提案する。SqSplatNetは,命令を直接3Dアベイランスマスクのシーケンスにマッピングするエンドツーエンドフレームワークである。
本手法は,1段階のインタラクションから,シーンレベルでの複雑なシーケンシャルなタスクへの可利用性推論を効果的に向上させる。
論文 参考訳(メタデータ) (2025-07-31T17:56:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。