論文の概要: Privacy-Preserving Depth-Only Open-Vocabulary 3D Semantic Segmentation Via Uncertainty-Guided Test-Time Optimization
- arxiv url: http://arxiv.org/abs/2607.00978v1
- Date: Wed, 01 Jul 2026 14:12:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.931373
- Title: Privacy-Preserving Depth-Only Open-Vocabulary 3D Semantic Segmentation Via Uncertainty-Guided Test-Time Optimization
- Title(参考訳): プライバシー保護型オープン語彙3次元セマンティックセグメンテーション : 不確実性ガイドによるテスト時間最適化
- Authors: Xuying Huang, Sicong Pan, Maren Bennewitz,
- Abstract要約: 現実の屋内環境に3Dシーン理解システムを展開するためには,プライバシ保護の認識が不可欠である。
深度のみのオープンな3次元セマンティックセマンティックセグメンテーションのための不確実性誘導テスト時間最適化フレームワークUTTOを提案する。
- 参考スコア(独自算出の注目度): 7.3244595780442125
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Privacy-preserving perception is a critical requirement for deploying 3D scene understanding systems in real-world indoor environments, yet it remains underexplored in open-vocabulary 3D semantic segmentation. Existing methods typically rely on obtaining rich semantic cues from RGB images, which may expose privacy-sensitive visual information. Depth-only 3D geometry provides a privacy-preserving alternative, but the absence of appearance-based semantic cues makes open-vocabulary predictions highly uncertain and less reliable. Under this setting, we propose to convert uncertainty into a guidance signal to identify unreliable semantic responses and use semantic priors from foundation models to regularize their refinement. We present UTTO, an uncertainty-guided test-time optimization framework for depth-only open-vocabulary 3D semantic segmentation. Without additional training, experiments on ScanNet20, ScanNet40, and ScanNet200 demonstrate that UTTO consistently improves depth-only open-vocabulary 3D segmentation and outperforms representative baselines under privacy-preserving conditions.
- Abstract(参考訳): プライバシー保護の認識は、現実世界の屋内環境に3Dシーン理解システムを展開する上で重要な要件であるが、オープンな語彙による3Dセマンティックセマンティックセグメンテーションでは未探索である。
既存の方法は通常、プライバシーに敏感な視覚情報を公開するRGBイメージからリッチなセマンティックな手がかりを取得することに依存している。
深さのみの3Dジオメトリは、プライバシーを守る代替手段を提供するが、外観に基づくセマンティックキューがないため、オープン語彙予測は極めて不確実で信頼性が低い。
そこで本研究では,不確実性をガイダンス信号に変換し,信頼できないセマンティック応答を識別し,基礎モデルからのセマンティックプライドを用いて改善を調整することを提案する。
深度のみのオープンな3次元セマンティックセマンティックセグメンテーションのための不確実性誘導テスト時間最適化フレームワークUTTOを提案する。
追加のトレーニングなしで、ScanNet20、ScanNet40、ScanNet200の実験では、UTTOは深さのみのオープンな3Dセグメンテーションを改善し、プライバシー保護条件下で代表的ベースラインを上回っている。
関連論文リスト
- LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding [9.377694035678948]
本稿では,Sparse Voxel Rasterization (SVRaster) を構造的,不随伴な幾何学表現として活用する新しいフレームワークを提案する。
これにより、決定論的で信頼性に配慮した特徴登録プロセスが可能となり、3DGSに共通する意味的出血アーティファクトが抑制される。
提案手法は,Open Vocabulary 3D Object Retrieval と Point Cloud Understanding ベンチマークの最先端性能を実現する。
論文 参考訳(メタデータ) (2026-04-01T20:48:06Z) - dinov3.seg: Open-Vocabulary Semantic Segmentation with DINOv3 [36.6036728217708]
Open-Vocabulary Semantics (OVSS)は、テキスト定義カテゴリのオープンセットからピクセルレベルのラベルを割り当て、推論時に見えないクラスに信頼性の高い一般化を要求する。
我々は dinov3.seg を導入し、 dinov3.txt を OVSS 専用のフレームワークに拡張した。
まず、このバックボーンに合わせたタスク固有のアーキテクチャを設計し、従来のオープン語彙セグメンテーション作業から確立した設計原則を体系的に適用する。
第2に、VTベースのエンコーダのグローバルトークンとローカルパッチレベルのビジュアル特徴の両方に整合したテキスト埋め込みを共同で活用する。
論文 参考訳(メタデータ) (2026-03-19T23:57:28Z) - SUG-Occ: An Explicit Semantics and Uncertainty Guided Sparse Learning Framework for Real-Time 3D Occupancy Prediction [5.730573889498275]
SuG-Occは明示的なセマンティックスと不確実性ガイドによるスパース学習を可能とした3D職業予測フレームワークである。
まず、ビュー変換時の自由空間からの射影を抑えるために、意味的および不確実性事前を利用する。
次に、幾何整合性を高めるために明示的な符号なし距離符号化を用い、構造的に一貫したスパース3D表現を生成する。
論文 参考訳(メタデータ) (2026-01-16T16:07:38Z) - Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene Understanding [58.38294408121273]
CUA-O3Dと呼ばれるオープン語彙3次元シーン理解のためのクロスモーダル・不確実性認識アグリゲーションを提案する。
提案手法は,(1)空間認識型視覚基盤モデルの幾何学的知識とともに,VLMのセマンティックな先入観を取り入れること,(2)モデル固有の不確かさを捉えるために,新しい決定論的不確実性推定を用いること,の2つの課題に対処する。
論文 参考訳(メタデータ) (2025-03-20T20:58:48Z) - GOI: Find 3D Gaussians of Interest with an Optimizable Open-vocabulary Semantic-space Hyperplane [53.388937705785025]
3Dオープンボキャブラリのシーン理解は、拡張現実とロボット応用の推進に不可欠である。
GOIは2次元視覚言語基礎モデルから3次元ガウススプラッティング(3DGS)に意味的特徴を統合するフレームワークである。
提案手法では,特徴空間内の超平面分割として特徴選択処理を扱い,クエリに関連性の高い特徴のみを保持する。
論文 参考訳(メタデータ) (2024-05-27T18:57:18Z) - Weakly Supervised 3D Open-vocabulary Segmentation [104.07740741126119]
学習済み基礎モデルCLIPとDINOを弱教師付きで活用することで,3次元オープン語彙セグメンテーションの課題に取り組む。
我々はCLIPとDINOのオープン語彙多様知識とオブジェクト推論能力をニューラルラディアンス場(NeRF)に蒸留する。
提案手法の特筆すべき点は,基礎モデルや蒸留プロセスに手動セグメンテーションアノテーションを必要としない点である。
論文 参考訳(メタデータ) (2023-05-23T14:16:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。