論文の概要: SILICA: Repurposing Diffusion Priors for Joint Glass Segmentation and Depth Estimation
- arxiv url: http://arxiv.org/abs/2607.24249v1
- Date: Mon, 27 Jul 2026 10:38:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.384896
- Title: SILICA: Repurposing Diffusion Priors for Joint Glass Segmentation and Depth Estimation
- Title(参考訳): SILICA: ガラス接合部の拡散前処理と深さ推定
- Authors: Tarun R, Anuj Verma, Laksh Nanwani, Sourav Garg, K. Madhava Krishna,
- Abstract要約: 標準的な深度センサーは、透明な表面で体系的に失敗し、破損した3Dマップとナビゲーションハザードを生成する。
SILICAは、テキストと画像の拡散モデルを利用して、ガラスのセグメンテーションとガラスの認識深度を共同で予測する統合パイプラインである。
SILICAは、多様な、目に見えない環境にまたがる顕著なゼロショット転送を実現し、最先端のモデルを約20%上回っている。
- 参考スコア(独自算出の注目度): 11.131505915750013
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Standard depth sensors systematically fail on transparent surfaces, creating corrupted 3D maps and severe navigation hazards. While specialized hardware sensors can detect glass, they lack modularity and have extensive hardware dependencies. Consequently, learning-based monocular depth estimation has emerged as a compelling alternative. However, domain-specific glass-aware monocular depth estimators struggle with unfamiliar indoor layouts; restricted by the severe scarcity of real-world glass depth annotations, they fail to generalize zero-shot to new settings. This motivates us to explore whether the extensive priors of text-to-image diffusion models can enable generalizable perception of transparent surfaces. We introduce SILICA, a unified pipeline leveraging these priors to jointly predict glass segmentation and glass-aware depth. This mutual information exchange establishes a robust spatial hierarchy, entirely eliminating the need for paired real-world glass depth annotations. Subsequently, we use the predicted segmentation mask to explicitly filter incorrect glass depth points from standard sensors, recovering accurate metric glass depth for downstream 3D mapping and autonomous collision avoidance. Supported by our novel Mirage 18k dataset, extensive experiments demonstrate that SILICA achieves remarkable zero-shot transfer across diverse, unseen environments, outperforming state-of-the-art models by almost 20% and setting a new benchmark for transparent surface perception.
- Abstract(参考訳): 標準的な深度センサーは、透明な表面で体系的に故障し、破損した3Dマップと深刻なナビゲーションハザードを生成する。
特殊なハードウェアセンサーはガラスを検出することができるが、モジュラリティが欠如し、ハードウェア依存が広い。
その結果、学習に基づく単眼深度推定が魅力的な代替手段として浮上した。
しかし、ドメイン固有のガラスを意識した単眼深度推定器は、実際のガラス深度アノテーションの不足によって制限され、ゼロショットを新しい設定に一般化することができず、不慣れな屋内配置に苦しむ。
このことは、テキストと画像の拡散モデルの広範な先行が、透明表面の一般化可能な認識を可能にするかどうかを探求する動機となる。
SILICAは,ガラスのセグメンテーションとガラス認識深度を協調的に予測するために,これらの先行情報を活用する統一パイプラインである。
この相互情報交換は堅牢な空間階層を確立し、ペア化された現実世界のガラス深度アノテーションの必要性を完全に排除する。
その後、予測されたセグメンテーションマスクを用いて、標準センサーから不正確なガラス深度を明示的にフィルタリングし、下流3次元マッピングと自律衝突回避のための正確な計量ガラス深度を復元する。
われわれの新しいMirage 18kデータセットによって支援され、SILICAは多様な、目に見えない環境をまたがる顕著なゼロショット転送を実現し、最先端のモデルを約20%上回り、透明な表面知覚のための新しいベンチマークを設定できることを示した。
関連論文リスト
- UniV2D: Bridging Visual Restoration and Semantic Perception for Underwater Salient Object Detection [71.83097731030254]
視覚的回復と有能な物体検出を協調的に最適化するUnified Vision-to-Detection Network (UniV2D)を提案する。
UniV2Dは、セマンティック駆動学習パラダイムを導入している。
定量評価と定性評価の両方において最先端の手法を著しく上回る。
論文 参考訳(メタデータ) (2026-05-08T02:31:45Z) - Enhancing Glass Surface Reconstruction via Depth Prior for Robot Navigation [3.49604158786247]
本研究では,奥行き基礎モデルを構造的先行として活用する学習自由フレームワークを提案する。
ガラス領域に対して幾何学的に導出された基底真理を持つ新しいRGB-DデータセットであるtiGlassReconについても紹介する。
論文 参考訳(メタデータ) (2026-04-20T14:35:31Z) - Decompositional Neural Scene Reconstruction with Generative Diffusion Prior [64.71091831762214]
完全な形状と詳細なテクスチャを持つ3次元シーンの分解的再構成は、下流の応用に興味深い。
近年のアプローチでは、この問題に対処するために意味的あるいは幾何学的正則化が取り入れられているが、制約の少ない領域では著しく劣化している。
本稿では,SDS(Score Distillation Sampling)の形で拡散先行値を用いたDP-Reconを提案し,新しい視点下で個々の物体の神経表現を最適化する。
論文 参考訳(メタデータ) (2025-03-19T02:11:31Z) - Depth-aware Volume Attention for Texture-less Stereo Matching [67.46404479356896]
実用的な屋外シナリオにおけるテクスチャ劣化に対処する軽量なボリューム改善手法を提案する。
画像テクスチャの相対的階層を抽出し,地中深度マップによって教師される深度体積を導入する。
局所的な微細構造と文脈は、体積凝集時のあいまいさと冗長性を緩和するために強調される。
論文 参考訳(メタデータ) (2024-02-14T04:07:44Z) - Glass Segmentation with Multi Scales and Primary Prediction Guiding [2.66512000865131]
ガラスのような物体は、日々の生活の中でどこにでも見えます。
本稿では,FineRescaling and Merging Module (FRM) から構成されるMGNetを提案する。
高信頼セグメンテーションマップを作成するために,不確実性を考慮した新たな損失関数を用いてモデルを監督する。
論文 参考訳(メタデータ) (2024-02-13T16:14:32Z) - MonoTDP: Twin Depth Perception for Monocular 3D Object Detection in
Adverse Scenes [49.21187418886508]
本論文は,モノTDP(MonoTDP)と呼ばれる悪シーンにおける2つの深度を知覚するモノクル3次元検出モデルを提案する。
まず、制御不能な気象条件を扱うモデルを支援するための適応学習戦略を導入し、様々な劣化要因による劣化を著しく抑制する。
そこで本研究では, シーン深度と物体深度を同時に推定する新たな2つの深度認識モジュールを提案する。
論文 参考訳(メタデータ) (2023-05-18T13:42:02Z) - On the Importance of Accurate Geometry Data for Dense 3D Vision Tasks [61.74608497496841]
不正確または破損したデータのトレーニングは、モデルバイアスとハマーズ一般化能力を誘導する。
本稿では,深度推定と再構成における高密度3次元視覚課題に対するセンサ誤差の影響について検討する。
論文 参考訳(メタデータ) (2023-03-26T22:32:44Z) - Leveraging RGB-D Data with Cross-Modal Context Mining for Glass Surface Detection [47.87834602551456]
ガラスの表面は、現代の建物が多くのガラスパネルを使用する傾向にあるため、ますます広くなっている。
これは、ロボット、自動運転車、ドローンなどの自律システムの運用に重大な課題をもたらす。
RGBと深度情報を組み合わせた新しいガラス表面検出フレームワークを提案する。
論文 参考訳(メタデータ) (2022-06-22T17:56:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。