論文の概要: GeomPrompt: Geometric Prompt Learning for RGB-D Semantic Segmentation Under Missing and Degraded Depth
- arxiv url: http://arxiv.org/abs/2604.11585v1
- Date: Mon, 13 Apr 2026 15:01:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.635856
- Title: GeomPrompt: Geometric Prompt Learning for RGB-D Semantic Segmentation Under Missing and Degraded Depth
- Title(参考訳): GeomPrompt:RGB-Dセマンティックセマンティックセグメンテーションのための幾何学的プロンプト学習
- Authors: Krishna Jaganathan, Patricio Vela,
- Abstract要約: GeomPromptは、RGBだけでタスク駆動の幾何学的プロンプトを合成する軽量適応モジュールである。
GeomPrompt-Recoveryは、凍結セグメンタに関連する第4のチャネル補正を予測することにより、劣化深さを補正する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal perception systems for robotics and embodied AI often assume reliable RGB-D sensing, but in practice, depth is frequently missing, noisy, or corrupted. We thus present GeomPrompt, a lightweight cross-modal adaptation module that synthesizes a task-driven geometric prompt from RGB alone for the fourth channel of a frozen RGB-D semantic segmentation model, without depth supervision. We further introduce GeomPrompt-Recovery, an adaptation module that compensates for degraded depth by predicting the fourth channel correction relevant for the frozen segmenter. Both modules are trained solely with downstream segmentation supervision, enabling recovery of the geometric prior useful for segmentation, rather than estimating depth signals. On SUN RGB-D, GeomPrompt improves over RGB-only inference by +6.1 mIoU on DFormer and +3.0 mIoU on GeminiFusion, while remaining competitive with strong monocular depth estimators. For degraded depth, GeomPrompt-Recovery consistently improves robustness, yielding gains up to +3.6 mIoU under severe depth corruptions. GeomPrompt is also substantially more efficient than monocular depth baselines, reaching 7.8 ms latency versus 38.3 ms and 71.9 ms. These results suggest that task-driven geometric prompting is an efficient mechanism for cross-modal compensation under missing and degraded depth inputs in RGB-D perception.
- Abstract(参考訳): ロボット工学と組み込みAIのためのマルチモーダル認識システムは、しばしば信頼できるRGB-Dセンシングを前提としているが、実際には、深さが欠落したり、うるさいり、腐敗したりすることが多い。
そこで我々は,RGBのみからタスク駆動幾何学的プロンプトを合成する軽量なクロスモーダル適応モジュールGeomPromptを,凍結したRGB-Dセマンティックセマンティックセグメンテーションモデルの第4チャンネルとして提案する。
さらに,凍ったセグメンタに関係のある第4のチャネル補正を予測することにより,劣化深さを補償する適応モジュールGeomPrompt-Recoveryを導入する。
どちらのモジュールも下流のセグメンテーションの監督でのみ訓練されており、深度信号を推定するのではなく、セグメンテーションに有用な幾何的事前の回復を可能にする。
SUN RGB-D では、GeomPrompt は DFormer では +6.1 mIoU 、GeminiFusion では +3.0 mIoU で RGB のみの推論よりも改善されている。
劣化した深度では、GeomPrompt-Recoveryは頑丈さを常に改善し、深刻な深度破壊の下では+3.6 mIoUまで上昇する。
GeomPromptは単分子深度ベースラインよりもはるかに効率的であり、38.3msと71.9msに対して7.8msのレイテンシに達した。
関連論文リスト
- PDDM: Pseudo Depth Diffusion Model for RGB-PD Semantic Segmentation Based in Complex Indoor Scenes [6.698379291727345]
高精度深度推定アルゴリズムからの擬似深さ(PD)は、RGB-Dセンサやアライメントプロセスへの依存をなくすことができる。
PDはセマンティックセグメンテーションにおいて有意な潜在性を示した。
PDは複数の擬似深度写像を単一のモードに集約する。
PDは最先端のパフォーマンスを達成し、NYUv2では+6.98 mIoU、SUNRGB-Dでは+2.11 mIoUに勝る。
論文 参考訳(メタデータ) (2025-03-24T07:05:31Z) - Depth Matters: Exploring Deep Interactions of RGB-D for Semantic Segmentation in Traffic Scenes [11.446541235218396]
本研究では、深度の有効性を探求するために、新しい学習可能な深度相互作用ピラミッド変換器(DiPFormer)を提案する。
DiPFormerはKITTI(KITTI道路で97.57%Fスコア、KITTI-360で68.74%mIoU)とCityscapesデータセットで最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2024-09-12T12:39:34Z) - Symmetric Uncertainty-Aware Feature Transmission for Depth
Super-Resolution [52.582632746409665]
カラー誘導DSRのためのSymmetric Uncertainty-aware Feature Transmission (SUFT)を提案する。
本手法は最先端の手法と比較して優れた性能を実現する。
論文 参考訳(メタデータ) (2023-06-01T06:35:59Z) - RGB-D Grasp Detection via Depth Guided Learning with Cross-modal
Attention [14.790193023912973]
本稿では,DGCAN(Depth Guided Cross-modal Attention Network)を用いた新しい学習手法を提案する。
深度チャネルに記録された幾何情報をよりよく活用するために、全6次元矩形表現を専用に考慮して採用する。
余分な掴み深度の予測は特徴学習を大幅に強化し、より正確な結果をもたらす。
論文 参考訳(メタデータ) (2023-02-28T02:41:27Z) - Dual Swin-Transformer based Mutual Interactive Network for RGB-D Salient
Object Detection [67.33924278729903]
本研究では,Dual Swin-Transformerを用いたMutual Interactive Networkを提案する。
視覚入力における長距離依存をモデル化するために,RGBと奥行きモードの両方の機能抽出器としてSwin-Transformerを採用している。
5つの標準RGB-D SODベンチマークデータセットに関する総合的な実験は、提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2022-06-07T08:35:41Z) - Cross-modality Discrepant Interaction Network for RGB-D Salient Object
Detection [78.47767202232298]
本稿では,RGB-D SODのためのクロスモダリティ離散相互作用ネットワーク(CDINet)を提案する。
2つのコンポーネントは、効果的な相互モダリティ相互作用を実装するように設計されている。
我々のネットワークは、定量的にも質的にも15ドルの最先端の手法より優れています。
論文 参考訳(メタデータ) (2021-08-04T11:24:42Z) - Deep RGB-D Saliency Detection with Depth-Sensitive Attention and
Automatic Multi-Modal Fusion [15.033234579900657]
RGB-Dサラエントオブジェクト検出(SOD)は通常、2つのモダリティ、すなわちRGBと深さの分類または回帰の問題として定式化される。
本稿では,salient objectsの奥行き方向幾何学的前置を用いた深さ感応型rgb特徴モデリング手法を提案する。
7つの標準ベンチマークに関する実験は、最先端技術に対する提案手法の有効性を示している。
論文 参考訳(メタデータ) (2021-03-22T13:28:45Z) - Progressively Guided Alternate Refinement Network for RGB-D Salient
Object Detection [63.18846475183332]
我々は,RGB-Dの高次物体検出のための効率的かつコンパクトなディープネットワークを開発することを目指している。
そこで本研究では,改良のための改良ネットワークを提案する。
我々のモデルは、既存の最先端のアプローチよりも大きなマージンで優れています。
論文 参考訳(メタデータ) (2020-08-17T02:55:06Z) - Data-Level Recombination and Lightweight Fusion Scheme for RGB-D Salient
Object Detection [73.31632581915201]
深部特徴抽出に先立って,RGBとD(深部)を融合する新たなデータレベル組換え手法を提案する。
新たに設計された3重ストリームネットワークをこれらの新しい定式化データ上に適用し,RGBとDのチャネルワイドな相補的融合状態を実現する。
論文 参考訳(メタデータ) (2020-08-07T10:13:05Z) - Cross-Modal Weighting Network for RGB-D Salient Object Detection [76.0965123893641]
我々は,RGB-D SODの深度チャネルとRGB-D SODの包括的相互作用を促進するために,新しいクロスモーダルウェイトリング(CMW)戦略を提案する。
具体的には、CMW-L、CMW-M、CMW-Hという3つのRGB-depth相互作用モジュールが、それぞれ低レベル、中級、高レベルのクロスモーダル情報融合を扱うように開発されている。
CMWNetは、7つの人気のあるベンチマークで15の最先端のRGB-D SODメソッドを上回っている。
論文 参考訳(メタデータ) (2020-07-09T16:01:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。