論文の概要: When Depth Hurts: Reliability-Aware Geometry Distillation for Depth-Free RGB-D Salient Object Detection
- arxiv url: http://arxiv.org/abs/2609.03378v1
- Date: Thu, 03 Sep 2026 05:29:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.930899
- Title: When Depth Hurts: Reliability-Aware Geometry Distillation for Depth-Free RGB-D Salient Object Detection
- Title(参考訳): 深度ハルト:深度のないRGB-D塩物検出のための信頼性を考慮した幾何蒸留法
- Abstract要約: 欠落した領域、ぼやけた境界、構造的アーティファクトは多モード核融合を通じて伝播し、RGB-D検出器はRGBのみの検出器よりも精度が低い。
本稿では,RGB-D SODベンチマークのための信頼性を考慮した幾何蒸留フレームワークを提案する。
ReDWeb-Sにおける13.4%のMAE削減を含む、最近のRGB-D SOD法と比較して、36のメトリック・データセットのうち26のベストまたはタイト・ベストな結果を達成する。
- 参考スコア(独自算出の注目度): 39.23633029110609
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Depth can resolve appearance ambiguity in RGB-D salient object detection (SOD), yet sensor depth is not uniformly reliable. Missing regions, blurred boundaries, and structural artifacts can propagate through multimodal fusion and make an RGB-D detector less accurate than its RGB-only counterpart. Existing quality-aware approaches regulate observed depth but remain dependent on the same potentially defective modality. We propose \method, a reliability-aware geometry distillation framework developed for RGB-D SOD benchmarks without using dataset-provided depth during training or inference. A frozen Depth Anything V2 model serves only as a training-time teacher, transferring dense relative geometry, hierarchical spatial attention, and boundary structure to a compact edge-aware geometry branch. Pooled bidirectional interaction aligns geometry with appearance, and a pixel-wise reliability estimator selectively injects geometry that is compatible with the current RGB representation. The teacher is removed after training, leaving an RGB-only inference network. Trained on 2,985 RGB-mask pairs, \method{} achieves the best or tied-best result in 26 of 36 metric-dataset comparisons against ten recent RGB-D SOD methods, including a 13.4\% relative MAE reduction on ReDWeb-S. When retrained on DUTS-TR, it also improves the strongest prior $F$-measure by 4.2\% on PASCAL-S, showing that the distilled geometry transfers beyond a particular sensor or dataset domain. Code will be released upon publication.
- Abstract(参考訳): 深度は、RGB-D Salient Object Detection (SOD)の外観の曖昧さを解消できるが、センサ深度は均一に信頼できない。
欠落した領域、ぼやけた境界、構造的アーティファクトは多モード核融合を通じて伝播し、RGB-D検出器はRGBのみの検出器よりも精度が低い。
既存の品質認識アプローチは、観測された深さを規制するが、潜在的に欠陥のあるモダリティに依存している。
本稿では,RGB-D SODベンチマークのための信頼性を考慮した幾何蒸留フレームワークであるShamethodを提案する。
凍結深度V2モデルは訓練時の教師としてのみ機能し、密接な相対幾何学、階層的な空間的注意、境界構造をコンパクトなエッジ認識幾何学枝に転送する。
ポーリングされた双方向相互作用は幾何学と外観を一致させ、画素単位の信頼性推定器は、現在のRGB表現と互換性のある幾何を選択的に注入する。
教師は訓練後に排除され、RGBのみの推論ネットワークが残る。
2,985対のRGB-maskペアでトレーニングされた \method{} は、ReDWeb-S上の13.4\%のMAE削減を含む、最近のRGB-D SOD法と比較して、36のメトリック・データセットの26の26のベストまたはタイト・ベストを達成している。
DUTS-TRで再訓練すると、PASCAL-Sで4.2\%のF$値が最安値に改善され、蒸留された幾何が特定のセンサーやデータセットドメインを超えて移動することを示す。
コードは出版時に公開される。
関連論文リスト
- GeomPrompt: Geometric Prompt Learning for RGB-D Semantic Segmentation Under Missing and Degraded Depth [0.0]
GeomPromptは、RGBだけでタスク駆動の幾何学的プロンプトを合成する軽量適応モジュールである。
GeomPrompt-Recoveryは、凍結セグメンタに関連する第4のチャネル補正を予測することにより、劣化深さを補正する。
論文 参考訳(メタデータ) (2026-04-13T15:01:22Z) - DepthMatch: Semi-Supervised RGB-D Scene Parsing through Depth-Guided Regularization [43.974708665104565]
本稿では,RGB-Dシーン解析に特化して設計された半教師付き学習フレームワークDepthMatchを紹介する。
本稿では,RGB-D画像対におけるテクスチャと空間的特徴の潜伏関係を明らかにするために,補間パッチ混在拡大法を提案する。
また,従来の複合核融合モジュールを代替する軽量空間先行インジェクタを設計し,不均一な特徴核融合の効率を向上する。
論文 参考訳(メタデータ) (2025-05-26T14:26:31Z) - RGB-based Category-level Object Pose Estimation via Decoupled Metric
Scale Recovery [72.13154206106259]
本研究では、6次元のポーズとサイズ推定を分離し、不完全なスケールが剛性変換に与える影響を緩和するパイプラインを提案する。
具体的には,事前学習した単分子推定器を用いて局所的な幾何学的情報を抽出する。
別個のブランチは、カテゴリレベルの統計に基づいてオブジェクトのメートル法スケールを直接復元するように設計されている。
論文 参考訳(メタデータ) (2023-09-19T02:20:26Z) - Robust RGB-D Fusion for Saliency Detection [13.705088021517568]
本稿では, 層状および三重項空間, 注意機構の利点を生かしたRGB-D融合法を提案する。
5つのベンチマーク・データセットを用いた実験により,提案手法は最先端の核融合法よりも一貫した性能を示した。
論文 参考訳(メタデータ) (2022-08-02T21:23:00Z) - Pyramidal Attention for Saliency Detection [30.554118525502115]
本稿では,RGB画像のみを活用し,RGBから深度を推定し,中間深度特性を利用する。
ピラミッド型アテンション構造を用いて,マルチレベル畳み込み変換器の特徴を抽出し,初期表現の処理を行う。
我々は8つのRGBおよびRGB-Dデータセット上で21と40の最先端SOD法に対する性能を著しく改善したことを報告した。
論文 参考訳(メタデータ) (2022-04-14T06:57:46Z) - Boosting RGB-D Saliency Detection by Leveraging Unlabeled RGB Images [89.81919625224103]
RGB-D Salient Object Detection (SOD) のための深層モデルの訓練は、しばしば多数のラベル付きRGB-D画像を必要とする。
本稿では、ラベルのないRGB画像を活用するために、Dual-Semi RGB-D Salient Object Detection Network (DS-Net)を提案する。
論文 参考訳(メタデータ) (2022-01-01T03:02:27Z) - Data-Level Recombination and Lightweight Fusion Scheme for RGB-D Salient
Object Detection [73.31632581915201]
深部特徴抽出に先立って,RGBとD(深部)を融合する新たなデータレベル組換え手法を提案する。
新たに設計された3重ストリームネットワークをこれらの新しい定式化データ上に適用し,RGBとDのチャネルワイドな相補的融合状態を実現する。
論文 参考訳(メタデータ) (2020-08-07T10:13:05Z) - Depth Quality Aware Salient Object Detection [52.618404186447165]
本稿では,選択的なRGB-D融合を行う前に,従来の2ストリーム構造に意識した新しい深度品質を組み込むことを目的としている。
本手法の主な特徴は,ロークオリティ,ノンコントリビューション,さらには負コントリビューションD領域のRGB-D融合における重要性を低下させることである。
論文 参考訳(メタデータ) (2020-08-07T09:54:39Z) - Bi-directional Cross-Modality Feature Propagation with
Separation-and-Aggregation Gate for RGB-D Semantic Segmentation [59.94819184452694]
深度情報はRGBD画像のセマンティックセグメンテーションにおいて有用であることが証明されている。
既存のほとんどの研究は、深度測定がRGBピクセルと正確で整合していると仮定し、問題をモーダルな特徴融合としてモデル化している。
本稿では,RGB特徴量応答を効果的に再検討するだけでなく,複数の段階を通して正確な深度情報を抽出し,代わりに2つの補正表現を集約する,統一的で効率的なクロスモダリティガイドを提案する。
論文 参考訳(メタデータ) (2020-07-17T18:35:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。