論文の概要: Weakly-Supervised RGB-D Salient Object Detection via SAM-driven Pseudo Annotation and State Space Interaction-based Diffusion
- arxiv url: http://arxiv.org/abs/2607.15041v1
- Date: Thu, 16 Jul 2026 14:21:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.1336
- Title: Weakly-Supervised RGB-D Salient Object Detection via SAM-driven Pseudo Annotation and State Space Interaction-based Diffusion
- Title(参考訳): SAM-driven Pseudo Annotationと状態空間相互作用に基づく拡散による弱改良RGB-Dサルエント物体検出
- Authors: Wenqi Si, Gongyang Li, Shixiang Shi, Weisi Lin,
- Abstract要約: 本稿では,Segment Anything Model (SAM) による擬似アノテーション生成法 (emphSAM-PAG) と状態空間相互作用に基づく条件拡散モデル (emph$S2$Diff) からなる,新しいスクリブル制御RGB-D SOD法を提案する。
提案手法は, 関連するスクリブル制御手法より優れ, 7つのデータセット上での完全教師付き手法と比較して, 競争性能が向上する。
- 参考スコア(独自算出の注目度): 48.141883885276634
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Weakly-supervised RGB-D Salient Object Detection (SOD) is explored to reduce the heavy burden of pixel-level annotations. But scribble annotations lack the structure and details of objects, resulting in inaccurate saliency maps. In this paper, we propose a novel scribble-supervised RGB-D SOD method, consisting of a Segment Anything Model (SAM)-driven pseudo annotation generation method (\emph{SAM-PAG}) and a state space interaction-based conditional diffusion model (\emph{$S^2$Diff}). Specifically, SAM-PAG is tailored to address the issue of sparse supervision information. In SAM-PAG, we adopt the advanced SAM to expand sparse scribbles to dense pixel-level pseudo annotations through the dual-branch structure and the consistency of segmentation masks. In $S^2$Diff, we adopt the diffusion model to iteratively refine the noisy saliency maps with the guidance of conditional information, generating accurate saliency maps. Naturally, the core of our $S^2$Diff lies in the acquisition of conditional features and the denoising of saliency maps. For the former, we employ a cross-modal conditional generation module to interweave cross-modal features through frequency integration and implicit-explicit state space interaction, effectively achieving global conditional features. For the latter, we employ a context injection module to mitigate noise interference and to enhance object information with the conditional context. With the close cooperation of SAM-PAG and $S^2$Diff, our method outperforms relevant scribble-supervised methods and achieves competitive performance compared to fully-supervised methods on seven datasets. The code and results of our method are available at https://github.com/Switch457/WeakS2Diff_SOD.
- Abstract(参考訳): 画素レベルのアノテーションの重荷を軽減するため, 弱教師付きRGB-D Salient Object Detection (SOD) について検討した。
しかし、スクリブルアノテーションはオブジェクトの構造や詳細を欠いているため、不正確なサリエンスマップをもたらす。
本稿では,Segment Anything Model (SAM) による擬似アノテーション生成手法 (\emph{SAM-PAG}) と状態空間の相互作用に基づく条件付き拡散モデル (\emph{$S^2$Diff}) からなる,新しいスクリブル制御RGB-D SOD法を提案する。
特にSAM-PAGは、スパース監視情報の問題に対処するように調整されている。
SAM-PAGでは、二重ブランチ構造とセグメンテーションマスクの整合性を通じてスパース・スクリブルを高密度ピクセルレベルの擬似アノテーションに拡張するために、高度なSAMを採用している。
S^2$Diffでは、拡散モデルを用いて、条件情報の誘導によりノイズの多い塩分マップを反復的に洗練し、正確な塩分マップを生成する。
当然のことながら、S^2$Diffの中核は条件付き特徴の取得と唾液度マップのデノナイズにある。
前者に対しては、周波数積分と暗黙的な状態空間の相互作用を通じて、クロスモーダルな特徴を織り交ぜるクロスモーダル条件生成モジュールを用いて、グローバルな条件特徴を効果的に達成する。
後者では、ノイズ干渉を緩和し、条件付きコンテキストでオブジェクト情報を強化するためにコンテキスト注入モジュールを用いる。
SAM-PAG と $S^2$Diff の密接な協力により,本手法は関連するスクリブル教師付き手法より優れ,7つのデータセットの完全教師付き手法と比較して競争性能が向上する。
我々のメソッドのコードと結果はhttps://github.com/Switch457/WeakS2Diff_SOD.orgで公開されている。
関連論文リスト
- SPDA-SAM: A Self-prompted Depth-Aware Segment Anything Model for Instance Segmentation [12.878470455789945]
本稿では,SPDA-SAM(Self-prompted Depth-Aware SAM)を提案する。
具体的には,画像エンコーダとSAMのマスクデコーダから意味的および空間的プロンプトを抽出するセマンティック・空間自己プロンプトモジュール(SSSPM)を設計する。
また,単分子RGB画像から抽出した特徴と,そこから推定した深度マップを融合した粗大なRGB-D核融合モジュール(C2FFM)を導入する。
論文 参考訳(メタデータ) (2026-02-06T03:01:41Z) - HyPSAM: Hybrid Prompt-driven Segment Anything Model for RGB-Thermal Salient Object Detection [75.406055413928]
RGB-T SODのための新しいプロンプト駆動セグメントモデル(HyPSAM)を提案する。
DFNetは動的畳み込みとマルチブランチデコーディングを使用して、適応的な相互モダリティ相互作用を促進する。
3つの公開データセットの実験により,本手法が最先端の性能を達成することを示す。
論文 参考訳(メタデータ) (2025-09-23T07:32:11Z) - DRRNet: Macro-Micro Feature Fusion and Dual Reverse Refinement for Camouflaged Object Detection [3.4710674889857787]
DRRNetは、これらの問題に対処する"context-fusion-refinement"パイプラインを特徴とする4段階アーキテクチャである。
グローバルカモフラージュパターンをキャプチャするOmniコンテキスト特徴抽出モジュールを提案する。
次に、シーン理解と構造認識の二重表現を形成するモジュールを設計する。
論文 参考訳(メタデータ) (2025-05-14T06:03:53Z) - PolSAM: Polarimetric Scattering Mechanism Informed Segment Anything Model [83.35198885088093]
PolSARデータは、そのリッチで複雑な特徴のために、ユニークな課題を提示する。
複素数値データ、偏光特性、振幅画像などの既存のデータ表現が広く使われている。
PolSARのほとんどの機能抽出ネットワークは小さく、機能を効果的にキャプチャする能力を制限している。
本稿では,ドメイン固有の散乱特性と新規なプロンプト生成戦略を統合したSegment Anything Model (SAM) であるPolarimetric Scattering Mechanism-Informed SAM (PolSAM)を提案する。
論文 参考訳(メタデータ) (2024-12-17T09:59:53Z) - PointSAM: Pointly-Supervised Segment Anything Model for Remote Sensing Images [16.662173255725463]
本稿では,PointSAM という新しいセグメンテーションモデルを提案する。
我々は, WHU, HRSID, NWPU VHR-10を含むRSIデータセットの実験を行った。
その結果,本手法はSAM,SAM2,その他の比較法で直接試験よりも優れていた。
論文 参考訳(メタデータ) (2024-09-20T11:02:18Z) - Learning Spatial-Semantic Features for Robust Video Object Segmentation [108.045326229865]
本稿では,空間意味的特徴と識別的オブジェクトクエリを学習する,ロバストなビデオオブジェクトセグメンテーションフレームワークを提案する。
DAVIS 2017 test (textbf87.8%)、YoutubeVOS 2019 (textbf88.1%)、MOSE val (textbf74.0%)、LVOS test (textbf73.0%)を含むベンチマークデータセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2024-07-10T15:36:00Z) - The devil is in the object boundary: towards annotation-free instance segmentation using Foundation Models [24.53385855664792]
オブジェクト検出とインスタンスのセグメンテーションでは、SAMやDINOのような基礎モデルは満足なパフォーマンスを達成するのに苦労する。
我々は、新しい分類優先発見パイプラインにおいて、$textbfZip$, $textbfZ$ips up CL$textbfip$, SAMを提案する。
Zipは、COCOデータセット上のSAMのマスクAPを12.5%大きく向上させ、さまざまな設定で最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2024-04-18T07:22:38Z) - Layout-to-Image Translation with Double Pooling Generative Adversarial
Networks [76.83075646527521]
入力レイアウトからフォトリアリスティックでセマンティックに一貫性のある結果を生成するための新しいDouble Pooing GAN(DPGAN)を提案する。
また,角形プールモジュール (SPM) と矩形プールモジュール (RPM) からなる新しい二重プールモジュール (DPM) を提案する。
論文 参考訳(メタデータ) (2021-08-29T19:55:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。