論文の概要: TF-SSD: A Strong Pipeline via Synergic Mask Filter for Training-free Co-salient Object Detection
- arxiv url: http://arxiv.org/abs/2604.00549v1
- Date: Wed, 01 Apr 2026 06:47:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:31.878976
- Title: TF-SSD: A Strong Pipeline via Synergic Mask Filter for Training-free Co-salient Object Detection
- Title(参考訳): TF-SSD:無訓練コサレント物体検出のためのアレルギー性マスクフィルタによる強力なパイプライン
- Authors: Zhijin He, Shuo Jin, Siyue Yu, Shuwei Wu, Bingfeng Zhang, Li Yu, Jimin Xiao,
- Abstract要約: Co-salient Object Detection (CoSOD) は、一連の関連画像に一貫して現れる有能なオブジェクトを分割することを目的としている。
本稿では,SAM と DINO の相乗効果を生かして,新しいトレーニング不要な TF-SSD を提案する。
- 参考スコア(独自算出の注目度): 34.533517442170314
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Co-salient Object Detection (CoSOD) aims to segment salient objects that consistently appear across a group of related images. Despite the notable progress achieved by recent training-based approaches, they still remain constrained by the closed-set datasets and exhibit limited generalization. However, few studies explore the potential of Vision Foundation Models (VFMs) to address CoSOD, which demonstrate a strong generalized ability and robust saliency understanding. In this paper, we investigate and leverage VFMs for CoSOD, and further propose a novel training-free method, TF-SSD, through the synergy between SAM and DINO. Specifically, we first utilize SAM to generate comprehensive raw proposals, which serve as a candidate mask pool. Then, we introduce a quality mask generator to filter out redundant masks, thereby acquiring a refined mask set. Since this generator is built upon SAM, it inherently lacks semantic understanding of saliency. To this end, we adopt an intra-image saliency filter that employs DINO's attention maps to identify visually salient masks within individual images. Moreover, to extend saliency understanding across group images, we propose an inter-image prototype selector, which computes similarity scores among cross-image prototypes to select masks with the highest score. These selected masks serve as final predictions for CoSOD. Extensive experiments show that our TF-SSD outperforms existing methods (e.g., 13.7\% gains over the recent training-free method). Codes are available at https://github.com/hzz-yy/TF-SSD.
- Abstract(参考訳): Co-salient Object Detection (CoSOD) は、一連の関連画像に一貫して現れる有能なオブジェクトを分割することを目的としている。
最近のトレーニングベースのアプローチによって達成された顕著な進歩にもかかわらず、クローズドセットデータセットには制約が残っており、限定的な一般化を示している。
しかし、CoSODに対処するためのビジョン・ファンデーション・モデル(VFM)の可能性を探る研究はほとんどない。
本稿では,CoSOD のための VFM の検討と活用を行うとともに,SAM と DINO の相乗効果により,新しいトレーニング不要な TF-SSD を提案する。
具体的には、まずSAMを使用して、候補マスクプールとして機能する包括的な生の提案を生成する。
次に、冗長マスクをフィルタする品質マスク生成装置を導入し、改良されたマスクセットを取得する。
このジェネレータはSAM上に構築されているため、本質的には唾液のセマンティックな理解が欠如している。
この目的のために,DINOの注目マップを用いて画像内の視覚的に有意なマスクを識別する画像内サリエンシフィルタを採用した。
さらに,グループ画像間の相性理解を拡大するため,画像間の類似度スコアを算出し,最も高いスコアを持つマスクを選択する画像間プロトタイプセレクタを提案する。
これらの選択されたマスクは、CoSODの最終予測として機能する。
大規模な実験により、TF-SSDは既存の手法よりも優れていることが示された(例えば、最近のトレーニングフリーな手法よりも13.7\%向上している)。
コードはhttps://github.com/hzz-y/TF-SSDで入手できる。
関連論文リスト
- E-SAM: Training-Free Segment Every Entity Model [22.29478489117426]
特有なES能力を示す新しいトレーニングフリーフレームワークであるE-SAMを紹介する。
E-SAMは、以前のESメソッドと比較して最先端のパフォーマンスを実現し、ベンチマークメトリクスで+30.1で大幅に改善されている。
論文 参考訳(メタデータ) (2025-03-15T11:41:33Z) - Bridge the Points: Graph-based Few-shot Segment Anything Semantically [79.1519244940518]
プレトレーニング技術の最近の進歩により、視覚基礎モデルの能力が向上した。
最近の研究はSAMをFew-shot Semantic segmentation (FSS)に拡張している。
本稿では,グラフ解析に基づく簡易かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2024-10-09T15:02:28Z) - Pluralistic Salient Object Detection [108.74650817891984]
本稿では,与えられた入力画像に対して,複数の有意な有意な有意な有意な有意な有意な分割結果を生成することを目的とした新しい課題であるPSOD(multiistic Salient Object Detection)を紹介する。
新たに設計された評価指標とともに,2つのSODデータセット "DUTS-MM" と "DUS-MQ" を提案する。
論文 参考訳(メタデータ) (2024-09-04T01:38:37Z) - DeSAM: Decoupled Segment Anything Model for Generalizable Medical Image Segmentation [22.974876391669685]
Segment Anything Model (SAM) は、医用画像セグメンテーションのクロスドメインロバスト性を改善する可能性を示している。
SAMは手動でトリガーする時よりも、自動セグメンテーションのシナリオで大幅にパフォーマンスが低下する。
Decoupled SAMはSAMのマスクデコーダを2つの新しいモジュールを導入して変更する。
論文 参考訳(メタデータ) (2023-06-01T09:49:11Z) - MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer [158.06850125920923]
拡散確率モデル(DPM)は、画像内の対象部分間の関係を学習する文脈推論能力に欠けることが多い。
画像中のオブジェクトの意味部分間の文脈的関係学習能力を高めるマスク潜在モデリング手法を提案する。
実験の結果、MDTv2は画像合成性能に優れており、例えば、新しいSOTA FIDスコアはImageNetデータセットで1.58であり、従来のSOTA DiTよりも10倍以上高速であることがわかった。
論文 参考訳(メタデータ) (2023-03-25T07:47:21Z) - Improving Masked Autoencoders by Learning Where to Mask [65.89510231743692]
マスケ画像モデリングは視覚データに対する有望な自己教師型学習手法である。
本稿では,Gumbel-Softmax を用いて,対向学習マスク生成装置とマスク誘導画像モデリングプロセスとを相互接続するフレームワーク AutoMAE を提案する。
実験の結果,AutoMAEは,標準の自己監督型ベンチマークや下流タスクに対して,効果的な事前学習モデルを提供することがわかった。
論文 参考訳(メタデータ) (2023-03-12T05:28:55Z) - Weakly-Supervised Saliency Detection via Salient Object Subitizing [57.17613373230722]
我々は,クラス非依存であるため,弱い監督としてサリエンシー・サブイタライジングを導入する。
これにより、監視はサリエンシー検出の特性と整合することができます。
5つのベンチマークデータセットに対して広範な実験を行う。
論文 参考訳(メタデータ) (2021-01-04T12:51:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。