論文の概要: Exploring SAM Supervision for Fine-Grained UAV Target Segmentation under Data Scarcity
- arxiv url: http://arxiv.org/abs/2607.03754v1
- Date: Sat, 04 Jul 2026 07:59:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.706703
- Title: Exploring SAM Supervision for Fine-Grained UAV Target Segmentation under Data Scarcity
- Title(参考訳): 微粒UAVターゲットセグメンテーションのためのSAMスーパービジョンの探索
- Authors: Le-Anh Tran,
- Abstract要約: 無人航空機(UAV)の目標セグメンテーションは、オブジェクトの小さなサイズ、外観の変化、乱雑な背景、密接な注釈付きデータの不足により困難である。
本稿では,コンパクトセグメンテーションネットワークのトレーニングにおいて,SAM3を擬似ラベル生成器として用いることを検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unmanned aerial vehicle (UAV) target segmentation remains challenging due to the small size of objects, appearance variations, cluttered backgrounds, and the scarcity of densely annotated data. These factors hinder the performance and practical deployment of lightweight segmentation models in real-world UAV applications. To address this problem, this paper investigates the use of SAM3 (Segment Anything Model 3) as a pseudo-label generator for training compact segmentation networks. Specifically, two supervision paradigms are explored: (i) direct pseudo-supervision using unaltered SAM3-generated masks, and (ii) a refinement strategy that re-applies SAM3 to localized image patches for improved mask quality. Based on these paradigms, a two-stage SAM3-guided pseudo-label generation framework is proposed. In the first stage, SAM3 generates coarse masks for initial object localization. The localized regions are subsequently cropped into patches and processed by SAM3 again to generate fine masks with accurate object boundaries and discard false positives. The resulting coarse and fine masks are then used as pseudo-labels to optimize a lightweight network, termed IPS-Seg, which consists of three components: an IdentityFormer backbone for feature extraction, an Atrous Spatial Pyramid Pooling module for multi-scale context aggregation, and a PixelShuffle-based decoder for spatial resolution recovery. Extensive experiments under multiple supervision settings demonstrate the effectiveness of the proposed framework. The results show that IPS-Seg achieves a favorable trade-off between segmentation accuracy and computational efficiency while benefiting consistently from the proposed pseudo-label generation strategy. These findings highlight the potential of large-scale foundation models as annotation sources for training compact task-specific segmentation networks in low-label vision domains.
- Abstract(参考訳): 無人航空機(UAV)の目標セグメンテーションは、オブジェクトの小さなサイズ、外観の変化、乱雑な背景、密接な注釈付きデータの不足など、依然として困難である。
これらの要因は、現実のUAVアプリケーションにおける軽量セグメンテーションモデルの性能と実践的展開を妨げる。
そこで本研究では, SAM3 (Segment Anything Model 3) を擬似ラベル生成器として用いて, コンパクトセグメンテーションネットワークのトレーニングを行う。
具体的には2つの監視パラダイムを探索する。
(i)未修正SAM3生成マスクを用いた直接擬似スーパービジョン、及び
(II)SAM3を局所化画像パッチに再適用してマスク品質を向上する改良戦略。
これらのパラダイムに基づいて、2段階のSAM3誘導擬似ラベル生成フレームワークを提案する。
最初の段階でSAM3は初期オブジェクトの局在のための粗いマスクを生成する。
ローカライズされた領域はその後パッチにトリミングされ、SAM3によって再び処理され、正確なオブジェクト境界を持つきめ細かいマスクを生成し、偽陽性を破棄する。
結果として得られた粗いマスクは、IPS-Segと呼ばれる軽量ネットワークを最適化するために擬似ラベルとして使用され、特徴抽出のためのIdentityFormerバックボーン、マルチスケールコンテキストアグリゲーションのためのAtrous Space Pyramid Poolingモジュール、空間解像度回復のためのPixelShuffleベースのデコーダの3つのコンポーネントで構成されている。
複数の監視環境下での大規模な実験により,提案手法の有効性が示された。
その結果、IPS-Segは、提案した擬似ラベル生成戦略から一貫した利益を得ながら、セグメンテーション精度と計算効率のトレードオフを良好に達成できることを示した。
これらの知見は,低ラベルビジョン領域におけるコンパクトなタスク固有セグメンテーションネットワークをトレーニングするためのアノテーション源として,大規模基盤モデルの可能性を強調した。
関連論文リスト
- Evaluating SAM2 for Video Semantic Segmentation [60.157605818225186]
Anything Model 2 (SAM2)は、画像とビデオの両方において、迅速な視覚オブジェクトのセグメンテーションのための強力な基盤モデルであることが証明されている。
本稿では, SAM2 から高密度ビデオセマンティック (VSS) への拡張について検討する。
我々の実験は、SAM2を利用することでVSSの全体的な性能が向上することを示唆している。
論文 参考訳(メタデータ) (2025-12-01T15:15:16Z) - Segment Concealed Objects with Incomplete Supervision [63.637733655439334]
不完全なスーパービジョン・コンセサイテッド・オブジェクト(ISCOS)は、周囲の環境にシームレスにブレンドするオブジェクトを分割する。
このタスクは、不完全な注釈付きトレーニングデータによって提供される限られた監督のため、非常に難しいままである。
本稿では,これらの課題に対処するためのISCOSの統一手法について紹介する。
論文 参考訳(メタデータ) (2025-06-10T16:25:15Z) - E-SAM: Training-Free Segment Every Entity Model [22.29478489117426]
特有なES能力を示す新しいトレーニングフリーフレームワークであるE-SAMを紹介する。
E-SAMは、以前のESメソッドと比較して最先端のパフォーマンスを実現し、ベンチマークメトリクスで+30.1で大幅に改善されている。
論文 参考訳(メタデータ) (2025-03-15T11:41:33Z) - SAMRefiner: Taming Segment Anything Model for Universal Mask Refinement [40.37217744643069]
マスク改善タスクにSAMを適用することで,汎用的で効率的なアプローチを提案する。
具体的には,SAMの多様な入力プロンプトをマイニングするためのマルチプロンプト掘削手法を提案する。
ターゲットデータセット上のジェネリックSAMRefinerのパフォーマンスをさらに向上するため、IoU適応ステップを追加してSAMRefiner++にメソッドを拡張します。
論文 参考訳(メタデータ) (2025-02-10T18:33:15Z) - ZISVFM: Zero-Shot Object Instance Segmentation in Indoor Robotic Environments with Vision Foundation Models [10.858627659431928]
サービスロボットは、機能を強化するために、未知のオブジェクトを効果的に認識し、セグメント化する必要がある。
従来の教師付き学習ベースのセグメンテーション技術は、広範な注釈付きデータセットを必要とする。
本稿では,セグメンテーションアプライスモデル (SAM) の強力なゼロショット能力と,自己監督型視覚変換器 (ViT) からの明示的な視覚表現を活用することで,UOISを解く新しいアプローチ (ZISVFM) を提案する。
論文 参考訳(メタデータ) (2025-02-05T15:22:20Z) - Bridge the Points: Graph-based Few-shot Segment Anything Semantically [79.1519244940518]
プレトレーニング技術の最近の進歩により、視覚基礎モデルの能力が向上した。
最近の研究はSAMをFew-shot Semantic segmentation (FSS)に拡張している。
本稿では,グラフ解析に基づく簡易かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2024-10-09T15:02:28Z) - Adapting Segment Anything Model for Unseen Object Instance Segmentation [70.60171342436092]
Unseen Object Instance(UOIS)は、非構造環境で動作する自律ロボットにとって不可欠である。
UOISタスクのためのデータ効率のよいソリューションであるUOIS-SAMを提案する。
UOIS-SAMは、(i)HeatmapベースのPrompt Generator(HPG)と(ii)SAMのマスクデコーダに適応する階層識別ネットワーク(HDNet)の2つの重要なコンポーネントを統合する。
論文 参考訳(メタデータ) (2024-09-23T19:05:50Z) - Weakly-Supervised Concealed Object Segmentation with SAM-based Pseudo
Labeling and Multi-scale Feature Grouping [40.07070188661184]
Wakly-Supervised Concealed Object (WSCOS) は、周囲の環境とうまく融合したオブジェクトを分割することを目的としている。
内在的な類似性のため、背景から隠された物体を区別することは困難である。
これら2つの課題に対処する新しいWSCOS手法を提案する。
論文 参考訳(メタデータ) (2023-05-18T14:31:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。