論文の概要: Zero-Shot and Supervised Bird Image Segmentation Using Foundation Models: A Dual-Pipeline Approach with Grounding DINO~1.5, YOLOv11, and SAM~2.1
- arxiv url: http://arxiv.org/abs/2603.00184v1
- Date: Thu, 26 Feb 2026 23:12:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-03 19:50:56.08991
- Title: Zero-Shot and Supervised Bird Image Segmentation Using Foundation Models: A Dual-Pipeline Approach with Grounding DINO~1.5, YOLOv11, and SAM~2.1
- Title(参考訳): 基礎モデルを用いたゼロショット・スーパービジョンバード画像分割:DINO~1.5, YOLOv11, SAM~2.1による二重パイプアプローチ
- Authors: Abhinav Munagala,
- Abstract要約: 本稿では,2025の基礎モデルを用いた二値鳥画像分割のための二重パイプラインフレームワークを提案する。
我々は,プロンプトベースのファンデーションモデルパイプラインが,タスク固有のエンドツーエンドのセグメンテーションネットワークより優れていることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Bird image segmentation remains a challenging task in computer vision due to extreme pose diversity, complex plumage patterns, and variable lighting conditions. This paper presents a dual-pipeline framework for binary bird image segmentation leveraging 2025 foundation models. We introduce two operating modes built upon Segment Anything Model 2.1 (SAM 2.1) as a shared frozen backbone: (1) a zero-shot pipeline using Grounding DINO 1.5 to detect birds via the text prompt "bird" before prompting SAM 2.1 with bounding boxes requiring no labelled bird data; and (2) a supervised pipeline that fine-tunes YOLOv11 on the CUB-200-2011 dataset for high-precision detection, again prompting SAM 2.1 for pixel-level masks. The segmentation model is never retrained for new species or domains. On CUB-200-2011 (11,788 images, 200 species), the supervised pipeline achieves IoU 0.912, Dice 0.954, and F1 0.953 outperforming all prior baselines including SegFormer-B2 (IoU 0.842) by +7.0 percentage points. The zero-shot pipeline achieves IoU 0.831 using only a text prompt, the first such result reported on this benchmark. We demonstrate that prompt-based foundation model pipelines outperform task specific end-to-end trained segmentation networks, while requiring only lightweight detector fine-tuning (~1 hour) for domain adaptation. Complete PyTorch implementation, dataset preparation scripts, and trained weights are publicly available.
- Abstract(参考訳): 鳥の画像セグメンテーションは、極端なポーズの多様性、複雑な配管パターン、そして様々な照明条件のために、コンピュータビジョンにおいて難しい課題である。
本稿では,2025の基礎モデルを用いた二値鳥画像分割のための二重パイプラインフレームワークを提案する。
我々は,Segment Anything Model 2.1 (SAM 2.1) をベースとした2つの動作モードを共有冷凍バックボーンとして導入する: 1) グラウンディングDINO 1.5 を用いて,テキストプロンプト "bird" を介して鳥を検知するゼロショットパイプライン,2) CUB-200-2011 データセット上で高精度検出のためにYOLOv11 を微調整し,またピクセルレベルのマスクに対してSAM 2.1 を誘導する教師付きパイプライン。
セグメンテーションモデルは、新しい種やドメインのために再訓練されることはない。
CUB-200-2011 (11,788枚、200種)では、監督パイプラインがIoU 0.912、Dice 0.954、F1 0.953を達成し、SegFormer-B2 (IoU 0.842) を含む全ての以前のベースラインを+7.0ポイント上回る。
ゼロショットパイプラインはテキストプロンプトのみを使用してIoU 0.831を達成する。
本研究では,タスク特定エンドツーエンドのセグメンテーションネットワークよりも高速で,ドメイン適応には軽量な検出器微調整(約1時間)しか必要としないことを示す。
完全なPyTorch実装、データセット準備スクリプト、トレーニングされたウェイトが公開されている。
関連論文リスト
- WATSON-Net: Vetting, Validation, and Analysis of Transits from Space Observations with Neural Networks [0.0]
WATSON-Netは、最先端のツールと競合するように設計された、オープンソースのニューラルネットワーク分類器とデータ準備パッケージである。
10倍のクロスバリデーションを用いたKepler Q1-Q17 DR25データに基づいて、WATSON-Netは10個の独立したモデルを生成し、それぞれ専用のテストセットで評価する。
Keplerのターゲットでは、WATSON-Netは0.903の0.99(R@P0.99)のリコール精度を達成し、ExoMinerネットワークのみの性能が向上した。
論文 参考訳(メタデータ) (2025-11-11T20:42:58Z) - TabPFN-2.5: Advancing the State of the Art in Tabular Foundation Models [76.52858476275865]
TabPFN-2.5は5万のデータポイントと2,000の機能を持つデータセット用に構築されている。
チューニングされたツリーベースモデルとAutoGluon 1.4の精度を大幅に上回った。
生産用として,TabPFN-2.5を小型または木製アンサンブルに変換する新しい蒸留エンジンを導入する。
論文 参考訳(メタデータ) (2025-11-11T18:57:15Z) - RGC: a radio AGN classifier based on deep learning. I. A semi-supervised model for the VLA images of bent radio AGNs [0.0]
RGC Python package for training wide-angle tail (WAT) and narrow-angle tail (NAT) radio active galactic nucleus (RAGNs)。
このパッケージには、639のWATとNATのラベル付きデータセットが新たに2つ含まれており、2万のラベルなしRAGNを利用する半教師付きRCCモデルが含まれている。
RGCモデルは最高性能に達し、精度は88.88%、F1スコアはWATが0.90、NATが0.85である。
論文 参考訳(メタデータ) (2025-10-25T06:55:29Z) - DiRecNetV2: A Transformer-Enhanced Network for Aerial Disaster Recognition [4.678150356894011]
災害評価における航空画像処理のための人工知能(AI)モデルと無人航空機の統合には、例外的な精度、計算効率、リアルタイム処理能力が必要である。
伝統的に、畳み込みニューラルネットワーク(CNN)は局所的特徴抽出の効率を示すが、大域的文脈解釈の可能性によって制限される。
視覚変換器(ViT)は、注意機構を用いることで、グローバルな文脈解釈の改善を約束するが、それでもUAVベースの災害対応アプリケーションでは未検討である。
論文 参考訳(メタデータ) (2024-10-17T15:25:13Z) - SOOD++: Leveraging Unlabeled Data to Boost Oriented Object Detection [68.18620488664187]
本稿では,SOOD++ と呼ばれる簡易かつ効果的な半教師付きオブジェクト指向検出手法を提案する。
具体的には、空中画像からの物体は、通常任意の向き、小さなスケール、密度分布を持つ。
各種ラベル付き環境下での多目的対象物に対する大規模な実験により,本手法の有効性が示された。
論文 参考訳(メタデータ) (2024-07-01T07:03:51Z) - Foundation Models for Structural Health Monitoring [14.36493796970864]
本稿では,トランスフォーマーニューラルネットワークをMasked Auto-Encoderアーキテクチャを用いて,構造的健康モニタリングのための基礎モデルとして初めて利用することを提案する。
自己教師付き事前学習を通じて、複数の大規模データセットから一般化可能な表現を学習する能力を実証する。
本研究は,3つの運用用インダクトのデータを用いた基礎モデルの有効性を示す。
論文 参考訳(メタデータ) (2024-04-03T13:32:44Z) - Boot and Switch: Alternating Distillation for Zero-Shot Dense Retrieval [50.47192086219752]
$texttABEL$は、ゼロショット設定でのパス検索を強化するための、シンプルだが効果的な教師なしのメソッドである。
ラベル付きデータに対して$texttABEL$を微調整するか、既存の教師付き高密度検索と統合することにより、最先端の結果が得られる。
論文 参考訳(メタデータ) (2023-11-27T06:22:57Z) - CLIP-AD: A Language-Guided Staged Dual-Path Model for Zero-shot Anomaly
Detection [49.510604614688745]
大規模視覚言語モデルCLIPのゼロショット機能を活用するために,CLIP-ADというフレームワークを提案する。
異常写像の直接計算における逆の予測と無関係なハイライトについて述べる。
論文 参考訳(メタデータ) (2023-11-01T11:39:22Z) - EdgeNeXt: Efficiently Amalgamated CNN-Transformer Architecture for
Mobile Vision Applications [68.35683849098105]
入力テンソルを複数のチャネルグループに分割するSDTAエンコーダを導入する。
1.3Mパラメータを持つEdgeNeXtモデルでは、ImageNet-1Kで71.2%のTop-1精度を実現している。
パラメータ5.6MのEdgeNeXtモデルでは、ImageNet-1Kで79.4%のTop-1精度を実現しています。
論文 参考訳(メタデータ) (2022-06-21T17:59:56Z) - Jigsaw Clustering for Unsupervised Visual Representation Learning [68.09280490213399]
本稿では,新しいjigsawクラスタリング・プレテキストタスクを提案する。
本手法は画像内情報と画像間情報の両方を利用する。
トレーニングバッチの半分しか使用されていない場合、コントラスト学習方法にも匹敵します。
論文 参考訳(メタデータ) (2021-04-01T08:09:26Z) - CNN Model & Tuning for Global Road Damage Detection [0.0]
オブジェクト検出のためのシングルステージおよびマルチステージネットワークアーキテクチャを評価する。
チェコ、インド、日本のスマートフォンカメラを用いた道路被害訓練データセットのデータ準備について述べる。
Resnet-50 と ResnetCSP-101 のバックボーンを持つ多段高速 R-CNN モデルを用いて,Test2 の 0.542 と Test1 の 0.536 の平均 F1 スコアを示す。
論文 参考訳(メタデータ) (2021-03-17T09:01:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。