論文の概要: Towards benchmarking Western Bluebird detection in the wild
- arxiv url: http://arxiv.org/abs/2610.07802v1
- Date: Tue, 06 Oct 2026 05:56:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.833777
- Title: Towards benchmarking Western Bluebird detection in the wild
- Title(参考訳): 野生における西部ブルーバード検出のベンチマークに向けて
- Abstract要約: 西部ブルーバードの検出とセグメンテーションのための新しいベンチマークデータセットを提案する。
データセットには、鳥が画像のごく一部を占める高解像度(4K)の画像が特徴である。
教師付き検出器, ゼロショットおよび微調整条件下での開語彙モデル, セグメンテーションアプローチについて検討した。
- 参考スコア(独自算出の注目度): 2.159873062715287
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Bird monitoring in natural environments is challenging due to the small size of some species of birds relative to the scene, background clutter, variability in illumination, and the observers' viewpoint. Progress is further limited by the scarcity of large-scale, realistic datasets, which are essential for understanding behavioral patterns. To address this gap, we introduce a new benchmark dataset for the detection and segmentation of Western bluebirds (Sialia Mexicana), comprising over 6,000 labeled images from 41 recording sessions. The dataset features high-resolution (4K) in-the-wild images in which birds occupy only a small fraction of the image. We evaluated supervised detectors, open-vocabulary models under zero-shot and fine-tuned settings, and segmentation approaches. Supervised detectors remain the most reliable overall, with Faster R-CNN achieving the highest detection mAP and RT-DETR offering the best precision-recall trade-off. Open-vocabulary models perform poorly in zero-shot settings; however, fine-tuning substantially improves their performance, with YOLO-World becoming competitive with supervised methods and achieving the highest precision, F1-score, and mAP@0.5. For segmentation, supervised methods significantly outperform Grounded-SAM and SAM 3: Mask R-CNN achieves the highest mask mAP, while YOLOv8-Seg provides the best precision and fastest inference. A diagnostic analysis further shows that failures are not explained by object size alone, but by a combination of apparent scale, brightness, contrast, clutter, blur, crowding, and recording-session variation. Overall, our findings highlight the difficulty of zero-shot bird detection in cluttered ecological scenes and underscore the importance of domain adaptation in small-object settings.
- Abstract(参考訳): 自然環境下での鳥の観察は、背景の散らばり、照明の変動、観察者の視点により、いくつかの種類の鳥の大きさが小さいため困難である。
進行は、行動パターンを理解するのに不可欠な大規模で現実的なデータセットの不足によってさらに制限される。
このギャップに対処するため、41回のレコーディングセッションから6000枚以上のラベル付き画像を含む西部のブルーバード(Sialia Mexicana)の検出とセグメンテーションのための新しいベンチマークデータセットを導入した。
データセットには、鳥が画像のごく一部を占める高解像度(4K)の画像が特徴である。
教師付き検出器, ゼロショットおよび微調整条件下での開語彙モデル, セグメンテーションアプローチについて検討した。
監視された検出器は全体として最も信頼性が高く、より高速なR-CNNは最も高い検出mAP、RT-DETRは最良の精度のリコールトレードオフを提供する。
オープン語彙モデルはゼロショット設定では性能が劣るが、微調整により性能が大幅に向上し、YOLO-Worldは教師付き手法と競合し、最高精度のF1スコアとmAP@0.5を達成する。
Mask R-CNNは最も高いマスクmAPを達成し、YOLOv8-Segは最高の精度と最速の推論を提供する。
診断分析により、失敗はオブジェクトのサイズだけで説明されるのではなく、明らかなスケール、明るさ、コントラスト、ぼやけた、ぼやけ、群集、記録・セッションの変動の組み合わせによって説明されることが示された。
以上の結果から, 散在する環境環境におけるゼロショット鳥検出の難しさを浮き彫りにし, 小対象環境におけるドメイン適応の重要性を浮き彫りにした。
関連論文リスト
- Automated Species Identification in Camera Trap Images for Wildlife Conservation [0.0]
この論文は、制限に対処するための自己注意機構を統合する、新しいエンドツーエンドフレームワークを提示している。
提案アーキテクチャは、より高速なRCNN検出ネットワークに統合されたSwin-BiFPNバックボーンと、LLaVA v1.5 (13B)マルチモーダル大言語モデルによって駆動される視覚的意味抽出モジュールを含む。
このフレームワークは、低コントラストトラップ画像と小動物間の検出精度を改善し、ゼロショット検出能力を実証する。
論文 参考訳(メタデータ) (2026-09-28T15:30:32Z) - A Comparative Evaluation of Deep Learning Object Detection Models on a Real-World Multi-Plant Dataset from Africa [0.0]
本研究では,6つのオブジェクト検出モデル YOLOv5, YOLOv8, YOLO11, YOLO26, Faster R-CNN, RT-DETRの比較評価を行った。
その結果,RT-DETRは0.768,mAP@0.5:0.95,0.624で最高性能を達成した。
YOLOベースのモデルは、より高速なR-CNNに比べて訓練効率が優れていた。
論文 参考訳(メタデータ) (2026-08-11T15:22:58Z) - FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales [65.4821703903285]
FLOROは、小さなが高度に多様なリモートセンシングコーパスから転送可能な表現を学習するために設計されたマルチモーダル基礎モデルである。
FLOROは、Sentinel-1、Sentinel-2、SkySAT画像、標高、UAV由来のデータとの不均一な組み合わせによるマスク付きオートエンコーディングを用いて事前訓練される。
我々は、シーン分類、セグメンテーション、回帰タスクにまたがる凍結エンコーダプロトコルを用いて、PANGAEAベンチマーク上でFLOROを評価した。
論文 参考訳(メタデータ) (2026-05-27T08:55:54Z) - RareSpot+: A Benchmark, Model, and Active Learning Framework for Small and Rare Wildlife in Aerial Imagery [9.37940568498261]
RareSpot+は、マルチスケールの一貫性学習、コンテキスト認識の強化、地理的にガイドされたアクティブラーニングを統合する、検出フレームワークである。
2 km2の航空データセットでは、RareSpot+はmAP@50を+35.2%(絶対+0.13)で検出する。
アクティブラーニングモジュールは、未ラベルタイルのわずか1.7%のアノテーション予算を使用して、プレーリードッグAPをさらに14.5%向上させる。
論文 参考訳(メタデータ) (2026-04-21T21:18:02Z) - Sparse Data Tree Canopy Segmentation: Fine-Tuning Leading Pretrained Models on Only 150 Images [0.8294874285381528]
空中画像からの樹冠検出は, 環境モニタリング, 都市計画, 生態系分析において重要な課題である。
Solafune Tree Canopy Detectionコンペティションは、実際のデータアノテーションの不足をシミュレートし、わずか150の注釈付きイメージの小さな不均衡なデータセットを提供する。
我々は, YOLOv11, Mask R-CNN, DeepLabv3, Swin-UNet, DINOv2の5つの代表的なアーキテクチャを評価し, 極度のデータ不足下でのキャノピーセグメンテーションの適合性を評価する。
論文 参考訳(メタデータ) (2026-01-16T01:20:32Z) - Noise-Robust Tiny Object Localization with Flows [63.60972031108944]
フレキシブルなエラーモデリングと不確実性誘導最適化に正規化フローを活用するノイズローバストローカライゼーションフレームワークを提案する。
本手法は,フローベース誤差モデルを用いて,複雑な非ガウス予測分布を抽出し,ノイズの多い監視下で頑健な学習を可能にする。
不確実性を考慮した勾配変調機構は、トレーニングを安定化しながら過度な適合を緩和し、高不確実でノイズの強いサンプルからの学習をさらに抑制する。
論文 参考訳(メタデータ) (2026-01-02T09:16:55Z) - RoHOI: Robustness Benchmark for Human-Object Interaction Detection [84.78366452133514]
ヒューマン・オブジェクト・インタラクション(HOI)検出は、コンテキスト認識支援を可能にするロボット・ヒューマン・アシストに不可欠である。
HOI検出のための最初のベンチマークを導入し、様々な課題下でモデルのレジリエンスを評価する。
我々のベンチマークであるRoHOIは、HICO-DETとV-COCOデータセットに基づく20の汚職タイプと、新しいロバストネスにフォーカスしたメトリクスを含んでいる。
論文 参考訳(メタデータ) (2025-07-12T01:58:04Z) - RareSpot: Spotting Small and Rare Wildlife in Aerial Imagery with Multi-Scale Consistency and Context-Aware Augmentation [6.756718879272925]
RareSpotは、マルチスケールの一貫性学習とコンテキスト認識強化を統合した堅牢な検出フレームワークである。
提案手法は最先端性能を実現し,ベースライン法と比較して検出精度を35%以上向上させる。
論文 参考訳(メタデータ) (2025-06-23T20:03:43Z) - SOTA: Spike-Navigated Optimal TrAnsport Saliency Region Detection in Composite-bias Videos [50.51658520045165]
Spike-d TrAnsport Saliency Region Detection (SOTA)は、スパイクカメラの強度を活用しつつ、空間次元と時間次元の両方のバイアスを緩和するフレームワークである。
本手法では,微妙なフレーム・ツー・フレームの変動を捉えるために,スパイクに基づくマイクロデビア(SM)を導入する。
SOTAは様々な条件にまたがる不整合を減らして予測を洗練させる。
論文 参考訳(メタデータ) (2025-05-01T08:30:40Z) - SIRST-5K: Exploring Massive Negatives Synthesis with Self-supervised
Learning for Robust Infrared Small Target Detection [53.19618419772467]
単一フレーム赤外線小ターゲット検出(SIRST)は、乱雑な背景から小さなターゲットを認識することを目的としている。
Transformerの開発に伴い、SIRSTモデルのスケールは常に増大している。
赤外線小ターゲットデータの多彩な多様性により,本アルゴリズムはモデル性能と収束速度を大幅に改善する。
論文 参考訳(メタデータ) (2024-03-08T16:14:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。