論文の概要: Efficient Passive Acoustic Monitoring of Killer Whales Using a Two-Stage Detection and Ecotype Classification Cascade
- arxiv url: http://arxiv.org/abs/2609.01792v1
- Date: Tue, 01 Sep 2026 19:03:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.925549
- Title: Efficient Passive Acoustic Monitoring of Killer Whales Using a Two-Stage Detection and Ecotype Classification Cascade
- Title(参考訳): 2段階検出とエコタイプ分類カスケードを用いた捕鯨クジラのパッシブ音響モニタリング
- Authors: Daniela Ruiz, Manuel Castellote, Zhongqi Miao, Carl Chalmers, Bruno Demuro, Rahul Dodhia, Pablo Arbelaez, Juan M. Lavista,
- Abstract要約: 本稿では,まずクジラの鳴き声を検知し,確実な検出を北太平洋東部の5つのエコタイプに分類する,軽量なResNetベースの2段階カスケードを提案する。
エコタイプ認識から検出を分離することにより、エンドツーエンドのカスケードは7クラスマクロF1を1段モデルで0.919から0.933に改善し、稀なOKWエコタイプで最大のゲインを得た。
- 参考スコア(独自算出の注目度): 3.406013651488656
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Passive acoustic monitoring of killer whales is particularly important for conservation of the endangered Southern Resident killer whale population, but requires accurate models that can operate in real time under severe class imbalance and deployment shift. We propose a lightweight ResNet-based two-stage cascade that first detects killer whale vocalizations and then classifies confident detections into five eastern North Pacific ecotypes, abstaining on ambiguous calls. We train and evaluate the pipeline on the DCLDE 2027 dataset, where the detector achieves 0.960 macro-F1 and the classifier 0.958, outperforming frozen Perch 2.0 embeddings on the five-ecotype benchmark. By separating detection from ecotype recognition, the end-to-end cascade improves seven-class macro-F1 from 0.919 for a single-stage model to 0.933, with the largest gain on the rare OKW ecotype. To assess transfer beyond the benchmark, we use active learning to adapt the Stage 1 to the acoustic environment of Puget Sound, WA, increasing killer whale detection F1 from 0.405 to 0.755 on manually verified detection windows. Finally, each stage processes a 3 s window in approximately 1.4 ms on an NVIDIA H100, enabling faster than real time inference. These results demonstrate that the proposed two-stage cascade pipeline enables reliable killer whale detection and classification, adaptation to new acoustic domains, and real-time monitoring for conservation applications.
- Abstract(参考訳): 致命的なクジラの音響モニタリングは、特に絶滅危惧種のサザン・レジデント・キラークジラの個体数の保全には重要であるが、深刻な階級不均衡と展開シフトの下でリアルタイムに活動できる正確なモデルが必要である。
本稿では,まずクジラの鳴き声を検知し,次に確実な検出を5つの北太平洋エコタイプに分類し,不明瞭な呼び出しを控える軽量なResNetベースの2段階カスケードを提案する。
我々はDCLDE 2027データセット上でパイプラインを訓練し評価し、検出器は0.960マクロF1と0.958を達成し、5つのエコタイプベンチマーク上のフリーズPerch 2.0埋め込みよりも優れていた。
エコタイプ認識から検出を分離することにより、エンドツーエンドのカスケードは7クラスマクロF1を1段モデルで0.919から0.933に改善し、稀なOKWエコタイプで最大のゲインを得た。
本研究は, 能動学習を用いて, ハワイ州ピュージェット・サウンドの音響環境に適応し, 手動で確認した検出窓上で, 0.405 から 0.755 にキラークジラ検出 F1 を増加させる。
最後に、各ステージはNVIDIA H100で3sウィンドウを約1.4msで処理し、リアルタイム推論よりも高速に実行できる。
これらの結果から,提案した2段階カスケードパイプラインは,信頼性の高いクジラの発見と分類,新しい音響領域への適応,保全のためのリアルタイムモニタリングを可能にすることが示唆された。
関連論文リスト
- Decoding Insect Song: A Multitask Semisupervised Orthoptera Bioacoustic Classifier [0.6524460254566904]
PULSEはオルソプテラ生物音響学のための半教師付きマルチタスクフレームワークである。
弱教師付き種分類、未学習のフィールドオーディオの自己教師型学習、汎用バイオ音響モデルからの知識蒸留を組み合わせている。
論文 参考訳(メタデータ) (2026-06-11T11:51:49Z) - From Birdsong to Rumbles: Classifying Elephant Calls with Out-of-Species Embeddings [0.0]
プレトレーニングされた音響埋め込みは、エンド・ツー・エンドのニューラルネットワークに近づいたレベルにおいて、象の発声を分類する。
ベストパフォーマンスシステムは、エンドツーエンドの象呼び出し分類システムの2.2%以内である。
論文 参考訳(メタデータ) (2026-04-30T21:00:05Z) - MI$^2$DAS: A Multi-Layer Intrusion Detection Framework with Incremental Learning for Securing Industrial IoT Networks [47.386868423451595]
MI$2$DASは、異常に基づく階層的なトラフィックプーリングとオープンセット認識を統合する多層侵入検知フレームワークである。
Edge-IIoTsetデータセットで実施された実験は、すべてのレイヤで強力なパフォーマンスを示している。
これらの結果は、IIoTセキュリティを強化するための効果的でスケーラブルで適応的なフレームワークとして、MI$2$DASを示している。
論文 参考訳(メタデータ) (2026-02-27T09:37:05Z) - Sleep Apnea Detection on a Wireless Multimodal Wearable Device Without Oxygen Flow Using a Mamba-based Deep Learning Approach [0.0]
本稿では,ANNE Oneの信号に基づく睡眠障害呼吸の診断および事象レベル評価のための,マンバに基づく深層学習モデルを提案し,評価する。
論文 参考訳(メタデータ) (2025-11-30T17:21:44Z) - A Novel Attention-Augmented Wavelet YOLO System for Real-time Brain Vessel Segmentation on Transcranial Color-coded Doppler [49.03919553747297]
我々は,脳動脈を効率よく捉えることができるAIを利用したリアルタイムCoW自動分割システムを提案する。
Transcranial Color-coded Doppler (TCCD) を用いたAIによる脳血管セグメンテーションの事前研究は行われていない。
提案したAAW-YOLOは, 異方性および対側性CoW容器のセグメンテーションにおいて高い性能を示した。
論文 参考訳(メタデータ) (2025-08-19T14:41:22Z) - Audio Anti-spoofing Using a Simple Attention Module and Joint
Optimization Based on Additive Angular Margin Loss and Meta-learning [43.519717601587864]
本研究では,畳み込み層における特徴写像に対する3次元の注意重みを推定するための単純な注意モジュールを提案する。
2進分類のための重み付き加法的角縁損失に基づく共同最適化手法を提案する。
提案手法は, プールEERが0.99%, min t-DCFが0.0289。
論文 参考訳(メタデータ) (2022-11-17T21:25:29Z) - Western Mediterranean wetlands bird species classification: evaluating
small-footprint deep learning approaches on a new annotated dataset [0.0]
この研究は、2つの重いフットプリントと大きなフットプリントのディープニューラルネットワーク(VGG16とResNet50)と、軽量な代替手段であるMobileNetV2の比較分析である。
実験の結果,MobileNetV2 は平均 F1 スコアが ResNet50 よりも 5% 以下であることがわかった。
Aiguamolls de l'Emporda Natural Parkの20の固有鳥類種の201.6分と5,795のオーディオ抜粋からなる西地中海湿原鳥類データセットを作成した。
論文 参考訳(メタデータ) (2022-07-12T08:48:12Z) - Raw Waveform Encoder with Multi-Scale Globally Attentive Locally
Recurrent Networks for End-to-End Speech Recognition [45.858039215825656]
本稿では,グローバルな注意的局所再帰(GALR)ネットワークを採用し,生波形を直接入力とする新しいエンコーダを提案する。
ベンチマークデータセットAISHELL-2と,5,000時間21,000時間の大規模マンダリン音声コーパスを用いて実験を行った。
論文 参考訳(メタデータ) (2021-06-08T12:12:33Z) - Anomaly Detection in Cybersecurity: Unsupervised, Graph-Based and
Supervised Learning Methods in Adversarial Environments [63.942632088208505]
現在の運用環境に固有ののは、敵対的機械学習の実践である。
本研究では,教師なし学習とグラフに基づく異常検出の可能性を検討する。
我々は,教師付きモデルの訓練時に,現実的な対人訓練機構を組み込んで,対人環境における強力な分類性能を実現する。
論文 参考訳(メタデータ) (2021-05-14T10:05:10Z) - Detecting COVID-19 from Breathing and Coughing Sounds using Deep Neural
Networks [68.8204255655161]
私たちは、Convolutional Neural Networksのアンサンブルを適応させて、スピーカーがCOVID-19に感染しているかどうかを分類します。
最終的には、74.9%のUnweighted Average Recall(UAR)、またはニューラルネットワークをアンサンブルすることで、ROC曲線(AUC)の80.7%を達成する。
論文 参考訳(メタデータ) (2020-12-29T01:14:17Z) - Detection of Obstructive Sleep Apnoea Using Features Extracted from
Segmented Time-Series ECG Signals Using a One Dimensional Convolutional
Neural Network [0.19686770963118383]
本研究は,単チャンネル心電図(ECG)信号から得られた閉塞性睡眠時無呼吸症(OSA)の自動検出を目的とした1次元畳み込みニューラルネットワーク(1DCNN)モデルを提案する。
このモデルは、畳み込み、最大プール層と、隠蔽層とSoftMax出力からなる完全に接続された多層パーセプトロン(MLP)を用いて構成されている。
これは、モデルが高い精度でApnoeaの存在を識別できることを示している。
論文 参考訳(メタデータ) (2020-02-03T15:47:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。