論文の概要: BioSEN: A Bio-acoustic Signal Enhancement Network for Animal Vocalizations
- arxiv url: http://arxiv.org/abs/2605.12534v2
- Date: Thu, 14 May 2026 08:05:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-25 12:34:33.795078
- Title: BioSEN: A Bio-acoustic Signal Enhancement Network for Animal Vocalizations
- Title(参考訳): BioSEN - 動物ボカライゼーションのためのバイオ音響信号強調ネットワーク
- Authors: Tianyu Song, Ton Viet Ta, Ngamta Thamwattana, Hisako Nomura, Linh Thi Hoai Nguyen,
- Abstract要約: 生体音響信号のためのモデルであるBioSENを開発した。
3つのバイオ音響データセットのテストでは、BioSENは最先端の音声強調モデルと一致するか超えている。
これらの結果から,バイオアコースティック・オーディオ・エンハンスメントに対するBioSENの強みと,生物多様性のモニタリングと保存への期待が示された。
- 参考スコア(独自算出の注目度): 0.7642986229377614
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most work in audio enhancement targets human speech, while bioacoustics is less studied due to noisy recordings and the distinct traits of animal sounds. To fill this gap, we adapt speech enhancement methods and build BioSEN, a model made for bioacoustic signals. BioSEN has three modules: a multi-scale dual-axis attention unit for time-frequency feature extraction, a bio-harmonic multi-scale enhancement unit for capturing harmonic structures, and an energy-adaptive gating connection unit that uses frequency weights to keep vocalizations from being removed as noise. Tests on three bioacoustic datasets show that BioSEN matches or exceeds state-of-the-art speech enhancement models while using far less computation. These results show BioSEN's strength for bioacoustic audio enhancement and its promise for biodiversity monitoring and conservation.
- Abstract(参考訳): 音声強調のほとんどの研究は人間の発話をターゲットとしているが、ノイズのある録音や動物音の特徴から、バイオ音響学の研究は少ない。
このギャップを埋めるために、音声強調法を適用し、バイオ音響信号のためのモデルであるBioSENを構築する。
BioSENには3つのモジュールがある: 時間周波数特徴抽出のためのマルチスケールデュアル軸アテンションユニット、ハーモニック構造を捕捉するバイオハーモニック・マルチスケールエンハンスメントユニット、周波数重みを使って発声をノイズとして除去しないようにするエネルギー適応型ゲーティング接続ユニット。
3つのバイオ音響データセットのテストでは、BioSENは、はるかに少ない計算を使用しながら、最先端の音声強調モデルと一致または超えている。
これらの結果から,バイオアコースティック・オーディオ・エンハンスメントに対するBioSENの強みと,生物多様性のモニタリングと保存への期待が示された。
関連論文リスト
- CoarseSoundNet: Building a reliable model for ecological soundscape analysis [73.44688723989053]
サウンドスケープは、生物音(動物音)、地球音(自然無生物音)、人類音(人間音)の3種類からなる。
論文 参考訳(メタデータ) (2026-05-20T13:18:11Z) - BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment [42.72898704470983]
動物種をマルチモーダルデータから理解することは、コンピュータビジョンと生態学の交差において新たな課題となる。
生体応用のための新しい視覚・テキスト・音響アライメントフレームワークであるBioVITAを提案する。
論文 参考訳(メタデータ) (2026-03-25T03:15:04Z) - The iNaturalist Sounds Dataset [60.157076990024606]
iNatSoundsは、5500種以上の音をキャプチャする23万のオーディオファイルのコレクションで、世界中で27,000人以上のレコーダーが貢献している。
このデータセットは、鳥類、哺乳類、昆虫、虫類、両生類からの音を包含し、iNaturalistに提出された観察から得られたオーディオおよび種名を含む。
我々は、次世代の公的なエンゲージメントアプリケーションを支えるこのデータに基づいて訓練されたモデルを構想し、大規模なオーディオコレクションの処理において生物学者、生態学者、土地利用管理者を支援する。
論文 参考訳(メタデータ) (2025-05-31T02:07:37Z) - animal2vec and MeerKAT: A self-supervised transformer for rare-event raw audio input and a large-scale reference dataset for bioacoustics [2.1019401515721583]
animal2vecは、未ラベルの音声から学習し、ラベル付きデータでその理解を洗練する、解釈可能な大きなトランスフォーマーモデルである。
Meerkat Audio Transcriptsは、ヒト以外の地上哺乳動物に関する最大のラベル付きデータセットである。
我々のモデルは,MeerKATの既存の手法と利用可能な NIPS4Bplus Birdong データセットより優れている。
論文 参考訳(メタデータ) (2024-06-03T12:11:01Z) - Transferable Models for Bioacoustics with Human Language Supervision [0.0]
BioLingualは、対照的な言語-オーディオ事前学習に基づくバイオ音響学の新しいモデルである。
分類群にまたがる1000種以上の呼び出しを識別し、完全なバイオ音響タスクをゼロショットで実行し、自然のテキストクエリから動物の発声記録を検索する。
論文 参考訳(メタデータ) (2023-08-09T14:22:18Z) - ASiT: Local-Global Audio Spectrogram vIsion Transformer for Event
Classification [42.95038619688867]
ASiTは、グループマスク付きモデル学習と自己蒸留を用いて、局所的およびグローバルな文脈情報をキャプチャする、新しい自己教師型学習フレームワークである。
我々は、音声イベント分類、キーワードスポッティング、話者識別を含む音声および音声の分類タスクにおいて、事前訓練されたモデルを評価する。
論文 参考訳(メタデータ) (2022-11-23T18:21:09Z) - Discriminative Singular Spectrum Classifier with Applications on
Bioacoustic Signal Recognition [67.4171845020675]
分析や分類に有用な特徴を効率的に抽出する識別機構を備えた生体音響信号分類器を提案する。
タスク指向の現在のバイオ音響認識法とは異なり、提案モデルは入力信号をベクトル部分空間に変換することに依存する。
提案法の有効性は,アヌラン,ミツバチ,蚊の3種の生物音響データを用いて検証した。
論文 参考訳(メタデータ) (2021-03-18T11:01:21Z) - Modelling Animal Biodiversity Using Acoustic Monitoring and Deep
Learning [0.0]
本稿では,機械学習の最先端技術を用いて,時系列音声信号から特徴を自動的に抽出する手法について概説する。
得られた鳥の歌はメル周波数ケプストラム(MFC)を用いて処理され、後に多層パーセプトロン(MLP)を用いて分類される特徴を抽出する。
提案手法は感度0.74,特異度0.92,精度0.74で有望な結果を得た。
論文 参考訳(メタデータ) (2021-03-12T13:50:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。