論文の概要: A Multi-Branch Hierarchy-Aware Framework for Heterogeneous Audio Classification
- arxiv url: http://arxiv.org/abs/2607.01974v1
- Date: Thu, 02 Jul 2026 10:08:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.783221
- Title: A Multi-Branch Hierarchy-Aware Framework for Heterogeneous Audio Classification
- Title(参考訳): 異種音声分類のためのマルチブランチ階層型フレームワーク
- Abstract要約: 本報告では,異種音声録音の分類を目的としたDCASE 2026 Challengeのタスク1について述べる。
本システムはCLAPに基づく音声テキスト表現に基づいて構築され,3つの戦略により改良されている。
検討した音響特性のうち、log-STFTブランチは最強の単一モデル性能を提供する。
- 参考スコア(独自算出の注目度): 9.384278545503735
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This technical report describes our system for Task 1 of the DCASE 2026 Challenge, which aims to classify heterogeneous audio recordings according to the Broad Sound Taxonomy (BST). The task requires both accurate second-level prediction and consistency with the top-level taxonomy. Our system is built on CLAP-based audio-text representations and is improved along three strategies: expanding the training set with a filtered subset of BSD35k, enhancing acoustic modeling with feature-specific branches, and refining predictions using hierarchy-aware classifiers and KNN-based post-processing. Among the acoustic features considered, the log-STFT branch provides the strongest single-model performance. With KNN-based post-processing, our best single system achieves a hierarchical F1 score (Hier. F1) of 80.84% on the BSD10k-v1.2 set under the same evaluation protocol as the baseline. We further construct ensemble systems by combining models with complementary acoustic features and classification heads, achieving Hier. F1 scores of 81.25% and 81.18%, respectively.
- Abstract(参考訳): 本技術報告では,異種音声録音をBST(Broad Sound Taxonomy)に基づいて分類することを目的としたDCASE 2026 Challengeのタスク1について述べる。
このタスクは、第2レベルの正確な予測と、上位レベルの分類との整合性の両方を必要とする。
本システムはCLAPに基づく音声テキスト表現に基づいて構築され,BSD35kのフィルタサブセットによるトレーニングセットの拡張,特徴分岐による音響モデリングの強化,階層認識分類器とKNNによる後処理による予測の修正という3つの戦略により改善されている。
検討した音響特性のうち、log-STFTブランチは最強の単一モデル性能を提供する。
KNNベースの後処理では、ベースラインと同じ評価プロトコルでBSD10k-v1.2の80.84%の階層的F1スコア(階層的F1)を達成する。
さらに,モデルと相補的な音響特徴と分類ヘッドを組み合わせたアンサンブルシステムを構築し,ハイアを達成した。
F1のスコアはそれぞれ81.25%と81.18%である。
関連論文リスト
- Representation-Regularized Convolutional Audio Transformer for Audio Understanding [53.092757178419355]
スクラッチからのブートストラップ表現は計算に高価で、しばしば収束するために広範囲のトレーニングを必要とします。
本稿では,これらの課題に対処するための統合フレームワークであるConvolutional Audio Transformer (CAT)を提案する。
論文 参考訳(メタデータ) (2026-01-29T12:16:19Z) - Enhancement of a Text-Independent Speaker Verification System by using
Feature Combination and Parallel-Structure Classifiers [0.0]
本稿では,特徴抽出と分類という2つのモジュールについて検討する。
最も適切な音響特徴の選択は、頑健な話者検証を行う上で重要な要素である。
ノイズの多い環境でシステムを強化するために,前処理段階としてのマルチバンドノイズ除去手法を提案する。
論文 参考訳(メタデータ) (2024-01-26T17:19:59Z) - MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition [62.89464258519723]
異なるレベルのオーディオ/視覚エンコーダに融合することで、各モードの表現を促進する多層クロスアテンション融合に基づくAVSR手法を提案する。
提案手法は第1位システムを超え,新たなSOTA cpCERの29.13%をこのデータセット上に構築する。
論文 参考訳(メタデータ) (2024-01-07T08:59:32Z) - An Inception-Residual-Based Architecture with Multi-Objective Loss for
Detecting Respiratory Anomalies [10.29057783664056]
本稿では,呼吸音の録音から異常を検出するための深層学習システムを提案する。
本システムでは,呼吸異常を分類するために,インセプションをベースとしたバックボーンモデルとマルチヘッドアテンションと多目的損失を統合した。
論文 参考訳(メタデータ) (2023-03-07T18:10:05Z) - Low-complexity deep learning frameworks for acoustic scene
classification [64.22762153453175]
音響シーン分類(ASC)のための低複雑さ深層学習フレームワークを提案する。
提案するフレームワークは、フロントエンドのスペクトログラム抽出、オンラインデータ拡張、バックエンドの分類、予測される確率の後期融合の4つの主要なステップに分けることができる。
DCASE 2022 Task 1 Development データセットで実施した実験は,低複雑さの要求を十分に満たし,最も高い分類精度を 60.1% で達成した。
論文 参考訳(メタデータ) (2022-06-13T11:41:39Z) - Wider or Deeper Neural Network Architecture for Acoustic Scene
Classification with Mismatched Recording Devices [59.86658316440461]
音響シーン分類(ASC)のためのロバストで低複雑性なシステムを提案する。
本稿では,まず,新しい入出力型ネットワークアーキテクチャを設計し,不一致な記録装置問題に対処する,ASCベースラインシステムを構築する。
さらなる性能向上を図りながら、低複雑性モデルを満たすために、多重スペクトルのアンサンブルとチャネル縮小の2つの手法を適用した。
論文 参考訳(メタデータ) (2022-03-23T10:27:41Z) - A Two-Stage Approach to Device-Robust Acoustic Scene Classification [63.98724740606457]
デバイスロバスト性を改善するために,完全畳み込みニューラルネットワーク(CNN)に基づく2段階システムを提案する。
以上の結果から,提案したASCシステムにより,開発環境における最先端の精度が得られた。
クラスアクティベーションマッピングを用いたニューラルサリエンシ解析により、モデルによって学習されたパターンに関する新たな洞察が得られる。
論文 参考訳(メタデータ) (2020-11-03T03:27:18Z) - Device-Robust Acoustic Scene Classification Based on Two-Stage
Categorization and Data Augmentation [63.98724740606457]
我々は,GT,USTC,Tencent,UKEの4つのグループからなる共同で,DCASE 2020 Challengeの第1タスク - 音響シーン分類(ASC)に取り組む。
タスク1aは、複数の(実とシミュレートされた)デバイスで記録されたオーディオ信号のASCを10種類の微細なクラスにフォーカスする。
Task 1bは、低複雑さのソリューションを使用して、データを3つの上位クラスに分類することに関心がある。
論文 参考訳(メタデータ) (2020-07-16T15:07:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。