論文の概要: RealDESED: A Real-World Domestic Sound Event Detection Benchmark
- arxiv url: http://arxiv.org/abs/2607.16736v1
- Date: Sat, 18 Jul 2026 09:50:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.249076
- Title: RealDESED: A Real-World Domestic Sound Event Detection Benchmark
- Title(参考訳): RealDESED: 実世界の家庭音事象検出ベンチマーク
- Authors: Florian Schmid, Paul Primus, Alexander Fichtinger, Tara Jadidi, Tobias Morocutti, Gerhard Widmer,
- Abstract要約: RealDESED (RealDESED) は、652人の参加者が自宅で収集した5,710の音声録音からなる実世界の家庭内音響イベント検出(SED)ベンチマークである。
各録音は15秒から35秒間の長さで、15の一般的な家庭音の授業のための時間的に正確なアノテーションを含んでいる。
- 参考スコア(独自算出の注目度): 41.94606140754546
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper presents RealDESED, a real-world domestic sound event detection (SED) benchmark comprising 5,710 audio recordings collected by 652 participants in their homes. Each recording is between 15 and 35 seconds long and contains temporally precise annotations for 15 common domestic sound classes. In contrast to existing SED datasets, which typically rely on simulated soundscapes or broad web-crawled audio, RealDESED consists exclusively of recordings captured in natural domestic environments, reflecting realistic variability in recording devices, device placement, acoustic conditions, background sounds, and naturally occurring event co-occurrences. A distinguishing characteristic of the dataset is its multi-annotator labeling scheme, where each recording is independently annotated by multiple annotators, while the validation and test sets undergo an additional review process to ensure high annotation quality and reliable benchmarking. Furthermore, the dataset provides rich metadata, including recording device, device placement, environment labels, and textual scene descriptions. We establish a strong transformer-based baseline and investigate annotation aggregation strategies, post-processing methods, long-form inference, and the impact of recording metadata on model performance. Our baseline achieves a macro-averaged PSDS1 score of 0.731 on the test set. We believe RealDESED provides a valuable benchmark for developing and evaluating robust SED systems under realistic domestic conditions, helping to bridge the gap between current research benchmarks and real-world deployment.
- Abstract(参考訳): 本稿では,実世界の家庭内音響イベント検出(SED)ベンチマークであるRealDESEDについて述べる。
各録音は15秒から35秒間の長さで、15の一般的な家庭音の授業のための時間的に正確なアノテーションを含んでいる。
従来のSEDデータセットとは対照的に、RealDESEDは、典型的にはシミュレートされたサウンドスケープや広帯域のWebcrawledオーディオに依存しており、自然の家庭環境においてキャプチャーされた録音のみで構成されており、記録装置、デバイス配置、音響条件、バックグラウンドサウンド、自然発生のイベント共起を反映している。
データセットの識別特性はマルチアノテータラベリング方式であり、各レコードは複数のアノテータによって独立にアノテートされ、検証とテストセットは高いアノテーション品質と信頼性のベンチマークを保証するために追加のレビュープロセスを実行する。
さらに、データセットは、記録装置、デバイス配置、環境ラベル、テキストシーン記述など、豊富なメタデータを提供する。
我々は,強力なトランスフォーマーベースラインを構築し,アノテーション集約戦略,後処理方法,長文推論,およびメタデータがモデル性能に与える影響について検討する。
我々のベースラインは、テストセット上でのマクロ平均PSDS1スコア0.731を達成する。
我々は、RealDESEDが、現実的な国内環境下で堅牢なSEDシステムの開発と評価のための貴重なベンチマークを提供し、現在の研究ベンチマークと実世界の展開のギャップを埋めるのに役立つと考えている。
関連論文リスト
- AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following [17.52339026461815]
本稿では,複雑な音声キャプションを可変個の独立した検証可能なバイナリルーブリックアイテムに適応的に分解する動的ルーブリック評価パラダイムを提案する。
我々はこの能力をAnyAudio-Judge Benchでベンチマークする。
実験により、AnyAudio-Judgeは、最先端のベースラインに比べて、ゼロショットアライメントの検出を著しく向上する。
論文 参考訳(メタデータ) (2026-06-02T04:00:32Z) - DHAuDS: A Dynamic and Heterogeneous Audio Benchmark for Test-Time Adaptation [0.3728263002609659]
音声・音声分析におけるTTA (Test-Time Adaptation) 研究は、しばしば定型ないし不一致な雑音条件下でモデルを評価する。
本稿では,より現実的で多様な音響シフトの下でTTAアプローチを評価するためのベンチマークであるDHAuDSを提案する。
DHAuDSは、UrbanSound8K-C、SpeechCommandsV2-C、VocalSound-C、ReefSet-Cの4つの標準ベンチマークで構成されている。
論文 参考訳(メタデータ) (2025-11-23T12:19:23Z) - SVeritas: Benchmark for Robust Speaker Verification under Diverse Conditions [54.34001921326444]
話者検証(SV)モデルは、セキュリティ、パーソナライゼーション、アクセス制御システムにますます統合されている。
既存のベンチマークでは、これらの条件のサブセットのみを評価しており、他は完全に欠落している。
SVeritasは、録音時間、自発性、コンテンツ、ノイズ、マイクロホン距離、残響、チャンネルミスマッチ、オーディオ帯域幅、コーデック、話者年齢、スプーフィングおよび敵攻撃に対する感受性などのストレス下でのSVシステムの評価を行う総合的な話者検証タスクベンチマークスイートである。
論文 参考訳(メタデータ) (2025-09-21T14:11:16Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - Self-Supervised Visual Acoustic Matching [63.492168778869726]
音響マッチングは、ターゲットの音響環境に録音されたかのように、音声クリップを再合成することを目的としている。
そこで本研究では,対象のシーン画像と音声のみを含む,視覚的音響マッチングのための自己教師型アプローチを提案する。
提案手法は,条件付きGANフレームワークと新しいメトリクスを用いて,室内音響をアンタングル化し,音をターゲット環境に再合成する方法を共同で学習する。
論文 参考訳(メタデータ) (2023-07-27T17:59:59Z) - RealImpact: A Dataset of Impact Sound Fields for Real Objects [29.066504517249083]
制御条件下で記録された実物体衝撃音の大規模データセットであるRealImpactを提案する。
RealImpactには、50の毎日の物体の衝撃音の15万の録音と詳細なアノテーションが含まれている。
本研究では,物体衝撃音を推定するための現在のシミュレーション手法の参考として,我々のデータセットを用いた予備試行を行う。
論文 参考訳(メタデータ) (2023-06-16T16:25:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。