論文の概要: MADS: A Multiview Acoustic Descriptor Set Beyond Standard Spectral Summaries
- arxiv url: http://arxiv.org/abs/2609.00792v1
- Date: Tue, 01 Sep 2026 06:43:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.420903
- Title: MADS: A Multiview Acoustic Descriptor Set Beyond Standard Spectral Summaries
- Title(参考訳): MADS: 標準スペクトルを超越したマルチビュー音響ディスクリプタ
- Authors: Utsab Ghosh, Roshni Chakraborty,
- Abstract要約: 音声信号の相補的スペクトル,時間的,機械的,構造を捉えるためのコンパクトなディスクリプタセットであるMADS(Multi-view Acoustic Descriptor Set)を紹介する。
ESC-10, ESC-50, MSoSの標準機械学習モデルを用いてMADSを評価し, 従来の手作りベースラインと比較した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dominant audio classification pipelines rely either on compact handcrafted summaries or on fixed time-frequency frontends such as log-mel representations prior to deep modeling. While highly successful, these representations do not explicitly expose the physical dynamics of the underlying sound-generating event. We introduce MADS (Multi-view Acoustic Descriptor Set), a compact 19-dimensional physics-informed descriptor set de- signed to capture complementary spectral, temporal, mechanical, and stochastic structure in audio signals. Rather than treating sound only as a spectral pattern, MADS encodes properties related to excitation, damping, periodicity, impulsiveness, and structural consistency within a unified multi-view representation. We evaluate MADS using standard classical machine learning models on ESC-10, ESC-50, and MSoS, and compare it against two conventional handcrafted baselines: a compact 26D MFCC- based baseline and an expanded 38D spectral-summary baseline. Across ESC-10 and ESC-50, MADS achieves the strongest peak results overall, reaching 81.00% and 52.78%, respectively, while using roughly half the dimensionality of the 38D baseline. On MSoS, MADS again delivers the strongest top-end performance, reaching 67.48%. These results establish MADS not merely as a competitive standalone descriptor set, but as the foundational descriptor layer of a broader acoustically grounded representation program for future frame-level and deep-learning-compatible audio modeling.
- Abstract(参考訳): 支配的な音声分類パイプラインは、手作りのコンパクトな要約や、深いモデリングの前にログメル表現のような固定時間帯のフロントエンドに依存している。
非常に成功したが、これらの表現は、下層の音発生事象の物理力学を明示的に明らかに示していない。
音声信号の相補的スペクトル,時間的,機械的,確率的構造を捉えるために,コンパクトな19次元物理インフォームドディスクリプタセットMADS(Multi-view Acoustic Descriptor Set)を導入する。
音をスペクトルパターンとしてのみ扱うのではなく、MADSは励起、減衰、周期性、衝動性、構造的一貫性を統一された多視点表現として符号化する。
ESC-10, ESC-50, MSoSの標準機械学習モデルを用いてMADSを評価し, 従来の手作りベースラインである26D MFCCベースラインと38Dスペクトルサマリーベースラインとを比較した。
ESC-10 と ESC-50 全体では、MADS は、それぞれ81.00% と52.78% に達し、38D ベースラインの約半分の寸法を使用している。
MSoSでは、MADSは再び最強のトップエンドパフォーマンスを提供し、67.48%に達した。
これらの結果は,MADSを単なるスタンドアロン記述子セットとしてではなく,将来のフレームレベルおよびディープラーニング互換オーディオモデリングのための,より広範な音響基底表現プログラムの基本記述子層として確立する。
関連論文リスト
- Speech Emotion Recognition using Attention-based LSTM-Network with Residual Connection [0.0]
音声の感情認識は、現代の人間とコンピュータのインタラクションシステムにおいて重要な要素である。
本稿では,残差接続をソフトアテンションと統合した軽量アーキテクチャであるResLSTM-SAを提案する。
最高の性能を持つ変種(ResLSTM-SA-h64)は最大で0.6517のUARを達成し、46.8kの訓練可能なパラメータしか持たない。
論文 参考訳(メタデータ) (2026-06-02T09:08:59Z) - Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation [78.39988331831077]
Mega-ASRは、スケーラブルな複合データ構築とプログレッシブ・アコースティック・ツー・セマンティック・最適化を組み合わせる。
我々は,Mega-ASRが従来の最先端システムに対して,悪条件ASRベンチマークにおいて大きな優位性を発揮することを示す。
論文 参考訳(メタデータ) (2026-05-19T13:26:51Z) - Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens [62.56027815951259]
現在のオーディオ言語モデルは、主にテキストファーストであり、事前訓練されたテキストLLMバックボーンを拡張するか、意味のみのオーディオトークンに依存する。
本稿では,大規模音声に次トーケン予測を適用したネイティブオーディオ基礎モデルの系統的研究を行った。
論文 参考訳(メタデータ) (2026-02-18T18:32:46Z) - High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling [65.02357548201188]
DAVIS(Diffusion-based Audio-VIsual separation framework)を提案する。
本フレームワークは、混合音声入力と関連する視覚情報に基づいて、ノイズ分布から直接、所望の分離音スペクトルを合成することによって機能する。
論文 参考訳(メタデータ) (2025-09-26T08:46:00Z) - Machine Learning Framework for Audio-Based Content Evaluation using MFCC, Chroma, Spectral Contrast, and Temporal Feature Engineering [0.0]
そこで本研究では,YouTube上の音楽カバーの音声サンプルと,オリジナル曲の音声とユーザコメントからの感情スコアを含むデータセットを構築した。
我々のアプローチは、広範囲な事前処理、音声信号を30秒のウィンドウに分割し、高次元の特徴表現を抽出することである。
回帰モデルを用いて感情スコアを0-100スケールで予測し,それぞれ3.420,5.482,2.783,4.212の根平均二乗誤差(RMSE)値を達成する。
論文 参考訳(メタデータ) (2024-10-31T20:26:26Z) - Convolutional Variational Autoencoders for Spectrogram Compression in Automatic Speech Recognition [0.0]
本稿では、畳み込み変分オートエンコーダ(VAE)に基づく圧縮スペクトログラム表現の代替手法を提案する。
畳み込みVAEモデルは、13次元の埋め込みから短いオーディオスペクトログラム(25ms)の断片を再構成するために、LibriSpeechデータセットのサブサンプルで訓練された。
トレーニングされた40次元(300ms)の埋め込みモデルは、GoogleSpeechCommandsデータセットで音声コマンドのコーパスを生成するために使用された。
論文 参考訳(メタデータ) (2024-10-03T15:04:27Z) - Transformer-based Sequence Labeling for Audio Classification based on
MFCCs [0.0]
本稿では,MFCCを用いた音声分類のためのトランスフォーマーエンコーダモデルを提案する。
モデルはESC-50、Speech Commands v0.02、UrbanSound8kのデータセットに対してベンチマークされ、高いパフォーマンスを示している。
モデルは127,544の合計パラメータで構成されており、オーディオ分類タスクでは軽量だが高効率である。
論文 参考訳(メタデータ) (2023-04-30T07:25:43Z) - MAST: Multiscale Audio Spectrogram Transformers [53.06337011259031]
音声分類のためのマルチスケール音声スペクトログラム変換器(MAST)について,マルチスケール特徴階層の概念をAST(Audio Spectrogram Transformer)に適用した。
実際に、MASTはLAPEベンチマークの8つの音声および非音声タスクで平均3.4%の精度でASTを著しく上回っている。
論文 参考訳(メタデータ) (2022-11-02T23:34:12Z) - Low-complexity deep learning frameworks for acoustic scene
classification [64.22762153453175]
音響シーン分類(ASC)のための低複雑さ深層学習フレームワークを提案する。
提案するフレームワークは、フロントエンドのスペクトログラム抽出、オンラインデータ拡張、バックエンドの分類、予測される確率の後期融合の4つの主要なステップに分けることができる。
DCASE 2022 Task 1 Development データセットで実施した実験は,低複雑さの要求を十分に満たし,最も高い分類精度を 60.1% で達成した。
論文 参考訳(メタデータ) (2022-06-13T11:41:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。