論文の概要: Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset
- arxiv url: http://arxiv.org/abs/2608.06165v1
- Date: Thu, 06 Aug 2026 15:33:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.944051
- Title: Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset
- Title(参考訳): 事前学習機能、データ拡張、新しいシートセージ-A2Sデータセットを用いた音声からスコアへの転写
- Authors: Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoro Mo, Yaolong Ju,
- Abstract要約: 既存のオーディオ・トゥ・スコアシステム(A2S)は主にクラシック音楽に焦点を当てており、ポピュラー音楽への応用は未検討のままである。
本論文はまず,テキストt**kernスコアエンコーディングを9,468クリップで61時間の音声を含むSheetSage-A2Sデータセットを提案する。
また,データ拡張とMuQを用いて既存のA2Sアプローチを改善した。
- 参考スコア(独自算出の注目度): 42.562297895496705
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Existing audio-to-score (A2S) systems primarily focus on classical music, and the application to popular music remains underexplored. This paper first presents the new SheetSage-A2S Dataset, which includes 61 hours of audio with \texttt{**kern} score encodings for 9,468 clips originating from 6,066 unique songs, the first of its kind to facilitate A2S research for popular music. Additionally, we improve on existing A2S approaches by using data augmentation and MuQ, a pretrained feature-extraction model for music audio, to enhance generalisation abilities and extract meaningful audio features. Results show that the proposed A2S model achieves 4.98\% symbol error rate (SER) on the Quartets collection for classical music, which significantly outperforms the 15.3\% SER from the existing state-of-the-art \cite{alfaro-contrerasTransformer2024}. Additionally, our model achieves 20.92\% SER on the SheetSage-A2S dataset for popular music, serving as a strong benchmark for future research. The dataset, model, and code are made publicly available at: https://github.com/Multimodal-Music-Research-Lab/SheetSage2Kern_model.
- Abstract(参考訳): 既存のオーディオ・トゥ・スコアシステム(A2S)は主にクラシック音楽に焦点を当てており、ポピュラー音楽への応用は未検討のままである。
本論文は,6,066曲を起源とする9,468曲のスコアエンコーディングを収録した61時間の音声を含むシートセージA2Sデータセットについて述べる。
さらに,データ拡張とMuQを用いて既存のA2Sアプローチを改善し,一般化能力を高め,有意義な音声特徴を抽出する。
提案したA2Sモデルは、クラシック音楽の四重奏曲集において4.98\%のシンボル誤り率(SER)を達成し、既存の最先端の「alfaro-contreras Transformer2024」から15.3\%のSERを著しく上回っている。
さらに、我々のモデルは、ポピュラー音楽のためのシートセージ-A2Sデータセット上で20.92\%のSERを達成し、将来の研究の強力なベンチマークとなる。
データセット、モデル、コードは、https://github.com/Multimodal-Music-Research-Lab/SheetSage2Kern_modelで公開されている。
関連論文リスト
- Who Will Top the Charts? Multimodal Music Popularity Prediction via Adaptive Fusion of Modality Experts and Temporal Engagement Modeling [47.3124073459729]
GAMENetは、音楽人気予測のためのエンドツーエンドのマルチモーダルディープラーニングアーキテクチャである。
適応的なゲーティング機構を通じて、オーディオ、歌詞、ソーシャルメタデータのモダリティ固有の専門家を統合する。
直接マルチモーダル特徴結合よりもR2が12%改善されている。
論文 参考訳(メタデータ) (2025-12-06T03:07:43Z) - Detecting Music Performance Errors with Transformers [3.6837762419929168]
既存の音楽誤り検出ツールは自動アライメントに依存している。
音楽エラー検出モデルをトレーニングするのに十分なデータが不足している。
本稿では,大規模な合成音楽誤りデータセットを作成することのできる新しいデータ生成手法を提案する。
論文 参考訳(メタデータ) (2025-01-03T07:04:20Z) - Audio Processing using Pattern Recognition for Music Genre Classification [0.0]
本研究は,GTZANデータセットを用いた音楽ジャンル分類における機械学習手法の適用について検討する。
パーソナライズされた音楽レコメンデーションの需要が高まる中、私たちは、ブルース、クラシック、ジャズ、ヒップホップ、カントリーという5つのジャンルの分類に注力しました。
ANNモデルは最高の性能を示し、検証精度は92.44%に達した。
論文 参考訳(メタデータ) (2024-10-19T05:44:05Z) - Taming Data and Transformers for Audio Generation [31.815960560115176]
AutoReCap-XLは、4700万回以上のクリップを持つ、最大の環境オーディオテキストデータセットである。
AutoCapは高品質のオーディオキャプションモデルである。
GenAuはスケーラブルなトランスフォーマーベースのオーディオ生成アーキテクチャである。
論文 参考訳(メタデータ) (2024-06-27T17:58:54Z) - Practical End-to-End Optical Music Recognition for Pianoform Music [3.69298824193862]
私たちはLinearized MusicXMLと呼ばれるシーケンシャルなフォーマットを定義します。
我々は,OpenScore Lieder corpus に基づいて MusicXML をベースとしたベンチマーク型セット OMR を作成する。
データセットのベースラインとして機能し、TEDnメトリックを使用してモデルを評価するために、エンドツーエンドモデルをトレーニングし、微調整する。
論文 参考訳(メタデータ) (2024-03-20T17:26:22Z) - Music Understanding LLaMA: Advancing Text-to-Music Generation with
Question Answering and Captioning [37.76488341368786]
テキスト・ツー・ミュージック・ジェネレーション(T2M-Gen)は、自然言語キャプションを備えた大規模公開楽曲データセットが不足しているため、大きな障害に直面している。
音楽関連質問に答え、音楽ファイルのキャプションを生成することができる音楽理解LLaMA(MU-LLaMA)を提案する。
本稿では,既存の音声キャプションデータセットから質問応答ペアを生成する手法を提案し,MusicQAデータセットを紹介する。
論文 参考訳(メタデータ) (2023-08-22T08:43:33Z) - MARBLE: Music Audio Representation Benchmark for Universal Evaluation [79.25065218663458]
我々は,UniversaL Evaluation(MARBLE)のための音楽音響表現ベンチマークを紹介する。
音響、パフォーマンス、スコア、ハイレベルな記述を含む4つの階層レベルを持つ包括的分類を定義することで、様々な音楽情報検索(MIR)タスクのベンチマークを提供することを目的としている。
次に、8つの公開データセット上の14のタスクに基づいて統一されたプロトコルを構築し、ベースラインとして音楽録音で開発されたすべてのオープンソース事前学習モデルの表現を公平かつ標準的に評価する。
論文 参考訳(メタデータ) (2023-06-18T12:56:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。