論文の概要: MulTTiPop: A Multitrack Transcription Dataset for Pop Music
- arxiv url: http://arxiv.org/abs/2607.08756v1
- Date: Thu, 09 Jul 2026 17:55:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.618599
- Title: MulTTiPop: A Multitrack Transcription Dataset for Pop Music
- Title(参考訳): MulTTiPop:ポップミュージックのためのマルチトラック転写データセット
- Abstract要約: MulTTiPopは、ポップミュージックセグメントと関連するマルチトラックMIDIレコードのデータセットである。
MulTTiPopには572曲のポピュラー音楽が含まれており、3.5時間分のオーディオがある。
我々は、MulTTiPop上での最先端の音楽自動書き起こしモデルの評価を行い、改善の余地を見出した。
- 参考スコア(独自算出の注目度): 49.06419020509759
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present MulTTiPop, a dataset of pop music segments and their associated multitrack MIDI recordings for the evaluation of automatic music transcription models. MulTTiPop contains 572 segments of popular music totaling 3.5 hours of audio, and contains songs from diverse genres and decades from the 1930s to 2000s. To collect this dataset, we perform metadata-based matching on song segments from the Lakh MIDI and TheoryTab datasets, manually identify an anchor beat between the audio and MIDI, then use beat tracking on the audio and warp the MIDI to match its tempo and timing. We evaluate state-of-the-art automatic music transcription models on MulTTiPop and find substantial room for improvement, with the best model achieving 38% Onset F1. More details and sound examples of MulTTiPop are available at https://gclef-cmu.org/multtipop.
- Abstract(参考訳): 本稿では,MulTTiPopについて紹介する。MulTTiPopはポップ・ミュージック・セグメントのデータセットであり,それに関連するマルチトラックMIDI記録を用いて自動楽譜生成モデルの評価を行う。
MulTTiPopは572曲のポピュラー音楽が3.5時間、1930年代から2000年代にかけての様々なジャンルや数十年の楽曲が収録されている。
このデータセットを収集するために、Lakh MIDI と TheoryTab のデータセットから楽曲セグメントのメタデータベースのマッチングを行い、音声と MIDI の間のアンカービートを手動で識別し、音声上でビートトラッキングを使用して、MIDI のテンポとタイミングに合わせてワープする。
我々は,MulTTiPop上での最先端の音楽自動書き起こしモデルを評価し,最も優れたモデルである38%のオンセットF1を達成し,大幅な改善の余地を見出した。
MulTTiPopの詳細と音の例はhttps://gclef-cmu.org/multtipop.com/で公開されている。
関連論文リスト
- Barwise Section Boundary Detection in Symbolic Music Using Convolutional Neural Networks [0.0]
セクション境界検出のための人手によるMIDIデータセットを提案する。
第2に、固定長の音楽窓におけるセクション境界の存在を分類するために、深層学習モデルを訓練する。
本モデルではF1スコアの0.77を達成し,類似した音声に基づく教師あり学習手法を改良した。
論文 参考訳(メタデータ) (2025-09-20T07:52:08Z) - PianoVAM: A Multimodal Piano Performance Dataset [56.318475235705954]
PianoVAMは、ビデオ、オーディオ、MIDI、手のランドマーク、指のラベル、リッチメタデータを含む包括的なピアノパフォーマンスデータセットである。
データセットはディクラヴィエピアノを使用して録音され、アマチュアピアニストの日々の練習セッション中にオーディオとMIDIをキャプチャした。
事前訓練されたポーズ推定モデルと半自動指先アノテーションアルゴリズムを用いて,手指のランドマークと指先ラベルを抽出した。
論文 参考訳(メタデータ) (2025-09-10T17:35:58Z) - Aria-MIDI: A Dataset of Piano MIDI Files for Symbolic Music Modeling [1.3812010983144802]
ピアノ演奏の録音を音符に書き起こして作成したMIDIファイルのデータセットについて紹介する。
私たちが使っているデータパイプラインはマルチステージで、インターネットから自律的にクロールしてオーディオ録音をスコアする言語モデルを採用しています。
得られたデータセットには100万以上の異なるMIDIファイルが含まれており、約10万時間の音声が書き起こされている。
論文 参考訳(メタデータ) (2025-04-21T12:59:40Z) - The GigaMIDI Dataset with Features for Expressive Music Performance Detection [5.585625844344932]
GigaMIDIデータセットには、140万以上のユニークなMIDIファイルが含まれており、180億のMIDIノートイベントと530万のMIDIトラックが含まれている。
このGigaMIDIのキュレートされたイテレーションは、NOMMLによって検出された、GigaMIDIデータセットの31%を構成する、明示的なパフォーマンスの楽器トラックを含んでいる。
論文 参考訳(メタデータ) (2025-02-24T23:39:40Z) - PIAST: A Multimodal Piano Dataset with Audio, Symbolic and Text [8.382511298208003]
PIAST(PIAST, PIano dataset with Audio, Symbolic, and Text)は、ピアノ音楽のデータセットである。
われわれはYouTubeから9,673曲を収集し、音楽の専門家による2,023曲の人間のアノテーションを追加した。
どちらも、オーディオ、テキスト、タグアノテーション、そして最先端のピアノの書き起こしとビート追跡モデルを利用したMIDIの書き起こしである。
論文 参考訳(メタデータ) (2024-11-04T19:34:13Z) - Accompanied Singing Voice Synthesis with Fully Text-controlled Melody [61.147446955297625]
Text-to-song (TTSong) は、歌声の伴奏を合成する音楽生成タスクである。
完全テキスト制御されたメロディで高品質な曲を生成する最初のTTSongモデルであるMelodyLMを提案する。
論文 参考訳(メタデータ) (2024-07-02T08:23:38Z) - MidiCaps: A large-scale MIDI dataset with text captions [6.806050368211496]
本研究の目的は,LLMとシンボリック音楽を組み合わせることで,テキストキャプションを付加した最初の大規模MIDIデータセットを提示することである。
近年のキャプション技術の発展に触発されて,テキスト記述付き168kのMIDIファイルをキュレートしたデータセットを提示する。
論文 参考訳(メタデータ) (2024-06-04T12:21:55Z) - Melody transcription via generative pre-training [86.08508957229348]
メロディの書き起こしの鍵となる課題は、様々な楽器のアンサンブルや音楽スタイルを含む幅広いオーディオを処理できる方法を構築することである。
この課題に対処するために、広帯域オーディオの生成モデルであるJukebox(Dhariwal et al. 2020)の表現を活用する。
広義音楽のクラウドソースアノテーションから50ドル(約5,400円)のメロディ書き起こしを含む新しいデータセットを導出する。
論文 参考訳(メタデータ) (2022-12-04T18:09:23Z) - PopMAG: Pop Music Accompaniment Generation [190.09996798215738]
単一シーケンスでの同時マルチトラック生成が可能なMUlti-track MIDI表現(MuMIDI)を提案する。
MuMIDIはシーケンス長を拡大し、長期音楽モデリングの新しい課題をもたらす。
我々は,ポップミュージックの伴奏生成をPopMAGと呼ぶ。
論文 参考訳(メタデータ) (2020-08-18T02:28:36Z) - Foley Music: Learning to Generate Music from Videos [115.41099127291216]
Foley Musicは、楽器を演奏する人々に関するサイレントビデオクリップのために、可愛らしい音楽を合成できるシステムだ。
まず、ビデオから音楽生成に成功するための2つの重要な中間表現、すなわち、ビデオからのボディーキーポイントと、オーディオ録音からのMIDIイベントを識別する。
身体の動きに応じてMIDIイベントシーケンスを正確に予測できるグラフ$-$Transformerフレームワークを提案する。
論文 参考訳(メタデータ) (2020-07-21T17:59:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。