論文の概要: TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data
- arxiv url: http://arxiv.org/abs/2609.00640v1
- Date: Tue, 01 Sep 2026 03:17:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.265347
- Title: TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data
- Title(参考訳): TUTTI:完全合成データによる一般化可能な音声合成を目指して
- Authors: Jianhuai Hu, Yashan Wang, Shangda Wu, Zhancheng Guo, Shijie Liang, Wuna Meng, Chuanqi Yang, Xiaobing Li, Feng Yu, Maosong Sun,
- Abstract要約: Generalizable Audio-to-Score (A2S) の書き起こしは、高品質な実世界のペアリングデータの深刻な不足によって制限される。
TUTTI (Transformer for Unified Audio-to-score Transcription trained on Synthetic Multi-Instrumentation Data) は、純粋に合成された大規模データセットによって駆動される事前学習パラダイムである。
複数構成データに対する統合された注意ベースモデルの事前学習は、単構成トレーニングよりも一貫して強力な表現が得られることを実証的に実証した。
- 参考スコア(独自算出の注目度): 31.79844009849322
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Generalizable Audio-to-Score (A2S) transcription is fundamentally constrained by the severe scarcity of high-quality, real-world paired data. Relying solely on existing human-annotated datasets often restricts the generalization of A2S models, limiting their efficacy primarily to single-instrumentation domains. To break this dependency on scarce real-world data, we introduce TUTTI (Transformer for Unified audio-To-score Transcription trained on Synthetic multi-Instrumentation Data), a pre-training paradigm driven by a purely synthetic, large-scale dataset. Rather than using human-composed scores, we leverage a symbolic music generation model to generate a massive, highly scalable multi-instrumentation corpus and create audio-score pairs with expressive acoustic characteristics. Capitalizing on the generated data, we employ a standard Transformer encoder-decoder architecture. We empirically demonstrate that pre-training a unified attention-based model on generated, multi-instrumentation data yields a consistently stronger foundational representation than single-instrumentation training. When fine-tuned with downstream real-world datasets, TUTTI outperforms previous approaches, establishing new overall state-of-the-art results across various A2S baselines. Notably, TUTTI shows remarkable cross-instrument transferability, effectively adapting to unseen instruments with highly competitive performance. The source code and the TuttiCorpus dataset will be made publicly available at https://github.com/a-musiclover/TUTTI.
- Abstract(参考訳): Generalizable Audio-to-Score (A2S) の転写は、高品質な実世界のペアリングデータの不足によって、基本的に制限されている。
既存の人間による注釈付きデータセットのみを頼りにすることで、A2Sモデルの一般化が制限され、その有効性は主に単一構造ドメインに制限される。
そこで本研究では,TUTTI (Transformer for Unified audio-to-score Transcription training on Synthetic Multi-Instrumentation Data)を導入する。
人間の構成した楽譜を使うのではなく、シンボリック音楽生成モデルを用いて、大規模でスケーラブルな多構成コーパスを生成し、表現力のある音響特性を持つオーディオスコアペアを作成する。
生成したデータに基づいて、標準のTransformer encoder-decoderアーキテクチャを採用する。
複数構成データに対する統合された注意ベースモデルの事前学習は、単構成トレーニングよりも一貫して強力な基礎表現をもたらすことを実証的に実証した。
下流の現実世界のデータセットで微調整された場合、TUTTIは以前のアプローチより優れており、さまざまなA2Sベースラインにまたがる、新たな総合的な結果を確立している。
特に、TUTTIは、非常に競争力のある未確認機器に効果的に適応し、優れたクロスストラクチャー転送性を示す。
ソースコードとTuttiCorpusデータセットはhttps://github.com/a-musiclover/TUTTIで公開されている。
関連論文リスト
- Towards Realistic Synthetic Data for Automatic Drum Transcription [3.975380931806995]
本稿では,ペアオーディオ-MIDIトレーニングデータの必要性を回避するために,ADT(Automatic Drum Transcription)の新たなパラダイムを提案する。
我々の主な貢献は、ラベルなし音源からの1発ドラムサンプルの多種多様なコーパスを自動的にキュレートする半教師付き手法である。
次に、このコーパスを用いて、MIDIファイルのみから高品質なデータセットを合成し、シーケンス対シーケンスの転写モデルをトレーニングする。
論文 参考訳(メタデータ) (2026-01-14T14:39:05Z) - Scaling Transformer-Based Novel View Synthesis Models with Token Disentanglement and Synthetic Data [53.040873127309766]
本稿では,トランスアーキテクチャ内でのトークンのアンタングル化プロセスを提案し,特徴分離を向上し,より効果的な学習を実現する。
提案手法は,データセット内およびデータセット間の評価において,既存のモデルよりも優れる。
論文 参考訳(メタデータ) (2025-09-08T17:58:06Z) - Where are we in audio deepfake detection? A systematic analysis over generative and detection models [59.09338266364506]
SONARはAI-Audio Detection FrameworkとBenchmarkの合成である。
最先端のAI合成聴覚コンテンツを識別するための総合的な評価を提供する。
従来のモデルベース検出システムと基礎モデルベース検出システムの両方で、AIオーディオ検出を均一にベンチマークする最初のフレームワークである。
論文 参考訳(メタデータ) (2024-10-06T01:03:42Z) - Synthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data [69.7174072745851]
音声分類データセットを合成データで拡張する新しい手法であるSynthioを提案する。
最初の課題を克服するために、好みの最適化を用いて、T2Aモデルの世代と小規模データセットを整列する。
2つ目の課題に対処するために,大規模言語モデルの推論能力を活用する新しいキャプション生成手法を提案する。
論文 参考訳(メタデータ) (2024-10-02T22:05:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。