論文の概要: Towards Robust Version Identification in the Wild: A Dataset, Benchmark, and Fine-Tuning Study
- arxiv url: http://arxiv.org/abs/2608.04543v1
- Date: Wed, 05 Aug 2026 07:28:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.770544
- Title: Towards Robust Version Identification in the Wild: A Dataset, Benchmark, and Fine-Tuning Study
- Title(参考訳): 野生におけるロバストバージョン同定に向けて:データセット,ベンチマーク,微調整研究
- Authors: Simon Hachmeier, R. Oguz Araz, Dmitry Bogdanov, Robert Jäschke, Xavier Serra,
- Abstract要約: 我々は1100万以上の音楽バージョンからなる大規模なVIデータセットであるDiVersを紹介した。
DiVersは自動的に割り当てられたタグとセグメントレベルの予測を提供する。
提案したデータセットを最先端VIシステムのトレーニングにより評価する。
- 参考スコア(独自算出の注目度): 9.415756457507383
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing datasets for musical version identification (VI) are primarily derived from curated metadata sources such as SecondHandSongs and Discogs, and are therefore dominated by professionally recorded tracks. This leads to a domain mismatch with real-world scenarios, where amateur and user-generated content is prevalent. To address this limitation, we introduce DiVers, a large-scale VI dataset comprising over 1.1 million musical versions, with train-validation-test splits compatible with established datasets such as Discogs-VI-YT, SHS100K, and Da-TACOS. In addition to standard version-level annotations, DiVers provides automatically assigned tags (e.g., instrumental, live) and segment-level predictions indicating the presence or absence of music. We evaluate the proposed dataset by training state-of-the-art VI systems. Our results show that models trained on DiVers achieve substantially improved robustness to acoustically diverse and noisy inputs, while maintaining a stable performance on cleaner, studio-quality benchmarks. We release the dataset metadata, code for its construction, and all experimental pipelines to support reproducibility.
- Abstract(参考訳): 既存のバージョン識別用データセット(VI)は、主にSecondHandSongsやD Discogsなどのキュレートされたメタデータソースから派生しており、プロが録音したトラックに支配されている。
これは、アマチュアやユーザ生成コンテンツが普及する現実世界のシナリオとのドメインミスマッチにつながる。
この制限に対処するため、Digigs-VI-YT、SHS100K、Da-TACOSといった既存のデータセットと互換性のある、1100万以上の音楽バージョンからなる大規模なVIデータセットであるDiVersを紹介した。
標準的なバージョンレベルのアノテーションに加えて、DiVersは自動的に割り当てられたタグ(例:楽器、ライブ)と、音楽の有無を示すセグメントレベルの予測を提供する。
提案したデータセットを最先端VIシステムのトレーニングにより評価する。
以上の結果から,DiVersでトレーニングしたモデルは,よりクリーンでスタジオ品質の高いベンチマークにおいて安定した性能を維持しつつ,音響的に多種多様でノイズの多い入力に対するロバスト性を大幅に向上させることが示唆された。
再現性をサポートするために、データセットメタデータ、構築のためのコード、すべての実験パイプラインをリリースします。
関連論文リスト
- RealDESED: A Real-World Domestic Sound Event Detection Benchmark [41.94606140754546]
RealDESED (RealDESED) は、652人の参加者が自宅で収集した5,710の音声録音からなる実世界の家庭内音響イベント検出(SED)ベンチマークである。
各録音は15秒から35秒間の長さで、15の一般的な家庭音の授業のための時間的に正確なアノテーションを含んでいる。
論文 参考訳(メタデータ) (2026-07-18T09:50:21Z) - Scaling Audio-Visual Quality Assessment Dataset via Crowdsourcing [62.250874651622574]
AVQAデータセット構築のための実用的なアプローチを提案する。
AVQAのためのクラウドソース型主観的実験フレームワークを設計し、インラブ設定の制約を破り、様々な環境にまたがって信頼性の高いアノテーションを実現する。
ユーザ生成オーディオおよびビデオシーケンス1,620のAVQAデータセットのうち,最大かつ最も多様なYT-NTU-AVQを用いて,このアプローチを検証する。
論文 参考訳(メタデータ) (2026-02-26T06:18:11Z) - ConceptCaps -- a Distilled Concept Dataset for Interpretability in Music Models [0.10923877073891443]
ConceptCapsは、200の属性の分類の明確なラベルを持つ23kのミュージックキャプションオーディオ三重奏曲のデータセットである。
VAEは可塑性属性共起パターンを学習し、微調整されたLCMは属性リストを専門的な記述に変換し、MusicGenは対応するオーディオを合成する。
音声テキストアライメント(CLAP)、言語品質指標(BERTScore, MAUVE)、およびTCAV分析により、概念プローブが音楽的に意味のあるパターンを復元することを確認した。
論文 参考訳(メタデータ) (2026-01-20T17:04:08Z) - Match Stereo Videos via Bidirectional Alignment [15.876953256378224]
最近の学習に基づく手法は、独立ステレオペアのパフォーマンスの最適化に重点を置いており、ビデオの時間的矛盾につながる。
本稿では,新しいビデオ処理フレームワークBiDAStereoとプラグイン安定化ネットワークBiDAStabilizerを紹介する。
本稿では,自然景観に着目したリアルな合成データセットとベンチマークと,様々な都市景観のステレオカメラが捉えた実世界のデータセットを定性評価として提示する。
論文 参考訳(メタデータ) (2024-09-30T13:37:29Z) - SpoofCeleb: Speech Deepfake Detection and SASV In The Wild [76.71096751337888]
SpoofCelebは、音声ディープフェイク検出(SDD)とスポフィングロバスト自動話者検証(SASV)のために設計されたデータセットである。
SpoofCelebは、1,251人のユニークな話者による250万以上の発話で構成され、自然界の状況下で収集されている。
論文 参考訳(メタデータ) (2024-09-18T23:17:02Z) - MARBLE: Music Audio Representation Benchmark for Universal Evaluation [79.25065218663458]
我々は,UniversaL Evaluation(MARBLE)のための音楽音響表現ベンチマークを紹介する。
音響、パフォーマンス、スコア、ハイレベルな記述を含む4つの階層レベルを持つ包括的分類を定義することで、様々な音楽情報検索(MIR)タスクのベンチマークを提供することを目的としている。
次に、8つの公開データセット上の14のタスクに基づいて統一されたプロトコルを構築し、ベースラインとして音楽録音で開発されたすべてのオープンソース事前学習モデルの表現を公平かつ標準的に評価する。
論文 参考訳(メタデータ) (2023-06-18T12:56:46Z) - Data leakage in cross-modal retrieval training: A case study [16.18916188804986]
提案したSoundDescベンチマークデータセットは,BBC Sound EffectsのWebページから自動的にソースされる。
SoundDescには、トレーニングデータを評価データに漏洩させる複数の重複が含まれていることが判明した。
オンラインで利用可能なデータセットに対して、新たなトレーニング、検証、テストの分割を提案します。
論文 参考訳(メタデータ) (2023-02-23T09:51:03Z) - Unaligned Supervision For Automatic Music Transcription in The Wild [1.2183405753834562]
NoteEMは、トランクレーバーを同時に訓練し、スコアを対応するパフォーマンスに合わせる方法である。
我々は、MAPSデータセットのSOTAノートレベル精度と、データセット間の評価において好適なマージンを報告した。
論文 参考訳(メタデータ) (2022-04-28T17:31:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。