論文の概要: Assessing AI-generated music detection in real-world broadcast monitoring
- arxiv url: http://arxiv.org/abs/2608.07359v1
- Date: Fri, 07 Aug 2026 15:58:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.543987
- Title: Assessing AI-generated music detection in real-world broadcast monitoring
- Title(参考訳): リアルタイム放送監視におけるAIによる音楽検出の評価
- Authors: David López-Ayala, Fernando García de la Cruz, Pablo Zinemanas, Emilio Molina, Martín Rocamora,
- Abstract要約: BAMM(Broadcast AI-Music Monitoring, 放送AI-Music Monitoring, 放送AI-Music Monitoring, 放送AI-Music Monitoring, 放送AI-Music Monitoring)を紹介する。
クリーントレーニングされたCNNとブロードキャストトレーニングされたCNNの3つのシナリオを比較した。
両モデルともCFMではほぼ完璧な性能を示すが、合成放送条件下では大幅に劣化する。
- 参考スコア(独自算出の注目度): 39.04964205178628
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The proliferation of AI-generated music in broadcast media raises concerns about transparency and fair compensation, but reliable detection under real broadcast conditions remains unresolved. Existing studies report substantial performance degradation in this domain, yet their evaluations are limited to synthetic broadcast data. To address this gap, we introduce BAMM (Broadcast AI-Music Monitoring), a 40-hour dataset of real-world television recordings containing AI-generated and human-made music. We compare clean-trained and broadcast-trained CNN variants across three progressively more challenging scenarios: Clean Foreground Music (CFM), Synthetic TV Broadcast (STB), and Real TV Broadcast (RTB). Both models achieve near-perfect performance on CFM but degrade substantially under synthetic broadcast conditions. Broadcast-oriented training improves robustness compared with clean training, although performance remains limited. On RTB, evaluated using BAMM, both models degrade further and show substantial score overlap between AI-generated and human-made music. These results expose a critical domain gap and show that current training approaches on CNN-based detectors remain insufficient for reliable AI-generated music detection in broadcast monitoring.
- Abstract(参考訳): 放送メディアにおけるAI生成音楽の拡散は透明性と公正な補償に関する懸念を高めるが、実際の放送条件下での信頼性の高い検出は未解決のままである。
既存の研究では、この領域ではかなりの性能劣化が報告されているが、それらの評価は合成放送データに限られている。
このギャップに対処するために,我々は,AI生成と人為的な音楽を含む実世界のテレビ録画の40時間のデータセットであるBAMM(Broadcast AI-Music Monitoring)を紹介した。
クリーンフォアグラウンド・ミュージック(CFM)、シンセティック・テレビ・ブロードキャスト(STB)、リアル・テレビ・ブロードキャスト(RTB)の3つの難題を比較した。
両モデルともCFMではほぼ完璧な性能を示すが、合成放送条件下では大幅に劣化する。
放送指向のトレーニングは、クリーンなトレーニングに比べて堅牢性を改善するが、パフォーマンスは制限されている。
BAMMを用いて評価したRTBでは、どちらのモデルもさらに劣化し、AI生成音楽と人為音楽の間にかなりのスコアオーバーラップを示す。
これらの結果は重要な領域ギャップを明らかにし、CNNベースの検出器に対する現在のトレーニングアプローチは、放送監視における信頼性の高いAI生成音楽検出には不十分であることを示す。
関連論文リスト
- SphereVideo: Prototype-anchored Hyperspherical Boundary for Continual AI-generated Video Detection [61.05420454815012]
AI生成ビデオ(AIGV)検出は、実際のビデオとAI生成ビデオとを区別することを目的としている。
実際には、既存のデータに基づいて訓練された検出器は、新しい生成モデルへの一般化に失敗することが多い。
2つの重要な観測結果に基づいてAIGV検出のための新しいフレームワークであるSphereVideoを提案する。
論文 参考訳(メタデータ) (2026-08-02T15:54:54Z) - Dataset Biases and Shortcut Learning in Motion-Based AI-Generated Video Detection [0.8092772265574579]
我々は4つの最先端モーションベースAI生成ビデオ検出器の堅牢性と適用性を評価する。
これらの手法では,前処理やサンプリングのバイアスが顕著であり,報告された性能のかなりの部分を占めていることを示す。
すべての検出器に対して、この動きバイアスを含まないデータセットで評価すると、性能がほぼランダムなレベルに低下することを示す。
論文 参考訳(メタデータ) (2026-07-01T13:47:42Z) - Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection [80.15317858033534]
ForeAgentは、反復的な自己進化を伴うAI生成画像検出のためのエージェント法医学フレームワークである。
ForeAgentはChameleonベンチマークで最先端のパフォーマンスを達成し、精度は82.18%に達した。
ForeAgent は GPT-5 や GPT-5-mini と比較して、より一貫性があり、因果的な推論をもたらす。
論文 参考訳(メタデータ) (2026-06-25T02:59:33Z) - AI-Generated Music Detection in Broadcast Monitoring [1.1937220268355655]
我々は,放送スタイルのAI-音楽検出に適した最初のデータセットであるAI-OpenBMATを紹介する。
実際のテレビオーディオの持続パターンと大音量の関係に従う3,294の1分間のオーディオ抜粋を含んでいる。
我々は,SNRと持続ロバスト性を評価するために,CNNベースラインと最先端SpectTTTraモデルをベンチマークし,全放送シナリオで評価する。
論文 参考訳(メタデータ) (2026-02-06T16:08:01Z) - Detecting Musical Deepfakes [0.0]
本研究では,FakeMusicCapsデータセットを用いたAI生成楽曲の検出について検討した。
実世界の逆境条件をシミュレートするため, テンポストレッチとピッチシフトをデータセットに適用した。
メルスペクトログラムは、修正されたオーディオから生成され、その後、畳み込みニューラルネットワークのトレーニングと評価に使用された。
論文 参考訳(メタデータ) (2025-05-03T21:45:13Z) - A Bias-Free Training Paradigm for More General AI-generated Image Detection [15.421102443599773]
良く設計された法医学的検知器は、データバイアスを反映するのではなく、生成物固有のアーティファクトを検出する必要がある。
本稿では,実画像から偽画像を生成する,バイアスのない学習パラダイムであるB-Freeを提案する。
我々は,最先端検出器の一般化とロバスト性の両方において有意な改善が認められた。
論文 参考訳(メタデータ) (2024-12-23T15:54:32Z) - Self-supervision versus synthetic datasets: which is the lesser evil in
the context of video denoising? [11.0189148044343]
監督されたトレーニングは、画像やビデオのデノベーションの最先端の結果につながった。
入手が難しいノイズとクリーンのペアの大規模なデータセットが必要です。
いくつかの自己教師型フレームワークは、ノイズの多いデータに基づいて、そのようなデノベーションネットワークを直接訓練するために提案されている。
論文 参考訳(メタデータ) (2022-04-25T08:17:36Z) - Bridging the Gap Between Clean Data Training and Real-World Inference
for Spoken Language Understanding [76.89426311082927]
既存のモデルはクリーンデータに基づいてトレーニングされ、クリーンデータトレーニングと現実世界の推論の間にtextitgapが発生する。
本稿では,良質なサンプルと低品質のサンプルの両方が類似ベクトル空間に埋め込まれた領域適応法を提案する。
広く使用されているデータセット、スニップス、および大規模な社内データセット(1000万のトレーニング例)に関する実験では、この方法は実世界の(騒々しい)コーパスのベースラインモデルを上回るだけでなく、堅牢性、すなわち、騒々しい環境下で高品質の結果を生み出すことを実証しています。
論文 参考訳(メタデータ) (2021-04-13T17:54:33Z) - RNN-T Models Fail to Generalize to Out-of-Domain Audio: Causes and
Solutions [73.45995446500312]
ストリーミングおよび非ストリーミングリカレントニューラルネットワークトランスデューサ(RNN-T)のエンド・ツー・エンドモデルにおける一般化特性を解析した。
トレーニング中に複数の正規化手法を組み合わせる方法と,動的重複推論を用いる方法を提案する。
論文 参考訳(メタデータ) (2020-05-07T06:24:47Z) - Deep Speaker Embeddings for Far-Field Speaker Recognition on Short
Utterances [53.063441357826484]
深層話者埋め込みに基づく話者認識システムは,制御条件下での大幅な性能向上を実現している。
制御されていない雑音環境下での短い発話に対する話者検証は、最も困難で要求の高いタスクの1つである。
本稿では,a)環境騒音の有無による遠距離話者検証システムの品質向上,b)短時間発話におけるシステム品質劣化の低減という2つの目標を達成するためのアプローチを提案する。
論文 参考訳(メタデータ) (2020-02-14T13:34:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。