論文の概要: Distinguishing AI-Generated Music from Edited Audio as a Hard-Negative Robustness Task
- arxiv url: http://arxiv.org/abs/2608.14916v1
- Date: Fri, 14 Aug 2026 22:03:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.125469
- Title: Distinguishing AI-Generated Music from Edited Audio as a Hard-Negative Robustness Task
- Title(参考訳): 難易度課題としての編集音声からのAI生成音楽の識別
- Abstract要約: 実世界のアップロードは、しばしばリミックス、再エンコード、ピッチシフト、その他編集される。
編集されたバージョンは、AIによって生成されたものではないが、合成オーディオ指紋に似たスペクトルアーティファクトを導入する。
我々は,この問題をAI生成音楽検出の難易度設定として検討し,同じアンカー曲から派生したAI生成・編集変奏曲に着目した。
- 参考スコア(独自算出の注目度): 39.146761527401424
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI-generated music detectors are commonly evaluated against original songs, but real-world uploads are often remixed, re-encoded, pitch-shifted, or otherwise edited. These edited versions form a difficult negative class: they are not generated by AI, yet they may introduce spectral artifacts that resemble synthetic audio fingerprints. We study this problem as a hard-negative robustness setting for AI-generated music detection, focusing on AI-generated and edited variants derived from the same anchor songs. We compile a YouTube-based dataset of AI, edited, and original variants, using the original tracks only as references, and train a binary AI versus edited detector. Audio is processed as 10-second clips and passed as raw waveforms to a pretrained PaSST spectrogram transformer. To reduce leakage, all splits are performed by anchor song. On the held-out test set, the final video-level system achieves 0.811 balanced accuracy. At clip level, AI-generated clips reach an F1-score of 0.836, while edited clips reach a lower F1-score of 0.720. The results suggest that AI-generated music retains detectable fingerprint-like spectral cues beyond ordinary editing, but the lower edited-class F1-score shows that these cues can still overlap with artifacts from edited audio. Grad-CAM visualizations are used to inspect whether high-confidence predictions rely on localized time-frequency regions.
- Abstract(参考訳): AIによって生成された音楽検出装置は、オリジナルの曲に対して一般的に評価されるが、実世界のアップロードは、しばしばリミックス、再エンコード、ピッチシフト、あるいは編集される。
これらの編集されたバージョンは、AIによって生成されたものではないが、合成オーディオ指紋に似たスペクトルアーティファクトを導入する。
我々は,この問題をAI生成音楽検出のための強硬な頑健性設定として検討し,同じアンカー曲から派生したAI生成・編集変奏曲に着目した。
私たちはYouTubeベースのAIデータセットをコンパイルし、オリジナルのトラックを参照としてのみ使用し、編集された検出器に対してバイナリAIをトレーニングします。
オーディオは10秒のクリップとして処理され、生波形としてトレーニング済みのPaSSTスペクトログラム変換器に渡される。
リークを低減するため、すべてのスプリットはアンカーソングによって実行される。
ホールドアウトテストセットでは、最終ビデオレベルシステムは0.811のバランスの取れた精度を達成する。
クリップレベルでは、AI生成されたクリップは0.836のF1スコアに到達し、編集されたクリップは0.720のF1スコアに到達している。
結果は、AIが生成した音楽は通常の編集以上の指紋のようなスペクトル的手がかりを検知できることを示唆するが、低い編集レベルのF1スコアは、これらの手がかりが編集されたオーディオのアーティファクトと重なる可能性があることを示している。
高信頼度予測が局所的な時間周波数領域に依存するかどうかを調べるために、Grad-CAM視覚化が使用される。
関連論文リスト
- How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures [39.04964205178628]
現在のAI音楽検出システムはバイナリであり、トラックを完全なAIまたは完全な人間として扱う。
連続AIエネルギー比における回帰問題として,AI音楽検出を[0, 1]でαに再構成する。
我々は、同様のCNNベースのアルファ回帰モデルをトレーニングし、同一パイプラインからの保留混合物上でMAE = 0.076とR2 = 0.85を達成する。
論文 参考訳(メタデータ) (2026-08-07T14:46:06Z) - FIGMA: Towards FIne-Grained Music retrievAl [65.98380295254817]
自然言語記述による音楽の検索はCLAPのような対照的な音声テキストモデルで改善されているが、現在のシステムはいまだに大まかなセマンティッククエリに限られている。
この制限は、長いキャプションで訓練されているにもかかわらず、CLAPベースのモデルは、最初の数個のトークンのみを効果的に活用する。
本研究では,グローバルな音声テキストアライメントとフレームレベルのトークンアライメントを共同で最適化することで,この制限に対処するマルチビューコントラストアーキテクチャであるFIGMAを提案する。
論文 参考訳(メタデータ) (2026-06-04T18:05:39Z) - Operation-Guided Progressive Human-to-AI Text Transformation Benchmark for Multi-Granularity AI-Text Detection [49.41415417307568]
OpAI-Benchは、プログレッシブな人間とAIのテキスト変換を研究するためのオペレーションガイド付きベンチマークである。
我々は、AIテキスト検出能力は、AI編集コンテンツの割合だけでなく、編集操作、ドメイン、累積修正履歴によっても支配されていることを示す。
論文 参考訳(メタデータ) (2026-06-04T17:58:05Z) - AI-Generated Music Detection in Broadcast Monitoring [1.1937220268355655]
我々は,放送スタイルのAI-音楽検出に適した最初のデータセットであるAI-OpenBMATを紹介する。
実際のテレビオーディオの持続パターンと大音量の関係に従う3,294の1分間のオーディオ抜粋を含んでいる。
我々は,SNRと持続ロバスト性を評価するために,CNNベースラインと最先端SpectTTTraモデルをベンチマークし,全放送シナリオで評価する。
論文 参考訳(メタデータ) (2026-02-06T16:08:01Z) - Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning [66.51617619673587]
AI生成ビデオにおける人間の知覚可能な視覚的アーティファクトを識別する,特殊な大規模言語モデル(MLLM)であるSkyraを紹介する。
この目的を達成するために、我々は、人間のアノテーションを微粒化した最初の大規模AI生成ビデオデータセットである、Supervised Fine-Tuning (SFT)のためのViF-CoT-4Kを構築した。
次に,モデルの時間的知覚,説明能力,検出精度を体系的に向上する2段階のトレーニング戦略を開発する。
論文 参考訳(メタデータ) (2025-12-17T18:48:26Z) - Segment Transformer: AI-Generated Music Detection via Music Structural Analysis [1.7034813545878587]
我々は,音楽セグメントの構造パターンを分析し,AIGM検出の精度を向上させることを目的とする。
具体的には、短い音声クリップから音楽的特徴を抽出するために、様々な事前学習モデルを統合する。
ロングオーディオのために,楽曲をセグメントに分割し,セグメント間関係を学習するセグメント変換器を開発した。
論文 参考訳(メタデータ) (2025-09-10T04:56:40Z) - DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning [58.70446237944036]
DAVID-Xは、AI生成ビデオに詳細な欠陥レベル、時間空間アノテーションと有理書を組み合わせた最初のデータセットである。
DAVID-XR1は、視覚的推論の解釈可能な連鎖を提供するために設計されたビデオ言語モデルである。
以上の結果から,AI生成ビデオコンテンツの信頼性確認のための説明可能な検出手法が期待できることを示す。
論文 参考訳(メタデータ) (2025-06-13T13:39:53Z) - Detecting Music Performance Errors with Transformers [3.6837762419929168]
既存の音楽誤り検出ツールは自動アライメントに依存している。
音楽エラー検出モデルをトレーニングするのに十分なデータが不足している。
本稿では,大規模な合成音楽誤りデータセットを作成することのできる新しいデータ生成手法を提案する。
論文 参考訳(メタデータ) (2025-01-03T07:04:20Z) - SONICS: Synthetic Or Not -- Identifying Counterfeit Songs [0.16777183511743465]
我々は、エンドツーエンド合成歌検出(SSD)のための新しいデータセットSONICSを紹介する。
歌唱における時間的長期依存性をモデル化することの重要性を強調した。
長い曲では、私たちのトップパフォーマンスの変種は、F1スコアでVTを8%上回り、より38%速く、メモリは26%減っています。
論文 参考訳(メタデータ) (2024-08-26T08:02:57Z) - Fully Automated End-to-End Fake Audio Detection [57.78459588263812]
本稿では,完全自動エンドツーエンド音声検出手法を提案する。
まず、wav2vec事前学習モデルを用いて、音声の高レベル表現を得る。
ネットワーク構造には, Light-DARTS という異種アーキテクチャサーチ (DARTS) の修正版を用いる。
論文 参考訳(メタデータ) (2022-08-20T06:46:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。