論文の概要: AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan
- arxiv url: http://arxiv.org/abs/2604.08184v1
- Date: Thu, 09 Apr 2026 12:38:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 18:34:05.919697
- Title: AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan
- Title(参考訳): AT-ADD:オール型オーディオディープフェイク検出課題評価計画
- Abstract要約: ACMマルチメディア2026におけるオールタイプオーディオディープフェイク検出(AT-ADD)グランドチャレンジを提案する。
AT-ADDは、堅牢で一般化可能なオーディオ法医学技術の開発を加速することを目的としている。
- 参考スコア(独自算出の注目度): 64.09595490689874
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid advancement of Audio Large Language Models (ALLMs) has enabled cost-effective, high-fidelity generation and manipulation of both speech and non-speech audio, including sound effects, singing voices, and music. While these capabilities foster creativity and content production, they also introduce significant security and trust challenges, as realistic audio deepfakes can now be generated and disseminated at scale. Existing audio deepfake detection (ADD) countermeasures (CMs) and benchmarks, however, remain largely speech-centric, often relying on speech-specific artifacts and exhibiting limited robustness to real-world distortions, as well as restricted generalization to heterogeneous audio types and emerging spoofing techniques. To address these gaps, we propose the All-Type Audio Deepfake Detection (AT-ADD) Grand Challenge for ACM Multimedia 2026, designed to bridge controlled academic evaluation with practical multimedia forensics. AT-ADD comprises two tracks: (1) Robust Speech Deepfake Detection, which evaluates detectors under real-world scenarios and against unseen, state-of-the-art speech generation methods; and (2) All-Type Audio Deepfake Detection, which extends detection beyond speech to diverse, unknown audio types and promotes type-agnostic generalization across speech, sound, singing, and music. By providing standardized datasets, rigorous evaluation protocols, and reproducible baselines, AT-ADD aims to accelerate the development of robust and generalizable audio forensic technologies, supporting secure communication, reliable media verification, and responsible governance in an era of pervasive synthetic audio.
- Abstract(参考訳): オーディオ大言語モデル(ALLM)の急速な進歩により、音声効果、歌声、音楽を含む音声と非音声の両方をコスト効率が高く、高忠実に生成し、操作することが可能になった。
これらの機能はクリエイティビティとコンテンツ生産を促進する一方で、現実的なオーディオディープフェイクを大規模に生成し、普及させることができるため、セキュリティと信頼の面での重大な課題も導入している。
しかし、既存の音声ディープフェイク検出(ADD)とベンチマークは、主に音声中心であり、しばしば音声固有のアーティファクトに依存し、実世界の歪みに制限された堅牢性を示す。
これらのギャップに対処するために,ACMマルチメディア2026におけるオールタイプオーディオディープフェイク検出(AT-ADD)グランドチャレンジを提案する。
AT-ADD は,(1) 実環境のシナリオ下で検出者を評価するロバスト音声深度検出,(2) 音声以外の様々な未知の音声タイプへの検出を拡張し,音声,音,歌,音楽のタイプ非依存的な一般化を促進する全型音声深度検出,の2つのトラックから構成される。
標準化されたデータセット、厳密な評価プロトコル、再現可能なベースラインを提供することにより、AT-ADDは、堅牢で一般化可能なオーディオ法医学技術の開発を加速し、セキュアな通信、信頼できるメディア検証、広汎な合成オーディオの時代における責任あるガバナンスをサポートすることを目的としている。
関連論文リスト
- MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection [18.1593708805924]
音声と環境音を異なる音響成分として扱う最初のベンチマークであるMADBenchを紹介する。
我々は、統一されたプロトコルの下で、最先端検出器とマルチモーダルな大規模言語モデルをベンチマークする。
実験の結果,環境音声操作は汎用エンコーダを用いた合成音声よりも検出しやすいことがわかった。
論文 参考訳(メタデータ) (2026-08-10T13:27:09Z) - Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception [19.10177637063233]
既存の対策 (CM) は単一型オーディオディープフェイク検出 (ADD) では良好に機能するが, クロスタイプのシナリオでは性能が低下する。
我々は、音声、音声、歌声、音楽のクロスタイプディープフェイク検出を取り入れ、現在のCMを評価するためのオールタイプADDベンチマークを包括的に確立した最初の人物である。
異なる音声タイプの聴覚知覚を考慮し,タイプ不変の聴覚深度情報をキャプチャするためのウェーブレット・プロンプト・チューニング(WPT)-SSL法を提案する。
論文 参考訳(メタデータ) (2025-04-09T10:18:45Z) - Measuring the Robustness of Audio Deepfake Detectors [59.09338266364506]
この研究は、16の一般的な汚職に対する10のオーディオディープフェイク検出モデルの頑健さを体系的に評価する。
従来のディープラーニングモデルと最先端の基礎モデルの両方を用いて、4つのユニークな観察を行う。
論文 参考訳(メタデータ) (2025-03-21T23:21:17Z) - Where are we in audio deepfake detection? A systematic analysis over generative and detection models [59.09338266364506]
SONARはAI-Audio Detection FrameworkとBenchmarkの合成である。
最先端のAI合成聴覚コンテンツを識別するための総合的な評価を提供する。
従来のモデルベース検出システムと基礎モデルベース検出システムの両方で、AIオーディオ検出を均一にベンチマークする最初のフレームワークである。
論文 参考訳(メタデータ) (2024-10-06T01:03:42Z) - SafeEar: Content Privacy-Preserving Audio Deepfake Detection [17.859275594843965]
音声コンテンツにアクセスすることなくディープフェイク音声を検知する新しいフレームワークであるSafeEarを提案する。
私たちのキーとなるアイデアは、ニューラルオーディオを、セマンティックおよび音響情報をオーディオサンプルから適切に分離する、新しいデカップリングモデルに組み込むことです。
このようにして、セマンティックな内容が検出器に露出されることはない。
論文 参考訳(メタデータ) (2024-09-14T02:45:09Z) - Proactive Detection of Voice Cloning with Localized Watermarking [50.13539630769929]
本稿では,AI生成音声の局所検出に特化して設計された,最初の音声透かし技術であるAudioSealを紹介する。
AudioSealは、ローカライゼーションロスと共同でトレーニングされたジェネレータ/検出器アーキテクチャを使用して、サンプルレベルまでローカライズされた透かし検出を可能にする。
AudioSealは、実生活のオーディオ操作に対する堅牢性と、自動的および人的評価指標に基づく非知覚性の観点から、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-01-30T18:56:22Z) - TranssionADD: A multi-frame reinforcement based sequence tagging model
for audio deepfake detection [11.27584658526063]
第2回Audio Deepfake Detection Challenge (ADD 2023)は、ディープフェイク音声の検出と分析を目的としている。
本稿では,モデルロバストネスと音声セグメント出力の解法として,新しいTranssionADDシステムを提案する。
提案システムの有効性とロバスト性を実証し, トラック2で2位となった。
論文 参考訳(メタデータ) (2023-06-27T05:18:25Z) - Deepfake audio detection by speaker verification [79.99653758293277]
本研究では,話者の生体特性のみを活用する新しい検出手法を提案する。
提案手法は,既成話者検証ツールに基づいて実装することができる。
そこで我々は,3つの一般的なテストセット上で,優れた性能,高い一般化能力,高ロバスト性を有する音声障害に対する高ロバスト性を検証した。
論文 参考訳(メタデータ) (2022-09-28T13:46:29Z) - Partially Fake Audio Detection by Self-attention-based Fake Span
Discovery [89.21979663248007]
本稿では,部分的に偽の音声を検出する自己認識機構を備えた質問応答(フェイクスパン発見)戦略を導入することで,新たな枠組みを提案する。
ADD 2022の部分的に偽の音声検出トラックで第2位にランクインした。
論文 参考訳(メタデータ) (2022-02-14T13:20:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。