論文の概要: MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection
- arxiv url: http://arxiv.org/abs/2608.09593v1
- Date: Mon, 10 Aug 2026 13:27:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.288605
- Title: MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection
- Title(参考訳): MADBench: モーダリティを意識したオーディオディープフェイク検出のためのベンチマーク
- Abstract要約: 音声と環境音を異なる音響成分として扱う最初のベンチマークであるMADBenchを紹介する。
我々は、統一されたプロトコルの下で、最先端検出器とマルチモーダルな大規模言語モデルをベンチマークする。
実験の結果,環境音声操作は汎用エンコーダを用いた合成音声よりも検出しやすいことがわかった。
- 参考スコア(独自算出の注目度): 18.1593708805924
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in speech synthesis and audio generation have made high-fidelity acoustic forgery low-cost and difficult to attribute, enabling a realistic attack scenario in which speech and background audio are independently manipulated over otherwise authentic video. Yet existing research either focuses on visual manipulation, addresses speech detection in isolation, or conflates speech and non-speech audio as a single undifferentiated audio stream, overlooking the distinct forensic challenges posed by background audio. This conflation is consequential: the two acoustic components arise from fundamentally different generative mechanisms, exhibit distinct artifact profiles, and pose different challenges to detection systems. We introduce MADBench, the first benchmark that treats speech and environmental audio as distinct acoustic components, enabling component-aware evaluation of audio deepfake detection across independently manipulated forgery sources. We benchmark representative state-of-the-art detectors and multimodal large language models under a unified protocol. Our experiments reveal that environmental audio manipulation is more detectable than synthetic speech across general-purpose encoders, while existing pretrained detectors fail on both acoustic components, and manipulated environmental audio asymmetrically degrades speech deepfake detection, findings entirely invisible under the single-label paradigm of prior benchmarks. MADBench establishes a rigorous foundation for future research into robust, component-aware audio deepfake detection.
- Abstract(参考訳): 近年,音声合成と音声生成の進歩により,高忠実度音響フォージェリーの低コスト化と特性評価が困難化している。
しかし、既存の研究は、視覚的な操作に焦点を当てたり、孤立した音声検出に対処したり、音声と非音声の音声を単一の未分化のオーディオストリームとして融合させたりしている。
2つの音響成分は基本的に異なる生成機構から生じ、異なるアーチファクトプロファイルを示し、検出システムに異なる課題を提起する。
音声と環境オーディオを別個の音響成分として扱う最初のベンチマークであるMADBenchを導入する。
我々は、統一されたプロトコルの下で、最先端検出器とマルチモーダルな大規模言語モデルをベンチマークする。
実験の結果,既存の事前学習型検知器は両方の音響成分で故障するのに対して,環境音声の操作は汎用エンコーダの合成音声よりも検出しやすく,音声深度検出を非対称的に非対称に劣化させることがわかった。
MADBenchは、堅牢でコンポーネント対応のオーディオディープフェイク検出に関する将来の研究のための厳格な基盤を確立する。
関連論文リスト
- AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan [64.09595490689874]
ACMマルチメディア2026におけるオールタイプオーディオディープフェイク検出(AT-ADD)グランドチャレンジを提案する。
AT-ADDは、堅牢で一般化可能なオーディオ法医学技術の開発を加速することを目的としている。
論文 参考訳(メタデータ) (2026-04-09T12:38:19Z) - SNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detection [51.096014381455454]
自己教師付き学習ベースの音声エンコーダは、目に見えない話者を一般化するのに苦労する。
話者の絡み合いは、検出者が人工物に関連する手がかりではなく、話者固有の相関を悪用する原因となる。
我々は、この依存を軽減するために、SNAPという話者無効化フレームワークを紹介した。
論文 参考訳(メタデータ) (2026-03-21T07:05:30Z) - Defense Against Synthetic Speech: Real-Time Detection of RVC Voice Conversion Attacks [0.0]
生成オーディオ技術は、高度にリアルな音声クローニングとリアルタイム音声変換を可能にする。
本研究では,検索音声変換を用いたAI生成音声のリアルタイム検出について検討する。
論文 参考訳(メタデータ) (2025-12-31T02:06:42Z) - AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation [55.607230723223346]
本研究は,Large Audio Model (LAM) をAudioJudgeの裁判官として体系的に研究し,両課題に対処する統一評価フレームワークを提供することができるかどうかを検討する。
本稿では、発音、発話速度、話者識別、音声品質、自動ベンチマークのためのシステムレベルの人間の嗜好シミュレーションなど、音声特徴検出タスクにまたがるAudioJudgeについて検討する。
本稿では,多視点アンサンブルAudioJudgeを導入し,音声評価を語彙内容,音声品質,パラ言語特徴の専門判断者に分解し,人間の嗜好と最大0.91のスピアマン相関を達成させる手法を提案する。
論文 参考訳(メタデータ) (2025-07-17T00:39:18Z) - Exposing Synthetic Speech: Model Attribution and Detection of AI-generated Speech via Audio Fingerprints [11.703509488782345]
我々は、AI生成音声を検出するためのトレーニング不要で効果的なアプローチを導入する。
本研究では,(1)オープンワールド環境における単一モデル帰属,(2)クローズドワールド環境における多モデル帰属,(3)合成音声と実音声の検知という3つの重要な課題に取り組む。
論文 参考訳(メタデータ) (2024-11-21T10:55:49Z) - Where are we in audio deepfake detection? A systematic analysis over generative and detection models [59.09338266364506]
SONARはAI-Audio Detection FrameworkとBenchmarkの合成である。
最先端のAI合成聴覚コンテンツを識別するための総合的な評価を提供する。
従来のモデルベース検出システムと基礎モデルベース検出システムの両方で、AIオーディオ検出を均一にベンチマークする最初のフレームワークである。
論文 参考訳(メタデータ) (2024-10-06T01:03:42Z) - SafeEar: Content Privacy-Preserving Audio Deepfake Detection [17.859275594843965]
音声コンテンツにアクセスすることなくディープフェイク音声を検知する新しいフレームワークであるSafeEarを提案する。
私たちのキーとなるアイデアは、ニューラルオーディオを、セマンティックおよび音響情報をオーディオサンプルから適切に分離する、新しいデカップリングモデルに組み込むことです。
このようにして、セマンティックな内容が検出器に露出されることはない。
論文 参考訳(メタデータ) (2024-09-14T02:45:09Z) - AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection [49.81915942821647]
本研究では、ディープフェイクビデオを検出するために、オーディオ・ヴィジュアル・トランスフォーマー・ベースのアンサンブルネットワーク(AVTENet)を導入する。
評価には、最近リリースされたマルチモーダルオーディオビデオFakeAVCelebデータセットを使用する。
AVTENetとその変種およびいくつかの既存手法をFakeAVCelebデータセットの複数のテストセット上で評価する。
論文 参考訳(メタデータ) (2023-10-19T19:01:26Z) - Combining Automatic Speaker Verification and Prosody Analysis for
Synthetic Speech Detection [15.884911752869437]
本稿では,人間の声の2つの高レベルな意味的特性を組み合わせた合成音声検出手法を提案する。
一方, 話者識別手法に着目し, 自動話者検証タスクの最先端手法を用いて抽出した話者埋め込みとして表現する。
一方、リズム、ピッチ、アクセントの変化を意図した音声韻律は、特殊なエンコーダによって抽出される。
論文 参考訳(メタデータ) (2022-10-31T11:03:03Z) - Deepfake audio detection by speaker verification [79.99653758293277]
本研究では,話者の生体特性のみを活用する新しい検出手法を提案する。
提案手法は,既成話者検証ツールに基づいて実装することができる。
そこで我々は,3つの一般的なテストセット上で,優れた性能,高い一般化能力,高ロバスト性を有する音声障害に対する高ロバスト性を検証した。
論文 参考訳(メタデータ) (2022-09-28T13:46:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。