論文の概要: BabelFake: A Multilingual Audio-Visual DeepFake Benchmark
- arxiv url: http://arxiv.org/abs/2610.06339v1
- Date: Mon, 05 Oct 2026 13:42:34 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:50:04.610057
- Title: BabelFake: A Multilingual Audio-Visual DeepFake Benchmark
- Title(参考訳): BabelFake: 多言語音声ビジュアルDeepFakeベンチマーク
- Abstract要約: BabelFakeは、参加者の同意を得て記録された多言語音声視覚DeepFakeベンチマークである。
BabelFakeには、5つの言語にまたがる496人の個人から399kのクリップ(1,323時間)が含まれている。
検出の難しさは、音声と視覚生成のペアリングに依存するが、実際の音声を保存した場合、性能が大幅に低下することを示す。
- 参考スコア(独自算出の注目度): 9.870676098084031
- License:
- Abstract: Reliable and practical audio-visual DeepFake detection requires benchmarks that reflect diverse linguistic contexts and modern data synthesis pipelines for visual as well as audio manipulations. However, existing datasets predominantly contain footage of English-speakers, often include outdated manipulation types, or overlook the audio modality. Further, many datasets feature individuals who did not consent to be used in DeepFake creation. We introduce BabelFake, a multilingual audio-visual DeepFake benchmark recorded with consenting participants. BabelFake contains 399k clips (1,323 hours) from 496 individuals spanning five languages (English, German, Italian, French, Spanish). Our modular data generation pipeline pairs 11 modern video manipulation methods with 4 voice cloning engines, distinguishing visual-only (face swapping) and joint audio-visual manipulations (lip synchronization and portrait animation). By benchmarking state-of-the-art detectors, we show that detection difficulty depends on the audio-visual generation pairing, with substantial performance degradation when authentic audio is preserved. Cross-language/demographic evaluation reveals sensitivity varying across detector architectures and training data, while human evaluation reveals that perceived realism and machine-detection difficulty do not necessarily align.
- Abstract(参考訳): 信頼性が高く実用的なオーディオ・ビジュアルなDeepFake検出には、多様な言語コンテキストを反映したベンチマークと、ビジュアルおよびオーディオ操作のための現代的なデータ合成パイプラインが必要である。
しかし、既存のデータセットは、主に英語話者の映像を含み、しばしば時代遅れの操作タイプを含むか、オーディオのモダリティを見落としている。
さらに、多くのデータセットはDeepFake作成に使用することに同意しない個人を特徴付けている。
BabelFakeは、参加者の同意を得て記録された多言語音声視覚DeepFakeベンチマークである。
BabelFakeは5つの言語(英語、ドイツ語、イタリア語、フランス語、スペイン語)にまたがる496の個人から399kのクリップ(1,323時間)を収録している。
我々のモジュラーデータ生成パイプラインは、11の現代的なビデオ操作手法と4つの音声クローニングエンジンをペアリングし、視覚のみ(顔交換)とジョイントオーディオ-視覚操作(リップ同期とポートレートアニメーション)を区別する。
最先端検出器のベンチマークにより, 検出の困難さは, 音響・視覚生成ペアリングに依存し, 真のオーディオ保存時の性能劣化が顕著であることを示す。
言語/デマトグラフィーによる相互評価は、検出器アーキテクチャやトレーニングデータによって異なる感度を示す一方、人間による評価は、現実性やマシン検出の難しさが必ずしも一致しないことを示している。
関連論文リスト
- Linguistically Augmented Audio Speech Data (LinguAS) [0.0]
LinguASには、Expert-Defined Linguistic Features (EDLFs)で注釈付けされた800以上のオーディオサンプルが含まれている。
ASVspoof 2021のディープラーニングベースラインを超えて,EDLFを付加したデータに基づいてトレーニングしたモデルでは,モデル性能が大幅に向上していることがわかった。
論文 参考訳(メタデータ) (2026-06-08T23:26:39Z) - A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple Languages [60.81571443992153]
音声による会話顔合成(TFS)は、音声入力から顔のアニメーションを生成することに焦点を当てている。
現在のモデルは英語ではうまく機能するが、英語以外の言語では不満足に機能し、間違った口の形と堅い表情を生み出している。
我々は,Phoneme-Guided Mixture-of-Expertsアーキテクチャを特徴とする新しいフレームワークであるMultilingual Experts (MuEx)を提案する。
論文 参考訳(メタデータ) (2025-10-08T03:46:39Z) - Tell me Habibi, is it Real or Fake? [15.344187517040508]
コードスイッチング(英語版)、特にアラビア語と英語の間では、アラブ世界では一般的であり、デジタル通信で広く使われている。
textbfArEnAVは、音声中のコードスイッチング、方言のバリエーション、モノリンガルのアラビアコンテンツを含む、アラビア語と英語の音声・視覚の大規模ディープフェイクデータセットである。
本データセットは4つのText-To-Speechモデルと2つのリップ同期モデルを統合し,多言語マルチモーダルディープフェイク検出の包括的解析を可能にする。
論文 参考訳(メタデータ) (2025-05-28T16:54:36Z) - MAVOS-DD: Multilingual Audio-Video Open-Set Deepfake Detection Benchmark [108.46287432944392]
マルチリンガル・オーディオ・ビデオ・ディープフェイク検出のための大規模オープンセット・ベンチマークを初めて提示する。
私たちのデータセットは8つの言語で250時間以上の実ビデオと偽ビデオで構成されています。
各言語について、偽ビデオは7つの異なるディープフェイク生成モデルで生成される。
論文 参考訳(メタデータ) (2025-05-16T10:42:30Z) - Vulnerability of Automatic Identity Recognition to Audio-Visual
Deepfakes [13.042731289687918]
本稿では, ディープフェイクSWAN-DFの音声・映像データベースとして初めて, 唇と音声をよく同期させる手法を提案する。
我々は,SpeechBrainのECAPA-TDNNモデルなど,アート話者認識システムの脆弱性を実証する。
論文 参考訳(メタデータ) (2023-11-29T14:18:04Z) - SceneFake: An Initial Dataset and Benchmarks for Scene Fake Audio Detection [54.74467470358476]
本稿では,シーンフェイク音声検出のためのデータセットSceneFakeを提案する。
操作されたオーディオは、オリジナルオーディオの音響シーンを改ざんするだけで生成される。
本論文では,SceneFakeデータセット上での擬似音声検出ベンチマーク結果について報告する。
論文 参考訳(メタデータ) (2022-11-11T09:05:50Z) - Audio-Visual Person-of-Interest DeepFake Detection [77.04789677645682]
本研究の目的は、現実世界で遭遇する様々な操作方法やシナリオに対処できるディープフェイク検出器を提案することである。
我々は、対照的な学習パラダイムを活用して、各アイデンティティに対して最も識別しやすい、移動面と音声セグメントの埋め込みを学習する。
本手法は,シングルモダリティ(オーディオのみ,ビデオのみ)とマルチモダリティ(オーディオビデオ)の両方を検出でき,低品質・低画質ビデオに対して堅牢である。
論文 参考訳(メタデータ) (2022-04-06T20:51:40Z) - Half-Truth: A Partially Fake Audio Detection Dataset [60.08010668752466]
本稿では半真性音声検出(HAD)のためのデータセットを開発する。
HADデータセットの部分的に偽の音声は、発話中の数単語だけを変更する。
我々は、偽のユトランを検知するだけでなく、このデータセットを用いて音声中の操作された領域をローカライズする。
論文 参考訳(メタデータ) (2021-04-08T08:57:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。