論文の概要: SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation
- arxiv url: http://arxiv.org/abs/2607.04848v1
- Date: Mon, 06 Jul 2026 09:19:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.102592
- Title: SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation
- Title(参考訳): SynSFX:ディープフェイク検出と評価のためのマルチモデル音響効果合成データセット
- Authors: Linxi Li, Yuncong Yu, Qianwei Guo, Liwei Jin, Yechen Wang, Carsten Maple,
- Abstract要約: SynSFXは、43374クリップ(26452 合成、16922 実写)の大規模コーパスで、7つの人気テキスト・オーディオモデルにまたがる。
- 参考スコア(独自算出の注目度): 12.34618784070723
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While audio deepfake detection has advanced significantly, representative detectors show limited generalization to synthetic sound effects. Existing environmental audio datasets such as EnvSDD provide important initial resources, but remain limited in scale and generation provenance for studying isolated sound-effect deepfakes. To support this direction, we present SynSFX, a large-scale corpus of 43374 clips (26452 synthetic, 16922 real) spanning 7 popular text-to-audio models.
- Abstract(参考訳): オーディオディープフェイク検出は大幅に進歩しているが、代表検出器は合成音響効果への限定的な一般化を示す。
EnvSDDのような既存の環境オーディオデータセットは、重要な初期資源を提供するが、孤立した音響効果のディープフェイクを研究するためのスケールと生成の証明は依然として限られている。
この方向をサポートするため、SynSFXは43374クリップ(26452 合成、16922 実写)の大規模コーパスで、7つの人気テキスト・オーディオモデルにまたがる。
関連論文リスト
- AUDETER: A Large-scale Dataset for Deepfake Audio Detection in Open Worlds [38.75029700407531]
AUDETERは大規模で高度に多様なディープフェイクオーディオデータセットである。
これは、最新のTSモデル11と、幅広いTS/vocoderパターンを持つ10のvocoderによって生成される4,500時間以上の合成オーディオで構成されている。
大規模なディープフェイクオーディオデータセットとしては最大である。
論文 参考訳(メタデータ) (2025-09-04T16:03:44Z) - EnvSDD: Benchmarking Environmental Sound Deepfake Detection [40.10435998849922]
環境音には異なる特徴があり、現実世界の音に対して、音声の検出やディープフェイクの歌唱の方法がより効果的になる可能性がある。
環境音のディープフェイク検出のための既存のデータセットは、スケールとオーディオタイプに制限されている。
このタスクのために設計された最初の大規模キュレートデータセットであるEnvSDDを導入し、実時間45.25時間、偽オーディオ316.74時間からなる。
論文 参考訳(メタデータ) (2025-05-25T16:02:56Z) - End-to-end Audio Deepfake Detection from RAW Waveforms: a RawNet-Based Approach with Cross-Dataset Evaluation [8.11594945165255]
生波形を直接操作するオーディオディープフェイク検出のためのエンドツーエンドのディープラーニングフレームワークを提案する。
我々のモデルであるRawNetLiteは、手作りの事前処理なしでスペクトルと時間の両方の特徴を捉えるために設計された軽量な畳み込み並列アーキテクチャである。
論文 参考訳(メタデータ) (2025-04-29T16:38:23Z) - Measuring the Robustness of Audio Deepfake Detectors [59.09338266364506]
この研究は、16の一般的な汚職に対する10のオーディオディープフェイク検出モデルの頑健さを体系的に評価する。
従来のディープラーニングモデルと最先端の基礎モデルの両方を用いて、4つのユニークな観察を行う。
論文 参考訳(メタデータ) (2025-03-21T23:21:17Z) - Sound Scene Synthesis at the DCASE 2024 Challenge [8.170174172545831]
本稿では,DCASE 2024 Challenge: Sound scene synthesis のタスク7について述べる。
音声合成と生成モデルの最近の進歩は、現実的で多様なオーディオコンテンツの作成を可能にしている。
目的と主観の両方を取り入れた,異なる音場合成システムを比較するための標準化された評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-01-15T05:15:54Z) - Where are we in audio deepfake detection? A systematic analysis over generative and detection models [59.09338266364506]
SONARはAI-Audio Detection FrameworkとBenchmarkの合成である。
最先端のAI合成聴覚コンテンツを識別するための総合的な評価を提供する。
従来のモデルベース検出システムと基礎モデルベース検出システムの両方で、AIオーディオ検出を均一にベンチマークする最初のフレームワークである。
論文 参考訳(メタデータ) (2024-10-06T01:03:42Z) - Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark [65.79402756995084]
Real Acoustic Fields (RAF)は、複数のモードから実際の音響室データをキャプチャする新しいデータセットである。
RAFは密集した室内音響データを提供する最初のデータセットである。
論文 参考訳(メタデータ) (2024-03-27T17:59:56Z) - AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection [49.81915942821647]
本研究では、ディープフェイクビデオを検出するために、オーディオ・ヴィジュアル・トランスフォーマー・ベースのアンサンブルネットワーク(AVTENet)を導入する。
評価には、最近リリースされたマルチモーダルオーディオビデオFakeAVCelebデータセットを使用する。
AVTENetとその変種およびいくつかの既存手法をFakeAVCelebデータセットの複数のテストセット上で評価する。
論文 参考訳(メタデータ) (2023-10-19T19:01:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。