論文の概要: Teffic-Audio: Tell Fact from Fiction
- arxiv url: http://arxiv.org/abs/2607.28351v1
- Date: Thu, 30 Jul 2026 15:21:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.621074
- Title: Teffic-Audio: Tell Fact from Fiction
- Title(参考訳): Teffic-Audio:Fact from Fiction
- Abstract要約: 本報告では,包括的評価環境のための音声深度検出システムTeffic-Audioについて述べる。
Teffic-Audioは、Conformerベースの音声エンコーダ、マルチヘッド注意統計プール、バイナリ分類器からなる単純な検出アーキテクチャを採用している。
Teffic-Audioは14テストセットのSpeech-DF-Arenaで1.454%のプールEERを達成した。
- 参考スコア(独自算出の注目度): 15.841023625898053
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speech deepfake detection has expanded in scope with increasingly heterogeneous spoofing mechanisms, including speech synthesis, voice conversion, vocoder reconstruction, and neural-codec resynthesis. The resulting spoofing artifacts can be further shaped by variability in source speech, recording environments, and transmission channels. This variability makes robust generalization across heterogeneous conditions a central requirement for practical detection systems. This report presents Teffic-Audio, a general speech deepfake detection system designed for comprehensive evaluation environment. Teffic-Audio adopts a straightforward detector architecture consisting of a Conformer-based speech encoder, multi-head attentive statistics pooling, and a binary classifier. Rather than relying on additional architectural complexity, the system improves generalization through its training recipe, which integrates multi-source data, attack- and source-balanced sampling, and diverse audio augmentation. Trained only with open-source data, Teffic-Audio achieves a pooled EER of 1.454% on the 14 test sets of Speech-DF-Arena, outperforming all currently public systems on the leaderboard. It also obtains the lowest EER on five individual test sets and shows a favorable performance-complexity trade-off compared with larger leading systems. Overall, Teffic-Audio provides a strong and practical reference system for general speech deepfake detection.
- Abstract(参考訳): 音声ディープフェイク検出は、音声合成、音声変換、ヴォコーダ再構成、ニューラル・コーデック再生など、ますます異質なスプーフィング機構によって範囲を広げている。
結果として得られるスプーフィングアーティファクトは、ソース音声、記録環境、伝送チャネルのばらつきによってさらに形作ることができる。
この可変性は、不均一な条件をまたいだ堅牢な一般化を実用的な検出システムの中心的な要件とする。
本報告では,包括的評価環境を目的とした音声深度検出システムTeffic-Audioについて述べる。
Teffic-Audioは、Conformerベースの音声エンコーダ、マルチヘッド注意統計プール、バイナリ分類器からなる単純な検出アーキテクチャを採用している。
追加のアーキテクチャの複雑さに頼るのではなく、マルチソースデータ、アタックとソースバランスのサンプリング、多様なオーディオ拡張を統合したトレーニングレシピを通じて一般化を改善する。
オープンソースデータのみでトレーニングされたTeffic-Audioは、14のテストセットであるSpeech-DF-Arenaで1.454%のプールEERを達成した。
また、5つのテストセットで最低のEERを取得し、より大きな先行システムと比較して、良好なパフォーマンスと複雑さのトレードオフを示す。
Teffic-Audioは、一般的な音声深度検出のための強力で実用的な参照システムを提供する。
関連論文リスト
- AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan [64.09595490689874]
ACMマルチメディア2026におけるオールタイプオーディオディープフェイク検出(AT-ADD)グランドチャレンジを提案する。
AT-ADDは、堅牢で一般化可能なオーディオ法医学技術の開発を加速することを目的としている。
論文 参考訳(メタデータ) (2026-04-09T12:38:19Z) - AUDETER: A Large-scale Dataset for Deepfake Audio Detection in Open Worlds [38.75029700407531]
AUDETERは大規模で高度に多様なディープフェイクオーディオデータセットである。
これは、最新のTSモデル11と、幅広いTS/vocoderパターンを持つ10のvocoderによって生成される4,500時間以上の合成オーディオで構成されている。
大規模なディープフェイクオーディオデータセットとしては最大である。
論文 参考訳(メタデータ) (2025-09-04T16:03:44Z) - Exposing Synthetic Speech: Model Attribution and Detection of AI-generated Speech via Audio Fingerprints [11.703509488782345]
我々は、AI生成音声を検出するためのトレーニング不要で効果的なアプローチを導入する。
本研究では,(1)オープンワールド環境における単一モデル帰属,(2)クローズドワールド環境における多モデル帰属,(3)合成音声と実音声の検知という3つの重要な課題に取り組む。
論文 参考訳(メタデータ) (2024-11-21T10:55:49Z) - Where are we in audio deepfake detection? A systematic analysis over generative and detection models [59.09338266364506]
SONARはAI-Audio Detection FrameworkとBenchmarkの合成である。
最先端のAI合成聴覚コンテンツを識別するための総合的な評価を提供する。
従来のモデルベース検出システムと基礎モデルベース検出システムの両方で、AIオーディオ検出を均一にベンチマークする最初のフレームワークである。
論文 参考訳(メタデータ) (2024-10-06T01:03:42Z) - Training-Free Deepfake Voice Recognition by Leveraging Large-Scale Pre-Trained Models [52.04189118767758]
一般化は、現在のオーディオディープフェイク検出器の主な問題である。
本稿では,オーディオディープフェイク検出のための大規模事前学習モデルの可能性について検討する。
論文 参考訳(メタデータ) (2024-05-03T15:27:11Z) - Audio-visual End-to-end Multi-channel Speech Separation, Dereverberation
and Recognition [52.11964238935099]
本稿では,音声-視覚的多チャンネル音声分離,デバーベレーション,認識手法を提案する。
ビデオ入力は、マスクベースのMVDR音声分離、DNN-WPEまたはスペクトルマッピング(SpecM)ベースの音声残響フロントエンドで一貫して実証される。
オックスフォードLSS2データセットのシミュレーションや再生を用いて合成した重畳および残響音声データについて実験を行った。
論文 参考訳(メタデータ) (2023-07-06T10:50:46Z) - Combining Automatic Speaker Verification and Prosody Analysis for
Synthetic Speech Detection [15.884911752869437]
本稿では,人間の声の2つの高レベルな意味的特性を組み合わせた合成音声検出手法を提案する。
一方, 話者識別手法に着目し, 自動話者検証タスクの最先端手法を用いて抽出した話者埋め込みとして表現する。
一方、リズム、ピッチ、アクセントの変化を意図した音声韻律は、特殊なエンコーダによって抽出される。
論文 参考訳(メタデータ) (2022-10-31T11:03:03Z) - Fully Automated End-to-End Fake Audio Detection [57.78459588263812]
本稿では,完全自動エンドツーエンド音声検出手法を提案する。
まず、wav2vec事前学習モデルを用いて、音声の高レベル表現を得る。
ネットワーク構造には, Light-DARTS という異種アーキテクチャサーチ (DARTS) の修正版を用いる。
論文 参考訳(メタデータ) (2022-08-20T06:46:55Z) - Any-to-Many Voice Conversion with Location-Relative Sequence-to-Sequence
Modeling [61.351967629600594]
本稿では,非並列音声変換手法である非並列音声変換法(seq2seq)を提案する。
本手法では,ボトルネック特徴抽出器(BNE)とセック2セック合成モジュールを組み合わせる。
主観的および主観的評価は,提案手法が自然性と話者類似性の両方において優れた音声変換性能を有することを示す。
論文 参考訳(メタデータ) (2020-09-06T13:01:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。