論文の概要: VoxENES 2026: Benchmarking Generalization of Speech Spoofing Detectors Against LLM-Era TTS and Voice Conversion
- arxiv url: http://arxiv.org/abs/2607.11706v1
- Date: Mon, 13 Jul 2026 15:35:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.537034
- Title: VoxENES 2026: Benchmarking Generalization of Speech Spoofing Detectors Against LLM-Era TTS and Voice Conversion
- Title(参考訳): VoxENES 2026:LLM-Era TTSと音声変換に対する音声発声検出器のベンチマーク化
- Abstract要約: 本稿では,10種類の現代音声合成法を用いて,53,628個の音声サンプルのベンチマークであるVoxENES 2026を紹介する。
VoxENES 2026を用いて、微調整なしで8つの事前訓練検出器をベンチマークし、大幅な性能劣化を観測する。
以上の結果から,現在の検出器における脆性人工物への依存を強調し,ロバストなオーディオスプーフィング対策を開発するための実践的テストベッドとしてVoxENES 2026を確立した。
- 参考スコア(独自算出の注目度): 0.6761285306775876
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern LLM-driven text-to-speech (TTS) and voice conversion (VC) systems produce synthetic speech that differs from the generators represented in many legacy spoofing benchmarks. This mismatch creates a temporal generalization gap that can overestimate detector robustness under real-world post-processing conditions. We bridge this gap by introducing VoxENES 2026, a bilingual (English and Spanish) benchmark of 53,628 audio samples generated using 10 contemporary speech synthesis methods and evaluated under 10 standardized post-processing conditions. Using VoxENES 2026, we benchmark eight pretrained detectors without fine-tuning and observe substantial performance degradation: the best model achieves 28.98\% EER overall, while most perform near or below random chance across modern generators and perturbations. Our results highlight the reliance on brittle artifacts in current detectors and establish VoxENES 2026 as a practical testbed for developing robust audio spoofing countermeasures.
- Abstract(参考訳): 現代のLLM駆動のテキスト音声変換(TTS)と音声変換(VC)システムは、多くのレガシーなスプーフィングベンチマークで表されるジェネレータとは異なる合成音声を生成する。
このミスマッチは時間的一般化のギャップを生じさせ、実世界の後処理条件下で検出器の堅牢性を過大評価することができる。
両言語(英語とスペイン語)のベンチマークであるVoxENES 2026を導入することで,このギャップを埋める。
VoxENES 2026を用いて8つの事前訓練された検出器を微調整せずにベンチマークし、性能劣化を観測する。
以上の結果から,現在の検出器における脆性人工物への依存を強調し,ロバストなオーディオスプーフィング対策を開発するための実践的テストベッドとしてVoxENES 2026を確立した。
関連論文リスト
- PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects [29.32197370490759]
PolySpeech-100は110の言語変種にわたるネイティブレベルの音声理解を評価するために設計された大規模ベンチマークである。
我々は、指示駆動合成音声によるゴールドスタンダードな人間の録音を増強する、新しいハイブリッド構築パイプラインを採用している。
論文 参考訳(メタデータ) (2026-05-31T05:13:32Z) - MOSS Transcribe Diarize: Accurate Transcription with Speaker Diarization [68.87577482940664]
話者対応のタイムスタンプ・トランセプションは,各話者の発話のタイミングを正確に決定することを目的としている。
既存のSATSシステムでは、エンド・ツー・エンドの定式化はまれであり、コンテキストウィンドウの制限、長距離スピーカーメモリの弱い、タイムスタンプの出力ができないといった制約がある。
本稿では,MOSS Transcribe Diarizeについて述べる。MOSS Transcribe Diarizeはマルチモーダルな大規模言語モデルで,エンドツーエンドのパラダイムで話者属性,時間スタンプの転写を行う。
論文 参考訳(メタデータ) (2026-01-04T15:01:10Z) - When Fine-Tuning is Not Enough: Lessons from HSAD on Hybrid and Adversarial Audio Spoof Detection [3.7411108810335922]
音声検出は、音声認証、スマートアシスタント、通信セキュリティの課題である。
1,248のクリーンと41,044の劣化した発話を含むベンチマークを,人間,クローン,ゼロショットAI生成,ハイブリッドオーディオの4つのクラスに分けて提示する。
事前訓練されたモデルは、ハイブリッド条件下で過度に一般化および崩壊し、スプーフ特異的微調整は分離性を改善するが、目に見えない組成に苦しむ。
論文 参考訳(メタデータ) (2025-09-09T01:43:28Z) - Cross-Technology Generalization in Synthesized Speech Detection: Evaluating AST Models with Modern Voice Generators [0.0]
本稿では,合成音声検出のためのAudio Spectrogram Transformer (AST)アーキテクチャについて述べる。
差別化された拡張戦略を使用することで、ElevenLabs、NotebookLM、Minimax AI音声ジェネレータに対してテストすると、全体の0.91%のEERを達成する。
論文 参考訳(メタデータ) (2025-03-28T15:07:26Z) - Where are we in audio deepfake detection? A systematic analysis over generative and detection models [59.09338266364506]
SONARはAI-Audio Detection FrameworkとBenchmarkの合成である。
最先端のAI合成聴覚コンテンツを識別するための総合的な評価を提供する。
従来のモデルベース検出システムと基礎モデルベース検出システムの両方で、AIオーディオ検出を均一にベンチマークする最初のフレームワークである。
論文 参考訳(メタデータ) (2024-10-06T01:03:42Z) - Retrieval-Augmented Audio Deepfake Detection [27.13059118273849]
そこで本研究では,類似のサンプルを用いて検体を増強する検索拡張検出フレームワークを提案する。
提案したRADフレームワークのベースライン法よりも優れた性能を示す実験を行った。
論文 参考訳(メタデータ) (2024-04-22T05:46:40Z) - Monitoring AI-Modified Content at Scale: A Case Study on the Impact of ChatGPT on AI Conference Peer Reviews [51.453135368388686]
本稿では,大規模言語モデル (LLM) によって実質的に修正あるいは生成される可能性のある大規模コーパスにおけるテキストの分数推定手法を提案する。
我々の最大可能性モデルは、専門家による参照テキストとAIによる参照テキストを利用して、コーパスレベルでの実世界のLLM使用を正確かつ効率的に検証する。
論文 参考訳(メタデータ) (2024-03-11T21:51:39Z) - TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation [61.564874831498145]
TranSpeechは、両側摂動を伴う音声から音声への翻訳モデルである。
我々は,非自己回帰S2ST手法を構築し,繰り返しマスキングを行い,単位選択を予測する。
TranSpeechは推論遅延を大幅に改善し、自動回帰技術よりも最大21.4倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2022-05-25T06:34:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。