論文の概要: A survey of AI-generated voices and their detection
- arxiv url: http://arxiv.org/abs/2608.15411v1
- Date: Sat, 15 Aug 2026 20:59:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.292216
- Title: A survey of AI-generated voices and their detection
- Title(参考訳): AI生成音声の探索と検出
- Authors: Chengzhe Sun, Tianle Yang, Siwei Lyu,
- Abstract要約: 近年、企業や政治指導者を狙った音声クローン詐欺事件は、堅固な保護の必要性を浮き彫りにした。
画像やビデオのディープフェイクとは異なり、合成音声の検出は、音声学、韻律、聴覚知覚の複雑さによって、独特な課題を引き起こす。
この調査は、AI音声生成と検出方法の包括的な概要を提供し、技術基盤と最新の最先端技術の両方を包含する。
- 参考スコア(独自算出の注目度): 24.68419598161603
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The ability of artificial intelligence (AI) models to generate highly realistic human voices has advanced rapidly. These technologies power accessibility tools, virtual assistants and creative applications, but they also enable harmful uses, including impersonation, fraud and disinformation. Recent incidents of voice cloning scams targeting businesses and political leaders underscore the urgent need for robust safeguards. Unlike image and video deepfakes, the detection of synthetic voices poses unique challenges due to the complexity of phonetics, prosody and auditory perception. This survey offers a comprehensive overview of AI voice generation and detection methods, encompassing both the technical foundations and the latest state-of-the-art advances. This study also identifies key open challenges, benchmark resources and future directions to make this survey useful for future researchers.
- Abstract(参考訳): 人工知能(AI)モデルが高度に現実的な人間の声を生成する能力は急速に進歩した。
これらの技術はアクセシビリティツール、仮想アシスタント、クリエイティブなアプリケーションに電力を供給するが、偽造、詐欺、偽情報などの有害な利用も可能にしている。
近年、企業や政治指導者を狙った音声クローン詐欺が相次ぎ、強固な保護の必要性が浮き彫りになっている。
画像やビデオのディープフェイクとは異なり、合成音声の検出は、音声学、韻律、聴覚知覚の複雑さによって、独特な課題を引き起こす。
この調査は、AI音声生成と検出方法の包括的な概要を提供し、技術基盤と最新の最先端技術の両方を包含する。
この研究は、この調査を将来の研究者にとって有用なものにするために、重要なオープン課題、ベンチマークリソース、今後の方向性を明らかにしている。
関連論文リスト
- Generative Adversarial Network based Voice Conversion: Techniques, Challenges, and Recent Advancements [12.716872085463887]
GAN(Generative Adversarial Network)ベースのアプローチは,その強力な特徴マッピング能力と,高度に現実的な音声を生成する可能性に対して,大きな注目を集めている。
本稿では,音声変換環境の包括的分析を行い,重要な技術,重要な課題,現場におけるGANの変容的影響を明らかにする。
全体として、この研究は、音声変換技術における最先端のSOTA(State-of-the-art)の推進を目指す研究者、開発者、実践者にとって不可欠なリソースとなっている。
論文 参考訳(メタデータ) (2025-04-27T11:22:21Z) - Where are we in audio deepfake detection? A systematic analysis over generative and detection models [59.09338266364506]
SONARはAI-Audio Detection FrameworkとBenchmarkの合成である。
最先端のAI合成聴覚コンテンツを識別するための総合的な評価を提供する。
従来のモデルベース検出システムと基礎モデルベース検出システムの両方で、AIオーディオ検出を均一にベンチマークする最初のフレームワークである。
論文 参考訳(メタデータ) (2024-10-06T01:03:42Z) - A Survey on Speech Deepfake Detection [7.3348524333159]
音声ディープフェイクは、現実的な音声を生成し、誤情報を広げることで深刻な脅威となる。
これに対抗するために、ディープフェイク検出技術を推進するために多くの課題が編成されている。
我々は2024年3月までに200以上の論文を体系的に分析した。
論文 参考訳(メタデータ) (2024-04-22T06:52:12Z) - Artificial Intelligence for Cochlear Implants: Review of Strategies, Challenges, and Perspectives [2.608119698700597]
本総説は、CIベースのASRと音声強調の進歩を包括的にカバーすることを目的としている。
このレビューは潜在的な応用を掘り下げ、この領域の既存の研究ギャップを埋めるための今後の方向性を提案する。
論文 参考訳(メタデータ) (2024-03-17T11:28:23Z) - Towards Possibilities & Impossibilities of AI-generated Text Detection:
A Survey [97.33926242130732]
大規模言語モデル(LLM)は、自然言語処理(NLP)の領域に革命をもたらし、人間のようなテキスト応答を生成する能力を持つ。
これらの進歩にもかかわらず、既存の文献のいくつかは、LLMの潜在的な誤用について深刻な懸念を提起している。
これらの懸念に対処するために、研究コミュニティのコンセンサスは、AI生成テキストを検出するアルゴリズムソリューションを開発することである。
論文 参考訳(メタデータ) (2023-10-23T18:11:32Z) - Deepfake audio detection by speaker verification [79.99653758293277]
本研究では,話者の生体特性のみを活用する新しい検出手法を提案する。
提案手法は,既成話者検証ツールに基づいて実装することができる。
そこで我々は,3つの一般的なテストセット上で,優れた性能,高い一般化能力,高ロバスト性を有する音声障害に対する高ロバスト性を検証した。
論文 参考訳(メタデータ) (2022-09-28T13:46:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。