論文の概要: DETECT-3B-Omni is Agnostic of Content and Demographics
- arxiv url: http://arxiv.org/abs/2607.03418v1
- Date: Fri, 03 Jul 2026 15:27:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.607286
- Title: DETECT-3B-Omni is Agnostic of Content and Demographics
- Title(参考訳): DETECT-3B-Omniはコンテンツとデモグラフィーを知らない
- Authors: Nicolas M. Müller, Aditya Tirumala Bukkapatnam, Dominik Schnieders, Zohaib Ahmed,
- Abstract要約: 本稿では,Resemble AI 検出器 DETECT-3B-Omni のセマンティック独立性について大規模に検討する。
検出精度は、音声コンテンツ(良性か悪意か)、話者性別、話者年齢、話者領域に依存するかを検証する。
したがって、検出器は、音声が何を言っているか、スピーカーが誰であるかに関わらず、AIが生成したオーディオを同等の精度で識別する。
- 参考スコア(独自算出の注目度): 4.1881782374871115
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A trustworthy and GDPR-compliant deepfake audio detector must base its decisions on acoustic artifacts, not on what is being said or who is speaking. We present a large-scale study of semantic independence for Resemble AI's detector, DETECT-3B-Omni. Using 10,240 audio samples from diverse US English speakers across 30 states, generated through 8 different AI voice-cloning systems, we test whether detection accuracy depends on spoken content (benign versus malicious), speaker gender, speaker age, or speaker region. Using equivalence testing, our results show that the accuracy difference between any two of these groups is at most 2 percentage points, at 99% confidence. The detector therefore identifies AI-generated audio with equivalent accuracy regardless of what the audio says or who the speaker is.
- Abstract(参考訳): 信頼できるGDPR準拠のディープフェイクオーディオ検出器は、何を言っているか、誰が話しているかではなく、アコースティックアーティファクトに基づいて決定を下さなければならない。
本稿では,Resemble AI 検出器 DETECT-3B-Omni のセマンティック独立性について大規模に検討する。
10,240人の米国英語話者の音声サンプルを用いて、8つの異なるAI音声閉鎖システムを用いて生成し、検出精度が音声コンテンツ(良性対悪意)、話者性別、話者年齢、話者領域に依存しているかどうかを検証した。
その結果,2つのグループ間の精度差は,少なくとも2ポイント,99%の信頼が得られた。
したがって、検出器は、音声が何を言っているか、スピーカーが誰であるかに関わらず、AIが生成したオーディオを同等の精度で識別する。
関連論文リスト
- All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation [45.45465533352999]
大規模オーディオ言語モデルは、音声と音声のベンチマークで一貫したパフォーマンス向上を示すが、高いスコアは真の聴覚知覚を反映していないかもしれない。
本稿では,テキストと一般知識のみから応答可能性を測定するテキスト先行法と,音響信号への実際の依存度を評価するオーディオ依存法という,2つの軸を用いた診断フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-27T12:25:18Z) - Enhancing Speaker Verification with Whispered Speech via Post-Processing [1.8849814100256281]
本研究では,より頑健な発話障害に対する表現を得るための学習レシピを用いたモデルを提案する。
提案システムは、細調整された話者検証バックボーン上に構築されたエンコーダ-デコーダ構造を用いる。
また, 発声音声を用いた性能評価において, 最も人気があり, 最先端の話者検証モデルの要約も提供する。
論文 参考訳(メタデータ) (2026-04-22T06:23:40Z) - Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception [142.4692205981783]
我々は,外部の音声知覚をいつ信頼するか,いつ外部の音声知覚を相談するかを知るという,一貫したスキルを学習する音声認識フレームワークを導入する。
音声認識と外部の音声理解タスクの両方でオムニモデルを鼻で微調整することは、しばしば性能を低下させる。
これを解決するために、我々のフレームワークであるSpeech-Handsは、問題を明示的な自己回帰決定として再考する。この学習可能なプリミティブは、モデルが欠陥のある外部候補によって脱線されるのを防ぐのに有効である。
論文 参考訳(メタデータ) (2026-01-14T12:06:50Z) - SpeakerSleuth: Evaluating Large Audio-Language Models as Judges for Multi-turn Speaker Consistency [12.420484491347073]
LALMがマルチターン対話における話者の一貫性を確実に判断できるかどうかを評価するベンチマークである SpeakerSleuth を提案する。
合成音声と実音声を対象とする4つの多種多様なデータセットを対象とした1,818の人間検証評価インスタンスを構築した。
モデルは音響的不整合を確実に検出するのに苦労している。
論文 参考訳(メタデータ) (2026-01-07T15:45:41Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation [55.607230723223346]
本研究は,Large Audio Model (LAM) をAudioJudgeの裁判官として体系的に研究し,両課題に対処する統一評価フレームワークを提供することができるかどうかを検討する。
本稿では、発音、発話速度、話者識別、音声品質、自動ベンチマークのためのシステムレベルの人間の嗜好シミュレーションなど、音声特徴検出タスクにまたがるAudioJudgeについて検討する。
本稿では,多視点アンサンブルAudioJudgeを導入し,音声評価を語彙内容,音声品質,パラ言語特徴の専門判断者に分解し,人間の嗜好と最大0.91のスピアマン相関を達成させる手法を提案する。
論文 参考訳(メタデータ) (2025-07-17T00:39:18Z) - Where are we in audio deepfake detection? A systematic analysis over generative and detection models [59.09338266364506]
SONARはAI-Audio Detection FrameworkとBenchmarkの合成である。
最先端のAI合成聴覚コンテンツを識別するための総合的な評価を提供する。
従来のモデルベース検出システムと基礎モデルベース検出システムの両方で、AIオーディオ検出を均一にベンチマークする最初のフレームワークである。
論文 参考訳(メタデータ) (2024-10-06T01:03:42Z) - In search of strong embedding extractors for speaker diarisation [49.7017388682077]
話者ダイアリゼーションにEEを採用する際の2つの重要な問題に対処する。
まず、性能向上に必要な特徴が話者検証とダイアリゼーションに異なるため、評価は簡単ではない。
広く採用されている話者検証評価プロトコルの性能向上は、ダイアリゼーション性能の向上に繋がらないことを示す。
重なり合う音声や話者変化の入力を認識するために,2番目の問題を緩和する2つのデータ拡張手法を提案する。
論文 参考訳(メタデータ) (2022-10-26T13:00:29Z) - DeID-VC: Speaker De-identification via Zero-shot Pseudo Voice Conversion [0.0]
DeID-VCは、実際の話者を擬似話者に変換する話者識別システムである。
PSGの助けを借りて、DeID-VCは独自の擬似話者を話者レベルや発話レベルに割り当てることができる。
論文 参考訳(メタデータ) (2022-09-09T21:13:08Z) - Towards an Efficient Voice Identification Using Wav2Vec2.0 and HuBERT
Based on the Quran Reciters Dataset [0.0]
We developed a Deep learning model for Arabic speakers identification by using Wav2Vec2.0 and HuBERT audio representation learning tools。
この実験により、ある話者に対する任意の波動信号が98%と97.1%の精度で識別できることが保証された。
論文 参考訳(メタデータ) (2021-11-11T17:44:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。