論文の概要: Exploiting Acoustic and Content-Oriented Speaker Verification Attacks Against Multilingual Voice Anonymization
- arxiv url: http://arxiv.org/abs/2610.08107v1
- Date: Tue, 06 Oct 2026 10:31:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.936513
- Title: Exploiting Acoustic and Content-Oriented Speaker Verification Attacks Against Multilingual Voice Anonymization
- Title(参考訳): 多言語音声匿名化に対する音響・コンテンツ指向話者検証攻撃の爆発
- Abstract要約: 多言語話者認証において,音響情報と文脈情報が重要であるかを検討する。
その結果,攻撃者の有効性は匿名音声の言語的有用性に依存することがわかった。
これらの知見は、より包括的な攻撃者モデリングと評価プロトコルの必要性を浮き彫りにした。
- 参考スコア(独自算出の注目度): 10.405695314718018
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Attacker ASV systems for voice anonymization have been studied primarily in English, leaving their behavior in multilingual settings largely unexplored. Conventional ASV has shown that both acoustic and contextual information are important for multilingual speaker verification. Inspired by this, we investigate whether the same holds for attacker ASV on anonymized speech. We evaluate both acoustic- and content-oriented attackers on multilingual anonymized speech and construct a multilingual voice-converted dataset to improve cross-lingual generalization. Our results show that attacker effectiveness depends on the linguistic utility of the anonymized speech. Overall, acoustic-oriented attackers achieve better performance. However, when linguistic information is well preserved, the performance gap between content- and acoustic-oriented attackers narrows compared with conditions involving stronger speech distortion. The multilingual voice-converted dataset further improves performance and partially reduces the cross-lingual gap. These findings highlight the need for more comprehensive attacker modeling and evaluation protocols that consider both privacy and utility, rather than relying on a attacker strategy\footnote{Full code and pretrained models and MultiVC Dataset link are available at: https://github.com/monkeyDarefeen/DAST
- Abstract(参考訳): 音声匿名化のためのアタッカーASVシステムは、主に英語で研究され、多言語環境での動作はほとんど探索されていない。
従来のASVでは、音響情報と文脈情報の両方が多言語話者の検証に重要であることが示されている。
そこで本研究では,攻撃者による匿名音声におけるASVの扱いについて検討した。
我々は、多言語匿名音声における音響攻撃とコンテンツ指向攻撃の両方を評価し、多言語音声変換データセットを構築し、言語間一般化を改善する。
その結果,攻撃者の有効性は匿名音声の言語的有用性に依存することがわかった。
全体として、アコースティック指向アタッカーはより良いパフォーマンスを達成する。
しかし、言語情報が十分に保存されている場合、内容指向と音響指向のアタッカーのパフォーマンスギャップは、強い音声歪みを含む条件と比較して狭くなる。
多言語音声変換データセットは、パフォーマンスをさらに向上し、言語間ギャップを部分的に低減する。
これらの調査結果は、アタッカー戦略に依存するのではなく、プライバシとユーティリティの両方を考慮したより包括的なアタッカーモデリングと評価プロトコルの必要性を強調している。
関連論文リスト
- Few-Shot Contrastive Adaptation for Audio Abuse Detection in Low-Resource Indic Languages [3.5238606794194816]
ソーシャルメディアが音声による対話へとシフトするにつれ、虐待的音声検出の重要性が高まっている。
コントラスト言語-オーディオ事前学習が、音声から直接虐待的音声検出を支援できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-04-10T08:23:03Z) - ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction [88.41471266579333]
本稿では,大規模言語モデル(LLM)からの言語知識をAV-TSEモデルに組み込む新しいフレームワークであるELEGANCEを提案する。
2つのAV-TSEバックボーン上でのRoBERTa、Qwen3-0.6B、Qwen3-4Bによる総合的な実験は大幅に改善された。
論文 参考訳(メタデータ) (2025-11-09T08:50:11Z) - You Are What You Say: Exploiting Linguistic Content for VoicePrivacy Attacks [9.235490630909323]
攻撃者訓練および評価データセットにおける話者内言語内容の類似性の影響を評価する。
また,VoicePrivacy Attacker Challengeデータセットでは,平均誤り率(EER)が35%に達し,EERを2%以下に抑えることができた。
我々の研究は、VoicePrivacyデータセットを再設計し、公正で偏見のない評価を確実にし、プライバシー評価のグローバルEERへの依存に挑戦することを提案している。
論文 参考訳(メタデータ) (2025-06-11T08:46:18Z) - Whisper Speaker Identification: Leveraging Pre-Trained Multilingual Transformers for Robust Speaker Embeddings [0.0]
我々は,Whisper自動音声認識モデルを多言語データに基づいて事前訓練したフレームワークであるWSI(Whisper Speaker Identification)を提案する。
本稿では,Whisper言語に依存しない音響表現の活用により,多様な言語にまたがる話者を効果的に区別する。
論文 参考訳(メタデータ) (2025-03-13T15:11:28Z) - An Initial Investigation of Language Adaptation for TTS Systems under Low-resource Scenarios [76.11409260727459]
本稿では,最近のSSLベースの多言語TSシステムであるZMM-TTSの言語適応性について検討する。
本研究では,事前学習言語と対象言語との音声学的な類似性が,対象言語の適応性能に影響を及ぼすことを示す。
論文 参考訳(メタデータ) (2024-06-13T08:16:52Z) - Multilingual self-supervised speech representations improve the speech
recognition of low-resource African languages with codeswitching [65.74653592668743]
微細な自己教師型多言語表現は絶対単語誤り率を最大20%削減する。
訓練データに制限のある状況では、自己教師付き表現を微調整することが、より良いパフォーマンスと実行可能なソリューションである。
論文 参考訳(メタデータ) (2023-11-25T17:05:21Z) - Towards a Deep Understanding of Multilingual End-to-End Speech
Translation [52.26739715012842]
我々は22言語以上で訓練された多言語エンドツーエンド音声翻訳モデルで学習した表現を解析する。
我々は分析から3つの大きな発見を得た。
論文 参考訳(メタデータ) (2023-10-31T13:50:55Z) - CLARA: Multilingual Contrastive Learning for Audio Representation
Acquisition [5.520654376217889]
CLARAはラベル付きデータへの依存を最小限に抑え、言語間の一般化を強化する。
我々のアプローチは、主観的評価問題を克服し、音声における感情的ニュアンスを十分に捉えている。
低リソース言語に適応し、多言語音声表現学習の進歩を示す。
論文 参考訳(メタデータ) (2023-10-18T09:31:56Z) - Learning Cross-lingual Visual Speech Representations [108.68531445641769]
言語横断的な自己監督型視覚表現学習は、ここ数年、研究トピックとして成長している。
我々は最近提案したRAVEn(Raw Audio-Visual Speechs)フレームワークを用いて,未ラベルデータを用いた音声-視覚モデルの事前学習を行う。
1)データ量が多いマルチ言語モデルはモノリンガルモデルよりも優れているが、データの量を維持すると、モノリンガルモデルの性能が向上する傾向にある。
論文 参考訳(メタデータ) (2023-03-14T17:05:08Z) - Investigating the Impact of Cross-lingual Acoustic-Phonetic Similarities
on Multilingual Speech Recognition [31.575930914290762]
言語間音響-音声の類似性を調べるために, 新たなデータ駆動手法を提案する。
ディープニューラルネットワークは、異なる音響モデルからの分布を直接的に同等の形式に変換するためのマッピングネットワークとして訓練されている。
モノリンガルに比べて8%の相対的な改善が達成されている。
論文 参考訳(メタデータ) (2022-07-07T15:55:41Z) - Unsupervised Cross-lingual Representation Learning for Speech
Recognition [63.85924123692923]
XLSRは、複数の言語における音声の生波形から1つのモデルを事前学習することで、言語間音声表現を学習する。
我々は、マスク付き潜在音声表現よりも対照的なタスクを解くことで訓練されたwav2vec 2.0を構築した。
実験により、言語間事前学習はモノリンガル事前訓練よりも著しく優れていることが示された。
論文 参考訳(メタデータ) (2020-06-24T18:25:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。