論文の概要: VietPrism: A large-scale Vietnamese speech and deepfake corpus with diverse dialects and code-switching
- arxiv url: http://arxiv.org/abs/2609.30005v1
- Date: Thu, 24 Sep 2026 15:48:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.066672
- Title: VietPrism: A large-scale Vietnamese speech and deepfake corpus with diverse dialects and code-switching
- Title(参考訳): VietPrism:様々な方言とコードスイッチングを備えたベトナム語とディープフェイクコーパス
- Abstract要約: オープンなマルチドメインコーパスであるVietPrismを導入し、これらの次元を大規模にまとめる。
実写ビデオ8,388本にわたる1,262人の話者が調査された。
ベトナムでは最初の大規模コーパスであり、共同で文字起こし、一貫した話者識別、5つの方言グループ、そして自然発生するベトナム英語のコードスイッチを提供する。
- 参考スコア(独自算出の注目度): 16.79760039563338
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vietnamese speech research is constrained by resources that isolate automatic speech recognition from speaker, dialect, code-switching, and deepfake analysis. We introduce VietPrism, an open, multi-domain corpus that brings these dimensions together at scale: 993.4 hours and 403,941 bona fide utterances from 1,262 verified speakers across 8,388 real-world videos. To our knowledge, it is the first large-scale Vietnamese corpus to jointly provide transcripts, consistent speaker identities, five dialect groups, and naturally occurring Vietnamese--English code-switching, which constitutes nearly half of the corpus by duration. We further create over 3.1K hours of spoof speech with four open-source and commercial synthesis systems. Every spoof is conditioned on a verified speaker reference and paired with a transcript- and speaker-matched bona fide utterance, enabling unique controlled evaluation with reduced lexical and identity confounds. Zero-shot evaluation of five pretrained multilingual detectors reveals striking brittleness: EER greatly varies across detector--generator pairings, while recent multilingual detector DFA-1B degrades from 16.3% to 33.6% as speaker similarity increases. Dialect-stratified results expose further model-dependent disparities. By unifying natural linguistic diversity with controlled spoof generation, VietPrism provides a challenging foundation for Vietnamese speech modeling and trustworthy audio-deepfake detection.
- Abstract(参考訳): ベトナムの音声研究は、話者、方言、コードスイッチング、ディープフェイク分析から自動音声認識を分離するリソースによって制限されている。
我々は、オープンなマルチドメインコーパスであるVietPrismを紹介し、これらの次元を大規模にまとめる: 993.4時間と403,941ボナフッドの発声は、8,388の現実世界のビデオで1,262人の話者から始まる。
我々の知る限り、このコーパスは、共同で書き起こし、一貫した話者識別、5つの方言群、自然発生するベトナム語のコードスイッチングを共同で提供する最初の大規模なベトナム語コーパスである。
さらに4つのオープンソースおよび商用合成システムによる3.1K時間以上のスプーフ音声を生成する。
全てのスプーフは、検証された話者基準に基づいて条件付けされ、転写文字と話者マッチングされたボナ・フェイド発話とペアリングされ、語彙とアイデンティティの相違を低減した独自の制御された評価を可能にする。
EERは検出器とジェネレータのペアによって大きく異なるが、最近の多言語検出器DFA-1Bは話者の類似性が増加するにつれて16.3%から33.6%に低下する。
ダイアレクト・ストラテファイドの結果は、さらなるモデル依存の相違を露呈する。
制御されたスプーフ生成と自然言語の多様性を統一することにより、ベトナム語音声モデリングと信頼できるオーディオディープフェイク検出のための挑戦的な基盤を提供する。
関連論文リスト
- X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning [62.740127542449166]
X-Voiceは、任意の音声をクローンし、誰でも30の言語を話せる多言語ゼロショット音声クローンモデルである。
X-Voiceは国際音声アルファベット(IPA)を統一表現として420K時間多言語コーパスで訓練されている。
論文 参考訳(メタデータ) (2026-05-07T02:57:53Z) - DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation [111.94720088481614]
多モーダル生成モデルは方言テキスト入力を効果的に生成できるのか?
6つの共通英語方言にまたがる大規模ベンチマークを構築した。
マルチモーダル生成モデルのための一般的なエンコーダに基づく緩和戦略を設計する。
論文 参考訳(メタデータ) (2025-10-16T17:56:55Z) - CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training [70.31925012315064]
野生におけるゼロショット多言語音声合成のための改良モデルであるCosyVoice 3を提案する。
CosyVoice 3の主な特徴は、韻律自然性を改善する新しい音声トークンである。
データは1万時間から100万時間に拡張され、9つの言語と18の中国語方言を含んでいる。
論文 参考訳(メタデータ) (2025-05-23T07:55:21Z) - In-Context Learning Boosts Speech Recognition via Human-like Adaptation to Speakers and Language Varieties [24.74769794165231]
本稿では,Phi-4 Multimodal におけるコンテキスト内学習(ICL)を実現するスケーラブルなフレームワークを提案する。
単語の誤り率を相対的に19.7%減少させるのは、12の例に過ぎない。
全体として、我々の新しいICL適応方式は、人間の聴取者と同様の性能を示す。
論文 参考訳(メタデータ) (2025-05-20T20:20:37Z) - FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Ü-Tsang, Amdo and Kham Speech Dataset Generation [10.73307957038715]
FMSD-TTS(FMSD-TTS)は、音声合成フレームワーク。
限られた参照音声と明示的な方言ラベルから並列方言音声を合成する。
論文 参考訳(メタデータ) (2025-05-20T13:35:55Z) - MulliVC: Multi-lingual Voice Conversion With Cycle Consistency [75.59590240034261]
MulliVCは、音色のみを変換し、多言語ペアリングデータなしでオリジナルコンテンツとソースコードの韻律を保持する新しい音声変換システムである。
目的と主観の両方の結果から,MulliVCはモノリンガルとクロスリンガルの両方の文脈において,他の手法をはるかに上回っていることが示唆された。
論文 参考訳(メタデータ) (2024-08-08T18:12:51Z) - Cross-lingual Low Resource Speaker Adaptation Using Phonological
Features [2.8080708404213373]
我々は、異なる言語に共通する音韻的特徴のセットに基づいて、言語に依存しないマルチスピーカモデルを訓練する。
対象話者データの32と8の発声で、対応する文献に匹敵する高い話者類似度スコアと自然性を得る。
論文 参考訳(メタデータ) (2021-11-17T12:33:42Z) - Unsupervised Cross-lingual Representation Learning for Speech
Recognition [63.85924123692923]
XLSRは、複数の言語における音声の生波形から1つのモデルを事前学習することで、言語間音声表現を学習する。
我々は、マスク付き潜在音声表現よりも対照的なタスクを解くことで訓練されたwav2vec 2.0を構築した。
実験により、言語間事前学習はモノリンガル事前訓練よりも著しく優れていることが示された。
論文 参考訳(メタデータ) (2020-06-24T18:25:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。