論文の概要: Disentangling Speaker and Language Effects in Cross-Lingual Speaker Verification for Iberian Languages
- arxiv url: http://arxiv.org/abs/2607.01161v1
- Date: Wed, 01 Jul 2026 16:44:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.995342
- Title: Disentangling Speaker and Language Effects in Cross-Lingual Speaker Verification for Iberian Languages
- Title(参考訳): イベリア語話者の言語間話者検証における話者間距離と言語効果
- Authors: Pol Buitrago, Javier Hernando,
- Abstract要約: 言語間話者検証 (SV) システムでは, 言語間での音声の入力やテストの発話において, 性能劣化を示す。
我々は,イベリア語5言語を対象としたバイリンガル同話者評価セットを導入し,話者同一性の下での言語間SVの分析を可能にした。
- 参考スコア(独自算出の注目度): 5.756864120253599
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cross-lingual speaker verification (SV) systems typically exhibit performance degradation when enrollment and test utterances are spoken in different languages. However, standard evaluation protocols confound language mismatch with inter-speaker variability, as evaluation is generally performed with different speakers across languages. In this work, we introduce a bilingual same-speaker evaluation set for five Iberian languages, enabling analysis of cross-lingual SV under constant speaker identity. We apply this setup to a HuBERT-based SV system previously shown to exhibit strong language dependence, and analyze results using the Cross-Lingual Transfer Matrix (CLTM) to study pairwise cross-lingual transfer. Our results show that speaker-related variability accounts for part of the observed degradation, but language mismatch remains the main driver of cross-lingual performance loss. These findings provide a more precise characterization of language dependence in cross-lingual SV.
- Abstract(参考訳): 言語間話者検証(SV)システムは典型的には、様々な言語で音声やテスト発話が話されるときに性能劣化を示す。
しかし、標準評価プロトコルは、言語間で異なる話者で一般的に評価されるため、話者間のばらつきと言語ミスマッチを混同する。
本研究では,イベリア語5言語を対象としたバイリンガルな同話者評価セットを導入する。
この設定をHuBERTベースのSVシステムに適用し、言語依存度が強いことを示すとともに、CLTM(Cross-Lingual Transfer Matrix)を用いて、両言語間移動の研究結果を解析する。
以上の結果から,話者関係の変動が観察結果の劣化の原因となっていることが明らかとなったが,言語ミスマッチが言語間性能低下の要因となっている。
これらの知見は言語間SVにおける言語依存のより正確な特徴を与える。
関連論文リスト
- L-Proto: Language-Aware Episodic Prototypical Training for Multilingual Speaker Verification [49.128847336227636]
本稿では,L-Protoを提案する。
TidyVoice Challengeベンチマークの実験では、従来の微調整およびランダムなエピソードサンプリングよりも一貫した性能向上が示されている。
論文 参考訳(メタデータ) (2026-06-16T01:57:41Z) - When Languages Disagree: Self-Evolving Multilingual LLM Judges [12.308063172324003]
多言語不整合が相補的な評価信号を提供することを示す。
SEMJは,反復的洗練のために言語間不整合を利用する自己進化型多言語判断器である。
論文 参考訳(メタデータ) (2026-06-06T10:36:24Z) - Adapting Self-Supervised Speech Representations for Cross-lingual Dysarthria Detection in Parkinson's Disease [72.0406069194794]
音声表現は、しばしば言語に依存した構造を符号化する。
本稿では,ソース言語による自己教師型音声表現とターゲット言語分布とを一致させる表現レベル言語シフトを提案する。
チェコ語,ドイツ語,スペイン語におけるパーキンソン病音声データセットの経口DDK記録に対するアプローチについて検討した。
論文 参考訳(メタデータ) (2026-03-23T17:23:39Z) - Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks [4.911970211082446]
言語間の言語間相互作用を定量化するための体系的手法であるCLTM(Cross-Lingual Transfer Matrix)を提案する。
我々は,多言語HuBERTエンコーダを用いて,ジェンダー識別と話者検証という2つのパラ言語課題にCLTMを適用した。
この結果から,タスクや言語間の異なる伝達パターンが明らかとなり,言語に依存した系統的な影響が反映された。
論文 参考訳(メタデータ) (2026-03-09T11:02:57Z) - When Meanings Meet: Investigating the Emergence and Quality of Shared Concept Spaces during Multilingual Language Model Training [57.230355403478995]
本研究では,EuroLLMの事前学習における言語に依存しない概念空間の開発について検討する。
共有概念空間は早期に出現し、洗練され続けていますが、それらとの整合性は言語に依存しています。
従来の作業とは対照的に、細かな手作業分析により、翻訳品質の顕著な向上は、行動の変化を反映していることが判明した。
論文 参考訳(メタデータ) (2026-01-30T11:23:01Z) - LASPA: Language Agnostic Speaker Disentanglement with Prefix-Tuned Cross-Attention [2.199918533021483]
アクセント、音声解剖学、言語音声構造などの声質特性の重複は、言語情報と話者情報の分離を複雑にする。
これらのコンポーネントの分離は、話者認識の精度を大幅に向上させる。
そこで本稿では,接頭辞付きクロスアテンションを通じて共同学習を統合する,新しい非絡み合い学習戦略を提案する。
論文 参考訳(メタデータ) (2025-06-02T10:59:31Z) - An Initial Investigation of Language Adaptation for TTS Systems under Low-resource Scenarios [76.11409260727459]
本稿では,最近のSSLベースの多言語TSシステムであるZMM-TTSの言語適応性について検討する。
本研究では,事前学習言語と対象言語との音声学的な類似性が,対象言語の適応性能に影響を及ぼすことを示す。
論文 参考訳(メタデータ) (2024-06-13T08:16:52Z) - Investigating the Impact of Cross-lingual Acoustic-Phonetic Similarities
on Multilingual Speech Recognition [31.575930914290762]
言語間音響-音声の類似性を調べるために, 新たなデータ駆動手法を提案する。
ディープニューラルネットワークは、異なる音響モデルからの分布を直接的に同等の形式に変換するためのマッピングネットワークとして訓練されている。
モノリンガルに比べて8%の相対的な改善が達成されている。
論文 参考訳(メタデータ) (2022-07-07T15:55:41Z) - Analyzing the Mono- and Cross-Lingual Pretraining Dynamics of
Multilingual Language Models [73.11488464916668]
本研究では,多言語事前学習プロセスのダイナミクスについて検討する。
我々は,XLM-Rプレトレーニング全体から抽出したチェックポイントを,一連の言語的タスクを用いて探索する。
分析の結果,より複雑なものよりも低レベルな言語スキルが得られ,早期に高い言語性能が得られることがわかった。
論文 参考訳(メタデータ) (2022-05-24T03:35:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。