論文の概要: A Native-Reference Coordinate Geometry for L2 Pronunciation Deviation Using Self-Supervised Speech Models
- arxiv url: http://arxiv.org/abs/2609.28060v1
- Date: Wed, 23 Sep 2026 13:11:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.025905
- Title: A Native-Reference Coordinate Geometry for L2 Pronunciation Deviation Using Self-Supervised Speech Models
- Title(参考訳): 自己教師付き音声モデルを用いたL2発音偏差のネイティブ参照座標幾何
- Abstract要約: そこで本研究では,L2音声の低次元参照部分空間を定義し,L2音声をL2音声からL2音声までの距離で評価する手法を提案する。
異なる自己教師付きエンコーダとモデル選択により、結果として得られるネイティブ参照距離は、話しの習熟度と-0.5までの負のスピアマン相関を示し、高い習熟度話者がネイティブ参照空間に近づく傾向があることを示している。
- 参考スコア(独自算出の注目度): 12.863684545287716
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-supervised speech models encode rich phonetic information, but it remains unclear how to transform this information into interpretable metrics for second-language (L2) pronunciation assessment in spontaneous speech. We propose a native-reference coordinate geometry in which phone-class averages from native speech define a low-dimensional reference subspace, and L2 speech is evaluated by its distance to matching native phone-class coordinates. Unlike prior distance-based approaches, our method does not require parallel recordings with matched linguistic content or dedicated pronunciation labels. Across different self-supervised encoders and modeling choices, the resulting native-reference distances show negative Spearman correlations up to -0.5 with speaking proficiency, indicating that higher-proficiency speakers tend to lie closer to the native-reference space.
- Abstract(参考訳): 自己教師音声モデルは、豊かな音声情報を符号化するが、この情報を自然発話における第二言語(L2)発音評価のための解釈可能な指標にする方法は、未だ不明である。
そこで本研究では,L2音声の低次元参照部分空間を定義し,L2音声をL2音声からL2音声までの距離で評価する手法を提案する。
従来の距離に基づくアプローチとは違い,本手法では,一致した言語内容や専用の発音ラベルの同時記録は不要である。
異なる自己教師付きエンコーダとモデル選択により、結果として得られるネイティブ参照距離は、話しの習熟度と-0.5までの負のスピアマン相関を示し、高い習熟度話者がネイティブ参照空間に近づく傾向があることを示している。
関連論文リスト
- Quantifying the Generation Modality Gap in Speech-Text Language Models [22.8588553114451]
純粋な音声言語モデルは、コヒーレントなコンテンツを生成する際に、テキストや音声-テキスト言語モデルに遅れをとることが多い。
本研究では,連続音響特徴量生成のためのフローマッチングに基づいて,音声モデル群における音声文のモダリティギャップについて検討する。
我々は、一致したデータに基づいて訓練された音声のみ、テキストのみ、および音声テキスト言語モデルを比較する、統合された世代ベース評価スイートを構築した。
論文 参考訳(メタデータ) (2026-09-13T19:09:07Z) - Unseen Speaker and Language Adaptation for Lightweight Text-To-Speech with Adapters [3.7987175642397832]
アダプタのレンズを用いた言語間テキスト音声合成について検討する。
その結果,言語固有の情報や話者固有の情報の学習において,アダプタの有効性が示された。
また,アダプタ配置,構成,使用話者数の影響について考察した。
論文 参考訳(メタデータ) (2025-08-25T13:14:57Z) - Languages in Multilingual Speech Foundation Models Align Both Phonetically and Semantically [58.019484208091534]
事前訓練された言語モデル(LM)における言語間アライメントは、テキストベースのLMの効率的な転送を可能にしている。
テキストに基づく言語間アライメントの発見と手法が音声に適用されるかどうかについては、未解決のままである。
論文 参考訳(メタデータ) (2025-05-26T07:21:20Z) - Multilingual self-supervised speech representations improve the speech
recognition of low-resource African languages with codeswitching [65.74653592668743]
微細な自己教師型多言語表現は絶対単語誤り率を最大20%削減する。
訓練データに制限のある状況では、自己教師付き表現を微調整することが、より良いパフォーマンスと実行可能なソリューションである。
論文 参考訳(メタデータ) (2023-11-25T17:05:21Z) - Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer [53.72998363956454]
個別の自己教師付き表現を用いた音声音声合成(S2ST)は顕著な精度を達成している。
高品質な話者並列データの不足は、翻訳中にスタイル転送を学習する上での課題となる。
我々は、個別の自己教師付き音声表現と音色単位に基づいて、スタイル変換機能を備えたS2STパイプラインを設計する。
論文 参考訳(メタデータ) (2023-09-14T09:52:08Z) - Incorporating L2 Phonemes Using Articulatory Features for Robust Speech
Recognition [2.8360662552057323]
本研究は,韓国語音素を指すL2音素の効率的な組み込みについて,音声特徴分析を用いて検討した。
格子のない最大相互情報(LF-MMI)の目的をエンドツーエンドに使い、音響モデルを訓練し、複数の発音候補のうちの1つを調整・予測する。
実験結果から,提案手法は韓国語L2音声のASR精度をL1音声データのみに基づく訓練により向上させることが示された。
論文 参考訳(メタデータ) (2023-06-05T01:55:33Z) - Cross-lingual Text-To-Speech with Flow-based Voice Conversion for
Improved Pronunciation [11.336431583289382]
本稿では,エンドツーエンドの言語間テキスト合成手法を提案する。
本来の話者の言語によらず、対象言語の発音を維持することを目的としている。
論文 参考訳(メタデータ) (2022-10-31T12:44:53Z) - Towards Language Modelling in the Speech Domain Using Sub-word
Linguistic Units [56.52704348773307]
音節や音素を含む言語単位に基づくLSTMに基づく新しい生成音声LMを提案する。
限られたデータセットでは、現代の生成モデルで要求されるものよりも桁違いに小さいので、我々のモデルはバブリング音声を近似する。
補助的なテキストLM,マルチタスク学習目標,補助的な調音特徴を用いた訓練の効果を示す。
論文 参考訳(メタデータ) (2021-10-31T22:48:30Z) - Using multiple reference audios and style embedding constraints for
speech synthesis [68.62945852651383]
提案モデルでは,複数の参照音声を用いて音声の自然さとコンテンツ品質を向上させることができる。
モデルは、スタイル類似性のABX選好テストにおいてベースラインモデルよりも優れている。
論文 参考訳(メタデータ) (2021-10-09T04:24:29Z) - VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised
Speech Representation Disentanglement for One-shot Voice Conversion [54.29557210925752]
ワンショット音声変換は、音声表現のアンタングルメントによって効果的に実現できる。
コンテンツエンコーディングにはベクトル量子化(VQ)を使用し、トレーニング中に相互情報(MI)を相関指標として導入する。
実験結果は,提案手法が効果的に非絡み合った音声表現を学習する際の優位性を反映している。
論文 参考訳(メタデータ) (2021-06-18T13:50:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。