論文の概要: Which Languages Transfer Best to Warlpiri? A Similarity-Based Study for Low-Resource ASR
- arxiv url: http://arxiv.org/abs/2607.10256v1
- Date: Sat, 11 Jul 2026 10:57:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.363042
- Title: Which Languages Transfer Best to Warlpiri? A Similarity-Based Study for Low-Resource ASR
- Title(参考訳): Warlpiri のどの言語が最適か : 低リソース ASR の類似性に基づく研究
- Abstract要約: 本稿では,低リソース環境下での自動音声認識(ASR)における言語類似性がどのように言語間移動を改善するかを検討する。
本稿では,事前学習した音声モデルと,タイポロジー,音素在庫,文法,構文的特徴に基づく言語的類似性を組み合わせた枠組みを提案する。
Whisperによる実験では、音響的およびタイポロジー的に類似した言語が単言語および多言語ベースラインより優れていることが示された。
- 参考スコア(独自算出の注目度): 20.570587554037616
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper investigates how language similarity can improve cross-lingual transfer for automatic speech recognition (ASR) in extremely low-resource settings. Warlpiri, an Australian Aboriginal language, has very limited transcribed speech data, making transfer learning essential. We propose a framework combining acoustic similarity from pre-trained speech models with linguistic similarity based on typology, phoneme inventories, grammatical, and syntactic features to rank high-resource source languages and evaluate their effectiveness for ASR transfer to Warlpiri. Experiments with Whisper show that acoustically and typologically similar languages outperform monolingual and multilingual baselines. Assamese and Hindi achieve substantial reductions in word and character error rates. Correlation analysis further indicates that acoustic similarity is the strongest predictor of fine-tuning performance, while phoneme inventory and typological similarity better explain zero-shot transfer.
- Abstract(参考訳): 本稿では,低リソース環境下での自動音声認識(ASR)における言語類似性がどのように言語間移動を改善するかを検討する。
オーストラリアのアボリジニ語であるWarlpiriは、転写された音声データが非常に限られており、転写学習が不可欠である。
本稿では,事前学習音声モデルの音響的類似性と,タイポロジー,音素在庫,文法,構文的特徴に基づく言語的類似性を組み合わせたフレームワークを提案する。
Whisperによる実験では、音響的およびタイポロジー的に類似した言語が単言語および多言語ベースラインより優れていることが示された。
AssameseとHindiは単語と文字の誤り率を大幅に下げる。
相関分析により、音素の類似性は微調整性能の最も強い予測因子であり、音素の在庫と類型的類似性はゼロショット転送をよりよく説明できることが示された。
関連論文リスト
- SITA: Learning Speaker-Invariant and Tone-Aware Speech Representations for Low-Resource Tonal Languages [11.655315357810371]
SITAは、事前訓練されたwav2vecスタイルのエンコーダに対して、話者不変性とトーン認識を強制する軽量な適応レシピである。
音色を効果的に表現できない多言語エンコーダであるHmongを主眼として評価した。
論文 参考訳(メタデータ) (2026-01-14T00:42:27Z) - Dialect Matters: Cross-Lingual ASR Transfer for Low-Resource Indic Language Varieties [7.81142462208334]
自然発声・雑音・符号混合音声を用いた言語間移動の実験的検討を行った。
以上の結果から,ASRは言語間の系統的距離を減らして改善されているものの,この因子だけでは方言設定における性能を完全に説明できないことが示唆された。
論文 参考訳(メタデータ) (2026-01-07T20:31:05Z) - Languages in Multilingual Speech Foundation Models Align Both Phonetically and Semantically [58.019484208091534]
事前訓練された言語モデル(LM)における言語間アライメントは、テキストベースのLMの効率的な転送を可能にしている。
テキストに基づく言語間アライメントの発見と手法が音声に適用されるかどうかについては、未解決のままである。
論文 参考訳(メタデータ) (2025-05-26T07:21:20Z) - Improving Cross-Lingual Phonetic Representation of Low-Resource Languages Through Language Similarity Analysis [7.751856268560216]
本稿では,低音源言語における音声処理における言語的類似性が言語間音声表現に与える影響について検討する。
音韻学的に類似した言語を使用すると、単言語訓練よりも55.6%の相対的な改善が達成される。
論文 参考訳(メタデータ) (2025-01-12T13:29:24Z) - Cross-Lingual Transfer Learning for Speech Translation [7.802021866251242]
本稿では,制限データを用いた音声基礎モデルの音声翻訳機能の拡張について検討する。
Whisperは、音声認識と英訳に強い性能を持つ音声基礎モデルであり、その例として用いられる。
音声から音声への検索を用いて,エンコーダが生成した音声表現を分析し,異なる言語からの発話を共有意味空間にマッピングすることを示す。
論文 参考訳(メタデータ) (2024-07-01T09:51:48Z) - Investigating the Impact of Cross-lingual Acoustic-Phonetic Similarities
on Multilingual Speech Recognition [31.575930914290762]
言語間音響-音声の類似性を調べるために, 新たなデータ駆動手法を提案する。
ディープニューラルネットワークは、異なる音響モデルからの分布を直接的に同等の形式に変換するためのマッピングネットワークとして訓練されている。
モノリンガルに比べて8%の相対的な改善が達成されている。
論文 参考訳(メタデータ) (2022-07-07T15:55:41Z) - Cross-lingual Low Resource Speaker Adaptation Using Phonological
Features [2.8080708404213373]
我々は、異なる言語に共通する音韻的特徴のセットに基づいて、言語に依存しないマルチスピーカモデルを訓練する。
対象話者データの32と8の発声で、対応する文献に匹敵する高い話者類似度スコアと自然性を得る。
論文 参考訳(メタデータ) (2021-11-17T12:33:42Z) - Cross-lingual Transfer for Speech Processing using Acoustic Language
Similarity [81.51206991542242]
言語間の移動は、このデジタル分割を橋渡しする魅力的な方法を提供する。
現在の言語間アルゴリズムは、テキストベースのタスクや音声関連タスクを低リソース言語で実現している。
本稿では,数百の言語をまたがる音響的言語間移動対を効率的に同定する言語類似性手法を提案する。
論文 参考訳(メタデータ) (2021-11-02T01:55:17Z) - Wav-BERT: Cooperative Acoustic and Linguistic Representation Learning
for Low-Resource Speech Recognition [159.9312272042253]
Wav-BERTは、協調的な音響および言語表現学習法である。
我々は、事前訓練された音響モデル(wav2vec 2.0)と言語モデル(BERT)をエンドツーエンドのトレーニング可能なフレームワークに統合する。
論文 参考訳(メタデータ) (2021-09-19T16:39:22Z) - How Phonotactics Affect Multilingual and Zero-shot ASR Performance [74.70048598292583]
Transformer encoder-decoderモデルは、トレーニング中に提示された言語のIPA転写において、多言語データをうまく活用することが示されている。
我々は,エンコーダデコーダをAMとLMを分離したハイブリッドASRシステムに置き換える。
交叉音韻律のモデル化による利得は限定的であり,強すぎるモデルがゼロショット転送を損なう可能性があることを示す。
論文 参考訳(メタデータ) (2020-10-22T23:07:24Z) - That Sounds Familiar: an Analysis of Phonetic Representations Transfer
Across Languages [72.9927937955371]
我々は、他言語に存在するリソースを用いて、多言語自動音声認識モデルを訓練する。
我々は,多言語設定における全言語間での大幅な改善と,多言語設定におけるスターク劣化を観察した。
分析の結果、ひとつの言語に固有の電話でさえ、他の言語からのトレーニングデータを追加することで大きなメリットがあることがわかった。
論文 参考訳(メタデータ) (2020-05-16T22:28:09Z) - Bridging Linguistic Typology and Multilingual Machine Translation with
Multi-View Language Representations [83.27475281544868]
特異ベクトル標準相関解析を用いて、各情報源からどのような情報が誘導されるかを調べる。
我々の表現は類型学を組み込み、言語関係と相関関係を強化する。
次に、多言語機械翻訳のための多視点言語ベクトル空間を利用して、競合する全体的な翻訳精度を実現する。
論文 参考訳(メタデータ) (2020-04-30T16:25:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。