論文の概要: From Sinhala to Dhivehi: Cross-Lingual Transfer Learning for Low-Resource Speech Recognition
- arxiv url: http://arxiv.org/abs/2607.06289v1
- Date: Tue, 07 Jul 2026 13:57:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.542222
- Title: From Sinhala to Dhivehi: Cross-Lingual Transfer Learning for Low-Resource Speech Recognition
- Title(参考訳): SinhalaからDhivehiへ:低音源音声認識のための言語間変換学習
- Authors: Lukmal Ilyas, Nevidu Jayatilleke,
- Abstract要約: モルディブの国語であるDhivehiは、現在、自動音声認識(ASR)のためにリソースが不足している。
本研究では,Sinhalaからの言語間移動学習がDhivehi ASRを改善できるかどうかを検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Dhivehi, the national language of the Maldives, is currently under-resourced for automatic speech recognition (ASR) and other NLP tasks. This study investigates whether cross-lingual transfer learning from Sinhala, a linguistically related, relatively well-resourced Insular Indo-Aryan language, can improve Dhivehi ASR. We conduct seventeen experiments across five transfer learning paradigms: Dhivehi-only baselines, sequential fine-tuning, multilingual fine-tuning, continual pre-training, and a control using Turkish as an unrelated language. The strongest system, continual pre-training on Sinhala followed by fine-tuning on Dhivehi with KenLM, achieves 12.89% WER and 2.70% CER, outperforming the Dhivehi-only baseline by 13.50% WER and 3.02% CER. However, the adaptation strategy and decoding configuration are equally critical for a successful transfer learning experiment. We conduct seventeen controlled experiments spanning five transfer learning paradigms: Dhivehi-only baselines, sequential fine-tuning, multilingual fine-tuning, continual pre-training, and a control experiment using Turkish as an unrelated language. The strongest system, continual pre-training on Sinhala followed by fine-tuning on Dhivehi with KenLM, achieves 12.89% WER and 2.70% CER, outperforming the Dhivehi-only baseline by 13.50% WER and 3.02% CER. The Turkish control experiment confirms that observed improvements stem from linguistic relatedness; adaptation strategy and decoding configuration are also critical.
- Abstract(参考訳): モルディブの国語であるDhivehiは、現在、自動音声認識(ASR)やその他のNLPタスクのためにリソースが不足している。
本研究は,言語関係の比較的豊富なインド・アーリア語であるSinhalaからの言語間移動学習が,Dhivehi ASRを改善できるかどうかを考察する。
Dhivehi-only baselines, sequence fine-tuning, multilingual fine-tuning, continual pre-training, and a control using Turk as a unrelated language。
最強のシステムはシンハラでのトレーニングを継続し、続いてKenLMでDhivehiを微調整し、12.89%のWERと2.70%のCERを達成し、Dhivehiのみのベースラインを13.50%のWERと3.02%のCERで上回った。
しかし、適応戦略と復号化構成は、転送学習実験を成功させる上でも同様に重要である。
Dhivehi-only baselines, sequence fine-tuning, multilingual fine-tuning, continual pre-training, and a control experiment using Turk as an unrelated language。
最強のシステムはシンハラでのトレーニングを継続し、続いてKenLMでDhivehiを微調整し、12.89%のWERと2.70%のCERを達成し、Dhivehiのみのベースラインを13.50%のWERと3.02%のCERで上回った。
トルコの制御実験では、観察された改善は言語的関連性によるものであることが確認されており、適応戦略と復号化構成も重要である。
関連論文リスト
- Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach [70.31217233606066]
10種類の非言語発声(NVV)を対象とした最初の系統的研究について述べる。
本研究では,Data2Vec の自己教師機能と ECAPA-TDNN を組み合わせたフレームワークを提案し,Mixture of Experts (MoE) モジュールと学習ドメイン認識ルーティングを併用した。
事前訓練された教師による音声入力に対する条件付き蒸留損失は音声合成精度を保ち、対照的な損失は音声-NVV領域ギャップを橋渡しする。
論文 参考訳(メタデータ) (2026-06-19T08:32:07Z) - Code-Switching In-Context Learning for Cross-Lingual Transfer of Large Language Models [64.54005959758733]
我々は,コードスイッチング・イン・コンテキスト・ラーニング(CSICL)を,推論中の翻訳障壁を克服するための原則的かつ堅牢なアプローチとして導入する。
4つのLLM、6つのデータセット、10の言語にわたる広範な実験を行い、知識集約型ドメインと推論指向ドメインの両方にまたがる。
その結果、CSICLはX-ICLベースラインを一貫して上回り、ターゲット言語と見当たらない言語の両方で3.1%pと1.9%pを達成した。
論文 参考訳(メタデータ) (2025-10-07T08:35:42Z) - A Study on Regularization-Based Continual Learning Methods for Indic ASR [0.0]
インドにおける言語多様性は、包括的自動音声認識(ASR)システムを開発する上で大きな課題となっている。
すべての言語データへの同時アクセスを必要とする従来の多言語モデルは、データのシーケンシャルな到着とプライバシ制約のため、現実的ではない。
継続学習(Continuous Learning)は、モデルがそれまでの知識を忘れずに、新しい言語を逐次学習できるようにすることによって、ソリューションを提供する。
論文 参考訳(メタデータ) (2025-08-08T13:02:19Z) - Seewo's Submission to MLC-SLM: Lessons learned from Speech Reasoning Language Models [4.917936997225074]
MLC-SLM(Multilingual Conversational Speech Language Model Challenge)の両トラック用システム
ASRのための音声モデルにおいて、推論と自己補正を明確に強化する多段階学習パイプラインを導入する。
論文 参考訳(メタデータ) (2025-06-16T09:42:05Z) - Speaker Diarization for Low-Resource Languages Through Wav2vec Fine-Tuning [4.396936958546459]
我々は、専用のクルド語コーパス上で、Wav2Vec 2.0の自己教師型学習モデルを訓練する。
我々は他の言語から学んだ多言語表現に適応し、クルド語の音声的・音響的特徴を捉える。
結果は、他の未研究言語で効果的なダイアリゼーションシステムを構築するための基盤を確立する。
論文 参考訳(メタデータ) (2025-04-23T10:45:59Z) - Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model [66.17354128553244]
多くのLVLM(Large Vision-Language Models)は、主に英語のデータに基づいて訓練されている。
異なる言語群に対する学習がいかに異なるかを検討する。
私たちはCenturio(100言語LVLM)をトレーニングし、14のタスクと56の言語を対象とした評価で最先端のパフォーマンスを提供する。
論文 参考訳(メタデータ) (2025-01-09T10:26:14Z) - Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling [50.62091603179394]
最も先進的なASRモデルの1つであるWhisperは99の言語を効果的に扱う。
しかし、ウィスパーは未確認の言語と戦っているが、それらは事前訓練には含まれていない。
本研究では,これらの関係を利用して未知言語上でのASR性能を向上させる手法を提案する。
論文 参考訳(メタデータ) (2024-12-21T04:05:43Z) - Adversarial Training For Low-Resource Disfluency Correction [50.51901599433536]
ディフルエンシ補正(DC)のための逆学習型シーケンスタグ付けモデルを提案する。
提案手法の利点は,3つのインド語でDCに対して評価することで,合成された非流動データに大きく依存することを示す。
また,本手法は,音声障害によって導入されたASR文字の破面的不一致の除去にも有効である。
論文 参考訳(メタデータ) (2023-06-10T08:58:53Z) - From English to More Languages: Parameter-Efficient Model Reprogramming
for Cross-Lingual Speech Recognition [50.93943755401025]
言語間音声認識のためのニューラルモデル再プログラミングに基づく新しいパラメータ効率学習フレームワークを提案する。
我々は、学習可能な事前学習機能強化に焦点を当てた、異なる補助的ニューラルネットワークアーキテクチャを設計する。
提案手法は,既存のASRチューニングアーキテクチャとその拡張性能を自己監督的損失で向上させる。
論文 参考訳(メタデータ) (2023-01-19T02:37:56Z) - Joint Unsupervised and Supervised Training for Multilingual ASR [43.46155711288589]
本稿では、教師付きRNN-T損失と自己監督型コントラスト言語モデリング(MLM)損失を組み合わせた、エンドツーエンドのJUST(Joint Unsupervised and Supervised Training)手法を提案する。
8言語を含む公開データセットであるLibriSpeech(MLS)の性能を検証し、極めて不均衡である。
実験により、JUSTは既存の最先端手法を一貫して上回り、モノリンガルベースラインをかなりの差で打ち負かすことができることが示された。
論文 参考訳(メタデータ) (2021-11-15T23:11:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。