論文の概要: Robust Assamese Speech Recognition through Controlled Fine-Tuning of Whisper Models
- arxiv url: http://arxiv.org/abs/2607.17164v1
- Date: Sun, 19 Jul 2026 09:54:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.384821
- Title: Robust Assamese Speech Recognition through Controlled Fine-Tuning of Whisper Models
- Title(参考訳): ウィスパーモデルの微調整によるロバストなアサメス音声認識
- Abstract要約: 本稿ではMozilla Common Voice 24.0-Assamese corpusで学習したWhisper-based Assamese ASRシステムについて述べる。
ハードウェア対応の最適化トレーニングパイプラインは、リソース制約のある環境向けに実装されている。
- 参考スコア(独自算出の注目度): 1.4095958360608893
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Developing Automatic Speech Recognition (ASR) for morphologically rich, low-resource languages such as Assamese is challenging due to insufficient annotated speech data. The pretrained Whisper model performs poorly on Assamese speech recognition tasks. This paper presents a controlled, fine-tuned Whisper-based Assamese ASR system trained on the Mozilla Common Voice 24.0-Assamese corpus. A hardware-aware optimized training pipeline is implemented for resource-constrained environments, employing mixed-precision training and gradient accumulation on Tesla 4 Graphics Processing Units (T4 GPUs). The proposed fine-tuned model significantly outperformed the Zero-shot baseline, yielding Word Error Rate (WER), Character Error Rate (CER), Match Error Rate (MER), and Word Infomation Loss (WIL) of 43.17\%, 13.18\%, 43\%, and 64.81\%, respectively, achieving significant relative improvements of 78.26\%, 93.10\%, 57.0\%, and 35.19\% over the baseline. Semantic evaluation of the fine-tuned model also demonstrates notable improvement over a zero baseline, attaining Bilingual Evaluation Understudy (BLEU) and Metric for Evaluation of Translation with Explicit ORdering (METEOR) scores of 30.81 and 0.5262, respectively. Additionally, the predicted hallucination rate and Real-Time Factor (RTF) are substantially improved by 96.70\% and 32.38\%, compared to the zero-shot baseline.
- Abstract(参考訳): Assameseのような形態的に豊かな低リソース言語のための自動音声認識(ASR)の開発は、注釈付き音声データが不足しているため困難である。
事前学習されたWhisperモデルは、アサメの音声認識タスクでは不十分である。
本稿ではMozilla Common Voice 24.0-Assamese corpusで学習したWhisper-based Assamese ASRシステムについて述べる。
ハードウェア対応で最適化されたトレーニングパイプラインは、リソース制約のある環境向けに実装されており、Tesla 4 Graphics Processing Units (T4 GPU)上で、混合精度のトレーニングと勾配の蓄積を利用している。
提案された微調整モデルはゼロショットベースラインを著しく上回り、ワードエラー率(WER)、文字エラー率(CER)、マッチエラー率(MER)、ワードインフォメーション損失(WIL)はそれぞれ43.17\%、13.18\%、43\%、64.81\%となり、ベースライン上の78.26\%、93.10\%、57.0\%、35.19\%の大幅な相対的な改善を実現した。
細調整モデルのセマンティック評価はまた、ゼロベースラインよりも顕著な改善を示し、それぞれ30.81と0.5262の2言語評価アンダーストディ(BLEU)とMetric for Evaluation with Explicit ORdering(METEOR)スコアを得た。
さらに、予測幻覚率とリアルタイム因子(RTF)は、ゼロショットベースラインと比較して96.70\%と32.38\%に大幅に改善されている。
関連論文リスト
- A Speech Corpus for Mizo Automatic Speech Recognition: Whisper and SraVaani 1.0 Fine-Tuning with Morphology-Aware Evaluation [7.015860050706781]
17.62時間の音声データを収集し、それをキュレートし、3つのWhisper多言語モデルとSraVaani 1.0 Indic多言語モデルでMizo ASRシステムを微調整した。
Whisper-large-v3は最も低いWER(18.08%)を達成し、形態学的評価は7.22%であった。
結果から,Whisper モデルは未知の言語に適応しても,極めて低い WER を実現することができた。
論文 参考訳(メタデータ) (2026-08-19T18:30:46Z) - Spoken Language Identification with Pre-trained Models and Margin Loss [9.800066159312749]
本稿では,TydyLang Challenge 2026で提案されている話者制御音声言語識別タスクについて,事前学習モデルに基づく言語識別手法を提案する。
提案手法は,事前学習したECAPA-TDNNを特徴エンコーダとして採用し,言語表現の識別能力を高めるためにマージンに基づく損失を取り入れる。
論文 参考訳(メタデータ) (2026-05-03T14:37:52Z) - Enhancing ASR Performance in the Medical Domain for Dravidian Languages [4.188779570200089]
本研究は,実音声データと合成音声データを統合した,信頼度に配慮した新たなトレーニングフレームワークを提案する。
5 グラムの KenLM 言語モデルを用いて復号後の訂正を行う。
その結果,学習可能な重み付きハイブリッド信頼度認識手法は認識誤差を大幅に低減することがわかった。
論文 参考訳(メタデータ) (2026-04-10T09:41:26Z) - Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation [0.0]
Pashtoは、約6000~8000万人が話すが、共有公開テストセット上での多言語自動音声認識(ASR)のベンチマークは公開されていない。
本稿では,公開Pashtoデータに対する最初の再現可能なマルチモデル評価を行い,ゼロショットASR,スクリプトレベルの故障,微調整モデルのクロスドメイン評価について報告する。
論文 参考訳(メタデータ) (2026-04-06T11:23:42Z) - DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation [111.94720088481614]
多モーダル生成モデルは方言テキスト入力を効果的に生成できるのか?
6つの共通英語方言にまたがる大規模ベンチマークを構築した。
マルチモーダル生成モデルのための一般的なエンコーダに基づく緩和戦略を設計する。
論文 参考訳(メタデータ) (2025-10-16T17:56:55Z) - One Whisper to Grade Them All [10.035434464829958]
複数部からなる第2言語テストの総合的自動発話評価(ASA)に対して,効率的なエンドツーエンドアプローチを提案する。
我々のシステムの主な特徴は、4つの音声応答を1つのWhisper小エンコーダで処理できることである。
このアーキテクチャは、書き起こしや部品ごとのモデルの必要性を排除し、推論時間を短縮し、ASAを大規模コンピュータ支援型言語学習システムに活用する。
論文 参考訳(メタデータ) (2025-07-23T20:31:40Z) - SAGE: Spliced-Audio Generated Data for Enhancing Foundational Models in Low-Resource Arabic-English Code-Switched Speech Recognition [4.210105570047471]
本稿では、方言アラビア語(DA)とアラビア英語(CS)音声における様々な音声SSLモデルの性能について検討する。
データ不足に対処するため,人工CS音声データを生成するための改良型オーディオスプライシング手法を導入した。
すでに微調整されたSSLモデルでは、アラビア語と英語のCSベンチマークでワードエラー率(WER)が7.8%向上する。
論文 参考訳(メタデータ) (2025-06-27T11:42:43Z) - Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking [68.77659513993507]
我々は,多言語ASRの精度を向上させるため,単純かつ効果的なN-best再分類手法を提案する。
その結果, 音声認識の精度は8.7%, 6.1%, 単語誤り率は3.3%, 単語誤り率は2.0%であった。
論文 参考訳(メタデータ) (2024-09-27T03:31:32Z) - Text Injection for Neural Contextual Biasing [57.589903308622745]
本研究では文脈テキストインジェクション(CTI)を提案する。
1000億のテキストを持つCTIは、強い神経バイアスモデルから43.3%の相対的なWER削減を達成することができる。
論文 参考訳(メタデータ) (2024-06-05T04:20:17Z) - From English to More Languages: Parameter-Efficient Model Reprogramming
for Cross-Lingual Speech Recognition [50.93943755401025]
言語間音声認識のためのニューラルモデル再プログラミングに基づく新しいパラメータ効率学習フレームワークを提案する。
我々は、学習可能な事前学習機能強化に焦点を当てた、異なる補助的ニューラルネットワークアーキテクチャを設計する。
提案手法は,既存のASRチューニングアーキテクチャとその拡張性能を自己監督的損失で向上させる。
論文 参考訳(メタデータ) (2023-01-19T02:37:56Z) - Unsupervised Cross-lingual Representation Learning for Speech
Recognition [63.85924123692923]
XLSRは、複数の言語における音声の生波形から1つのモデルを事前学習することで、言語間音声表現を学習する。
我々は、マスク付き潜在音声表現よりも対照的なタスクを解くことで訓練されたwav2vec 2.0を構築した。
実験により、言語間事前学習はモノリンガル事前訓練よりも著しく優れていることが示された。
論文 参考訳(メタデータ) (2020-06-24T18:25:05Z) - Listen Attentively, and Spell Once: Whole Sentence Generation via a
Non-Autoregressive Architecture for Low-Latency Speech Recognition [66.47000813920619]
我々はLASOと呼ばれる非自己回帰型エンドツーエンド音声認識システムを提案する。
非自己回帰性のため、LASOは他のトークンに依存することなくシーケンス内のテキストトークンを予測する。
我々は,中国における公開データセットAISHELL-1の実験を行った。
論文 参考訳(メタデータ) (2020-05-11T04:45:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。