論文の概要: GigaAM Multilingual: Foundation Model for Underrepresented Languages
- arxiv url: http://arxiv.org/abs/2607.10371v1
- Date: Sat, 11 Jul 2026 15:48:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.405387
- Title: GigaAM Multilingual: Foundation Model for Underrepresented Languages
- Title(参考訳): GigaAM Multilingual: 表現不足言語の基礎モデル
- Authors: Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin,
- Abstract要約: We present GigaAM Multilingual, a Conformer encoder pre-trained on 200M hours of audio using a HuBERT-style objective。
我々は,事前学習時のクラスタレベルのデータバランス戦略と,微調整時のドメイン認識サンプリング手法を導入し,見出し言語の優位性を緩和する。
- 参考スコア(独自算出の注目度): 63.406165255277195
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite recent scaling successes, multilingual ASR performance remains highly uneven, with long-tail languages suffering from severe data scarcity. This work addresses the challenge of building robust foundation models for underrepresented Central Asian languages (Kazakh, Kyrgyz, Uzbek). We present GigaAM Multilingual, a Conformer encoder pre-trained on 2M hours of audio using a HuBERT-style objective. Crucially, we introduce a cluster-level data balancing strategy during pre-training and a domain-aware sampling method during fine-tuning to mitigate head-language dominance. In controlled comparisons, our approach outperforms strong open pretrained encoders (Whisper Large v3, Omnilingual-1B) on target languages, achieving significant gains on spontaneous speech while maintaining efficiency. We release the foundation encoder and ASR model, offering a proven recipe for effective multilingual adaptation under realistic data imbalance.
- Abstract(参考訳): 近年のスケーリングの成功にもかかわらず、多言語ASRのパフォーマンスは非常に不均一であり、長い尾の言語は深刻なデータ不足に悩まされている。
この研究は、未表現の中央アジアの言語(カザフ語、キルギス語、ウズベク語)の堅牢な基礎モデルを構築するという課題に対処する。
We present GigaAM Multilingual, a Conformer encoder pre-trained on 200M hours of audio using a HuBERT-style objective。
重要な点として,事前学習時のクラスタレベルのデータバランス戦略と,微調整時のドメイン認識サンプリング手法を導入し,ヘッドランゲージの優位性を緩和する。
制御された比較において,本手法は,目標言語における強オープンな事前学習エンコーダ(Whisper Large v3, Omnilingual-1B)よりも優れ,効率を保ちながら自然発話において顕著に向上する。
我々は、現実的なデータ不均衡の下で、効果的な多言語適応のための実証されたレシピを提供する基礎エンコーダとASRモデルをリリースする。
関連論文リスト
- An Empirical Recipe for Universal Phone Recognition [63.45609714127985]
音声認識(PR)は、多言語および低リソースの音声処理タスクの鍵となる機能である。
我々は、大規模多言語データに基づいて訓練されたPhonticXEUSを提案する。
多言語(17.7%PFER)とアクセント付き英語(10.6%PFER)の両方で最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-03-30T22:12:48Z) - Harmonizing the Arabic Audio Space with Data Scheduling [15.84874997729878]
本稿では、アラビア語中心のLLMのためのマルチタスク・インストラクション・チューニングに関する最初の体系的研究について述べる。
我々はQwen2.5-Omni (7B) を微調整し、Aligner-Based Diverse Smpling (ADS) とともにタスクプログレッシブカリキュラム (TPC) を提案する。
ADSは初期収束を加速するが、その固有の勾配のボラティリティは、長期の訓練で生成的復号を不安定にすることができる。
論文 参考訳(メタデータ) (2026-01-18T17:08:31Z) - Towards Inclusive NLP: Assessing Compressed Multilingual Transformers across Diverse Language Benchmarks [33.2185998586144]
本研究は、アラビア語、英語、インド語にまたがる多言語および単言語大言語モデル(LLM)の性能をベンチマークする。
発見は言語的多様性と資源の可利用性によって引き起こされる顕著なパフォーマンスの違いを示している。
量子化(4ビットと8ビット)は、効率を向上しながらモデルの精度を維持するのに有効であるが、アグレッシブプルーニングは性能を著しく損なう。
論文 参考訳(メタデータ) (2025-07-25T22:35:10Z) - Efficient Multilingual ASR Finetuning via LoRA Language Experts [59.27778147311189]
本稿では,WhisperをベースとしたLoRA言語エキスパートによる多言語ASRをカスタマイズするための効率的な微調整フレームワークを提案する。
LoRAエキスパート融合や知識蒸留により,本手法は従来の微調整法よりも目標言語での認識性能が向上する。
実験の結果,提案モデルでは,言語認識および言語認識のシナリオにおいて,約10%と15%の性能向上が得られた。
論文 参考訳(メタデータ) (2025-06-11T07:06:27Z) - Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis [4.774607166378613]
自己教師付き事前トレーニングと大規模言語モデル(LLM)を組み合わせることで、低リソースシナリオにおけるASRのパフォーマンスを効果的に向上させることができる。
我々は、ラベル付き方言とアクセント付き音声データの30,000時間でData2vec2モデルを事前訓練し、教師付きデータセット上で4万時間アライメントトレーニングを行う。
論文 参考訳(メタデータ) (2025-05-27T12:50:55Z) - Efficient Compression of Multitask Multilingual Speech Models [0.0]
DistilWhisperは、マルチタスクとマルチ言語機能の利点を維持しながら、これらの言語におけるASRのパフォーマンスギャップを埋めることができる。
提案手法は, 言語専門家を用いた軽量モジュール型ASR微調整と, ささやかな大口径v2からの知識蒸留の2つの戦略を含む。
論文 参考訳(メタデータ) (2024-05-02T03:11:59Z) - Distributionally Robust Multilingual Machine Translation [94.51866646879337]
本稿では,分散的ロバストな最適化に基づくMNMT(Multilingual Neural Machine Translation)の新しい学習目標を提案する。
この目的を,反復的最適応答方式を用いて,大規模翻訳コーパスに対して実用的に最適化する方法を示す。
本手法は,多対一の翻訳設定と多対多の翻訳設定の両方において,平均と言語毎のパフォーマンスにおいて,強いベースライン法より一貫して優れる。
論文 参考訳(メタデータ) (2021-09-09T03:48:35Z) - Cross-lingual Machine Reading Comprehension with Language Branch
Knowledge Distillation [105.41167108465085]
言語間機械読解(CLMRC)は、ローソース言語に大規模なデータセットがないため、依然として難しい問題である。
本稿では,Language Branch Machine Reading (LBMRC) という新しい拡張手法を提案する。
LBMRCは、個々の言語に精通したMultiple Machine Read comprehension (MRC)モデルを訓練する。
複数の言語分岐モデルから全ての対象言語に対する単一モデルへのアマルガメート知識の多言語蒸留アプローチを考案する。
論文 参考訳(メタデータ) (2020-10-27T13:12:17Z) - Mixed-Lingual Pre-training for Cross-lingual Summarization [54.4823498438831]
言語間の要約は、ソース言語の記事に対する対象言語の要約を作成することを目的としている。
本稿では,翻訳のような言語間タスクと,マスク付き言語モデルのようなモノリンガルタスクの両方を活用する混合言語事前学習に基づくソリューションを提案する。
本モデルでは,2.82(中国語)と1.15(中国語,英語)のROUGE-1スコアを最先端の結果に対して改善する。
論文 参考訳(メタデータ) (2020-10-18T00:21:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。