論文の概要: Language-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASR
- arxiv url: http://arxiv.org/abs/2608.03610v2
- Date: Mon, 10 Aug 2026 11:37:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 13:55:18.502628
- Title: Language-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASR
- Title(参考訳): 多言語LDMに基づくASRのための言語特化マルチ教師オンポリティ蒸留
- Abstract要約: 言語固有の知識獲得を多言語機能統合から切り離す言語特化型多言語教師オンポリシィ蒸留(LS-MOPD)を提案する。
Mandarin, Mandarin subdialects, Cantonese, English を対象とするベンチマーク実験では、LS-MOPD が RL のベースラインを大幅に上回り、最高のパフォーマンスの教師によって定義された経験的パフォーマンスエンベロープを超えていることが示された。
- 参考スコア(独自算出の注目度): 17.90532879806511
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern LLM-based ASR systems have established multilingual capability as a standard feature, leveraging large-scale multilingual corpora and LLMs' cross-lingual knowledge to achieve competitive performance across multilingual benchmarks. However, jointly modeling languages with heterogeneous acoustic, phonological, and lexical characteristics inevitably introduces optimization conflicts, undermining language-wise specialization. To address this challenge, we propose Language-Specialized Multi-Teacher On-Policy Distillation (LS-MOPD), which decouples language-specific knowledge acquisition from multilingual capability integration: language-specialized teachers are independently optimized via reinforcement learning (RL), with their expertise then integrated into a generalist multilingual student through language routing and token-level multi-teacher distillation, thereby reducing direct cross-lingual optimization conflicts. We further explore static and dynamic acoustic-prefix configurations to examine how teacher-student prefix consistency influences the efficacy of on-policy distillation. Experiments on benchmarks covering Mandarin, Mandarin subdialects, Cantonese, and English demonstrate that LS-MOPD substantially outperforms RL baselines and surpasses the empirical performance envelope defined by the best-performing RL teachers on nearly all benchmarks, revealing its potential to generalize beyond all teachers in multilingual ASR.
- Abstract(参考訳): 現代のLLMベースのASRシステムは、多言語ベンチマーク間の競合性能を達成するために、大規模多言語コーパスとLLMの言語間知識を活用することで、標準機能として多言語機能を確立している。
しかし,不均一な音響・音韻・語彙特性を持つ言語は必然的に最適化の矛盾を生じさせ,言語の専門化を損なう。
言語特化教師は、強化学習(RL)を介して独立に最適化され、その専門知識は、言語ルーティングとトークンレベルの多言語蒸留を通じて一般の多言語学生に統合され、直接言語間最適化の競合が軽減される。
さらに,教師と学生の接頭辞の一貫性がオンライン蒸留の有効性にどのように影響するかを検討するために,静的および動的音響前置構成について検討する。
Mandarin, Mandarin subdialects, Cantonese, English を含むベンチマークの実験では、LS-MOPD は RL のベースラインを大幅に上回り、RL の教師がほぼ全てのベンチマークで定義した経験的パフォーマンスエンベロープを超えており、多言語 ASR のすべての教師を超えて一般化する可能性を示している。
関連論文リスト
- AlignX: Advancing Multilingual Large Language Models with Multilingual Representation Alignment [46.881574083116085]
多言語大言語モデル(LLM)には、印象的な多言語理解と生成能力がある。
LLMのパフォーマンスと言語間アライメントは、非支配言語ではしばしば遅れる。
2段階の表現レベルフレームワークである多言語のパフォーマンスギャップを橋渡しするために,AlignXを提案する。
論文 参考訳(メタデータ) (2025-09-29T06:37:46Z) - Exploring Polyglot Harmony: On Multilingual Data Allocation for Large Language Models Pretraining [16.590296049892576]
本稿では,多言語データアロケーションを体系的に最適化する新しいフレームワークであるClimbを紹介する。
Climbの中核となるのは、言語間の相互作用を意識した言語比率を導入し、言語間の依存関係をキャプチャすることで、各言語の効果的なアロケーションを明示的に定量化している。
大規模な実験により、Climbは様々な多言語間相互作用を正確に測定できることを確認した。
論文 参考訳(メタデータ) (2025-09-19T03:34:34Z) - Efficient Multilingual ASR Finetuning via LoRA Language Experts [59.27778147311189]
本稿では,WhisperをベースとしたLoRA言語エキスパートによる多言語ASRをカスタマイズするための効率的な微調整フレームワークを提案する。
LoRAエキスパート融合や知識蒸留により,本手法は従来の微調整法よりも目標言語での認識性能が向上する。
実験の結果,提案モデルでは,言語認識および言語認識のシナリオにおいて,約10%と15%の性能向上が得られた。
論文 参考訳(メタデータ) (2025-06-11T07:06:27Z) - LUSIFER: Language Universal Space Integration for Enhanced Multilingual Embeddings with Large Language Models [89.13128402847943]
LUSIFERは,LLMをベースとした多言語タスクの埋め込みモデルに,多言語監視を必要とせずに適用可能なゼロショット方式である。
LUSIFERのアーキテクチャは多言語エンコーダを組み、言語ユニバーサル学習者として機能し、埋め込み固有のタスクに最適化されたLLMベースの埋め込みモデルと組み合わせている。
5つの主要な埋め込みタスク、123の多様なデータセット、14言語にわたるカバレッジを含む新しいベンチマークを導入する。
論文 参考訳(メタデータ) (2025-01-01T15:43:07Z) - Lens: Rethinking Multilingual Enhancement for Large Language Models [70.85065197789639]
大規模言語モデル(LLM)における多言語機能向上のための新しいアプローチであるLensを提案する。
Lensは2つの部分空間で機能する: 言語に依存しない部分空間で、ターゲット言語と中心言語を一致させて強力な意味表現を継承する部分空間、言語固有の部分空間で、ターゲット言語と中心言語を分離して言語的特異性を保存する部分空間である。
レンズは、モデルの英語能力を維持しながら、多言語のパフォーマンスを著しく向上させ、既存の訓練後のアプローチと比べて計算コストの低い結果を得る。
論文 参考訳(メタデータ) (2024-10-06T08:51:30Z) - Getting More from Less: Large Language Models are Good Spontaneous Multilingual Learners [67.85635044939836]
大きな言語モデル(LLM)は印象的な言語機能を示している。
本研究では,LLMの自然多言語アライメント改善について検討する。
質問翻訳データ(すなわち注釈付き回答なし)に基づいて学習したLLMは、英語と幅広い言語との整合を促進できることがわかった。
論文 参考訳(メタデータ) (2024-05-22T16:46:19Z) - Investigating Multilingual Instruction-Tuning: Do Polyglot Models Demand for Multilingual Instructions? [42.37657013017192]
単言語コーパスの代わりに並列で命令チューニングを行うことで、最大9.9%の言語間命令に従うことができることを示す。
また,多言語チャットシナリオにおけるヒューマンベースとGPT-4に基づく評価の整合性を理解するために,人間のアノテーション研究を行う。
論文 参考訳(メタデータ) (2024-02-21T11:07:07Z) - How Vocabulary Sharing Facilitates Multilingualism in LLaMA? [19.136382859468693]
大きな言語モデル(LLM)は英語のタスクに強いパフォーマンスを示すが、他の言語には制限がある。
本研究では,語彙共有の観点からLLMの多言語的能力について検討する。
論文 参考訳(メタデータ) (2023-11-15T16:13:14Z) - Multilingual DistilWhisper: Efficient Distillation of Multi-task Speech
Models via Language-Specific Experts [14.999359332108767]
表現不足言語に対するASRの性能ギャップを埋めるため、DistilWhisperを提案する。
提案手法は, 言語専門家を用いた軽量モジュール型ASR微調整と, ささやかな大口径v2からの知識蒸留の2つの戦略を含む。
その結果,本手法は通常のファインチューニングやLoRAアダプタよりも効果的であることがわかった。
論文 参考訳(メタデータ) (2023-11-02T08:37:30Z) - AMTSS: An Adaptive Multi-Teacher Single-Student Knowledge Distillation
Framework For Multilingual Language Inference [27.333905128454546]
AMTSSは適応型マルチ教師によるシングルスチューデント蒸留フレームワークである。
まず,適応的な学習戦略と教師の重みを導入し,学生が最上級の教師から効果的に学習できるようにする。
複数の言語をサポートする異なるプロジェクション層を持つ学生を共用し、開発コストと機械コストを大幅に削減することに寄与する。
論文 参考訳(メタデータ) (2023-05-13T14:42:30Z) - Not All Languages Are Created Equal in LLMs: Improving Multilingual
Capability by Cross-Lingual-Thought Prompting [123.16452714740106]
大規模言語モデル(LLM)は印象的な多言語機能を示すが、その性能は言語によって大きく異なる。
XLT (cross-lingual- Thought prompting) という,シンプルで効果的な方法を提案する。
XLTは汎用テンプレートプロンプトで、言語間および論理的推論スキルを刺激し、言語間のタスクパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2023-05-11T17:44:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。