論文の概要: MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond
- arxiv url: http://arxiv.org/abs/2607.22100v1
- Date: Fri, 24 Jul 2026 08:52:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.087508
- Title: MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond
- Title(参考訳): MEUSLI: LLMベースのASR用多言語プロジェクタ
- Abstract要約: 我々は,最初のオープンサイエンス多言語プロジェクタファミリーであるMEUSLIを紹介する。
これはWhisperエンコーダとオープンソースの多言語LLMを結びつけ、28のヨーロッパ言語で完全なエンドツーエンドのASRを可能にする。
適切な連続的傾き技術を用いることで、MEUSLIは訓練で見られない他の言語にも容易に拡張できる。
- 参考スコア(独自算出の注目度): 7.8241547017865045
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Lightweight projectors are an established way to connect pre-trained speech encoders with large language models (LLMs), mapping acoustic features into token-level embeddings for tasks like ASR and spoken question answering. Existing systems, however, typically only support a few languages and are often limited to English. We introduce MEUSLI, the first open-science multilingual projector family that links a Whisper encoder with open-source multilingual LLMs, enabling fully open-source end-to-end ASR in 28 European languages. MEUSLI extends prior monolingual pipelines, delivering strong results across high- and low-resource languages. Using proper continual leaning techniques, MEUSLI can be easily extended to other languages not seen in training. We further demonstrate that the MEUSLI projector can be leveraged beyond ASR, enabling multilingual speech translation and topic identification with only a few hours of task specific supervision per language. Overall, MEUSLI provides a solid foundation for multilingual speech understanding tasks, supporting scalable and inclu- sive open-source SpeechLLM
- Abstract(参考訳): 軽量プロジェクタは、事前訓練された音声エンコーダを大きな言語モデル(LLM)に接続し、音響特徴をASRや音声質問応答のようなタスクのためのトークンレベルの埋め込みにマッピングする確立された方法である。
しかし、既存のシステムは典型的にはいくつかの言語しかサポートせず、しばしば英語に限られる。
我々は,Whisperエンコーダとオープンソース多言語LLMをリンクする最初のオープンソース多言語プロジェクタファミリーであるMEUSLIを紹介する。
MEUSLIは以前のモノリンガルパイプラインを拡張し、ハイソース言語とローソース言語で強力な結果を提供する。
適切な連続的傾き技術を用いることで、MEUSLIは訓練で見られない他の言語にも容易に拡張できる。
さらに,MEUSLIプロジェクタがASRを超えて活用可能であることを実証し,多言語音声翻訳と話題識別を,言語ごとのタスク固有の監督時間で実現可能であることを示した。
全体として、MEUSLIは多言語音声理解タスクの基盤を提供し、スケーラブルでインクルーブなオープンソースのSpeechLLMをサポートしている。
関連論文リスト
- Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages [15.84874997729878]
本チュートリアルでは, テキスト, 音声, 視覚の多言語多義性に関するこの新たな研究領域について概説する。
低コストなデータ作成/キュレーション、トリモーダルアライメントのためのアダプタスタック、英語以外の文化認識評価について取り上げる。
コンテンツはインタラクティブなハーフデイチュートリアルとして提供され、低リソースの言語設定で多言語でマルチモーダルAIに取り組んでいる研究者や実践者向けにデザインされる。
論文 参考訳(メタデータ) (2026-05-16T20:56:15Z) - Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision [36.3996368188181]
多くの言語で命令を理解し、従う音声大言語モデル(LLM)は、実世界の対話に有用である。
最近の蒸留法に基づくアプローチでは、注釈付きASRデータのみを用いて、軽量プロジェクタのみを用いてテキストと音声をアライメントすることで、英文のみのLLMを訓練している。
クエリバンクとゲーティングネットワークを用いて,Q-Formerプロジェクタを用いてクエリトークンを選択または混合する言語対応蒸留を導入することで,この問題に対処する。
論文 参考訳(メタデータ) (2026-03-07T04:09:47Z) - Multimodal In-context Learning for ASR of Low-resource Languages [16.078416187950207]
大規模言語モデル(LLM)を用いたインコンテキスト学習(ICL)はこの問題に対処する。
本稿では,マルチモーダル ICL (MICL) を用いて,LLM が未知言語を学習できるかどうかを検討する。
言語間移動学習は、訓練なしでターゲット言語でのMICL効率を向上させる。
論文 参考訳(メタデータ) (2026-01-09T10:52:23Z) - Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ Languages [76.14451035425229]
大規模自動音声認識システムであるOmnilingual ASRを紹介する。
自己教師付き事前学習を7Bパラメータに拡張し、堅牢な音声表現を学習する。
ASRが提供しなかった500以上の言語を含む1,600以上の言語にカバー範囲を広げている。
論文 参考訳(メタデータ) (2025-11-12T19:48:09Z) - Speech LLMs in Low-Resource Scenarios: Data Volume Requirements and the Impact of Pretraining on High-Resource Languages [9.577509224534323]
大規模言語モデル (LLM) は, 様々なタスクにおいて, 音声入力を高速に処理し, 最先端の性能に到達する可能性を実証している。
本研究では,SLAM-ASRフレームワークを用いた低リソース自動音声認識におけるLLMの利用について検討する。
単言語または多言語プロジェクタを高ソース言語で事前訓練することにより,データ不足の影響を低減できることを示す。
論文 参考訳(メタデータ) (2025-08-07T08:33:42Z) - LinguaLIFT: An Effective Two-stage Instruction Tuning Framework for Low-Resource Language Reasoning [28.288949710191158]
大規模言語モデル(LLM)は、多言語事前学習コーパスと命令微調整データによって駆動される、印象的な多言語推論能力を示す。
事前学習コーパスにおける言語不均衡に起因する高リソース言語推論タスクと低リソース言語推論タスクの間には,パフォーマンスギャップが存在する。
LinguaLIFTは低リソース言語推論を進めるための2段階の命令チューニングフレームワークである。
論文 参考訳(メタデータ) (2024-12-17T03:03:17Z) - Lens: Rethinking Multilingual Enhancement for Large Language Models [70.85065197789639]
大規模言語モデル(LLM)における多言語機能向上のための新しいアプローチであるLensを提案する。
Lensは2つの部分空間で機能する: 言語に依存しない部分空間で、ターゲット言語と中心言語を一致させて強力な意味表現を継承する部分空間、言語固有の部分空間で、ターゲット言語と中心言語を分離して言語的特異性を保存する部分空間である。
レンズは、モデルの英語能力を維持しながら、多言語のパフォーマンスを著しく向上させ、既存の訓練後のアプローチと比べて計算コストの低い結果を得る。
論文 参考訳(メタデータ) (2024-10-06T08:51:30Z) - Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language Models [117.20416338476856]
大規模言語モデル(LLM)は、特別にキュレートされた多言語並列コーパスで事前訓練されることなく、顕著な多言語機能を示す。
LLM内の言語特異的ニューロンを識別するための新しい検出手法である言語アクティベーション確率エントロピー(LAPE)を提案する。
以上の結果から,LLMが特定の言語を処理できる能力は,神経細胞のサブセットが少なすぎるためであることが示唆された。
論文 参考訳(メタデータ) (2024-02-26T09:36:05Z) - UltraLink: An Open-Source Knowledge-Enhanced Multilingual Supervised
Fine-tuning Dataset [69.33424532827608]
オープンソースの大規模言語モデル(LLM)は、様々な分野において大きな強みを持っている。
本研究では,オープンソースの多言語教師付き微調整データセットを構築する。
結果として得られたUltraLinkデータセットは、5つの言語にわたる約100万のサンプルで構成されている。
論文 参考訳(メタデータ) (2024-02-07T05:05:53Z) - Okapi: Instruction-tuned Large Language Models in Multiple Languages
with Reinforcement Learning from Human Feedback [61.83548032416181]
複数の言語を対象としたRLHFに基づく命令調整型LLMシステムであるOkapiを提案する。
オカピは26の多言語言語でインストラクションと応答ランクデータを導入し、将来の多言語LLM研究の促進と開発に役立てている。
論文 参考訳(メタデータ) (2023-07-29T18:01:46Z) - Generalizing Multimodal Pre-training into Multilingual via Language
Acquisition [54.69707237195554]
英語のVision-Language Pre-Trainingは、様々な下流タスクで大きな成功を収めた。
この成功を英語以外の言語に一般化するために、Multilingual Vision-Language Pre-Trainingを通じていくつかの取り組みがなされている。
単言語視覚言語事前学習モデルを多言語に容易に一般化できるtextbfMultitextbfLingual textbfAcquisition (MLA) フレームワークを提案する。
論文 参考訳(メタデータ) (2022-05-29T08:53:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。