論文の概要: Efficiently Adapting Spoken Language Models for the Singaporean Context
- arxiv url: http://arxiv.org/abs/2607.10092v1
- Date: Sat, 11 Jul 2026 03:11:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.299704
- Title: Efficiently Adapting Spoken Language Models for the Singaporean Context
- Title(参考訳): シンガポールの文脈における音声言語モデルへの適応
- Abstract要約: 音声言語モデル(SLM)は、音声認識と推論を統一するが、それらに敏感な領域に適応させることは過小評価される。
シンガポールの4つの公式言語における5つのスピーチタスクにわたって、シンガポールのホームチームコンテキストにオープンソースのSLMを適用します。
また,HTD-multilingual-QA,504,853サンプル多言語QAデータセットをテキストと音声形式で構築する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Spoken language models (SLMs) unify speech perception and reasoning, but adapting them to sensitive domains is underexplored, especially when the original training data is inaccessible and the use case demands multilingual, spoken-query interaction. We adapt an open-source SLM to the Singaporean Home Team context across five speech tasks in Singapore's four official languages, combining LoRA fine-tuning, a surrogate text-QA dataset that guards against catastrophic forgetting, and a multi-task objective that adapts the CoBa reweighting scheme to speech. We also build HTD-multilingual-QA, a 504,853 sample multilingual QA dataset in text and spoken form. The resulting HT-Moonstone (5B) matches or outperforms SLMs up to 7x its size on most tasks, attains the best accent and gender recognition among all models evaluated, and loses under 2\% of its original speech QA ability.
- Abstract(参考訳): 音声言語モデル(SLM)は、音声認識と推論を統一するが、特に、元のトレーニングデータがアクセス不能であり、ユースケースが多言語、音声-クエリの相互作用を必要とする場合、センシティブなドメインへの適応は過小評価される。
シンガポールの4つの公式言語における5つのスピーチタスクにまたがって、オープンソースのSLMをシンガポールのホームチームコンテキストに適用する。
また,HTD-multilingual-QA,504,853サンプル多言語QAデータセットをテキストと音声形式で構築する。
その結果得られたHT-Moonstone(5B)は、ほとんどのタスクにおいてSLMのサイズを最大7倍に向上させ、評価された全てのモデルの中で最高のアクセントと性別認識を獲得し、元の音声QA能力の2倍以下を失う。
関連論文リスト
- GigaAM Multilingual: Foundation Model for Underrepresented Languages [63.406165255277195]
We present GigaAM Multilingual, a Conformer encoder pre-trained on 200M hours of audio using a HuBERT-style objective。
我々は,事前学習時のクラスタレベルのデータバランス戦略と,微調整時のドメイン認識サンプリング手法を導入し,見出し言語の優位性を緩和する。
論文 参考訳(メタデータ) (2026-07-11T15:48:03Z) - Cross-Lingual Interleaving for Speech Language Models [29.477655980414273]
音声言語モデル(SLM)は,個別単位を用いて言語能力を直接学習することを目的としている。
本稿では,言語間で音声トークンを混在させる言語間相互補完手法を提案する。
論文 参考訳(メタデータ) (2025-12-01T16:48:05Z) - A Unified Speech LLM for Diarization and Speech Recognition in Multilingual Conversations [25.58593495281218]
本稿では、ダイアリゼーションとASRをエンドツーエンドで共同で行う統一音声LLMを提案する。
トレーニングデータフォーマットを再構成し,推論手順を変更することで,事前分類音声に固有のあいまいさに対処する。
論文 参考訳(メタデータ) (2025-06-26T01:54:02Z) - SpokenNativQA: Multilingual Everyday Spoken Queries for LLMs [12.60449414234283]
SpokenNativQAは、最初の多言語および文化的に整列された音声質問応答データセットである。
データセットは、複数の言語で約33,000の自然に話される質問と回答から構成される。
論文 参考訳(メタデータ) (2025-05-25T14:22:18Z) - Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models [38.608158064184366]
我々は、MNSC(Multitask National Speech Corpus)を導入し、最大のSinglishコーパスを標準化し、注釈する。
これらのデータセットは、自動音声認識(ASR)、音声質問回答(SQA)、音声対話要約(SDS)、パラ言語質問回答(PQA)など様々なタスクをサポートする。
本稿ではマルチタスクマルチモーダルモデルであるSingAudioLLMを提案する。
論文 参考訳(メタデータ) (2025-01-02T03:28:52Z) - ComSL: A Composite Speech-Language Model for End-to-End Speech-to-Text
Translation [79.66359274050885]
公的な事前訓練された音声のみのモデルと言語のみのモデルからなる複合アーキテクチャ上に構築された音声言語モデルであるComSLを提案する。
提案手法は,エンドツーエンドの音声-テキスト翻訳タスクにおいて有効であることを示す。
論文 参考訳(メタデータ) (2023-05-24T07:42:15Z) - SpokenWOZ: A Large-Scale Speech-Text Benchmark for Spoken Task-Oriented Dialogue Agents [70.08842857515141]
SpokenWOZは音声TODのための大規模音声テキストデータセットである。
SpokenWOZでは、クロスターンスロットと推論スロット検出が新たな課題である。
論文 参考訳(メタデータ) (2023-05-22T13:47:51Z) - Efficiently Aligned Cross-Lingual Transfer Learning for Conversational
Tasks using Prompt-Tuning [98.60739735409243]
英語のような高リソース言語で訓練された言語モデルの言語間移動は、多くのNLPタスクのために広く研究されている。
並列および大規模多言語会話データセットである言語間アライメント事前学習のためのXSGDを導入する。
協調的な言語間表現を容易にするために,アライメントプロンプトを学習するための効率的なプロンプトチューニング手法を開発した。
論文 参考訳(メタデータ) (2023-04-03T18:46:01Z) - QAmeleon: Multilingual QA with Only 5 Examples [71.80611036543633]
数ショットの学習環境下で事前学習した言語モデルを利用する方法を示す。
我々のアプローチであるQAmeleonは、PLMを使用して、QAモデルをトレーニングした多言語データを自動的に生成する。
言語毎に5つの例しか持たないデータ合成のためにPLMをプロンプトチューニングすることで、翻訳ベースのベースラインよりも精度が向上する。
論文 参考訳(メタデータ) (2022-11-15T16:14:39Z) - SD-QA: Spoken Dialectal Question Answering for the Real World [15.401330338654203]
われわれは5つの言語(アラビア語、ベンガル語、英語、キスワヒリ語、韓国語)で68k以上の音声プロンプトを、255人の話者から24の方言で作成する。
本稿では,QAシステムの実環境性能を示すベースライン結果を提供し,下流性能に対する言語多様性やその他の感性的話者属性の影響を解析する。
最後に,ASRモデルとQAモデルの妥当性について,基礎となるユーザ数について検討する。
論文 参考訳(メタデータ) (2021-09-24T16:54:27Z) - Unsupervised Cross-lingual Representation Learning for Speech
Recognition [63.85924123692923]
XLSRは、複数の言語における音声の生波形から1つのモデルを事前学習することで、言語間音声表現を学習する。
我々は、マスク付き潜在音声表現よりも対照的なタスクを解くことで訓練されたwav2vec 2.0を構築した。
実験により、言語間事前学習はモノリンガル事前訓練よりも著しく優れていることが示された。
論文 参考訳(メタデータ) (2020-06-24T18:25:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。