論文の概要: SpiRit-LM: Interleaved Spoken and Written Language Model
- arxiv url: http://arxiv.org/abs/2402.05755v1
- Date: Thu, 8 Feb 2024 15:39:32 GMT
- ステータス: 処理完了
- システム内更新日: 2024-02-09 14:29:05.055959
- Title: SpiRit-LM: Interleaved Spoken and Written Language Model
- Title(参考訳): SpiRit-LM: インターリーブされた言語モデル
- Authors: Tu Anh Nguyen, Benjamin Muller, Bokai Yu, Marta R. Costa-jussa, Maha
Elbayad, Sravya Popuri, Paul-Ambroise Duquenne, Robin Algayres, Ruslan
Mavlyutov, Itai Gat, Gabriel Synnaeve, Juan Pino, Benoit Sagot, Emmanuel
Dupoux
- Abstract要約: SPIRIT-LMは、テキストと音声を自由に混合する基礎的マルチモーダル言語モデルである。
モデルは、事前訓練されたテキスト言語モデルに基づいており、テキストと音声ユニットで継続的にトレーニングすることで、音声モダリティに拡張する。
- 参考スコア(独自算出の注目度): 45.44798658207754
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce SPIRIT-LM, a foundation multimodal language model that freely
mixes text and speech. Our model is based on a pretrained text language model
that we extend to the speech modality by continuously training it on text and
speech units. Speech and text sequences are concatenated as a single set of
tokens, and trained with a word-level interleaving method using a small
automatically-curated speech-text parallel corpus. SPIRIT-LM comes in two
versions: a BASE version that uses speech semantic units and an EXPRESSIVE
version that models expressivity using pitch and style units in addition to the
semantic units. For both versions, the text is encoded with subword BPE tokens.
The resulting model displays both the semantic abilities of text models and the
expressive abilities of speech models. Additionally, we demonstrate that
SPIRIT-LM is able to learn new tasks in a few-shot fashion across modalities
(i.e. ASR, TTS, Speech Classification).
- Abstract(参考訳): テキストと音声を自由に混合する基礎的マルチモーダル言語モデルであるSPIRIT-LMを紹介する。
本モデルは,テキスト単位と音声単位を連続的に訓練することにより,音声モダリティに拡張した事前学習されたテキスト言語モデルに基づいている。
音声とテキストのシーケンスは1組のトークンとして連結され、小さな自動計算された音声テキスト並列コーパスを用いて単語レベルのインターリーブ法で訓練される。
SPIRIT-LMは、音声意味単位を使用するBASEバージョンと、意味単位に加えてピッチとスタイル単位を使用して表現率をモデル化するExpressionIVEバージョンである。
どちらのバージョンでも、テキストはサブワードのBPEトークンでエンコードされる。
得られたモデルは、テキストモデルの意味能力と音声モデルの表現能力の両方を表示する。
さらに、SPIRIT-LMは、モーダル性(ASR, TTS, 音声分類)にまたがって、数ショットで新しいタスクを学習できることを実証する。
関連論文リスト
- Toward Joint Language Modeling for Speech Units and Text [89.32163954508489]
音声単位とテキストの共用言語モデリングについて検討する。
音声とテキストの混在度を評価するための自動計測手法を提案する。
提案手法を用いて音声単位とテキストを混合することにより,SLUタスクにおける音声のみのベースラインを改良することを示す。
論文 参考訳(メタデータ) (2023-10-12T20:53:39Z) - Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation [65.13824257448564]
本稿では,多言語多言語音声音声合成のためのテキストレス学習手法を提案する。
音声単位を擬似テキストとして扱うことにより、音声の言語内容に焦点を合わせることができる。
提案するUTUTモデルは,音声音声合成(S2ST)だけでなく,多言語音声合成(T2S)やテキスト音声合成(T2ST)にも有効であることを示す。
論文 参考訳(メタデータ) (2023-08-03T15:47:04Z) - AudioPaLM: A Large Language Model That Can Speak and Listen [79.44757696533709]
本稿では,音声理解・生成のための大規模言語モデルであるAudioPaLMを紹介する。
AudioPaLMはテキストベースの言語モデルと音声ベースの言語モデルを融合する。
音声認識や音声音声翻訳などの応用により、テキストと音声を処理および生成することができる。
論文 参考訳(メタデータ) (2023-06-22T14:37:54Z) - WAVPROMPT: Towards Few-Shot Spoken Language Understanding with Frozen
Language Models [57.557319372969495]
大量のテキストで事前訓練された大規模自動回帰言語モデルは、新しい自然言語タスクを実行するという印象的な能力を示している。
近年の研究では、エンコーダを訓練し、画像のエンコードを埋め込みにすることで、このような数発の学習能力をテキスト画像設定にまで拡張できることが示されている。
そこで我々は,wav2vecモデルを微調整して,言語モデルによって理解された音声埋め込みのシーケンスを生成する,新しい音声理解フレームワークWavPromptを提案する。
論文 参考訳(メタデータ) (2022-03-29T19:08:55Z) - Towards Language Modelling in the Speech Domain Using Sub-word
Linguistic Units [56.52704348773307]
音節や音素を含む言語単位に基づくLSTMに基づく新しい生成音声LMを提案する。
限られたデータセットでは、現代の生成モデルで要求されるものよりも桁違いに小さいので、我々のモデルはバブリング音声を近似する。
補助的なテキストLM,マルチタスク学習目標,補助的な調音特徴を用いた訓練の効果を示す。
論文 参考訳(メタデータ) (2021-10-31T22:48:30Z) - Text-Free Prosody-Aware Generative Spoken Language Modeling [46.19240899818964]
pGSLM(Prosody-aware Generative Speech Language Model)を提案する。
音声のマルチストリームトランスフォーマー言語モデル(MS-TLM)と、MS-TLM出力を波形に変換する適応型HiFi-GANモデルで構成されている。
実験結果から, pGSLMは韻律とコンテンツモデリングの両方を改善するために韻律を利用することができ, 自然な, 意味のある, 一貫性のある音声を生成することができることがわかった。
論文 参考訳(メタデータ) (2021-09-07T18:03:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。