論文の概要: Quantifying the Generation Modality Gap in Speech-Text Language Models
- arxiv url: http://arxiv.org/abs/2609.14743v1
- Date: Sun, 13 Sep 2026 19:09:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.953393
- Title: Quantifying the Generation Modality Gap in Speech-Text Language Models
- Title(参考訳): 音声テキスト言語モデルにおける生成モダリティギャップの定量化
- Abstract要約: 純粋な音声言語モデルは、コヒーレントなコンテンツを生成する際に、テキストや音声-テキスト言語モデルに遅れをとることが多い。
本研究では,連続音響特徴量生成のためのフローマッチングに基づいて,音声モデル群における音声文のモダリティギャップについて検討する。
我々は、一致したデータに基づいて訓練された音声のみ、テキストのみ、および音声テキスト言語モデルを比較する、統合された世代ベース評価スイートを構築した。
- 参考スコア(独自算出の注目度): 22.8588553114451
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pure speech language models often lag behind text and speech-text language models in generating coherent content, but this gap is difficult to quantify because speech and text systems are typically evaluated with different metrics and trained on different data. We study the speech-text modality gap in a family of spoken language models, based on flow matching for continuous acoustic feature generation. We construct a unified generation-based evaluation suite that compares speech-only, text-only, and speech-text language models trained on matched data distributions and evaluated in matched generation settings. We evaluate generated continuations along multiple dimensions: semantic coherence, measured by transcribing generated speech and scoring it with a reference language model; local phonetic structure, measured by phone n-gram distributional statistics; speaker consistency and acoustic quality; and emotion-based distributional metrics. Across datasets, we find that joint speech-text modeling substantially improves semantic coherence. However, the improvement is not uniform across metrics: phone-level metrics change only modestly, speaker similarity and predicted quality are lower for speech-text continuations, while emotion-based distributional metrics improve. Compared with larger-scale speech-only models, our speech-text model closes much of the scaling gap in transcript-based semantic coherence, suggesting that text provides an efficient semantic training signal for spoken language modeling.
- Abstract(参考訳): 純音声言語モデルは、コヒーレントなコンテンツを生成する際に、テキストや音声-テキスト言語モデルに遅れが生じることが多いが、このギャップは、通常、異なるメトリクスで評価され、異なるデータで訓練されるため、定量化が難しい。
本研究では,連続音響特徴量生成のためのフローマッチングに基づいて,音声モデル群における音声文のモダリティギャップについて検討する。
一致したデータ分布に基づいて訓練された音声のみ、テキストのみ、および音声テキスト言語モデルを比較し、一致した生成設定で評価する統合世代ベース評価スイートを構築した。
生成した音声を翻訳し、参照言語モデルで評価する意味的コヒーレンス、電話n-gram分布統計による局所音韻構造、話者の一貫性と音響品質、感情に基づく分布測定など、複数の次元に沿って生成された連続性を評価する。
データセット全体にわたって、共同音声テキストモデリングは意味的コヒーレンスを大幅に改善する。
しかし、電話レベルの指標は穏やかにのみ変化し、話者の類似性や予測品質は音声テキストの継続において低くなり、感情ベースの分布指標は改善される。
大規模音声のみのモデルと比較すると,音声テキストモデルは転写文に基づくセマンティックコヒーレンスにおけるスケーリングギャップの大部分を解消し,テキストが音声言語モデリングに効果的なセマンティックトレーニング信号を提供することを示す。
関連論文リスト
- On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation [88.77441715819366]
大規模生音声で事前訓練された生成音声言語モデルは、適切な内容で音声プロンプトを継続することができる。
本稿では,グローバルトークンの難易度に代えて,多種多様な可能性・生成的評価手法を提案する。
論文 参考訳(メタデータ) (2026-01-09T22:01:56Z) - MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance [66.74042564585942]
MOSS-Speechは、テキストガイダンスに頼ることなく直接理解し、音声を生成する、真の音声音声合成大言語モデルである。
我々の研究は、表現的かつ効率的なエンドツーエンドの音声対話のための新しいパラダイムを確立する。
論文 参考訳(メタデータ) (2025-10-01T04:32:37Z) - Improving Spoken Language Modeling with Phoneme Classification: A Simple Fine-tuning Approach [14.5696754689252]
音声言語モデリングの最近の進歩は、音声から直接言語を学ぶことが可能であることを示している。
音素分類に基づく微調整音声表現モデルにより、より文脈不変な表現が得られることを示す。
論文 参考訳(メタデータ) (2024-09-16T10:29:15Z) - Toward Joint Language Modeling for Speech Units and Text [89.32163954508489]
音声単位とテキストの共用言語モデリングについて検討する。
音声とテキストの混在度を評価するための自動計測手法を提案する。
提案手法を用いて音声単位とテキストを混合することにより,SLUタスクにおける音声のみのベースラインを改良することを示す。
論文 参考訳(メタデータ) (2023-10-12T20:53:39Z) - Few-Shot Spoken Language Understanding via Joint Speech-Text Models [18.193191170754744]
テキストと協調的に事前学習した音声表現モデルに関する最近の研究は、音声表現の改善の可能性を示している。
このような共有表現を活用して、音声言語理解タスクにおける限られたデータ可用性の持続的課題に対処する。
事前訓練された音声テキストモデルを用いることで、テキスト上で微調整されたモデルを音声テストデータに効果的に転送できることが分かる。
論文 参考訳(メタデータ) (2023-10-09T17:59:21Z) - Towards Language Modelling in the Speech Domain Using Sub-word
Linguistic Units [56.52704348773307]
音節や音素を含む言語単位に基づくLSTMに基づく新しい生成音声LMを提案する。
限られたデータセットでは、現代の生成モデルで要求されるものよりも桁違いに小さいので、我々のモデルはバブリング音声を近似する。
補助的なテキストLM,マルチタスク学習目標,補助的な調音特徴を用いた訓練の効果を示す。
論文 参考訳(メタデータ) (2021-10-31T22:48:30Z) - Direct speech-to-speech translation with discrete units [64.19830539866072]
本稿では、中間テキスト生成に頼ることなく、ある言語から別の言語に音声を変換する直接音声音声翻訳(S2ST)モデルを提案する。
そこで本稿では,ラベルなし音声コーパスから学習した自己教師付き離散表現の予測を提案する。
対象のテキスト書き起こしが利用可能となると、同一の推論パスで2つのモード出力(音声とテキスト)を同時に生成できる、共同音声認識とテキストトレーニングを備えたマルチタスク学習フレームワークを設計する。
論文 参考訳(メタデータ) (2021-07-12T17:40:43Z) - Bridging the Modality Gap for Speech-to-Text Translation [57.47099674461832]
エンド・ツー・エンドの音声翻訳は、ある言語における音声を、エンド・ツー・エンドの方法で他の言語におけるテキストに変換することを目的としている。
既存のほとんどの手法では、音響表現と意味情報を同時に学習するために、単一のエンコーダを持つエンコーダ・デコーダ構造を用いる。
本稿では,音声とテキスト間のモダリティギャップを埋めることで,エンドツーエンドのモデル性能を向上させることを目的とした音声翻訳モデルのための音声テキスト適応手法を提案する。
論文 参考訳(メタデータ) (2020-10-28T12:33:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。