論文の概要: Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text
- arxiv url: http://arxiv.org/abs/2608.22908v1
- Date: Mon, 24 Aug 2026 07:41:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.953084
- Title: Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text
- Title(参考訳): 音声モデルはテキストを読みながら音声を聴くか? 音声とテキストの間に構造的ギャップを埋める
- Authors: Hyeonyu Kim, Hwayeon Kim, Youngwon Choi, Myeongkyun Cho, Huu-Kim Nguyen,
- Abstract要約: 音声言語モデルは、音声から直接テキスト応答を生成する。
既存のSLMは、より弱い命令追従挙動と限定的な一般化を示す。
意味的アライメントから長さミスマッチを分離する単純なフレームワークを提案する。
- 参考スコア(独自算出の注目度): 3.1208668217678355
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Spoken Language Models (SLMs) generate textual responses directly from speech, offering an alternative to cascaded systems. Despite recent advances, existing SLMs still exhibit weaker instruction-following behavior and limited generalization across diverse tasks compared to text-based language models. Our analysis shows that speech and text representations in current SLMs remain weakly aligned despite strong downstream performance, indicating that structural differences between continuous, temporally varying speech and discrete text remain insufficiently addressed. To address this, we propose a simple framework that decouples length mismatch from semantic alignment and encourages closer correspondence between speech and text representations. Experiments across multiple benchmarks demonstrate competitive performance against strong baselines, underscoring the importance of explicitly addressing structural differences between speech and text in SLM training. Our code is publicly available at https://github.com/jaykim9870/Do_SLMs_Hear_Speech_as_They_Read_Text.
- Abstract(参考訳): 音声言語モデル(SLM)は、音声から直接テキスト応答を生成し、カスケードシステムに代わる手段を提供する。
近年の進歩にもかかわらず、既存のSLMは、テキストベースの言語モデルと比較して、命令追従動作が弱く、様々なタスクにまたがる一般化が制限されている。
分析の結果,現在のSLMにおける音声とテキストの表現は,低調なダウンストリーム性能にもかかわらず弱調であり,連続的,時間的変化のある音声と離散的テキストの構造的差異が不十分なままであることが示唆された。
そこで本研究では,長さのミスマッチを意味的アライメントから切り離し,音声とテキストの表現との密接な対応を促す,シンプルなフレームワークを提案する。
複数のベンチマーク実験は、SLMトレーニングにおいて、音声とテキストの構造的違いに明示的に対処することの重要性を強調し、強いベースラインに対する競争性能を示す。
私たちのコードはhttps://github.com/jaykim9870/Do_SLMs_Hear_Speech_as_They_Read_Textで公開されています。
関連論文リスト
- Anatomy of the Modality Gap: Dissecting the Internal States of End-to-End Speech LLMs [15.914430317382077]
音声とテキストの表現が階層的にどのように進化するかを分析する。
音声表現は、冗長な音声の性質に起因して、広い層間アライメントバンドを示す。
論文 参考訳(メタデータ) (2026-03-02T06:21:43Z) - MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance [66.74042564585942]
MOSS-Speechは、テキストガイダンスに頼ることなく直接理解し、音声を生成する、真の音声音声合成大言語モデルである。
我々の研究は、表現的かつ効率的なエンドツーエンドの音声対話のための新しいパラダイムを確立する。
論文 参考訳(メタデータ) (2025-10-01T04:32:37Z) - Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model [76.06585781346601]
音声言語モデル(Speech LMs)は、単一のモデル内でエンドツーエンドの音声テキストモデリングを可能にする。
音声テキストの共同復号パラダイムの選択は、性能、効率、アライメント品質において重要な役割を担っている。
論文 参考訳(メタデータ) (2025-06-04T23:53:49Z) - SpeechLM: Enhanced Speech Pre-Training with Unpaired Textual Data [100.46303484627045]
本稿では,事前定義した統一表現と音声とテキストの事前学習を協調させるクロスモーダル音声言語モデル(SpeechLM)を提案する。
具体的には、音声とテキストのモダリティをブリッジするために、2つの別の離散トークン化器を導入する。
音声認識, 音声翻訳, ユニバーサル表現評価フレームワーク SUPERB など, 様々な音声言語処理タスクにおける音声LM の評価を行った。
論文 参考訳(メタデータ) (2022-09-30T09:12:10Z) - Bridging the Modality Gap for Speech-to-Text Translation [57.47099674461832]
エンド・ツー・エンドの音声翻訳は、ある言語における音声を、エンド・ツー・エンドの方法で他の言語におけるテキストに変換することを目的としている。
既存のほとんどの手法では、音響表現と意味情報を同時に学習するために、単一のエンコーダを持つエンコーダ・デコーダ構造を用いる。
本稿では,音声とテキスト間のモダリティギャップを埋めることで,エンドツーエンドのモデル性能を向上させることを目的とした音声翻訳モデルのための音声テキスト適応手法を提案する。
論文 参考訳(メタデータ) (2020-10-28T12:33:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。