論文の概要: Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model
- arxiv url: http://arxiv.org/abs/2607.13013v1
- Date: Tue, 14 Jul 2026 17:53:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.2441
- Title: Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model
- Title(参考訳): 凍結離散拡散言語モデルを用いた音声認識
- Authors: Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani, Vineet Agarwal,
- Abstract要約: 我々はDiffusionGemmaのための音声ネイティブインタフェースをトレーニングし、一様でランダムな離散拡散によってテキストを生成する。
自然な訓練対象は、既に無視されている注意によってのみ、その勾配がプロジェクターに到達するため、音声を接地できないことが判明した。
結果として得られたモデルは、LibriSpeechテストクリーン上で6.6%のワードエラー率に達し、発話の長さに関わらずおよそ8つの並列ステップで書き起こされ、6つの言語で訓練された単一のアダプタを使用する。
- 参考スコア(独自算出の注目度): 0.23332469289621785
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automatic speech recognition is dominated by autoregressive decoders that emit one token at a time. We ask whether a discrete diffusion language model can transcribe speech instead, refining a whole transcript in parallel over a small number of denoising steps. We train an audio-native interface for DiffusionGemma, a 26B mixture-of-experts model that generates text by uniform, random-token discrete diffusion rather than the absorbing-mask scheme common to recent diffusion language models. A frozen Whisper encoder supplies acoustic features, a lightweight projector maps them into the model embedding space, and low-rank adapters let the frozen backbone attend to the new modality. About 42M parameters are trained, which is 0.16 percent of the backbone. We find that the natural training objectives fail to ground the audio because their gradient reaches the projector only through attention that has already dismissed it. A connectionist temporal classification loss applied through the frozen output head breaks this deadlock. The resulting model reaches 6.6 percent word error rate on LibriSpeech test-clean, transcribes in roughly eight parallel steps regardless of utterance length, and uses a single adapter trained on six languages, which we evaluate here on English, Hindi, and Mandarin.
- Abstract(参考訳): 自動音声認識は、一度に1つのトークンを発行する自己回帰デコーダによって支配される。
離散拡散言語モデルが音声の書き起こしを代行できるかどうかを問う。
最近の拡散言語モデルに共通する吸収マスク方式よりも、均一でランダムな離散拡散によってテキストを生成する26B混合専門家モデルであるDiffusionGemmaの音声ネイティブインタフェースを訓練する。
冷凍されたウィスパーエンコーダは音響的特徴を提供し、軽量のプロジェクターはそれらをモデル埋め込み空間にマッピングし、低ランクのアダプタは冷凍されたバックボーンを新しいモダリティに対応させる。
約42Mのパラメータがトレーニングされており、これはバックボーンの0.16パーセントである。
自然な訓練対象は、既に無視されている注意によってのみ、その勾配がプロジェクターに到達するため、音声を接地できないことが判明した。
凍結出力ヘッドを介して適用された接続性時間的分類損失は、このデッドロックを破る。
結果として得られたモデルは、LibriSpeechテストクリーン上で6.6%の単語エラー率に達し、発話の長さに関わらずおよそ8つの並列ステップで書き起こされ、6つの言語で訓練された1つのアダプタを使用し、ここでは英語、ヒンディー語、マンダリンで評価する。
関連論文リスト
- Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition [9.131439623985028]
事前訓練された大規模言語モデルは、音声認識におけるタスク固有のデコーダを置き換える。
彼らのテキスト由来の先行性は、認識をより公平にするか、あるいは人口統計グループに偏っているか?
我々は,3世代にわたる9つのモデルを5つの人口動態軸にわたる約43,000発の発話で評価した。
論文 参考訳(メタデータ) (2026-04-23T04:40:58Z) - DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion [23.01044837428522]
我々は、音声LLMが音声応答とともに内部テキスト推論を生成するパラダイムであるtextbfSilent Thought, Spoken Answer'を紹介する。
本稿では,理解と生成の両方をサポートする最初の拡散型音声テキスト言語モデルを提案する。
実験の結果,最先端の音声合成QAの精度を最大9ポイント向上させることができた。
論文 参考訳(メタデータ) (2026-01-30T12:08:33Z) - Long-Form Speech Generation with Spoken Language Models [64.29591880693468]
テキストなしの音声言語モデルは、数十秒を超える可読な音声を生成するのに苦労する。
我々は、長音の音声から学習し、サンプルする最初の音声言語モデルであるSpeechSSMを導出する。
SpeechSSMは線形時間列モデリングの最近の進歩を活用し、コヒーレンスと効率性において現在のトランスフォーマー音声LMを大幅に上回っている。
論文 参考訳(メタデータ) (2024-12-24T18:56:46Z) - SyllableLM: Learning Coarse Semantic Units for Speech Language Models [21.762112843104028]
本稿では,音声表現を粗い音節単位にマージする制御可能な自己教師手法を提案する。
制御可能なセマンティックユニットを5Hz,60bpsで生成し,SotA incセグメンテーションとクラスタリングを行った。
SyllableLMは、トレーニング計算の30倍の削減と4倍のウォールクロック推論高速化によって、大幅な効率向上を実現している。
論文 参考訳(メタデータ) (2024-10-05T04:29:55Z) - SpeechAlign: Aligning Speech Generation to Human Preferences [51.684183257809075]
本稿では,言語モデルと人間の嗜好を一致させる反復的自己改善戦略であるSpeechAlignを紹介する。
我々は、SpeechAlignが分散ギャップを埋め、言語モデルの継続的自己改善を促進することができることを示す。
論文 参考訳(メタデータ) (2024-04-08T15:21:17Z) - TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head
Translation [54.155138561698514]
音声から音声への直接翻訳は、自己教師付き学習から得られる離散単位を導入することにより、高品質な結果が得られる。
既存の方法は常にカスケードに依存し、音声とテキストの両方を通して合成し、遅延やカスケードエラーを引き起こす。
本稿では,音声-視覚音声を他の言語で直接音声-視覚音声に翻訳できる,頭部翻訳モデルである textbfTransFace を提案する。
論文 参考訳(メタデータ) (2023-12-23T08:45:57Z) - TransFusion: Transcribing Speech with Multinomial Diffusion [20.165433724198937]
本研究では,事前学習した音声特徴に基づく拡散モデルを用いて音声認識を行う手法を提案する。
我々は,LibriSpeech音声認識ベンチマークにおいて,既存の高性能コントラストモデルに匹敵する性能を示す。
また,多項拡散モデルのサンプリングと復号化を効果的に行う新しい手法を提案する。
論文 参考訳(メタデータ) (2022-10-14T10:01:43Z) - Self-supervised Learning with Random-projection Quantizer for Speech
Recognition [51.24368930992091]
音声認識のためのシンプルで効果的な自己教師型学習手法を提案する。
このアプローチは、離散ラベルの形で、マスキングされた音声信号を予測するモデルを学ぶ。
非ストリーミングモデルを用いた自己教師付き学習を用いて、従来の作業と同じような単語エラー率を達成する。
論文 参考訳(メタデータ) (2022-02-03T21:29:04Z) - Towards Language Modelling in the Speech Domain Using Sub-word
Linguistic Units [56.52704348773307]
音節や音素を含む言語単位に基づくLSTMに基づく新しい生成音声LMを提案する。
限られたデータセットでは、現代の生成モデルで要求されるものよりも桁違いに小さいので、我々のモデルはバブリング音声を近似する。
補助的なテキストLM,マルチタスク学習目標,補助的な調音特徴を用いた訓練の効果を示す。
論文 参考訳(メタデータ) (2021-10-31T22:48:30Z) - Unsupervised Cross-lingual Representation Learning for Speech
Recognition [63.85924123692923]
XLSRは、複数の言語における音声の生波形から1つのモデルを事前学習することで、言語間音声表現を学習する。
我々は、マスク付き潜在音声表現よりも対照的なタスクを解くことで訓練されたwav2vec 2.0を構築した。
実験により、言語間事前学習はモノリンガル事前訓練よりも著しく優れていることが示された。
論文 参考訳(メタデータ) (2020-06-24T18:25:05Z) - Improving Unsupervised Sparsespeech Acoustic Models with Categorical
Reparameterization [31.977418525076626]
本研究では,Sparsespeechモデルを拡張して,確率変数をサンプリングし,擬似後生図を生成する。
新しい改良されたモデルは、限定的または無監督のASRのベンチマークであるLibri-Light corpusでトレーニングされ、評価されている。
改良されたモデルを用いて, 話者間でのABX誤差率を31.4%まで改善した。
論文 参考訳(メタデータ) (2020-05-29T13:58:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。