論文の概要: DirectSpeech2LLM: A Simple End-to-End Framework to Mitigate Prompt Overfitting in Speech-LLMs
- arxiv url: http://arxiv.org/abs/2610.08085v1
- Date: Tue, 06 Oct 2026 10:16:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.929826
- Title: DirectSpeech2LLM: A Simple End-to-End Framework to Mitigate Prompt Overfitting in Speech-LLMs
- Title(参考訳): DirectSpeech2LLM:音声-LLMにおけるプロンプトオーバーフィッティングを緩和するシンプルなエンドツーエンドフレームワーク
- Abstract要約: 音声-LLMは、しばしばプロンプトオーバーフィッティングを示し、自動音声認識(ASR)命令にのみ訓練されたモデルは、音声翻訳のような新しい命令への一般化に失敗する。
DirectSpeech2LLMは,LLMの指示追従能力を保持するシンプルなエンドツーエンドフレームワークである。
- 参考スコア(独自算出の注目度): 54.94557715360404
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Speech-LLMs often exhibit prompt overfitting, where models solely trained on automatic speech recognition (ASR) instruction fail to generalize to new instructions such as speech translation and continue to behave primarily as ASR system. We propose DirectSpeech2LLM, a simple end-to-end framework that preserves the instruction-following ability of the LLM on unseen tasks when conditioned on speech. It computes distance-based CTC loss over the frozen LLM embedding matrix and uses greedy CTC labels to derive geometrically and temporally aligned speech embeddings respectively as an input to the LLM. Trained solely on 960 hours of LibriSpeech ASR data, DirectSpeech2LLM outperforms the cascaded system on ASR (seen task) and generalizes zero-shot to speech translation and emotion recognition (two unseen tasks), closely matching the cascaded system upper bound on these two new instructions despite seeing neither during training. We also find that geometric alignment strength plays a smaller role than previously assumed, as our modified CTC loss is shown to provide sufficient implicit geometric grounding without requiring an explicit regression loss. Results are consistent across two LLM families and scale with both more training data and model capacity.
- Abstract(参考訳): 音声-LLMは、しばしばプロンプトオーバーフィッティングを示し、自動音声認識(ASR)命令にのみ訓練されたモデルは、音声翻訳などの新しい命令に一般化できず、主にASRシステムとして振る舞う。
DirectSpeech2LLMは,LLMの指示追従能力を保持するシンプルなエンドツーエンドフレームワークである。
凍結LDM埋め込み行列上の距離ベースCTC損失を計算し、グリーディCTCラベルを用いてそれぞれ幾何学的および時間的に整列された音声埋め込みをLLMへの入力として導出する。
DirectSpeech2LLMは、960時間のASRデータのみに基づいてトレーニングされ、ASR上のカスケードシステムよりも優れ、ゼロショットから音声への翻訳と感情認識(2つの未知のタスク)を一般化し、トレーニング中も見ていないにもかかわらず、これらの2つの新しい命令の上部にカスケードシステムと密接にマッチする。
また、修正CTCの損失は、明示的な回帰損失を必要とせず、十分に暗黙的な幾何的なグラウンド化をもたらすことが示され、幾何アライメント強度が以前想定していたより小さい役割を担っていることも判明した。
2つのLLMファミリに一貫性があり、トレーニングデータとモデルキャパシティの両方でスケールする。
関連論文リスト
- HINTT Submission to the 2nd MLC-SLM Challenge: Comparing Cascaded and Unified Approaches to Diarization and ASR [23.76296910298882]
本稿では,MLC-SLM(Multilingual Conversational Speech Language Model)の第2回チャレンジワークショップに提出されたHINTTシステムについて述べる。
我々は、多言語話者対応ASRに対処し、誰がいつ、何が話されたかをシステムが判断しなければならない。
本稿では、話者ダイアリゼーションと音声LLMに基づくASRを組み合わせたカスケードパイプラインと、話者ラベル、タイムスタンプ、転写を直接生成する統一音声LLMの2つのモデル戦略について検討する。
論文 参考訳(メタデータ) (2026-10-06T09:57:17Z) - Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs [33.559566576032964]
本稿では,LLMの入力埋め込み多様体内に存在する全ての音声表現を制約する言語間LLMブリッジであるConvex Gateを提案する。
C-Gateは、自動音声認識と感情認識にまたがって、強い関節演奏を実現する。
結果として,トークンの離散性よりも幾何が音声からLLMインターフェースの基本設計要素であることが示唆された。
論文 参考訳(メタデータ) (2026-06-08T11:38:40Z) - Diffusion Large Language Models for Visual Speech Recognition [56.81307584718608]
本稿では,最初の拡散大言語モデル(DLLM)に基づく視覚音声認識(VSR)フレームワークを提案する。
DLLM-VSRは早期に高信頼位置をコミットし、コミットトークンを双方向コンテキストとして、曖昧なトークンを洗練させる。
我々は、ビデオ長を用いて、可塑性転写長仮説を構築する長さ誘導型候補復号法を開発した。
提案手法はラベル付きトレーニングデータのみを用いて, LRS3 上で19.5%の最先端 WER を実現する。
論文 参考訳(メタデータ) (2026-05-27T13:22:08Z) - Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling [52.02344262645619]
本稿では,新しいトランス層を凍結テキストLLMに挿入し,付加層のみを音声データに基づいて訓練するマルチモーダル深さアップスケーリングを提案する。
SmolLM2-360MとSmolLM2-1.7Bによる48k時間の英語自動音声認識(ASR)データによる実験により、深度アップスケーリングは完全な微調整に匹敵するASRを実現することが示された。
さらに,テキストの劣化を75%以上低減し,トレーニング可能なパラメータを60%少なく抑えながら,大規模モデルの完全微調整に適合あるいは超越したASRを実現するために,音声認識用に設計されたアーキテクチャであるE-Branchformerを組み込むことが示される。
論文 参考訳(メタデータ) (2026-04-01T05:16:06Z) - TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding [15.908533215017059]
本稿では,テンポラルアンカーグラウンドを用いた統合フレームワークTagSpeechについて述べる。
本フレームワークは,(1)SOT(Serialized Output Training)を用いて微調整されたセマンティックストリームと話者ストリームを分離してターンテイクダイナミクスを学習し,(2)セマンティック理解と話者追跡の同期信号として機能するインターリーブ時間アンカー機構である。
論文 参考訳(メタデータ) (2026-01-11T12:40:07Z) - Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR [16.090902570653803]
本稿では、細調整されたWhisperとmHuBERTエンコーダをLLMと組み合わせたLLMベースのASRフレームワークを提案する。
CER/WERは10.69%で、上位1位にランクインしている。
論文 参考訳(メタデータ) (2026-01-04T10:08:53Z) - AzeroS: Extending LLM to Speech with Self-Generated Instruction-Free Tuning [49.68129589035101]
AZeroS (Auden Zero-Instruction-tuned Speech-LLM) を導入する。
AZeroSはセマンティックベンチマークとパラ言語ベンチマークの両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-12-31T04:05:04Z) - ML-LMCL: Mutual Learning and Large-Margin Contrastive Learning for
Improving ASR Robustness in Spoken Language Understanding [55.39105863825107]
本稿では,ML-LMCL(Multual Learning and Large-Margin Contrastive Learning)を提案する。
微調整では、相互学習を適用し、手書き文字とASR文字の2つのSLUモデルを訓練する。
3つのデータセットの実験では、ML-LMCLは既存のモデルより優れ、新しい最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-11-19T16:53:35Z) - Long-Running Speech Recognizer:An End-to-End Multi-Task Learning
Framework for Online ASR and VAD [10.168591454648123]
本稿では、ASRとVODを1つのモデルに統合する新しいエンドツーエンド(E2E)マルチタスク学習(MTL)フレームワークを提案する。
提案システムはLong-Running Speech Recognizer (LR-SR) と呼ばれ, 訓練段階における2つのタスク固有のデータセットから, ASR と VAD を併用して学習する。
推論段階では、LR-SRシステムは低計算コストで非音声部品を除去し、高い堅牢性を有する音声部品を認識する。
論文 参考訳(メタデータ) (2021-03-02T11:49:03Z) - Semi-Supervised Spoken Language Understanding via Self-Supervised Speech
and Language Model Pretraining [64.35907499990455]
そこで本稿では,音声から意味論を直接学習するフレームワークを提案する。
我々のフレームワークは、事前訓練されたエンドツーエンド(E2E)ASRとBERTのような自己教師型言語モデルに基づいて構築されている。
並行して,SLUモデルを評価するための重要な基準として,環境騒音汚染度とE2Eセマンティクス評価の2つがあげられる。
論文 参考訳(メタデータ) (2020-10-26T18:21:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。