論文の概要: HINTT Submission to the 2nd MLC-SLM Challenge: Comparing Cascaded and Unified Approaches to Diarization and ASR
- arxiv url: http://arxiv.org/abs/2610.08063v1
- Date: Tue, 06 Oct 2026 09:57:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.924139
- Title: HINTT Submission to the 2nd MLC-SLM Challenge: Comparing Cascaded and Unified Approaches to Diarization and ASR
- Title(参考訳): 第2回MLC-SLMチャレンジへのHINTTの提出:ダイアリゼーションとASRに対するカスケードと統一アプローチの比較
- Abstract要約: 本稿では,MLC-SLM(Multilingual Conversational Speech Language Model)の第2回チャレンジワークショップに提出されたHINTTシステムについて述べる。
我々は、多言語話者対応ASRに対処し、誰がいつ、何が話されたかをシステムが判断しなければならない。
本稿では、話者ダイアリゼーションと音声LLMに基づくASRを組み合わせたカスケードパイプラインと、話者ラベル、タイムスタンプ、転写を直接生成する統一音声LLMの2つのモデル戦略について検討する。
- 参考スコア(独自算出の注目度): 23.76296910298882
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper presents the HINTT system submitted to the 2nd Challenge and Workshop on Multilingual Conversational Speech Language Model (MLC-SLM). We address multilingual speaker-attributed ASR, where systems must determine who spoke when and what was spoken. We investigate two modeling strategies for this problem: a cascaded pipeline that combines speaker diarization with speech-LLM-based ASR, and a unified speech LLM that directly generates speaker labels, timestamps, and transcriptions. Our final submission is based on the cascaded pipeline, consisting of a fine-tuned DiariZen diarization model, a fine-tuned Qwen3-ASR model, and LLM-based generative error correction. For comparison, we also fine-tune VibeVoice-ASR as a unified model using the same official training data. All task-specific fine-tuning and model selection are performed using only the official MLC-SLM data, without external data or pseudo-labels. Experimental results demonstrate that the cascaded system remains more reliable under the MLC-SLM Task 1 conditions, while unified speech LLMs offer a promising direction for future speaker-attributed ASR.
- Abstract(参考訳): 本稿では,MLC-SLM(Multilingual Conversational Speech Language Model)の第2回チャレンジ・ワークショップに提出されたHINTTシステムについて述べる。
我々は、多言語話者対応ASRに対処し、誰がいつ、何が話されたかをシステムが判断しなければならない。
本稿では、話者ダイアリゼーションと音声LLMに基づくASRを組み合わせたカスケードパイプラインと、話者ラベル、タイムスタンプ、転写を直接生成する統一音声LLMの2つのモデル戦略について検討する。
最終提出は,細調整ダイアリゼーションモデル,細調整Qwen3-ASRモデル,LLMに基づく生成誤差補正からなるカスケードパイプラインに基づく。
比較のためには、同じ公式トレーニングデータを用いて、VibeVoice-ASRを統一モデルとして微調整する。
全てのタスク固有の微調整とモデル選択は、外部データや擬似ラベルなしで、公式のLCC-SLMデータのみを使用して行われる。
実験結果から,MLC-SLMタスク1の条件下ではカスケードシステムの方が信頼性が高く,統一音声LLMは将来の話者対応ASRに有望な方向を提供することが示された。
関連論文リスト
- DirectSpeech2LLM: A Simple End-to-End Framework to Mitigate Prompt Overfitting in Speech-LLMs [54.94557715360404]
音声-LLMは、しばしばプロンプトオーバーフィッティングを示し、自動音声認識(ASR)命令にのみ訓練されたモデルは、音声翻訳のような新しい命令への一般化に失敗する。
DirectSpeech2LLMは,LLMの指示追従能力を保持するシンプルなエンドツーエンドフレームワークである。
論文 参考訳(メタデータ) (2026-10-06T10:16:49Z) - Who Spoke What When? Evaluating Spoken Language Models for Conversational ASR with Semantic and Overlap-Aware Metrics [99.89493037369071]
音声の重複や遠距離雑音,話者数の変化など,会話の自動音声認識は依然として困難である。
近年のLCMベースのシステムは単一話者のベンチマークでは良好に動作するが、マルチ話者設定におけるロバスト性は不明確である。
重なり、意味的忠実度、話者数、シングルチャンネルとマルチチャネル入力の4つの軸に沿って、LLMベースのアプローチとモジュラーアプローチを体系的に比較する。
論文 参考訳(メタデータ) (2026-03-24T02:01:21Z) - Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR [16.090902570653803]
本稿では、細調整されたWhisperとmHuBERTエンコーダをLLMと組み合わせたLLMベースのASRフレームワークを提案する。
CER/WERは10.69%で、上位1位にランクインしている。
論文 参考訳(メタデータ) (2026-01-04T10:08:53Z) - A Unified Speech LLM for Diarization and Speech Recognition in Multilingual Conversations [25.58593495281218]
本稿では、ダイアリゼーションとASRをエンドツーエンドで共同で行う統一音声LLMを提案する。
トレーニングデータフォーマットを再構成し,推論手順を変更することで,事前分類音声に固有のあいまいさに対処する。
論文 参考訳(メタデータ) (2025-06-26T01:54:02Z) - DrVoice: Parallel Speech-Text Voice Conversation Model via Dual-Resolution Speech Representations [62.00227663434538]
DRVOICE-7BはOpenAudioBenchとBig Bench Audioベンチマーク上で新しい最先端(SOTA)を確立する。
本稿では,共同自己回帰モデルに基づくパラレル音声音声対話モデルであるDrVoiceを提案する。
論文 参考訳(メタデータ) (2025-06-11T02:57:22Z) - Retrieval-Enhanced Few-Shot Prompting for Speech Event Extraction [0.0]
音声イベント抽出(SpeechEE)は、音声認識(ASR)と自然言語処理(NLP)の交差点に位置する課題である。
本稿では,Large Language Models (LLM) のセマンティック検索強化プロンプトと高性能ASRを統合したモジュール型パイプラインベースのSpeechEEフレームワークを提案する。
この結果から,LLMに強化されたパイプラインアプローチは,エンド・ツー・エンドのシステムに匹敵する,あるいは超越できることを示した。
論文 参考訳(メタデータ) (2025-04-30T07:10:10Z) - Zero-resource Speech Translation and Recognition with LLMs [38.11535502039386]
我々は,ペア音声テキストデータを見たことのない言語において,多言語大言語モデル(LLM)を用いてSTとASRを実行することを提案する。
我々は、事前訓練された多言語音声エンコーダ、多言語LLM、およびLLMのトークン埋め込み空間に音声表現をマッピングする軽量適応モジュールを用いて、これを実現する。
論文 参考訳(メタデータ) (2024-12-24T17:37:11Z) - MSA-ASR: Efficient Multilingual Speaker Attribution with frozen ASR Models [59.80042864360884]
話者分布自動音声認識(SA-ASR)は,対応する話者に文字を正確に割り当てながら音声を転写することを目的としている。
本稿では,凍結した多言語ASRモデルを用いて話者属性を転写に組み込む新しい手法を提案する。
論文 参考訳(メタデータ) (2024-11-27T09:01:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。