論文の概要: An Omnilingual-ASR-Based Speech-LLM System for the 2nd MLC-SLM Challenge
- arxiv url: http://arxiv.org/abs/2607.12468v1
- Date: Tue, 14 Jul 2026 07:52:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.081807
- Title: An Omnilingual-ASR-Based Speech-LLM System for the 2nd MLC-SLM Challenge
- Title(参考訳): 第2回MLC-SLMチャレンジのための全言語ASR音声LLMシステム
- Abstract要約: 本稿では,DiariZen-Large-s80(WavLM-Large)セグメンテーション,埋め込み型2適応クラスタリング,LoRA-OmniASR LLM 7B v2認識器を組み合わせたダイアリゼーション認識システムについて述べる。
公式開発セット(150の会話、21の言語/アクセントのカテゴリ)では、マクロMERが29.27%、公式ベースラインが79.15%、評価セットでは50.23%に達している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We describe our submission to Task 1 of the 2nd MLCSLM Challenge: a cascaded diarization-then-recognition system that combines DiariZen-Large-s80 (WavLM-Large) segmentation, CAM++ embedding-based two-speaker clustering, and a LoRA-adapted omniASR LLM 7B v2 recognizer, with no oracle segmentation or speaker labels at test time. On the official Development set (150 conversations, 21 language/accent categories) the system attains a macro tcpMER of 29.27%, versus 79.15% for the official baseline; on the Evaluation set it scores 50.23%. We also analyze two engineering choices that substantially affect tcpMER. First, embedding-based speaker clustering outperforms an end-to-end-style alternative that assigns speakers from ASR <sc> turn markers alone. Second, overlap-aware segmentation, although intended to raise diarization recall, increases tcpMER because overlapped speech is transcribed twice.
- Abstract(参考訳): 第2回MLCSLMチャレンジのタスク1:DiariZen-Large-s80(WavLM-Large)セグメンテーション、CAM++埋め込みベースの2話者クラスタリング、LoRA適応のOmniASR LLM 7B v2認識器、テスト時にオラクルセグメンテーションや話者ラベルを組み込んだカスケードダイアリゼーション-then認識システムについて述べる。
公式開発セット(150の会話、21の言語/アクセントのカテゴリ)では、システムはマクロtcpMERが29.27%、公式ベースラインが79.15%、評価セットでは50.23%に達している。
また、tcpMERに大きく影響する2つのエンジニアリング選択も分析する。
まず、埋め込みベースの話者クラスタリングは、ASR<sc>のターンマーカーのみから話者を割り当てるエンドツーエンドスタイルの代替手段よりも優れています。
第二に、重複認識セグメンテーションは、ダイアリゼーションリコールを促進することを意図しているが、重複した音声が2回書き起こされるため、tcpMERを増加させる。
関連論文リスト
- Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech [14.048968602801606]
本稿では,MLC-SLM 2026 Challenge のタスク1における自己設計型幻覚システムについて述べる。
このシステムはモジュラースピーカーダイアリゼーションフロントエンドとチャレンジ適応型Qwen3-ASR-1.7B認識器を組み合わせたものである。
論文 参考訳(メタデータ) (2026-07-09T08:07:34Z) - Who Spoke What When? Evaluating Spoken Language Models for Conversational ASR with Semantic and Overlap-Aware Metrics [99.89493037369071]
音声の重複や遠距離雑音,話者数の変化など,会話の自動音声認識は依然として困難である。
近年のLCMベースのシステムは単一話者のベンチマークでは良好に動作するが、マルチ話者設定におけるロバスト性は不明確である。
重なり、意味的忠実度、話者数、シングルチャンネルとマルチチャネル入力の4つの軸に沿って、LLMベースのアプローチとモジュラーアプローチを体系的に比較する。
論文 参考訳(メタデータ) (2026-03-24T02:01:21Z) - Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR [16.090902570653803]
本稿では、細調整されたWhisperとmHuBERTエンコーダをLLMと組み合わせたLLMベースのASRフレームワークを提案する。
CER/WERは10.69%で、上位1位にランクインしている。
論文 参考訳(メタデータ) (2026-01-04T10:08:53Z) - MEGConformer: Conformer-Based MEG Decoder for Robust Speech and Phoneme Classification [1.0896567381206717]
We present Conformer-based decoders for the LibriBrain 2025 PNPL competition。
提案手法は,306チャネルのMEG信号にコンパクトなコンバータを適応させる。
音声検出のために、MEG指向のSpecAugmentは、MEG固有の拡張を初めて探求した。
音素分類では,逆平方根クラス重み付けと動的グルーピングローダを用いた。
論文 参考訳(メタデータ) (2025-12-01T09:25:22Z) - Unifying Diarization, Separation, and ASR with Multi-Speaker Encoder [53.00939565103065]
本稿では、話者ダイアリゼーション(SD)、音声分離(SS)、マルチ話者自動音声認識(ASR)タスクの表現を共同で学習する新しいアーキテクチャを提案する。
我々は,UMEの複数の層から隠された表現を残重畳符号化(RWSE)として活用し,異なる意味レベルからの情報を効果的に活用する。
このジョイントトレーニングアプローチは,タスク間の相互依存性を捕捉し,重なり合う音声データの全体的な性能を向上させる。
論文 参考訳(メタデータ) (2025-08-28T06:50:57Z) - SLICER: Learning universal audio representations using low-resource
self-supervised pre-training [53.06337011259031]
ラベルなし音声データに事前学習エンコーダを組み込むための自己指導型学習手法を提案する。
我々の主な目的は、多種多様な音声および非音声タスクにまたがる一般化が可能な音声表現を学習することである。
論文 参考訳(メタデータ) (2022-11-02T23:45:33Z) - Bi-LSTM Scoring Based Similarity Measurement with Agglomerative
Hierarchical Clustering (AHC) for Speaker Diarization [0.0]
2つの話者間の典型的な会話は、声が重なり合う部分からなり、互いに中断したり、複数の文間での会話を止めたりする。
ダイアリゼーション技術の最近の進歩は、話者ダイアリゼーションシステムを即興化するニューラルネットワークベースのアプローチを活用している。
類似度行列に存在する要素を推定するための双方向長短期記憶ネットワークを提案する。
論文 参考訳(メタデータ) (2022-05-19T17:20:51Z) - Speaker Embedding-aware Neural Diarization: a Novel Framework for
Overlapped Speech Diarization in the Meeting Scenario [51.5031673695118]
重なり合う音声のダイアリゼーションを単一ラベル予測問題として再構成する。
話者埋め込み認識型ニューラルダイアリゼーション(SEND)システムを提案する。
論文 参考訳(メタデータ) (2022-03-18T06:40:39Z) - The USTC-Ximalaya system for the ICASSP 2022 multi-channel multi-party
meeting transcription (M2MeT) challenge [43.262531688434215]
ターゲットスピーカ音声活動検出(TS-VAD)における2つの改善点を提案する。
これらの手法は,高話者オーバラップ比,高残響・雑音条件下での実世界会議シナリオにおける多話者会話を処理するように設計されている。
論文 参考訳(メタデータ) (2022-02-10T06:06:48Z) - Audio-visual Multi-channel Recognition of Overlapped Speech [79.21950701506732]
本稿では,音声とマルチチャンネルの重なり合う音声認識システムについて述べる。
実験により,提案したマルチチャネルAVSRシステムは,音声のみのASRシステムを最大6.81% (26.83%) ,22.22% (56.87%) の絶対単語誤り率 (WER) で比較した。
論文 参考訳(メタデータ) (2020-05-18T10:31:19Z) - Unsupervised Speaker Adaptation using Attention-based Speaker Memory for
End-to-End ASR [61.55606131634891]
エンドツーエンド音声認識(E2E)のためのニューラルチューリングマシンにインスパイアされた教師なし話者適応手法を提案する。
提案モデルでは,学習データから抽出した話者i-vectorを格納し,注意機構を通じてメモリから関連i-vectorを読み取るメモリブロックを含む。
テスト時に補助的な話者埋め込み抽出システムを必要としないMベクトルは、単話者発話のiベクトルと類似の単語誤り率(WER)を達成し、話者変化がある発話のWERを著しく低下させることを示す。
論文 参考訳(メタデータ) (2020-02-14T18:31:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。