論文の概要: Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction
- arxiv url: http://arxiv.org/abs/2608.22196v1
- Date: Sun, 23 Aug 2026 03:21:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:36.952126
- Title: Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction
- Title(参考訳): ダイアリゼーションに基づくトランスクリプト補正を用いたマルチストーカーASRにおける話者漏洩の軽減
- Abstract要約: マルチトーカーASR (MT-ASR) の性能は、分離時に話者の漏れによって制限されることが多い。
本稿では, 漏洩物を確実に識別し, 除去する相補的プルーニングに基づくパラダイムを提案する。
LibriMix, LibriSpeechMix, AMI Meeting corpus の結果から, 多様な重なり合う条件において, アルゴリズムが常に cpW ER を減少させることが示された。
- 参考スコア(独自算出の注目度): 0.8749675983608171
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While cascaded multi-talker ASR (MT-ASR) leverages state-of-the-art foundation models, its performance is often capped by speaker leakage during separation. Prior correction strategies primarily focus on lexical re-labeling for speaker attribution. We propose a complementary pruning-based paradigm that robustly identifies and removes leakage artifacts. Our method utilizes a pre-trained speaker diarization model as a multimodal verifier to prune transcribed segments satisfying a tripartite consensus of temporal containment, lexical cross-validation, and temporal alignment. Results on LibriMix, LibriSpeechMix, and the AMI Meeting corpus show our algorithm consistently reduces cpW ER across diverse overlap conditions. Specifically, on subsets with high speaker leakage, our method achieves relative cpW ER reductions of up to 29%, highlighting its effectiveness in enhancing the reliability of cascaded MT-ASR transcripts in complex acoustic environments.
- Abstract(参考訳): カスケード型マルチトーカー ASR (MT-ASR) は最先端の基盤モデルを活用するが、その性能は分離時に話者の漏れによって制限されることが多い。
事前補正戦略は、主に話者帰属のための語彙的再ラベルに焦点をあてる。
本稿では, 漏洩物を確実に識別し, 除去する相補的プルーニングに基づくパラダイムを提案する。
提案手法では,事前学習した話者ダイアリゼーションモデルをマルチモーダル検証器として,時間的包摂,語彙的相互検証,時間的アライメントの3部構成を満足する書き起こしセグメントをプーンする。
LibriMix, LibriSpeechMix, AMI Meeting corpus の結果から, 多様な重なり合う条件において, アルゴリズムが常に cpW ER を減少させることが示された。
具体的には,高話者リークのサブセットにおいて,cpW ERを最大29%削減し,複雑な音響環境下でのMT-ASR文字起こしの信頼性向上に有効であることを示す。
関連論文リスト
- Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition [4.573909205189436]
CSクリティカル領域における認識を改善するために,POI(Point-of-Interest)対応のコントラスト学習フレームワークを提案する。
CS-FLEURS (cmn-eng) と ViMedCSS (vie-eng) の実験は、一般およびCS対応のエラーレートにおいて、2%以上の一貫した減少を示した。
論文 参考訳(メタデータ) (2026-06-05T07:24:39Z) - AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech [31.143755362391115]
本稿では,複合命令の意図的表現制御を目的としたマルチエージェントクローズドループフレームワークであるAgentSteerTTSを紹介する。
対向的絡み合い防止剤は、漏れ抑制正規化を伴う分離可能なアイデンティティと感情プロソディ部分空間を学習することにより、話者感情漏洩を緩和する。
複合インストラクションベンチマークと公開テストセットの実験は、AgentSteerTTSがベースラインに一貫性と大幅な改善をもたらすことを示している。
論文 参考訳(メタデータ) (2026-05-14T13:31:23Z) - Who Spoke What When? Evaluating Spoken Language Models for Conversational ASR with Semantic and Overlap-Aware Metrics [99.89493037369071]
音声の重複や遠距離雑音,話者数の変化など,会話の自動音声認識は依然として困難である。
近年のLCMベースのシステムは単一話者のベンチマークでは良好に動作するが、マルチ話者設定におけるロバスト性は不明確である。
重なり、意味的忠実度、話者数、シングルチャンネルとマルチチャネル入力の4つの軸に沿って、LLMベースのアプローチとモジュラーアプローチを体系的に比較する。
論文 参考訳(メタデータ) (2026-03-24T02:01:21Z) - StutterFuse: Mitigating Modality Collapse in Stuttering Detection with Jaccard-Weighted Metric Learning and Gated Fusion [0.40105987447353786]
散乱検出は、拡散が重なると故障する。
既存のパラメトリックモデルは、複雑で同時的な分散を区別するのに苦労する。
マルチラベル検出のための最初のレトリーバル拡張一般化(RAC)であるStutterFuseを紹介する。
論文 参考訳(メタデータ) (2025-12-15T18:28:39Z) - Listen Like a Teacher: Mitigating Whisper Hallucinations using Adaptive Layer Attention and Knowledge Distillation [9.486565210140279]
Whisperモデルは、多言語およびゼロショット設定における強力なパフォーマンスのために広く採用されている。
ウィスパースタイルのASRシステムにおける幻覚を減らすための以前の研究は、主に誤ったコンテンツをフィルタリングするために、音声前処理や書き起こしの後処理に重点を置いていた。
本稿では,まずアダプティブ・レイヤ・アテンション(ALA)を用いてエンコーダのロバスト性を向上し,多目的知識蒸留(KD)フレームワークを用いた幻覚を抑制する2段階アーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-11-18T07:52:47Z) - Towards Low-Latency Tracking of Multiple Speakers With Short-Context Speaker Embeddings [52.985061676464554]
短文脈話者埋め込み抽出のための知識蒸留に基づく学習手法を提案する。
我々は、ビームフォーミングを用いて興味ある話者の空間情報を活用し、重複を低減する。
以上の結果から,本モデルは短文埋め込み抽出に有効であり,重なりやすいことが示唆された。
論文 参考訳(メタデータ) (2025-08-18T11:32:13Z) - High-Fidelity Speech Synthesis with Minimal Supervision: All Using
Diffusion Models [56.00939852727501]
最小教師付き音声合成は、2種類の離散音声表現を組み合わせることでTSを分離する。
非自己回帰フレームワークは、制御可能性を高め、持続拡散モデルは、多様化された韻律表現を可能にする。
論文 参考訳(メタデータ) (2023-09-27T09:27:03Z) - BA-SOT: Boundary-Aware Serialized Output Training for Multi-Talker ASR [54.23941663326509]
話者の頻繁な変化は、話者の変化を予測するのを難しくする。
境界対応型直列出力訓練(BA-SOT)を提案する。
オリジナルのSOTと比較して、BA-SOTはCER/UD-CERを5.1%/14.0%削減している。
論文 参考訳(メタデータ) (2023-05-23T06:08:13Z) - Continuous Speech Separation with Conformer [60.938212082732775]
分離システムでは、リカレントニューラルネットワークの代わりにトランスとコンバータを用いる。
我々は,自己注意に基づく方法でグローバルな情報を取得することが,音声分離に不可欠であると信じている。
論文 参考訳(メタデータ) (2020-08-13T09:36:05Z) - Audio-visual Multi-channel Recognition of Overlapped Speech [79.21950701506732]
本稿では,音声とマルチチャンネルの重なり合う音声認識システムについて述べる。
実験により,提案したマルチチャネルAVSRシステムは,音声のみのASRシステムを最大6.81% (26.83%) ,22.22% (56.87%) の絶対単語誤り率 (WER) で比較した。
論文 参考訳(メタデータ) (2020-05-18T10:31:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。