論文の概要: PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction
- arxiv url: http://arxiv.org/abs/2607.08111v1
- Date: Thu, 09 Jul 2026 04:51:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.41548
- Title: PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction
- Title(参考訳): PS4: Proxy-Supervised Joint Training for Real Target Speaker extract
- Abstract要約: PS4は、リアルタイムの会話ミキシングにおけるTSEのためのプロキシ管理トレーニングフレームワークである。
PS4は全体として第2位であり、全てのシステムの中で最高の話者類似性とタイミングF1を達成している。
- 参考スコア(独自算出の注目度): 4.349122610017793
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training target speaker extraction (TSE) models for real conversational mixtures remains challenging because large-scale training corpora and clean target speech for supervision are unavailable. We present PS4, a proxy-supervised training framework for TSE in real conversational mixtures, with two main contributions. First, we construct a large-scale corpus of 71,771 training samples derived from four public datasets, covering both Chinese and English scenarios. Each sample contains an overlapping speech mixture, per-speaker enrollment audio, a ground-truth transcript, and frame-level voice activity labels. Second, we propose a proxy-supervised joint training strategy that fine-tunes a BSRNN-based TSE model using four complementary differentiable objectives: ASR cross-entropy, speaker similarity, frame-level voice activity detection, and perceptual audio quality. Starting from a publicly available pre-trained checkpoint, only the BSRNN separator is updated during fine-tuning. On the REAL-T challenge leaderboard, PS4 ranks 2nd overall, achieving the best speaker similarity and timing F1 among all submitted systems.
- Abstract(参考訳): 大規模学習コーパスとクリーンターゲット音声の監視が不可能なため, 実際の会話混合に対する訓練対象話者抽出(TSE)モデルは依然として困難である。
提案するPS4は,2つの主要なコントリビューションを伴って,リアルタイムの会話ミキシングにおけるTSEのためのプロキシ教師付きトレーニングフレームワークである。
まず、4つの公開データセットから抽出した71,771の大規模コーパスを構築し、中国語と英語の両方のシナリオをカバーする。
各サンプルには、重なり合う音声の混合、話者ごとの参加音声、接地トランスクリプト、フレームレベルの音声活動ラベルが含まれる。
次に、ASRクロスエントロピー、話者類似性、フレームレベルの音声活動検出、知覚音質の4つの相補的な目的を用いて、BSRNNベースのTSEモデルを微調整する。
公開されている事前訓練チェックポイントから始めて、微調整中に更新されるのはBSRNNセパレータのみである。
REAL-Tチャレンジのリーダーボードでは、PS4が全システムの中で最高の話者類似性とタイミングF1を達成し、総合2位にランクインしている。
関連論文リスト
- From A to B to A: Palindromic Zero-Shot Voice Conversion with Non-Parallel Data [8.018854030707912]
並列コーパスや明示的なアライメントを必要とせず,多言語データをサポートする合成現実訓練パラダイムを提案する。
複数の言語にまたがる実験により、提案手法は英語データにのみ訓練されているにもかかわらず、高い自然性と強い話者類似性を実現することが示された。
論文 参考訳(メタデータ) (2026-06-07T21:25:14Z) - TRACE: Training-Free Partial Audio Deepfake Detection via Embedding Trajectory Analysis of Speech Foundation Models [6.951909224842812]
本研究では, TRACE (Training-free Representation-based Audio Countermeasure via Embedding dynamics) を提案する。
TRACEは、トレーニング、ラベル付きデータ、アーキテクチャの変更なしに、凍結音声基礎モデルの表現の1次ダイナミクスを分析する。
6つの音声基礎モデルを用いて2言語にまたがる4つのベンチマークでTRACEを評価した。
論文 参考訳(メタデータ) (2026-04-01T16:12:31Z) - Learning Speech Representation From Contrastive Token-Acoustic
Pretraining [57.08426714676043]
本研究では、2つのエンコーダを用いて音素と音声を複数モーダル空間に導入するCTAP(Contrastive Token-Acoustic Pretraining)を提案する。
提案したCTAPモデルは、210k音声と音素ペアで訓練され、最小教師付きTS、VC、ASRを実現する。
論文 参考訳(メタデータ) (2023-09-01T12:35:43Z) - Improving Audio-Visual Speech Recognition by Lip-Subword Correlation
Based Visual Pre-training and Cross-Modal Fusion Encoder [58.523884148942166]
本稿では,事前学習および微調整訓練の枠組みの下で,音声視覚音声認識(AVSR)を改善するための2つの新しい手法を提案する。
まず, マンダリンにおける口唇形状と音節レベルサブワード単位の相関について検討し, 口唇形状から良好なフレームレベル音節境界を確立する。
次に,音声誘導型クロスモーダルフュージョンエンコーダ(CMFE)ニューラルネットワークを提案する。
論文 参考訳(メタデータ) (2023-08-14T08:19:24Z) - ERNIE-SAT: Speech and Text Joint Pretraining for Cross-Lingual
Multi-Speaker Text-to-Speech [58.93395189153713]
言語間複数話者音声合成タスクの事前学習法を拡張した。
本稿では,スペクトルと音素をランダムにマスキングする,音声・テキスト共同事前学習フレームワークを提案する。
本モデルは,話者埋め込み型マルチスピーカTS法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2022-11-07T13:35:16Z) - Generation of Speaker Representations Using Heterogeneous Training Batch
Assembly [16.534380339042087]
本稿では,CNNに基づく話者モデリング手法を提案する。
トレーニングデータを一組のセグメントにランダムに合成的に拡張する。
各セグメントには、その話者占有率に基づいてソフトラベルが課される。
論文 参考訳(メタデータ) (2022-03-30T19:59:05Z) - Speaker Embedding-aware Neural Diarization: a Novel Framework for
Overlapped Speech Diarization in the Meeting Scenario [51.5031673695118]
重なり合う音声のダイアリゼーションを単一ラベル予測問題として再構成する。
話者埋め込み認識型ニューラルダイアリゼーション(SEND)システムを提案する。
論文 参考訳(メタデータ) (2022-03-18T06:40:39Z) - WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech
Processing [102.45426364965887]
そこで本研究では,フルスタックダウンストリーム音声タスクを解決するための,事前学習型モデルWavLMを提案する。
WavLMはHuBERTフレームワークに基づいて構築されており、音声コンテンツモデリングと話者アイデンティティ保存の両方に重点を置いている。
トレーニングデータセットを60k時間から94k時間までの公開オーディオデータにスケールアップし、そのトレーニング手順を最適化して表現抽出を改善する。
論文 参考訳(メタデータ) (2021-10-26T17:55:19Z) - Conformer-Based Self-Supervised Learning for Non-Speech Audio Tasks [20.316239155843963]
本稿では,音声表現学習手法を提案し,それを下流の音声非音声タスクに適用する。
AudioSetベンチマークでは、平均平均精度(mAP)スコアが0.415に達しています。
論文 参考訳(メタデータ) (2021-10-14T12:32:40Z) - VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised
Speech Representation Disentanglement for One-shot Voice Conversion [54.29557210925752]
ワンショット音声変換は、音声表現のアンタングルメントによって効果的に実現できる。
コンテンツエンコーディングにはベクトル量子化(VQ)を使用し、トレーニング中に相互情報(MI)を相関指標として導入する。
実験結果は,提案手法が効果的に非絡み合った音声表現を学習する際の優位性を反映している。
論文 参考訳(メタデータ) (2021-06-18T13:50:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。