論文の概要: Neural Multichannel Distant Speaker Diarization with Heavy-tailed Source Separation Model
- arxiv url: http://arxiv.org/abs/2609.12154v1
- Date: Thu, 10 Sep 2026 19:41:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.527434
- Title: Neural Multichannel Distant Speaker Diarization with Heavy-tailed Source Separation Model
- Title(参考訳): 重み付き音源分離モデルを用いたニューラルマルチチャネル距離話者ダイアリゼーション
- Abstract要約: 本稿では,音声の混合によるブラインド音源分離とダイアリゼーションを共同で学習するニューラルモデルを一般化する。
ダイアリゼーションエラーレート (DER) とジャカードエラーレート (JER) は, 各種コーパスのベースラインに比べて一貫した改善が見られた。
- 参考スコア(独自算出の注目度): 12.362272115239522
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Distant speaker diarization remains challenging due to difficult acoustic environments, varying numbers of speakers and overlapping speech. Model-driven methods are proposed to exploit the speech source features in multi-channel recordings that help diarization. This paper generalizes a neural model that jointly learns to perform blind source separation and diarization over speech mixtures (neural FCASA) with heavy-tailed models. The popular Gaussian distribution has been applied for variance modeling in the original source separation model, which we replace with two families of heavy-tailed models (Leptokurtic Generalized Gaussian distribution and Student's t distribution) to better capture the heavy-tailedness in speech signals. Thanks to the Gaussian scale mixture model, we are able to unify the proposed method and the original one under the same form of learning objective. Our experiments show consistent large improvements in Diarization Error Rate (DER) and Jaccard Error Rate (JER) compared to the baseline on various corpora.
- Abstract(参考訳): 遠隔話者ダイアリゼーションは、難聴環境、話者数の変化、重なり合う音声のために依然として困難である。
ダイアリゼーションを支援するマルチチャンネル記録における音源特徴を利用したモデル駆動手法を提案する。
本稿では,重み付きモデルを用いた音声混合(FCASA)によるブラインド音源分離とダイアリゼーションを共同で学習するニューラルネットワークを一般化する。
一般的なガウス分布は、元の音源分離モデルにおける分散モデルに適用され、音声信号の重み付けをよりよく捉えるために、重み付けモデルの2つのファミリー(レプソルティック一般化ガウス分布と学生のt分布)に置き換えられる。
ガウススケール混合モデルにより,提案手法と原案を同一の学習目標の下で統一することができる。
ダイアリゼーションエラー率 (DER) とジャカードエラー率 (JER) は, 各種コーパスのベースラインと比較して一貫した改善が見られた。
関連論文リスト
- Speech Enhancement Based on Drifting Models [2.6958419576949146]
ドリフトモデル(DriftSE)に基づく音声強調手法を提案する。
DriftSEは平衡問題としてデノイングを定式化する新しい生成フレームワークである。
VoiceBank-DEMANDの実験では、DriftSEは単一のステップで高忠実性向上を実現する。
論文 参考訳(メタデータ) (2026-04-27T09:00:51Z) - From Denoising to Refining: A Corrective Framework for Vision-Language Diffusion Model [72.73512218682187]
ReDiff(Refining-enhanced diffusion framework)は、モデルに自身のエラーを特定し、修正するように教えるフレームワークである。
まず、合成エラーを修正するためにモデルをトレーニングすることで、基礎的なリビジョン機能を具現化し、次に、新しいオンライン自己補正ループを実装します。
この誤り駆動学習は、モデルに既存の出力を再検討し、洗練する重要な能力を与え、エラーカスケードを効果的に破壊する。
論文 参考訳(メタデータ) (2025-10-22T06:58:55Z) - Disentanglement of Sources in a Multi-Stream Variational Autoencoder [4.562056072136493]
変分オートエンコーダ(VAE)は、非絡み合った表現を学習する問題に対処する主要な手法である。
ここでは、個別のラテントを用いて、個々のソースのVAE表現を組み合わせることで、異なるアプローチを探求する。
論文 参考訳(メタデータ) (2025-10-17T13:54:56Z) - Generalized Interpolating Discrete Diffusion [65.74168524007484]
仮面拡散はその単純さと有効性のために一般的な選択である。
ノイズ発生過程の設計において、より柔軟性の高い離散拡散(GIDD)を補間する新しいファミリを一般化する。
GIDDの柔軟性をエクスプロイトし、マスクと均一ノイズを組み合わせたハイブリッドアプローチを探索し、サンプル品質を向上する。
論文 参考訳(メタデータ) (2025-03-06T14:30:55Z) - BEND: Bagging Deep Learning Training Based on Efficient Neural Network Diffusion [56.9358325168226]
BEND(Efficient Neural Network Diffusion)に基づくバッグング深層学習学習アルゴリズムを提案する。
我々のアプローチは単純だが効果的であり、まず複数のトレーニングされたモデルの重みとバイアスを入力として、オートエンコーダと潜伏拡散モデルを訓練する。
提案したBENDアルゴリズムは,元のトレーニングモデルと拡散モデルの両方の平均および中央値の精度を一貫して向上させることができる。
論文 参考訳(メタデータ) (2024-03-23T08:40:38Z) - One More Step: A Versatile Plug-and-Play Module for Rectifying Diffusion
Schedule Flaws and Enhancing Low-Frequency Controls [77.42510898755037]
One More Step (OMS) は、推論中に単純だが効果的なステップを付加したコンパクトネットワークである。
OMSは画像の忠実度を高め、トレーニングと推論の二分法を調和させ、元のモデルパラメータを保存する。
トレーニングが完了すると、同じ潜在ドメインを持つ様々な事前訓練された拡散モデルが同じOMSモジュールを共有することができる。
論文 参考訳(メタデータ) (2023-11-27T12:02:42Z) - Multi-scale Diffusion Denoised Smoothing [79.95360025953931]
ランダムな平滑化は、大規模モデルに敵対的ロバスト性を提供する、いくつかの具体的なアプローチの1つになっている。
本報告では, 分割平滑化におけるロバスト性と精度との現在のトレードオフに対処するスケーラブルな手法を提案する。
提案手法と拡散微細調整を併用したマルチスケール平滑化手法により,高騒音レベルで高い信頼性のロバスト性が得られることを示す。
論文 参考訳(メタデータ) (2023-10-25T17:11:21Z) - Denoising Diffusion Bridge Models [54.87947768074036]
拡散モデルは、プロセスを使用してデータにノイズをマッピングする強力な生成モデルである。
画像編集のような多くのアプリケーションでは、モデル入力はランダムノイズではない分布から来る。
本研究では, DDBM(Denoising Diffusion Bridge Models)を提案する。
論文 参考訳(メタデータ) (2023-09-29T03:24:24Z) - Separate And Diffuse: Using a Pretrained Diffusion Model for Improving
Source Separation [99.19786288094596]
上界をランダムな生成モデルに一般化する方法を示す。
複数のベンチマークで2, 3, 5, 10, 20人の話者に最先端の結果を示す。
論文 参考訳(メタデータ) (2023-01-25T18:21:51Z) - A weighted-variance variational autoencoder model for speech enhancement [0.0]
パラメータ学習における各スペクトル時間枠の寄与を重み付けした重み付き分散生成モデルを提案する。
提案した生成モデルに基づいて,効率的な学習と音声強調アルゴリズムを開発する。
論文 参考訳(メタデータ) (2022-11-02T09:51:15Z) - Speech Prediction in Silent Videos using Variational Autoencoders [29.423462898526605]
我々はサイレントビデオで音声を生成するモデルを提案する。
提案モデルは、繰り返しニューラルネットワークと変分深部生成モデルを組み合わせて、聴覚の条件分布を学習する。
標準ベンチマークに基づくGRIDデータセット上で,本モデルの性能を示す。
論文 参考訳(メタデータ) (2020-11-14T17:09:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。