論文の概要: Disentangling Speaker Traits for Deepfake Source Verification via Chebyshev Polynomial and Riemannian Metric Learning
- arxiv url: http://arxiv.org/abs/2603.21875v1
- Date: Mon, 23 Mar 2026 12:05:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.652728
- Title: Disentangling Speaker Traits for Deepfake Source Verification via Chebyshev Polynomial and Riemannian Metric Learning
- Title(参考訳): Chebyshev Polynomial と Riemannian Metric Learning によるディープフェイク音源検証のためのディエンタングリング話者特性
- Authors: Xi Xuan, Wenxin Zhang, Zhiyu Li, Jennifer Williams, Ville Hautamäki, Tomi H. Kinnunen,
- Abstract要約: 音声深度音源検証システムは、同一音源発生器から2つの合成音声が発するか否かを判定することを目的としている。
本稿ではまず,話者要因が情報源検証に与える影響について検討する。
本稿では,2つの新しい損失関数を組み込んだ話者距離距離学習(SDML)フレームワークを提案する。
- 参考スコア(独自算出の注目度): 23.354047693244457
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speech deepfake source verification systems aims to determine whether two synthetic speech utterances originate from the same source generator, often assuming that the resulting source embeddings are independent of speaker traits. However, this assumption remains unverified. In this paper, we first investigate the impact of speaker factors on source verification. We propose a speaker-disentangled metric learning (SDML) framework incorporating two novel loss functions. The first leverages Chebyshev polynomial to mitigate gradient instability during disentanglement optimization. The second projects source and speaker embeddings into hyperbolic space, leveraging Riemannian metric distances to reduce speaker information and learn more discriminative source features. Experimental results on MLAAD benchmark, evaluated under four newly proposed protocols designed for source-speaker disentanglement scenarios, demonstrate the effectiveness of SDML framework. The code, evaluation protocols and demo website are available at https://github.com/xxuan-acoustics/RiemannSD-Net.
- Abstract(参考訳): 音声深層音源検証システムは、2つの合成音声発話が同一の音源発生源から発せられるか否かを判断することを目的としており、その結果の音源埋め込みが話者特性とは無関係であると仮定することが多い。
しかし、この仮定は検証されていない。
本稿ではまず,話者要因が情報源検証に与える影響について検討する。
本稿では,2つの新しい損失関数を組み込んだ話者距離距離学習(SDML)フレームワークを提案する。
最初はチェビシェフ多項式を利用して、非交叉最適化時の勾配不安定を緩和する。
第2のプロジェクトは双曲空間へのソース埋め込みと話者埋め込みを計画し、リーマン距離を利用して話者情報を減らし、より識別的なソース特徴を学ぶ。
MLAADベンチマークの実験結果から, SDMLフレームワークの有効性を実証した。
コード、評価プロトコル、デモウェブサイトはhttps://github.com/xxuan-acoustics/RiemannSD-Net.comで公開されている。
関連論文リスト
- How to Evaluate Speech Translation with Source-Aware Neural MT Metrics [32.41110835446445]
機械翻訳において、原文を組み込んだ神経メトリクスは、人間の判断と強い相関関係を得る。
本研究は,音声からテキストへの翻訳におけるソース・アウェア・メトリクスの体系的研究である。
本稿では,合成源と参照翻訳のアライメントミスマッチに対処するため,新たな2段階の言語間再分割アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-11-05T08:49:22Z) - MARS-Sep: Multimodal-Aligned Reinforced Sound Separation [72.85468563236005]
MARS-Sepは音分離のための強化学習フレームワークである。
クリッピングされた信頼領域サロゲートによって最適化された、ファクタライズされたベータマスクポリシを学ぶ。
複数のベンチマークの実験は、テキスト、オーディオ、イメージ-キュード分離において一貫した利得を示している。
論文 参考訳(メタデータ) (2025-10-12T09:05:28Z) - Audio Large Language Models Can Be Descriptive Speech Quality Evaluators [46.765203628127345]
本稿では,人間格付けから生成した最初の自然言語に基づく音声評価コーパスについて紹介する。
このコーパスは、複数の次元にわたる詳細な分析を提供し、品質劣化の原因を特定する。
生音声から関連情報を抽出するために,LLM蒸留(ALLD)を用いたアライメント手法を提案する。
論文 参考訳(メタデータ) (2025-01-27T22:47:51Z) - Online speaker diarization of meetings guided by speech separation [0.0]
重複した音声は、話者ダイアリゼーションシステムに問題があることで知られている。
長時間録音のオンライン話者ダイアリゼーションに適した音声分離誘導ダイアリゼーション方式を提案する。
論文 参考訳(メタデータ) (2024-01-30T09:09:22Z) - HyPoradise: An Open Baseline for Generative Speech Recognition with
Large Language Models [81.56455625624041]
ASRの誤り訂正に外部の大規模言語モデル(LLM)を利用する最初のオープンソースベンチマークを導入する。
提案したベンチマークには、334,000組以上のN-best仮説を含む新しいデータセットHyPoradise (HP)が含まれている。
合理的なプロンプトと生成能力を持つLLMは、N-bestリストに欠けているトークンを修正できる。
論文 参考訳(メタデータ) (2023-09-27T14:44:10Z) - TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation [61.564874831498145]
TranSpeechは、両側摂動を伴う音声から音声への翻訳モデルである。
我々は,非自己回帰S2ST手法を構築し,繰り返しマスキングを行い,単位選択を予測する。
TranSpeechは推論遅延を大幅に改善し、自動回帰技術よりも最大21.4倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2022-05-25T06:34:14Z) - Separate What You Describe: Language-Queried Audio Source Separation [53.65665794338574]
言語問合せ音声ソース分離(LASS)の課題について紹介する。
LASSは、ターゲットソースの自然言語クエリに基づいて、ターゲットソースをオーディオミックスから分離することを目的としている。
本稿では,音響情報と言語情報を協調処理するエンドツーエンドニューラルネットワークLASS-Netを提案する。
論文 参考訳(メタデータ) (2022-03-28T23:47:57Z) - Speaker Embedding-aware Neural Diarization: a Novel Framework for
Overlapped Speech Diarization in the Meeting Scenario [51.5031673695118]
重なり合う音声のダイアリゼーションを単一ラベル予測問題として再構成する。
話者埋め込み認識型ニューラルダイアリゼーション(SEND)システムを提案する。
論文 参考訳(メタデータ) (2022-03-18T06:40:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。