論文の概要: Time-Frequency Consistency Learning for Robust Speech Deepfake Detection
- arxiv url: http://arxiv.org/abs/2607.17761v2
- Date: Tue, 28 Jul 2026 04:55:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 16:37:20.830899
- Title: Time-Frequency Consistency Learning for Robust Speech Deepfake Detection
- Title(参考訳): ロバスト音声深度検出のための時間周波数一貫性学習
- Abstract要約: 音響エコーキャンセラ、ノイズ抑圧、自動利得制御、音声活動検出を含む統合AFEパイプラインをシミュレートする。
その結果, AFEによる非線形および時間周波数結合歪みは検出性能を著しく低下させることがわかった。
AFE処理前後で安定な不変なスプーフィング表現を学習することを目的とした時間周波数一貫性学習フレームワークを提案する。
- 参考スコア(独自算出の注目度): 31.448593507749745
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recently, speech deepfake detection (SDD) has achieved significant progress. However, its robustness evaluation remains largely confined to controlled additive noise scenarios, lacking systematic investigation of the complex distortions introduced by acoustic front-end (AFE) processing pipelines in real-world deployments. In this work, we simulate a unified AFE pipeline comprising acoustic echo cancellation, noise suppression, automatic gain control, and voice activity detection (VAD), and conduct a comprehensive evaluation of current state-of-the-art models. The results show that the nonlinear and time-frequency coupled distortions introduced by AFE significantly degrade detection performance. To address this issue, we propose a Time-Frequency Consistency Learning (TFCL) framework, which aims to learn invariant spoofing representations that remain stable before and after AFE processing. We observe that AFE not only introduces temporal misalignment (e.g., segment-level shifts caused by VAD), but also weakens or distorts critical frequency-domain cues. To this end, TFCL employs an attention-driven soft alignment mechanism to capture cross-temporal dependencies, along with frequency-domain structural consistency constraints to enforce feature invariance. As a result, the model is able to maintain stable representations under both temporal perturbations and spectral distortions. Extensive experimental results demonstrate that the proposed method effectively mitigates the performance degradation caused by AFE processing, significantly improving the robustness of SDD in real-world scenarios. The code is available at https://github.com/JunXue-tech/TFCL.
- Abstract(参考訳): 近年,音声深度検出(SDD)は大きな進歩を遂げている。
しかし、その頑健性評価は、実世界の展開において、音響フロントエンド(AFE)処理パイプラインによって引き起こされる複雑な歪みの体系的な研究が欠如している、制御された付加的雑音のシナリオに限られている。
本研究では,音響エコーキャンセル,ノイズ抑圧,自動利得制御,音声活動検出(VAD)を含む統合AFEパイプラインをシミュレートし,現在の最先端モデルの包括的評価を行う。
その結果, AFEによる非線形および時間周波数結合歪みは検出性能を著しく低下させることがわかった。
この問題に対処するため,AFE処理前後で安定な不変なスプーフィング表現を学習することを目的としたTFCLフレームワークを提案する。
AFEは時間的不整合(例えば、VADによるセグメントレベルのシフト)をもたらすだけでなく、重要な周波数領域の手がかりを弱めたり歪ませたりする。
この目的のために、TFCLは、時間的依存関係を捕捉するための注意駆動型ソフトアライメント機構と、特徴不変性を強制するための周波数領域の構造的一貫性の制約を用いる。
結果として、モデルは時間的摂動とスペクトル歪みの両方の下で安定した表現を維持することができる。
実験結果から,提案手法はAFE処理による性能劣化を効果的に軽減し,実世界のシナリオにおけるSDDの堅牢性を大幅に向上することを示した。
コードはhttps://github.com/JunXue-tech/TFCLで公開されている。
関連論文リスト
- Variational Rectification Inference for Learning with Noisy Labels [74.85528327499662]
損失関数の適応的補正を定式化するために, 変分補正推論(VRI)を提案する。
VRIは、補正ベクトルを潜在変数として扱うことによって階層ベイズとして構成される。
VRIで変分項を導入することにより、条件付き後部を正確に推定し、ディラックデルタ関数への崩壊を避ける。
論文 参考訳(メタデータ) (2026-03-18T01:25:08Z) - Contextual and Seasonal LSTMs for Time Series Anomaly Detection [49.50689313712684]
CS-LSTM (Contextual and Seasonal LSTMs) という新しい予測型フレームワークを提案する。
CS-LSTMはノイズ分解戦略に基づいて構築され、コンテキスト依存と季節パターンを併用する。
彼らは一貫して最先端の手法を上回り、堅牢な時系列異常検出における有効性と実用的価値を強調した。
論文 参考訳(メタデータ) (2026-02-10T11:46:15Z) - Explainable Transformer-CNN Fusion for Noise-Robust Speech Emotion Recognition [2.0391237204597363]
音声感情認識システムは、予測不能な音響干渉にさらされると、しばしば性能が低下する。
本稿では,Wav2Vec 2.0のコンテキストモデリングと1次元畳み込みニューラルネットワークのスペクトル安定性を融合したHybrid Transformer-CNNフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-20T10:05:58Z) - FAIM: Frequency-Aware Interactive Mamba for Time Series Classification [87.84511960413715]
時系列分類(TSC)は、環境モニタリング、診断、姿勢認識など、多くの実世界の応用において重要である。
本稿では,周波数対応対話型マンバモデルであるFAIMを提案する。
FAIMは既存の最先端(SOTA)手法を一貫して上回り、精度と効率のトレードオフが優れていることを示す。
論文 参考訳(メタデータ) (2025-11-26T08:36:33Z) - CARLE: A Hybrid Deep-Shallow Learning Framework for Robust and Explainable RUL Estimation of Rolling Element Bearings [2.312232949770907]
Remaining Useful Life (RUL) は、コンポーネント、例えばローリングエレメントのベアリングが障害前にどれくらいの期間動作するかを予測する。
多くのRUL法が存在するが、動作条件が変化すると一般化性や堅牢性に欠けることが多い。
本稿では,これらの課題に対処するために,深層学習と浅層学習を組み合わせたハイブリッドAIフレームワークであるCARLEを紹介する。
論文 参考訳(メタデータ) (2025-10-10T21:43:26Z) - CALM: A Framework for Continuous, Adaptive, and LLM-Mediated Anomaly Detection in Time-Series Streams [0.42970700836450476]
本稿では,リアルタイム異常検出のための新しいエンドツーエンドフレームワークであるCALMを紹介する。
CALMはApache Beam分散処理フレームワーク上に構築されている。
クローズドループで連続的な微調整機構を実装し、異常検出モデルがほぼリアルタイムで進化するデータパターンに適応できるようにする。
論文 参考訳(メタデータ) (2025-08-29T00:27:35Z) - HADL Framework for Noise Resilient Long-Term Time Series Forecasting [0.7810572107832383]
長期の時系列予測は、金融、経済、エネルギーといった分野において重要である。
拡張されたルックバックウィンドウにおける時間ノイズの影響は未調査であり、しばしばモデル性能と計算効率を劣化させる。
本稿では、離散ウェーブレット変換(DWT)と離散コサイン変換(DCT)を統合することで、これらの課題に対処する新しいフレームワークを提案する。
提案手法は,ノイズの多い入力に対する競合堅牢性を示し,計算複雑性を著しく低減し,多様なベンチマークデータセット間での競合性ないし最先端の予測性能を実現する。
論文 参考訳(メタデータ) (2025-02-14T21:41:42Z) - Error-quantified Conformal Inference for Time Series [55.11926160774831]
時系列予測の不確かさの定量化は、時系列データの時間的依存と分布シフトのために困難である。
量子化損失関数をスムースにすることで,iError-quantified Conformal Inference (ECI)を提案する。
ECIは有効な誤発見制御と、他のベースラインよりも厳密な予測セットを出力することができる。
論文 参考訳(メタデータ) (2025-02-02T15:02:36Z) - Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization [60.899082019130766]
本稿では、フレームレベル検出ネットワーク(FDN)と、音声の時間的偽造検出とローカライゼーションのための改良ネットワーク(PRN)を提案する。
FDNは、偽のフレーム間で情報的不整合の手がかりを抽出し、偽の領域を大まかに示すのに有用な識別的特徴を得る。
PRNは、FDNから派生した粗粒度の提案を洗練するために、信頼スコアと回帰オフセットを予測する責任がある。
論文 参考訳(メタデータ) (2024-07-23T15:07:52Z) - CLeaRForecast: Contrastive Learning of High-Purity Representations for
Time Series Forecasting [2.5816901096123863]
時系列予測(TSF)は現代社会において重要であり、多くの領域にまたがっている。
従来の表現学習に基づくTSFアルゴリズムは、典型的には、分離された傾向周期表現を特徴とする対照的な学習パラダイムを取り入れている。
CLeaRForecastは,高純度時系列表現をサンプル,特徴量,アーキテクチャ浄化手法を用いて学習するための,新しいコントラスト学習フレームワークである。
論文 参考訳(メタデータ) (2023-12-10T04:37:43Z) - DiffusionAD: Norm-guided One-step Denoising Diffusion for Anomaly Detection [80.20339155618612]
DiffusionADは、再構成サブネットワークとセグメンテーションサブネットワークからなる、新しい異常検出パイプラインである。
高速なワンステップデノゲーションパラダイムは、同等の再現品質を維持しながら、数百倍の加速を達成する。
異常の出現の多様性を考慮し、複数のノイズスケールの利点を統合するためのノルム誘導パラダイムを提案する。
論文 参考訳(メタデータ) (2023-03-15T16:14:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。