論文の概要: An Intervention-Based Framework for Shortcut Diagnosis in Spoofing Countermeasures
- arxiv url: http://arxiv.org/abs/2607.03150v1
- Date: Fri, 03 Jul 2026 09:42:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.534207
- Title: An Intervention-Based Framework for Shortcut Diagnosis in Spoofing Countermeasures
- Title(参考訳): スポーフィング対策におけるショートカット診断のためのインターベンションベースフレームワーク
- Authors: Santiago Rubio, Pilar Bello, Dayana Ribas, Antonio Miguel, Eduardo Lleida, Alfonso Ortega,
- Abstract要約: 本稿では,コンバウンド駆動のショートカット依存を識別するための介入に基づく診断フレームワークを提案する。
非音声構造、スペクトル含量、信号エネルギーを対象とする制御音響摂動によりこれを操作する。
その結果、非音声介入は最大のパフォーマンスシフトをもたらし、非音声区間が支配的なショートカットであることを確認した。
- 参考スコア(独自算出の注目度): 5.593982292458519
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While deepfake audio detection systems achieve high performance in controlled benchmarks, their reliability often diminishes in the wild. Prior work shows that dataset-specific artifacts contribute to this gap. Yet, systematic tools to identify which acoustic properties a model exploits as shortcuts remain limited. We propose an intervention-based diagnostic framework, grounded in a directed graphical model, that formally distinguishes confound-driven shortcut dependencies from legitimate domain shift. We operationalise this through controlled acoustic perturbations targeting non-speech structure, spectral content, and signal energy, complemented by corpus-level distributional analysis. Evaluating XLS-R-300M with RawGAT-ST across ASVspoof challenges datasets, we quantify model sensitivity to specific intervention types. Results reveal that non-speech interventions produce the largest performance shifts, confirming non-speech intervals as a dominant shortcut.
- Abstract(参考訳): ディープフェイクオーディオ検出システムは、制御されたベンチマークで高い性能を達成するが、その信頼性は荒々しく低下することが多い。
以前の研究は、データセット固有のアーティファクトがこのギャップに寄与していることを示している。
しかし、モデルがどの音響特性をショートカットとして利用するかを特定するための体系的なツールはまだ限られている。
そこで本稿では,整合性領域シフトと整合性領域シフトとを正式に区別する,有向的グラフィカルモデルに基づく介入に基づく診断フレームワークを提案する。
我々は、コーパスレベルの分布解析によって補完される非音声構造、スペクトル内容、信号エネルギーを対象とする制御された音響摂動を通してこれを運用する。
ASVspoofでのXLS-R-300MとRawGAT-STの評価はデータセットに挑戦し、特定の介入タイプに対するモデルの感度を定量化する。
その結果、非音声介入は最大のパフォーマンスシフトをもたらし、非音声区間が支配的なショートカットであることを確認した。
関連論文リスト
- Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis [14.922065513695294]
Resp-Agent(Resp-Agent)は、アクティブアドリキュラムエージェント(Thinker-A$2$CA)によって編成された自律型マルチモーダルシステムである。
表現ギャップに対処するため,EHRデータをストラテジックグローバルアテンションを介して音声トークンで織り込むModality-Weaving Diagnoserを導入する。
データギャップに対処するために,テキストのみのLarge Language Model (LLM) をモダリティインジェクションにより適応させるフローマッチングジェネレータを設計する。
論文 参考訳(メタデータ) (2026-02-16T14:48:24Z) - Learning to Separate RF Signals Under Uncertainty: Detect-Then-Separate vs. Unified Joint Models [53.79667447811139]
受信した信号に直接適用した場合、単一のディープニューラルネットワークアーキテクチャが共同で検出および分離することを学習していることを示す。
これらの結果から,UJM は DTS に代わるスケーラブルで実用的な代替品であり,広範に推定された統合分離のための新たな方向を開拓した。
論文 参考訳(メタデータ) (2026-02-04T15:25:02Z) - A Framework for Evaluating Faithfulness in Explainable AI for Machine Anomalous Sound Detection Using Frequency-Band Perturbation [37.2521660642532]
機械音響解析におけるXAI忠実度を評価するための新しい定量的枠組みを提案する。
我々は,XAI技術が信頼性に違いがあることを示し,Occlusionは真のモデル感度と最強のアライメントを示す。
論文 参考訳(メタデータ) (2026-01-26T23:06:50Z) - LLM Hallucination Detection: A Fast Fourier Transform Method Based on Hidden Layer Temporal Signals [10.85580316542761]
幻覚は、信頼性に敏感なアプリケーションに大規模言語モデル(LLM)をデプロイする上で、依然として重要な障壁である。
隠れ表現の時間的ダイナミクスをモデル化する新しい幻覚検出フレームワークであるHSAD(Hidden Signal Analysis-based Detection)を提案する。
TruthfulQAを含む複数のベンチマークにおいて、HSADは従来の最先端手法に比べて10パーセント以上の改善を実現している。
論文 参考訳(メタデータ) (2025-09-16T15:08:19Z) - FADEL: Uncertainty-aware Fake Audio Detection with Evidential Deep Learning [9.960675988638805]
顕在学習を用いた偽音声検出(FADEL)という新しいフレームワークを提案する。
FADELはモデルの不確実性を予測に組み込んでおり、OODシナリオではより堅牢なパフォーマンスを実現している。
本研究では,異なるスプーフィングアルゴリズム間の平均不確かさと等誤差率(EER)の強い相関関係を解析し,不確かさ推定の有効性を示す。
論文 参考訳(メタデータ) (2025-04-22T07:40:35Z) - $C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction [80.57232374640911]
我々はMask-And-Recover (MAR)と呼ばれるモデルに依存しない戦略を提案する。
MARは、モダリティ間およびモダリティ間コンテキスト相関を統合し、抽出モジュール内の大域的推論を可能にする。
各サンプルの難易度を向上するために, 精細信頼スコア(FCS)モデルを導入する。
論文 参考訳(メタデータ) (2025-04-01T13:01:30Z) - Anomaly Detection and Localization for Speech Deepfakes via Feature Pyramid Matching [8.466707742593078]
音声ディープフェイク(英: Speech Deepfakes)は、ターゲット話者の声を模倣できる合成音声信号である。
音声のディープフェイクを検出する既存の方法は教師あり学習に依存している。
本稿では,音声深度検出を異常検出タスクとして再設定する,新しい解釈可能な一クラス検出フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-23T11:15:22Z) - Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization [60.899082019130766]
本稿では、フレームレベル検出ネットワーク(FDN)と、音声の時間的偽造検出とローカライゼーションのための改良ネットワーク(PRN)を提案する。
FDNは、偽のフレーム間で情報的不整合の手がかりを抽出し、偽の領域を大まかに示すのに有用な識別的特徴を得る。
PRNは、FDNから派生した粗粒度の提案を洗練するために、信頼スコアと回帰オフセットを予測する責任がある。
論文 参考訳(メタデータ) (2024-07-23T15:07:52Z) - High-Fidelity Speech Synthesis with Minimal Supervision: All Using
Diffusion Models [56.00939852727501]
最小教師付き音声合成は、2種類の離散音声表現を組み合わせることでTSを分離する。
非自己回帰フレームワークは、制御可能性を高め、持続拡散モデルは、多様化された韻律表現を可能にする。
論文 参考訳(メタデータ) (2023-09-27T09:27:03Z) - Fuzzy Attention Neural Network to Tackle Discontinuity in Airway
Segmentation [67.19443246236048]
気道セグメンテーションは肺疾患の検査、診断、予後に重要である。
いくつかの小型の気道支線(気管支や終端など)は自動セグメンテーションの難しさを著しく増す。
本稿では,新しいファジィアテンションニューラルネットワークと包括的損失関数を備える,気道セグメンテーションの効率的な手法を提案する。
論文 参考訳(メタデータ) (2022-09-05T16:38:13Z) - Cross-domain Adaptation with Discrepancy Minimization for
Text-independent Forensic Speaker Verification [61.54074498090374]
本研究では,複数の音響環境下で収集したCRSS-Forensicsオーディオデータセットを紹介する。
我々は、VoxCelebデータを用いてCNNベースのネットワークを事前訓練し、次に、CRSS-Forensicsのクリーンな音声で高レベルのネットワーク層の一部を微調整するアプローチを示す。
論文 参考訳(メタデータ) (2020-09-05T02:54:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。