論文の概要: Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry
- arxiv url: http://arxiv.org/abs/2608.01796v1
- Date: Mon, 03 Aug 2026 07:04:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.368087
- Title: Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry
- Title(参考訳): オーディオディープフェイク検出のためのマルチバックボーン自己監督アンサンブルと生成-検出非対称性のクロストラック解析
- Authors: Seunghyun Kim, Junghyun Kim, Jiyoung Woo,
- Abstract要約: 本稿では,ImageCLEF 2026 Audio Deepfake Detection and Generationタスクにおけるチーム"Go-To-Germany"の参加について述べる。
筆者らは, 被験者生成ディープフェイクの100%を検知し, 顕著な非対称性を示すクロストラック解析を行った。
本報告では, ホールドアウトオーガナイザの実際の記録に対して, 11.25%の偽陽性ギャップを, 展開の鍵となるオープンチャレンジとして報告する。
- 参考スコア(独自算出の注目度): 9.42962723864652
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper describes the participation of team "Go-To-Germany" in the ImageCLEF 2026 Audio Deepfake Detection and Generation task. Our detection system, built on a four-backbone self-supervised learning (SSL) ensemble combining WavLM-Large, Wav2Vec2-XLS-R-300M, ECAPA-TDNN, and x-vector representations, achieved a final score of 0.9522 on the official ImageCLEF 2026 evaluation, with perfect accuracy (1.0000) on participant-generated deepfakes and 0.8875 on the held-out organizer ground-truth real data. For the Generation sub-task, our official team submission, an F5-TTS v1 baseline processed with a uniform reverberation pass and submitted as a deliberate anti-forensic probe, ranked first with a final score of 0.4304 (word error rate (WER) 4.99%, character error rate (CER) 2.07%); details of our four-model program (GLM-TTS, F5-TTS, XTTS v2, CosyVoice3), from which the official entry was drawn, appear in the paper. We present a cross-track analysis revealing a pronounced asymmetry: our detection system identifies 100% of participant-generated deepfakes, while our official generation entry, despite ranking first in the Audio Generation sub-task and evading 61.4% and 56.2% of participant and organizer detectors, attains a Final Score of 0.4304 against 0.9522 on the Detection side. We further report falsification-based ablation experiments (LOSO 56-speaker cross-validation, three-region backbone geometry, bootstrap confidence intervals, and PCA analysis) that motivate our architectural-insurance hypothesis for multi-backbone SSL ensembling. We complement these results with five cross-track insights and five pre-registered falsification experiments connecting generation-side evasion to detection-side design decisions, and we openly report an 11.25% false-positive gap on held-out organizer real recordings as the principal open challenge for deployment.
- Abstract(参考訳): 本稿では,ImageCLEF 2026 Audio Deepfake Detection and Generationタスクにおけるチーム"Go-To-Germany"の参加について述べる。
我々の検出システムは,WavLM-Large, Wav2Vec2-XLS-R-300M, ECAPA-TDNN, およびxベクトル表現を組み合わせた4つのバックボーン型自己教師学習(SSL)アンサンブルに基づいて構築され, ImageCLEF 2026 評価において0.9522 の最終的なスコアを達成した。
提案する4モデルプログラム(GLM-TTS, F5-TTS, XTTS v2, CosyVoice3)の詳細は,本論文に記載されている。
我々の検出システムは100%の参加者生成ディープフェイクを識別する一方、私たちの公式なジェネレーションエントリは、オーディオジェネレーションサブタスクで第1位であり、参加者とオーガナイザ検出器の61.4%と56.2%を回避しているにもかかわらず、検出側の0.4304対0.9522のファイナルスコアを達成している。
さらに,フェーシフィケーションに基づくアブレーション実験(LOSO56話者クロスバリデーション,3領域バックボーン形状,ブートストラップ信頼区間,PCA解析)を報告する。
これらの結果を5つのクロストラックインサイトと5つの事前登録されたファルシフィケーション実験で補完し、生成側回避と検出側設計決定を結びつけるとともに、ホールドアウトオーガナイザの実際の録音に11.25%の偽陽性のギャップを、デプロイの鍵となるオープンチャレンジとしてオープンに報告する。
関連論文リスト
- Adversarial Deepfake Generation and an Investigation of Purification-Based Adversarial Detection [9.42962723864652]
本稿では,ImageCLEF 2026 Deepfake Detection and Generation Taskにおけるチーム"Go To Germany"の参加について述べる。
画像生成タスクでは、識別保存顔合成にFLUX.1-devとPuLIDを用いる。
画像検出タスクでは、AI生成画像のSigLIP+DINOv2と顔操作のGenD-DINOv3の2つの補完検出器を組み合わせる。
論文 参考訳(メタデータ) (2026-07-28T15:19:16Z) - SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification [0.0]
nsfaguardは、エージェントAIシステムを運用上の脅威から保護するためのガードレールフレームワークである。
まず,185種のリスク変異をCIA-Triad-grounded 階層に分類するNSFA分類について紹介する。
凍結したバックボーン上の識別的分類ヘッドと解釈可能なオフライン監査のためのSFTに基づく生成推論を組み合わせたデュアルモードアプローチを開発した。
論文 参考訳(メタデータ) (2026-07-13T07:28:45Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Explainable Deep Learning for Brain Tumor Classification: Comprehensive Benchmarking with Dual Interpretability and Lightweight Deployment [4.259927630334864]
この研究は、MRI画像から脳腫瘍を自動分類するための完全なディープラーニングシステムを提供する。
Inception-ResNet V2は最先端のパフォーマンスに達し、99.53%の精度を達成した。
このエンドツーエンドソリューションは、信頼できるAIの正確性、解釈可能性、デプロイ性を考慮している。
論文 参考訳(メタデータ) (2025-11-20T17:21:40Z) - MIRAGE: Agentic Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning [0.6475163438744868]
我々は、マルチモーダル検証を4つのシーケンシャルモジュールに分解する推論時モデルプラガブルエージェントフレームワークであるMIRAGEを提案する。
視覚的妥当性評価は、AI生成した画像を検出し、クロスモーダルな一貫性分析は、Webエビデンスにおけるアウト・オブ・コンテクストの再利用、検索強化された事実チェックの根拠を特定する。
MIRAGEは、ターゲットとするWeb検索、構造化された出力、引用リンクされた有理数を用いた視覚言語モデル推論をオーケストレーションする。
論文 参考訳(メタデータ) (2025-10-20T14:40:26Z) - When Fine-Tuning is Not Enough: Lessons from HSAD on Hybrid and Adversarial Audio Spoof Detection [3.7411108810335922]
音声検出は、音声認証、スマートアシスタント、通信セキュリティの課題である。
1,248のクリーンと41,044の劣化した発話を含むベンチマークを,人間,クローン,ゼロショットAI生成,ハイブリッドオーディオの4つのクラスに分けて提示する。
事前訓練されたモデルは、ハイブリッド条件下で過度に一般化および崩壊し、スプーフ特異的微調整は分離性を改善するが、目に見えない組成に苦しむ。
論文 参考訳(メタデータ) (2025-09-09T01:43:28Z) - Lie Detector: Unified Backdoor Detection via Cross-Examination Framework [68.45399098884364]
半正直な設定で一貫したバックドア検出フレームワークを提案する。
本手法は,SoTAベースラインよりも5.4%,1.6%,11.9%の精度で検出性能が向上する。
特に、マルチモーダルな大規模言語モデルにおいて、バックドアを効果的に検出するのは、これが初めてである。
論文 参考訳(メタデータ) (2025-03-21T06:12:06Z) - Whole-body Detection, Recognition and Identification at Altitude and
Range [57.445372305202405]
多様なデータセットに基づいて評価したエンドツーエンドシステムを提案する。
我々のアプローチでは、一般的な画像データセットで検出器を事前トレーニングし、BRIARの複雑なビデオや画像でそれを微調整する。
屋内・屋外・航空シナリオにおける様々な範囲や角度の異なる条件下で徹底的な評価を行う。
論文 参考訳(メタデータ) (2023-11-09T20:20:23Z) - Scenario Aware Speech Recognition: Advancements for Apollo Fearless
Steps & CHiME-4 Corpora [70.46867541361982]
本稿では、TRILLと呼ばれる三重項損失に基づく自己監督基準で訓練された一般的な非意味的音声表現について考察する。
我々は、Fearless Stepsの開発と評価のために、+5.42%と+3.18%の相対的なWER改善を観察した。
論文 参考訳(メタデータ) (2021-09-23T00:43:32Z) - G-DetKD: Towards General Distillation Framework for Object Detectors via
Contrastive and Semantic-guided Feature Imitation [49.421099172544196]
そこで本研究では,すべてのピラミッドレベルにまたがる特徴ペア間のソフトマッチングを自動的に行う,意味誘導型特徴模倣手法を提案する。
また,異なる特徴領域間の関係で符号化された情報を効果的に捉えるために,コントラスト蒸留を導入する。
本手法は,(1)フレームワークのコンポーネントを別々に使用した場合に,既存の検出KD技術よりも優れた性能を発揮する。
論文 参考訳(メタデータ) (2021-08-17T07:44:27Z) - FoolHD: Fooling speaker identification by Highly imperceptible
adversarial Disturbances [63.80959552818541]
話者識別モデルに対する知覚不能な摂動を発生させるホワイトボックス・ステガノグラフィーによる敵攻撃を提案する。
我々のアプローチであるFoolHDは、DCTドメインで動作するGated Convolutional Autoencoderを使用し、多目的損失関数で訓練されている。
我々は,VoxCelebを用いて訓練した250話者識別xベクトルネットワークを用いてFoolHDを検証する。
論文 参考訳(メタデータ) (2020-11-17T07:38:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。