論文の概要: Audio Deepfake Detection with Half-Truth Localisation Using Cross-Attentive Feature Fusion
- arxiv url: http://arxiv.org/abs/2605.29531v1
- Date: Thu, 28 May 2026 07:47:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:56.029763
- Title: Audio Deepfake Detection with Half-Truth Localisation Using Cross-Attentive Feature Fusion
- Title(参考訳): クロスアテンティブな特徴融合を用いた半トラック音像定位によるディープフェイク検出
- Authors: S. Sutharya, Remya K. Sasi,
- Abstract要約: CAFNetは3次分類(リアル、フルフェイク、ハーフトゥルース)を行い、合成された領域の時間的境界を1つの前方通過で遅らせる。
2値検出では、96.76%の精度と3.20%の誤差率(EER)を達成し、500倍以上のパラメータで微調整されたXLS-R 300M(78.31%)とAST 87M(93.03%)を上回っている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audio deepfake detection is well-studied as a binary problem, but partially manipulated speech, where a short synthesised segment is spliced into an otherwise genuine utterance, poses a harder and more realistic threat. Detecting such half-truth audio requires not only distinguishing it from real and fully fake speech, but also localising where the manipulation occurs. We present CAFNet, a 576k-parameter architecture that addresses both tasks jointly: it performs ternary classification (real, fully-fake, or half-truth) and regresses the temporal boundaries of the synthesised region in a single forward pass. CAFNet fuses Mel-Frequency Cepstral Coefficient (MFCC), Linear-Frequency Cepstral Coefficient (LFCC), and Chroma Short-Time Fourier Transform (Chroma-STFT) features through parallel depthwise-separable convolution branches with cross-attention, followed by a Bidirectional Long Short-Term Memory (BiLSTM) regression head for boundary prediction. On the combined Multi-Lingual Audio Deepfake Detection Corpus (MLADDC) T2+T3 test set, CAFNet achieves 92.71% accuracy and macro Area Under the Curve (AUC) of 0.9910, with boundary localisation Mean Absolute Error (MAE) of 0.075s and a median error of 0.052s. On binary detection, it achieves 96.76% accuracy and 3.20% Equal Error Rate (EER), outperforming fine-tuned XLS-R 300M (78.31%) and AST 87M (93.03%) at over 500 times fewer parameters. A cross-dataset study further shows that standard fine-tuning collapses cross-domain representations even under reduced backbone learning rates.
- Abstract(参考訳): 音声のディープフェイク検出は二分問題としてよく研究されているが、部分的に操作された音声では、短い合成されたセグメントが真の発話にスプライシングされ、より困難で現実的な脅威となる。
このような半真正な音声を検出するには、実際の音声と完全に偽の音声とを区別するだけでなく、操作の場所をローカライズする必要がある。
CAFNetは,3次分類(実数,完全フェイク,半実数)を行い,合成領域の時間的境界を1つの前方通過で補強する576kパラメータアーキテクチャである。
CAFNetは、Mel-Frequency Cepstral Coefficient(MFCC)、LFCC(Linear-Frequency Cepstral Coefficient)、Chroma Short-Time Fourier Transform(Chroma-STFT)を、相互アテンションを持つ並列的に分離可能な畳み込み枝を通じて融合し、次いで境界予測のための双方向長短短期記憶(BiLSTM)回帰ヘッドを伴って、Mel-Frequency Cepstral Coefficient(MFCC)、Chroma Short-Time Fourier Transform(Chroma-STFT)を融合する。
MLADDC(Multi-Lingual Audio Deepfake Detection Corpus)とT2+T3(Multi-Lingual Audio Deepfake Detection Corpus)を組み合わせたテストセットでは、CAFNetは92.71%の精度とマクロ領域を0.9910で達成し、境界ローカライゼーションの平均絶対誤差(MAE)は0.075s、中央誤差は0.052sである。
2値検出では、96.76%の精度と3.20%の誤差率(EER)を達成し、500倍以上のパラメータで微調整されたXLS-R 300M(78.31%)とAST 87M(93.03%)を上回っている。
クロスデータセット研究により、標準的な微調整は、バックボーン学習率の低下の下でも、クロスドメイン表現を分解することが示された。
関連論文リスト
- Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - TIE: Time Interval Encoding for Video Generation over Events [50.66585165263848]
ディレクタースタイルのプロンプト、ロボットアクション予測、インタラクティブなビデオエージェントは、同時イベントに対する時間的根拠を要求する。
現代のビデオジェネレータは、ポイントワイドな位置エンコーディングを通して、タイムを離散的なポイントとして表現する。
Time Interval TIEは、プラグイン・アンド・プレイ・インターバル・アウェアの一般化である。
論文 参考訳(メタデータ) (2026-05-11T13:23:14Z) - CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling [46.16066322190728]
完全連続配列混合アーキテクチャであるCAWN(Continuous Acoustic Wave Network)を導入する。
CAWNは離散行列ベースの注意を代わりに、多面体複素ドメインファサーに隠された状態を計画している。
超長コンテキスト上での信号劣化を防止するため,デュアルゲート選択位相共振機構を導入する。
論文 参考訳(メタデータ) (2026-04-05T20:13:22Z) - Time-Series at the Edge: Tiny Separable CNNs for Wearable Gait Detection and Optimal Sensor Placement [3.7765281299298015]
我々は,3軸加速度の短い窓から発生するパーキンソン病(PD)の歩行検出のためのデバイス上での時系列解析について検討した。
1つの文献ベースライン(分離可能な畳み込み)と2つのウルトラライトモデル(純粋に分離可能なもの)である。
論文 参考訳(メタデータ) (2025-11-29T08:52:41Z) - Cross-Attention with Confidence Weighting for Multi-Channel Audio Alignment [5.380078543698624]
マルチチャンネルオーディオアライメントは、生体音響モニタリング、空間オーディオシステム、音響ローカライゼーションにおいて重要な要件である。
マルチチャンネル音声同期を改善するために,クロスアテンション機構と信頼度重み付けスコアリングを組み合わせた手法を提案する。
提案手法は,BioDCASE 2025 Task 1 チャレンジにおいて,ディープラーニングベースラインの 0.58 に対して,テストデータセットの平均 0.30 MSE で1位となった。
論文 参考訳(メタデータ) (2025-09-21T05:14:06Z) - FCPE: A Fast Context-based Pitch Estimation Model [10.788664167503676]
本稿では,低計算コストと頑健な耐雑音性を維持しつつ,メルスペクトルの特徴を捉える高速な文脈ベースピッチ推定モデルを提案する。
実験の結果,MIR-1Kデータセット上で96.79%のRAW Pitch Accuracy(RPA)が達成された。
論文 参考訳(メタデータ) (2025-09-18T16:50:09Z) - Consistency Trajectory Models: Learning Probability Flow ODE Trajectory of Diffusion [56.38386580040991]
Consistency Trajectory Model (CTM) は Consistency Models (CM) の一般化である
CTMは、対戦訓練とスコアマッチング損失を効果的に組み合わせることで、パフォーマンスを向上させる。
CMとは異なり、CTMのスコア関数へのアクセスは、確立された制御可能/条件生成メソッドの採用を合理化することができる。
論文 参考訳(メタデータ) (2023-10-01T05:07:17Z) - Global Context Aggregation Network for Lightweight Saliency Detection of
Surface Defects [70.48554424894728]
我々は,エンコーダ・デコーダ構造上の表面欠陥を簡易に検出するためのGCANet(Global Context Aggregation Network)を開発した。
まず、軽量バックボーンの上部層に新しいトランスフォーマーエンコーダを導入し、DSA(Depth-wise Self-Attention)モジュールを通じてグローバルなコンテキスト情報をキャプチャする。
3つの公開欠陥データセットの実験結果から,提案したネットワークは,他の17の最先端手法と比較して,精度と実行効率のトレードオフを良好に達成できることが示された。
論文 参考訳(メタデータ) (2023-09-22T06:19:11Z) - Structure-Aware Long Short-Term Memory Network for 3D Cephalometric
Landmark Detection [37.031819721889676]
本研究では,3次元ランドマーク検出のための構造対応長短期記憶フレームワーク(SA-LSTM)を提案する。
SA-LSTMは、まず、ダウンサンプリングCBCTボリューム上の熱マップ回帰によって粗いランドマークを見つける。
その後、高解像度の収穫パッチを使用して、注意深いオフセット回帰によってランドマークを徐々に洗練する。
実験の結果,提案手法は効率と精度で最先端の手法よりも優れていた。
論文 参考訳(メタデータ) (2021-07-21T06:35:52Z) - Sequential End-to-End Intent and Slot Label Classification and
Localization [2.1684857243537334]
エンドツーエンド(e2e)の音声言語理解(SLU)ソリューションが最近提案されている。
本稿では,音声信号のチャンクを連続処理して意図とスロット値を予測する,ストリーミングシナリオのためのコンパクトなe2e SLUアーキテクチャを提案する。
その結果,CTC 98.97 %,CTL 98.78 % に到達した音声信号の処理能力が得られた。
論文 参考訳(メタデータ) (2021-06-08T19:53:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。