論文の概要: An Explainable FFT-Based Spatial-Frequency Fusion Framework for Deepfake Detection
- arxiv url: http://arxiv.org/abs/2607.17441v1
- Date: Sun, 19 Jul 2026 23:45:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.467103
- Title: An Explainable FFT-Based Spatial-Frequency Fusion Framework for Deepfake Detection
- Title(参考訳): ディープフェイク検出のための説明可能なFFTに基づく空間周波数融合フレームワーク
- Authors: Pamela Kirui, Cho Hyuk, Qingzhong Liu, Haodi Jiang,
- Abstract要約: 近年の研究では、空間的特徴と周波数的特徴を組み合わせることで、独立して使用するよりも強い検出結果が得られることが示されている。
本稿では,Fast Fourier Transform (FFT) を用いた画像レベルの深度検出のためのマルチスケールクロスアテンションフレームワーク MSCA-FFT を提案する。
- 参考スコア(独自算出の注目度): 1.8549313085249324
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deepfake generation has raised growing concerns regarding digital media authenticity, misinformation, identity fraud, and public trust. Recent studies show that combining spatial and frequency features leads to stronger detection results than using independently. This paper presents MSCA-FFT, a Fast Fourier Transform (FFT)-based multi-scale cross-attention framework for image-level deepfake detection. The model combines a partially fine-tuned Xception spatial branch with an FFT-based frequency branch. The frequency branch processes the log-scaled FFT magnitude spectrum through shallow convolutional layers, avoiding inverse frequency-to-image reconstruction used in DCT-based pipelines. The spatial and frequency representations are refined by transformer encoders, fused through cross-attention, and passed to an MLP classifier for real/fake prediction. Experimental results show that MSCA-FFT achieves consistently higher performance than the DCT-based state-of-the-art spatial-frequency fusion method and the compared baseline models. The ablation study further indicates that the FFT-based frequency branch provides complementary spectral cues when fused with spatial features. In addition, FFT-based frequency analysis and Grad-CAM/LIME explanations show consistent evidence around manipulation-sensitive facial regions, including the eyes, mouth, nose, and facial boundaries.
- Abstract(参考訳): ディープフェイク生成は、デジタルメディアの真正性、誤報、身元確認詐欺、公的な信頼に関する懸念が高まっている。
近年の研究では、空間的特徴と周波数的特徴を組み合わせることで、独立して使用するよりも強い検出結果が得られることが示されている。
本稿では,Fast Fourier Transform(FFT)に基づく画像レベルの深度検出のためのマルチスケールクロスアテンションフレームワークであるMSCA-FFTを提案する。
このモデルは、部分的に微調整されたXセプション空間分岐とFFTベースの周波数分岐を組み合わせたものである。
周波数分岐は、浅い畳み込み層を通して対数スケールのFFTスペクトルを処理し、DCTベースのパイプラインで使用される逆周波数-画像再構成を避ける。
空間および周波数の表現は変換器エンコーダによって洗練され、クロスアテンションを通して融合され、実/フェイク予測のためにMPP分類器に渡される。
実験結果から,MSCA-FFTはDCTに基づく空間周波数融合法や比較ベースラインモデルよりも一貫した性能が得られた。
アブレーション研究は、FFTベースの周波数分岐が空間的特徴と融合した場合に相補的なスペクトル手がかりを与えることを示している。
さらに、FFTに基づく周波数分析とGrad-CAM/LIMEの説明は、目、口、鼻、顔の境界を含む、操作に敏感な顔領域に関する一貫した証拠を示している。
関連論文リスト
- PF-Trans: Physics-Embedded Frequency-Aware Transformer for Spectral Reconstruction [9.122692658405116]
高忠実度リモートセンシングスペクトル再構成のための物理埋め込み周波数対応変換器(PF-Trans)を提案する。
PF-Transは最先端のパフォーマンスを実現し、GF-5上海データセット上で最大48.50dBのピーク信号対雑音比(PSNR)を達成する。
論文 参考訳(メタデータ) (2026-06-09T03:34:34Z) - Adaptive Local Frequency Filtering for Fourier-Encoded Implicit Neural Representations [7.7579389797716365]
フーリエ符号化INRに対する適応型局所周波数フィルタリング法を提案する。
提案手法では,エンコードされたフーリエ成分を変調するために,空間的に変化するパラメータ $(mathbfx)$ を導入する。
2次元画像整合、3次元形状表現、スパースデータ再構成の実験は、提案手法が常に再現品質を向上させることを示す。
論文 参考訳(メタデータ) (2026-04-03T08:04:30Z) - Phase4DFD: Multi-Domain Phase-Aware Attention for Deepfake Detection [0.0]
本稿では,位相差の相互作用を明示的にモデル化する位相対応周波数領域ディープフェイク検出フレームワークを提案する。
提案手法は,Fast Fourier Transform (FFT) とLocal binary pattern (LBP) を用いて標準RGB入力を拡張し,微妙な合成アーティファクトを露呈する。
CIFAKEとDFFDのデータセットを用いた実験により,提案したフェーズ4DFDは,芸術空間および周波数に基づく検出器の状態よりも優れていた。
論文 参考訳(メタデータ) (2026-01-09T15:37:03Z) - Freqformer: Image-Demoiréing Transformer via Efficient Frequency Decomposition [83.40450475728792]
本稿では,Freqformerについて述べる。Freqformerは,ターゲット周波数分離による画像復号化に特化して設計されたトランスフォーマーベースのフレームワークである。
本手法は,モワールパターンを高周波数空間局在化テクスチャと低周波数スケールローバスト色歪みに明確に分割する有効な周波数分解を行う。
様々なデモアのベンチマーク実験により、Freqformerは、コンパクトなモデルサイズで最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2025-05-25T12:23:10Z) - F2former: When Fractional Fourier Meets Deep Wiener Deconvolution and Selective Frequency Transformer for Image Deblurring [8.296475046681696]
本稿では、空間周波数の統一表現であるFRFT(Fractional Fourier Transform)に基づく新しい手法を提案する。
提案手法の性能は,他のSOTA手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-09-03T17:05:12Z) - Frequency-Aware Deepfake Detection: Improving Generalizability through
Frequency Space Learning [81.98675881423131]
この研究は、目に見えないディープフェイク画像を効果的に識別できるユニバーサルディープフェイク検出器を開発するという課題に対処する。
既存の周波数ベースのパラダイムは、偽造検出のためにGANパイプラインのアップサンプリング中に導入された周波数レベルのアーティファクトに依存している。
本稿では、周波数領域学習を中心にしたFreqNetと呼ばれる新しい周波数認識手法を導入し、ディープフェイク検出器の一般化性を高めることを目的とする。
論文 参考訳(メタデータ) (2024-03-12T01:28:00Z) - Misalignment-Robust Frequency Distribution Loss for Image Transformation [51.0462138717502]
本稿では,画像強調や超解像といった深層学習に基づく画像変換手法における共通の課題に対処することを目的とする。
本稿では、周波数領域内における分布距離を計算するための、新しいシンプルな周波数分布損失(FDL)を提案する。
本手法は,周波数領域におけるグローバル情報の思慮深い活用により,トレーニング制約として実証的に有効であることが実証された。
論文 参考訳(メタデータ) (2024-02-28T09:27:41Z) - Adaptive Frequency Learning in Two-branch Face Forgery Detection [66.91715092251258]
本稿では、AFDと呼ばれる2分岐検出フレームワークにおいて、周波数情報を適応的に学習する手法を提案する。
我々は、固定周波数変換からネットワークを解放し、データおよびタスク依存の変換層でより良いパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-03-27T14:25:52Z) - Deep Frequency Filtering for Domain Generalization [55.66498461438285]
Deep Neural Networks(DNN)は、学習プロセスにおいて、いくつかの周波数成分を優先する。
本稿では、ドメイン一般化可能な特徴を学習するためのDeep Frequency Filtering (DFF)を提案する。
提案したDFFをベースラインに適用すると,ドメインの一般化タスクにおける最先端の手法よりも優れることを示す。
論文 参考訳(メタデータ) (2022-03-23T05:19:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。