論文の概要: Benchmarking Spatial, Spectral, and Self-Supervised Cues for Face Forgery Detection under Realistic Degradation
- arxiv url: http://arxiv.org/abs/2609.01511v1
- Date: Tue, 01 Sep 2026 16:41:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.834585
- Title: Benchmarking Spatial, Spectral, and Self-Supervised Cues for Face Forgery Detection under Realistic Degradation
- Title(参考訳): 現実的劣化下における顔偽造検出のための空間・スペクトル・自己監督キューのベンチマーク
- Authors: Lucas Cunha, Lucas Sotomaior, Lucas Gasperin, Beatriz Caldas, Eduardo Pianovski, Rayson Laroca,
- Abstract要約: 本稿では,MFFI(Multi-dimensional Face Forgery Image)データセットを用いた顔偽造検出のための標準化されたベンチマークを提案する。
我々は、畳み込みネットワーク、トランスフォーマーベースモデル、凍結自己管理型DINOv3バックボーンを含む6つのモデルファミリを比較した。
RGB の Xception は 0.884 に達すると ROC-AUC となるが、ハードパーティションでは大幅に劣化する。
- 参考スコア(独自算出の注目度): 0.6619186532078049
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Face forgery detectors often achieve strong results on controlled benchmarks, but their reliability under realistic image degradations remains limited. This paper presents a standardized benchmark for face forgery detection using the Multi-Dimensional Face Forgery Image (MFFI) dataset and evaluates performance on both clean and degraded test partitions. We compare six model families, including convolutional networks, transformer-based models, and a frozen self-supervised DINOv3 backbone, across spatial, spectral, and hybrid input representations. The results show that clean-set performance is not a reliable indicator of robustness under compression, resizing, and blurring. Xception with RGB obtains the best clean performance, reaching 0.884 mean ROC-AUC, but degrades substantially on the harder partition. In contrast, frozen DINOv3 achieves the strongest degraded-set result, with 0.726 mean ROC-AUC, while training only a linear classification head. The representation analysis indicates that Fourier-domain cues are most useful when combined with RGB information, whereas purely spectral inputs consistently underperform spatial representations. Qualitative attribution maps further suggest that convolutional detectors focus on localized artifacts, while DINOv3 relies on broader facial structure. These findings reinforce the need for degraded evaluation protocols and highlight self-supervised visual representations as a promising direction for robust face forgery detection. Our source code is publicly available at https://github.com/lucasdocunha/FaceForgery-Benchmark/.
- Abstract(参考訳): 顔偽造検知器は、しばしば制御されたベンチマークで強い結果を得るが、現実的な画像劣化下での信頼性は依然として限られている。
本稿では,MFFI(Multi-dimensional Face Forgery Image)データセットを用いた顔偽造検出のための標準化されたベンチマークを提案し,クリーンかつ劣化したテストパーティションの性能評価を行う。
畳み込みネットワーク,トランスフォーマーベースモデル,凍結自己教師型DINOv3バックボーンを含む6つのモデルファミリを空間的,スペクトル的,ハイブリッドな入力表現で比較した。
その結果, クリーンセット性能は, 圧縮, リサイズ, ぼやけにおける堅牢性の信頼性指標ではないことがわかった。
RGB の Xception は 0.884 に達すると ROC-AUC となるが、ハードパーティションでは大幅に劣化する。
対照的に、凍結したDINOv3は、線形分類ヘッドのみを訓練しながら、0.726の平均ROC-AUCで最大の劣化セットを得る。
表現分析は、フーリエ領域のキューがRGB情報と組み合わせると最も有用であることを示し、一方純粋にスペクトル入力は空間表現を一貫して過小評価している。
定性的帰属地図はさらに、畳み込み検出器が局所化された人工物に焦点を当てていることを示唆し、一方DINOv3はより広い顔構造に依存している。
これらの知見は、劣化した評価プロトコルの必要性を強化し、堅牢な顔偽造検出のための有望な方向として自己監督型視覚表現を強調した。
私たちのソースコードはhttps://github.com/lucasdocunha/FaceForgery-Benchmark/で公開されています。
関連論文リスト
- Employing Vision-Language Models for Face Image Quality Assessment [0.023141219541346198]
顔画像品質評価(FIQA)はバイオメトリックパイプラインにおいて重要な制御ステップである。
最先端のFIQA法は高い実用性を達成するが、通常「ブラックボックス」として機能する
ゼロショット環境でFIQAを実行することにより,このギャップを埋めるため,市販のビジョンランゲージモデル(VLM)の可能性を検討する。
論文 参考訳(メタデータ) (2026-05-17T14:57:52Z) - HIR-ALIGN: Enhancing Hyperspectral Image Restoration via Diffusion-Based Data Generation [50.46910397782266]
ハイパスペクトル画像(HSI)の復元は、ノイズ、ぼかし、分解能損失などの劣化に悩まされるため、信頼性の高い解析に不可欠である。
本稿では,HIR-ALIGNを提案する。HIR-ALIGNは,限られたトレーニング画像と,ターゲット分布と密に一致した合成データとを付加して,ハイパースペクトル画像の復元を促進するための,プラグアンドプレイのターゲット適応型拡張フレームワークである。
論文 参考訳(メタデータ) (2026-05-13T14:14:13Z) - Practical Manipulation Model for Robust Deepfake Detection [55.2480439325792]
画像超解像領域において,より現実的な劣化モデルを構築した。
擬似フェイクの空間を、ポアソンブレンディング、より多様なマスク、ジェネレータアーティファクト、およびイントラクタを用いて拡張する。
DFDCデータセットとDFDCPデータセットでは、それぞれ3.51%$と6.21%$AUCが明らかに増加した。
論文 参考訳(メタデータ) (2025-06-05T15:06:16Z) - Understanding and Improving Training-Free AI-Generated Image Detections with Vision Foundation Models [68.90917438865078]
顔合成と編集のためのディープフェイク技術は、生成モデルに重大なリスクをもたらす。
本稿では,モデルバックボーン,タイプ,データセット間で検出性能がどう変化するかを検討する。
本稿では、顔画像のパフォーマンスを向上させるContrastive Blurと、ノイズタイプのバイアスに対処し、ドメイン間のパフォーマンスのバランスをとるMINDERを紹介する。
論文 参考訳(メタデータ) (2024-11-28T13:04:45Z) - AUPIMO: Redefining Visual Anomaly Detection Benchmarks with High Speed and Low Tolerance [0.562479170374811]
Per-IMage Overlap(PIMO)は、AUROCとAUPROの欠点に対処する新しいメトリクスである。
画像ごとのリコールの測定は、計算を単純化し、ノイズの多いアノテーションに対してより堅牢である。
実験の結果,PIMOは実用的優位性があり,性能の見識に乏しいことがわかった。
論文 参考訳(メタデータ) (2024-01-03T21:24:44Z) - Hierarchical Forgery Classifier On Multi-modality Face Forgery Clues [61.37306431455152]
我々は,HFC-MFFD (hierarchical Forgery for Multi-modality Face Forgery Detection) を提案する。
HFC-MFFDは、マルチモーダルシナリオにおけるフォージェリー認証を強化するために、堅牢なパッチベースのハイブリッド表現を学習する。
クラス不均衡問題を緩和し、さらに検出性能を高めるために、特定の階層的な顔偽造を提案する。
論文 参考訳(メタデータ) (2022-12-30T10:54:29Z) - Dense Label Encoding for Boundary Discontinuity Free Rotation Detection [69.75559390700887]
本稿では,分類に基づく比較的研究の少ない方法論について検討する。
我々は2つの側面でフロンティアを推し進めるための新しい手法を提案する。
航空画像のための大規模公開データセットの実験と視覚解析は,我々のアプローチの有効性を示している。
論文 参考訳(メタデータ) (2020-11-19T05:42:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。