論文の概要: DBCF: Dual-Branch Complementary Fusion of Foundation Models for Generalized Deepfake Detection
- arxiv url: http://arxiv.org/abs/2609.34720v1
- Date: Mon, 28 Sep 2026 09:26:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 03:25:56.749738
- Title: DBCF: Dual-Branch Complementary Fusion of Foundation Models for Generalized Deepfake Detection
- Title(参考訳): DBCF: 一般化ディープフェイク検出のための基礎モデルの二重分岐補間融合
- Abstract要約: 偽造検出モデルは 様々な領域をまたいだ一般化と 目に見えない操作に苦慮する
本稿では,相補的な事前学習表現を統合した階層型多粒度フレームワークを提案する。
提案手法は,より包括的な偽造表現を学習し,高い操作性能を実現する。
- 参考スコア(独自算出の注目度): 43.58339450050692
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As image generation and editing technologies have progressed substantially, facial forgeries pose significant challenges to privacy and public safety. Due to limited ability to capture forgery cues, existing small-scale forgery detection models often struggle to generalize across various domains and unseen manipulations. To address this limitation, researchers have turned to large-scale foundation models, which can provide richer representations and better generalization. Nevertheless, relying on a single foundation model alone remains insufficient for effective forgery detection. While models like CLIP offer robust global semantic cues, they lack the capacity to capture detailed local facial features. In contrast, DINO excels at capturing local structural features of faces, but provides weaker global semantic context. To fully utilize the synergies among multiple foundation models, we propose a hierarchical multi-granular framework that integrates complementary pretrained representations. Specifically, a Global Context Branch (GCB) based on CLIP captures holistic semantic cues, while a Fine-grained Cue Branch (FCB) built on DINOv3 captures localized structural irregularities. In addition, we design a feature fusion module that enables parameter-efficient adaptation of the frozen foundation backbones by adaptively extracting and integrating complementary features from the two models. By jointly leveraging global context and fine-grained cues, our method learns more comprehensive forgery representations and achieves strong cross-manipulation performance. Extensive experiments on multiple benchmarks demonstrate the benefit of the proposed design, particularly under cross-dataset and cross-manipulation settings.
- Abstract(参考訳): 画像生成と編集技術が大幅に進歩するにつれて、顔の偽造はプライバシーと公衆の安全に重大な課題をもたらす。
偽造の手がかりを捕捉する能力が限られているため、既存の小規模な偽造検出モデルは、様々な領域をまたいで一般化し、目に見えない操作を行うのに苦労することが多い。
この制限に対処するため、研究者はよりリッチな表現とより良い一般化を提供する大規模な基礎モデルに転換した。
それでも、単一の基盤モデルのみに依存することは、効果的な偽造検出には不十分である。
CLIPのようなモデルは、堅牢なグローバルセマンティックキューを提供するが、詳細なローカルな顔の特徴をキャプチャする能力は欠如している。
対照的に、DINOは顔の局所的な構造的特徴を捉えるのに優れているが、より弱いグローバルな意味的文脈を提供する。
複数の基礎モデル間の相乗効果を十分に活用するために,相補的な事前学習表現を統合する階層型多粒度フレームワークを提案する。
具体的には、CLIPに基づくGlobal Context Branch(GCB)が全体論的意味的手がかりをキャプチャし、DINOv3上に構築されたきめ細かいCue Branch(FCB)が局所的な構造的不規則をキャプチャする。
さらに,2つのモデルから相補的特徴を適応的に抽出,統合することにより,凍結基盤骨のパラメータ効率の良い適応を可能にする機能融合モジュールを設計する。
グローバルコンテキストと微粒なキューを協調的に活用することにより,より包括的な偽造表現を学習し,高い操作性能を実現する。
複数のベンチマークでの大規模な実験は、特にクロスデータセットとクロスマニピュレーション設定下で、提案された設計の利点を示している。
関連論文リスト
- Toward Generalizable Deblurring: Leveraging Massive Blur Priors with Linear Attention for Real-World Scenarios [9.82847623835017]
GLOWDeblurは、畳み込みベースの事前再構成とドメインアライメントモジュールと軽量な拡散バックボーンを組み合わせた、一般化可能なreaL-wOrld Light Weight Deblurモデルである。
本稿では,Blur Pattern Pretraining (BPP)を提案する。
我々はさらに、高度劣化下でぼやけた前兆を強化するためにMoSeG(MoSeG)を導入し、それをGLOWDeblur(GLOWDeblur)に統合する。
論文 参考訳(メタデータ) (2026-01-10T11:01:31Z) - Toward Stable Semi-Supervised Remote Sensing Segmentation via Co-Guidance and Co-Fusion [31.189038928192648]
Co2Sは半教師付きRSセグメンテーションフレームワークで、ビジョン言語モデルと自己教師型モデルとを融合する。
テキスト埋め込みと学習可能なクエリを利用した,明示的でシンプルなセマンティックコガイダンス機構が導入された。
6つの一般的なデータセットに対する実験は,提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2025-12-28T18:24:19Z) - UAGLNet: Uncertainty-Aggregated Global-Local Fusion Network with Cooperative CNN-Transformer for Building Extraction [83.48950950780554]
リモートセンシング画像からの抽出は、複雑な構造変化のために難しい課題である。
既存の方法は、セグメンテーションモデルにおけるマルチスケール特徴をキャプチャするために、畳み込みブロックまたは自己アテンションブロックを使用する。
高品質なグローバルローカルなビジュアルセマンティクスを活用するために,不確実性集約型グローバルローカルフュージョンネットワーク(UAGLNet)を提案する。
論文 参考訳(メタデータ) (2025-12-15T02:59:16Z) - MFCLIP: Multi-modal Fine-grained CLIP for Generalizable Diffusion Face Forgery Detection [64.29452783056253]
フォトリアリスティック・フェイスジェネレーション手法の急速な発展は、社会やアカデミックにおいて大きな関心を集めている。
既存のアプローチは主に画像モダリティを用いて顔の偽造パターンをキャプチャするが、きめ細かいノイズやテキストのような他のモダリティは完全には探索されていない。
そこで本研究では,画像ノイズの多点にわたる包括的かつきめ細かなフォージェリートレースをマイニングする,MFCLIP(MF-modal Fine-fine-fine-fine-fine-fine CLIP)モデルを提案する。
論文 参考訳(メタデータ) (2024-09-15T13:08:59Z) - GM-DF: Generalized Multi-Scenario Deepfake Detection [49.072106087564144]
既存の偽造検出は、通常、単一のドメインでのトレーニングモデルのパラダイムに従う。
本稿では,複数の顔偽造検出データセットを共同で訓練した場合のディープフェイク検出モデルの一般化能力について詳しく検討する。
論文 参考訳(メタデータ) (2024-06-28T17:42:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。