論文の概要: FUSED: Forensic-Semantic Mixture-of-Experts for AI Inpainting Detection and Localization
- arxiv url: http://arxiv.org/abs/2608.28302v1
- Date: Fri, 28 Aug 2026 13:05:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.336373
- Title: FUSED: Forensic-Semantic Mixture-of-Experts for AI Inpainting Detection and Localization
- Title(参考訳): FUSED:AI Inpainting DetectionとLocalizationのためのForensic-Semantic Mixture-of-Experts
- Authors: Anton Nuzhdin, Marcel Worring, Ivona Najdenkoska,
- Abstract要約: 拡散ベースの塗装モデルは、画像の局所的な部分だけを変更する。
多くのAIイメージ検出器は、グローバルアーティファクトに依存し、ローカライズしない。
FUSEDは,AIによるインペイントの同時検出と局所化のための統合フレームワークである。
- 参考スコア(独自算出の注目度): 14.056602265859645
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Diffusion-based inpainting models modify only a localized part of an image, while many AI-image detectors rely on global artifacts and do not localize. These artifacts vary across generators, limiting detector transfer under distribution shifts. Recent work shows that restoring the authentic pixels outside the inpainted region removes these cues and can degrade pretrained detectors. To address this, we present FUSED, a unified framework for the joint detection and localization of AI-generated inpainting. FUSED combines low-level forensic cues with high-level semantic features using a sparsely-gated Mixture-of-Experts architecture, enabling the model to adaptively prioritize the most relevant signal for each token. For each input, FUSED predicts both an image-level manipulation score and a pixel-level mask of the inpainted area. On the OpenSDID cross-generator benchmark, FUSED achieves the best average detection and localization, with the largest gains on unseen generators. The same model transfers directly to the held-out AutoSplice and CocoGlide benchmarks, more than doubling localization performance. Evaluating each held-out benchmark with and without the global generator artifact further shows that all evaluated methods, ours included, partly read the artifact as evidence of manipulation, and FUSED remains the strongest under both conditions. Code and pretrained models are available at https://github.com/AntonNuzhdin/FUSED.
- Abstract(参考訳): 拡散ベースの塗装モデルは画像の局所的な部分だけを修正し、多くのAIイメージ検出器はグローバルなアーティファクトに依存し、ローカライズしない。
これらのアーティファクトは発電機によって異なり、分散シフトの下で検出器の移動を制限する。
最近の研究は、塗装された領域の外にある真正のピクセルを復元することで、これらの手がかりを取り除き、事前訓練された検出器を分解できることを示している。
そこで本稿では,AIによるインペイントの同時検出と局所化のための統合フレームワークであるFUSEDを提案する。
FUSEDは、低レベルの法学的な手がかりと高レベルのセマンティックな特徴を疎結合のMixture-of-Expertsアーキテクチャで組み合わせることで、各トークンに対して最も関連性の高いシグナルを適応的に優先順位付けすることができる。
各入力に対して、FUSEDは画像レベルの操作スコアと塗装領域の画素レベルのマスクの両方を予測する。
OpenSDIDクロスジェネレータベンチマークでは、FUSEDが最高の平均検出とローカライゼーションを実現し、目に見えないジェネレータで最大のゲインを得た。
同じモデルは、ローカライゼーション性能を2倍にするのではなく、保留中のAutoSpliceとCocoGlideのベンチマークに直接転送する。
各ホールドアウトベンチマークをグローバル・ジェネレータ・アーティファクトで評価すると、評価対象のすべての方法、そのうちの1つは操作の証拠としてアーティファクトを部分的に読み取ることであり、FUSEDはどちらの条件でも最強である。
コードと事前訓練されたモデルはhttps://github.com/AntonNuzhdin/FUSED.comで入手できる。
関連論文リスト
- GAP-SAM: A Global Artifact Prior for Generalizable AI-Generated Image Manipulation Localization [15.115841637929895]
ソースイメージのCannyエッジと深度マップを用いてCOCO-ControlNetを構築し、セマンティクスと幾何学を整合させ、複数のローカライザ間でのOOD性能を向上させる。
また、細調整されたセグメンテーションモデルでは、真の操作境界ではなく、意味オブジェクトの輪郭に予測をスナップする。
GAP-SAMは画像とその凍結されたVAE再構成をグローバルアーティファクトトークンにエンコードし、ピクセル復号の前にゼロゲートFiLMを介してSAM3の特徴ピラミッドに注入する。
論文 参考訳(メタデータ) (2026-08-21T09:49:58Z) - LoRC: Detecting AI-Generated Images via Low-Rank Collapse in Semantic Residuals [50.157719466558696]
現代の発電機は, セマンティック・残留部分空間において, 支配的なセマンティックな方向を保ちながら, 低ランクの崩壊を示すことを示す。
崩壊した残余幾何を捉えるために意味的優位性を分離するフレームワークである textbfLoRC を提案する。
本手法は,複数のベンチマークで平均7.0%の精度向上を実現し,39個の未知のジェネレータ上で97.0%の精度を実現する。
論文 参考訳(メタデータ) (2026-08-21T08:58:47Z) - Unveiling Perceptual Artifacts: A Fine-Grained Benchmark for Interpretable AI-Generated Image Detection [95.08316274158165]
X-AIGDは、低レベルの歪み、高レベルの意味論、認知レベルの反事実など、知覚的アーティファクトのピクセルレベルの分類されたアノテーションを提供する。
既存のAIGI検出器は、最も基本的な歪みレベルであっても、知覚的アーティファクトに依存しない。
モデル注意をアーティファクト領域と明確に整合させることは、検出器の解釈可能性と一般化を高めることができる。
論文 参考訳(メタデータ) (2026-01-27T10:09:17Z) - Zooming In on Fakes: A Novel Dataset for Localized AI-Generated Image Detection with Forgery Amplification Approach [69.01456182499486]
textbfBR-Genは、さまざまなシーン認識アノテーションを備えた15万のローカル鍛造イメージの大規模なデータセットである。
textbfNFA-ViTはノイズ誘導フォージェリ増幅ビジョン変換器で、ローカライズされたフォージェリの検出を強化する。
論文 参考訳(メタデータ) (2025-04-16T09:57:23Z) - Rethinking the Up-Sampling Operations in CNN-based Generative Network
for Generalizable Deepfake Detection [86.97062579515833]
我々は、アップサンプリング操作から生じる一般化された構造的アーティファクトをキャプチャし、特徴付ける手段として、NPR(Neighboring Pixel Relationships)の概念を紹介した。
tft28の異なる生成モデルによって生成されたサンプルを含む、オープンワールドデータセット上で包括的な分析を行う。
この分析は、新しい最先端のパフォーマンスを確立し、既存の手法よりも優れたtft11.6%の向上を示している。
論文 参考訳(メタデータ) (2023-12-16T14:27:06Z) - Weakly-supervised deepfake localization in diffusion-generated images [4.548755617115687]
本稿では,Xception ネットワークをバックボーンアーキテクチャとして用いた弱教師付きローカライズ問題を提案する。
本研究では,(局所スコアに基づく)最良動作検出法は,データセットやジェネレータのミスマッチよりも,より緩やかな監視に敏感であることを示す。
論文 参考訳(メタデータ) (2023-11-08T10:27:36Z) - TruFor: Leveraging all-round clues for trustworthy image forgery
detection and localization [17.270110456445806]
TruForは、さまざまなイメージ操作方法に適用可能な、法医学的なフレームワークである。
変換器をベースとした融合アーキテクチャにより,高レベルのトレースと低レベルのトレースの両方を抽出する。
当社の手法は,安価なフェイクとディープフェイク操作の両方を確実に検出し,ローカライズすることができる。
論文 参考訳(メタデータ) (2022-12-21T11:49:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。