論文の概要: GAP-SAM: A Global Artifact Prior for Generalizable AI-Generated Image Manipulation Localization
- arxiv url: http://arxiv.org/abs/2608.20929v1
- Date: Fri, 21 Aug 2026 09:49:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.499965
- Title: GAP-SAM: A Global Artifact Prior for Generalizable AI-Generated Image Manipulation Localization
- Title(参考訳): GAP-SAM:AI生成画像の汎用化に先立つグローバルアーティファクト
- Abstract要約: ソースイメージのCannyエッジと深度マップを用いてCOCO-ControlNetを構築し、セマンティクスと幾何学を整合させ、複数のローカライザ間でのOOD性能を向上させる。
また、細調整されたセグメンテーションモデルでは、真の操作境界ではなく、意味オブジェクトの輪郭に予測をスナップする。
GAP-SAMは画像とその凍結されたVAE再構成をグローバルアーティファクトトークンにエンコードし、ピクセル復号の前にゼロゲートFiLMを介してSAM3の特徴ピラミッドに注入する。
- 参考スコア(独自算出の注目度): 15.115841637929895
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI-generated image manipulation localization identifies edited pixels, but its OOD performance lags behind image-level detection partly because pixel supervision entangles forensic evidence with dataset-specific mask geometry and semantic boundaries. Extending image-level distribution alignment to localization, we construct COCO-ControlNet with source-image Canny edges and depth maps to align semantics and geometry, improving OOD performance across multiple localizers. Yet tighter Mask-VAE Reconstruction Alignment (Mask-VAE) underperforms COCO-ControlNet, showing that VAE reconstruction artifacts transfer poorly to local diffusion-inpainting artifacts. We also identify \emph{boundary adhesion}, where fine-tuned segmentation models snap predictions to semantic object contours rather than true manipulation boundaries. These findings motivate GAP-SAM, which encodes an image and its frozen VAE reconstruction into a global artifact token and injects it into SAM3's feature pyramid via zero-gated FiLM before pixel decoding. Without prescribing a spatial region, this token modulates dense decoding to preserve localization while suppressing semantic-boundary shortcuts. Across six datasets, GAP-SAM averages 79.8 Pixel-F1, outperforming the strongest prior method by 12.6 points. It also performs best at every tested severity of JPEG compression, Gaussian blur, and resizing.
- Abstract(参考訳): AIによって生成された画像操作のローカライゼーションは、編集されたピクセルを識別するが、OODのパフォーマンスは、画像レベルの検出に遅れている。
画像レベルの分布アライメントをローカライズに拡張し、ソースイメージのCannyエッジと深度マップを用いてCOCO-ControlNetを構築し、セマンティクスと幾何学を整列させ、複数のローカライザ間のOOD性能を改善した。
さらにMask-VAEレコンストラクションアライメント(Mask-VAE)はCOCO-ControlNetを弱め、VAEレコンストラクションアーティファクトが局所拡散塗布アーティファクトに乏しいことを示す。
また、細調整されたセグメンテーションモデルが真の操作境界ではなくセマンティックオブジェクトの輪郭を予測する「emph{boundary adhesion}」も同定する。
これらの発見はGAP-SAMを動機付け、画像とその凍結されたVAE再構成をグローバルアーティファクトトークンにエンコードし、ピクセル復号の前にゼロゲートFiLMを介してSAM3の特徴ピラミッドに注入する。
空間領域を規定することなく、このトークンは、意味境界のショートカットを抑えながら、局所性を維持するために高密度な復号を変調する。
6つのデータセットで、GAP-SAMの平均は79.8 Pixel-F1であり、最強の先行手法を12.6ポイント上回っている。
また、JPEG圧縮、ガウスのぼかし、リサイズでテストされたすべての重大度で最高に機能する。
関連論文リスト
- FUSED: Forensic-Semantic Mixture-of-Experts for AI Inpainting Detection and Localization [14.056602265859645]
拡散ベースの塗装モデルは、画像の局所的な部分だけを変更する。
多くのAIイメージ検出器は、グローバルアーティファクトに依存し、ローカライズしない。
FUSEDは,AIによるインペイントの同時検出と局所化のための統合フレームワークである。
論文 参考訳(メタデータ) (2026-08-28T13:05:43Z) - SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization [64.6372217552272]
公開編集データセットには、IMLトレーニングサンプルと構造的に同一(オリジナル、編集)のペアが数百万個含まれており、ピクセルレベルのマスクのみが欠如している。
本稿では,視覚基盤のバックボーンにおいて意味・特徴の相違を行うSIGMAを提案する。
1.1M IMLトレーニングセットを生成し、5つのデータセットに対して+18.34%のF1で6つの多様な検出器を改善する。
論文 参考訳(メタデータ) (2026-05-27T03:55:13Z) - From Semantics to Pixels: Coarse-to-Fine Masked Autoencoders for Hierarchical Visual Understanding [31.516613298007005]
C2FMAEは粗いマスク付きオートエンコーダで、3つのデータ粒度にわたる階層的な視覚表現を明示的に学習する。
我々は,C2FMAEが画像分類,オブジェクト検出,セマンティックセグメンテーションにおいて顕著な性能向上を実現していることを示す。
論文 参考訳(メタデータ) (2026-03-10T17:51:12Z) - Gaussian Masked Autoencoders [74.2341070024126]
本稿では,Masked Autoencoders (MAE) をガウススプラッティングで探索する。
GMAE(Gaussian Masked Autoencoder)と呼ばれる我々のアプローチは,意味論的抽象化と空間的理解を共同で学習することを目的としている。
論文 参考訳(メタデータ) (2025-01-06T18:59:57Z) - Pixel-Inconsistency Modeling for Image Manipulation Localization [59.968362815126326]
デジタル画像法医学は、画像認証と操作のローカライゼーションにおいて重要な役割を果たす。
本稿では,画素不整合アーチファクトの解析を通じて,一般化されたロバストな操作ローカライゼーションモデルを提案する。
実験により,本手法は固有の画素不整合偽指紋を抽出することに成功した。
論文 参考訳(メタデータ) (2023-09-30T02:54:51Z) - In-Domain GAN Inversion for Faithful Reconstruction and Editability [132.68255553099834]
ドメイン誘導型ドメイン正規化とエンコーダで構成されたドメイン内GANインバージョンを提案し、事前学習されたGANモデルのネイティブ潜在空間における反転コードを正規化する。
エンコーダ構造,開始反転点,および逆パラメータ空間の効果を総合的に解析し,再構成品質と編集特性とのトレードオフを観察する。
論文 参考訳(メタデータ) (2023-09-25T08:42:06Z) - iEdit: Localised Text-guided Image Editing with Weak Supervision [53.082196061014734]
テキスト誘導画像編集のための新しい学習法を提案する。
ソースイメージに条件付けされた画像とテキスト編集プロンプトを生成する。
画像の忠実度、CLIPアライメントスコア、および生成された画像と実際の画像の両方を定性的に編集する点において、画像に対して好ましい結果を示す。
論文 参考訳(メタデータ) (2023-05-10T07:39:14Z) - CoupAlign: Coupling Word-Pixel with Sentence-Mask Alignments for
Referring Image Segmentation [104.5033800500497]
画像セグメント化の参照は、自然言語文で記述された視覚オブジェクトのすべてのピクセルをローカライズすることを目的としている。
以前の作業では、参照オブジェクトをハイライトするために、文章の埋め込みとピクセルレベルの埋め込みを簡単に調整することを学びました。
単純で効果的なマルチレベル視覚系列アライメント法であるCoupAlignを提案する。
論文 参考訳(メタデータ) (2022-12-04T08:53:42Z) - An Empirical Method to Quantify the Peripheral Performance Degradation
in Deep Networks [18.808132632482103]
畳み込みニューラルネットワーク(CNN)カーネルは、各畳み込み層に結合する。
より深いネットワークとストライドベースのダウンサンプリングを組み合わせることで、この領域の伝播は、画像の無視できない部分をカバーすることができる。
我々のデータセットは、高解像度の背景にオブジェクトを挿入することで構築され、画像境界に対してターゲットオブジェクトを特定の位置に配置するサブイメージを収穫することができる。
マスクR-CNNの動作を目標位置の選択にわたって探索することにより、画像境界付近、特に画像コーナーにおいて、パフォーマンス劣化の明確なパターンが明らかになる。
論文 参考訳(メタデータ) (2020-12-04T18:00:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。