論文の概要: Impostor: An Agent-Curated Benchmark for Realistic AIGC Manipulation Localization
- arxiv url: http://arxiv.org/abs/2606.04545v1
- Date: Wed, 03 Jun 2026 07:27:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-04 20:44:18.604776
- Title: Impostor: An Agent-Curated Benchmark for Realistic AIGC Manipulation Localization
- Title(参考訳): Impostor: AIGC操作ローカライゼーションのためのエージェントキュレートベンチマーク
- Abstract要約: 高品質なAI編集画像操作ローカライゼーションデータセットであるImpostorを紹介した。
Impostorは、シーン認識、編集計画、操作実行、品質検証、反復リフレクションを統合するクローズドループエージェントフレームワークであるCraftAgentによって構築されている。
本研究では,局所的な位相モデリングと意味論的整合性学習を導入し,意味論的に検証可能なが法学的に乱された領域をよりよくローカライズする意味情報ネットワーク(PANet)を提案する。
- 参考スコア(独自算出の注目度): 45.52738316793005
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in generative image editing have improved the realism and controllability of localized image manipulation, raising new challenges for image manipulation detection and localization (IMDL). However, existing IMDL benchmarks still have limitations in visual realism, manipulation diversity, and generator coverage, making it difficult to reflect recent trends in image manipulation. To address these limitations, we introduce Impostor, a high-quality AI-edited image manipulation localization dataset containing 100K manipulated images. Impostor is constructed by CraftAgent, a closed-loop agent framework that integrates scene perception, editing planning, manipulation execution, quality validation, and iterative reflection to automatically generate diverse and visually realistic manipulated images. Moreover, Impostor contains images generated by seven recent AIGC models across three manipulation types and includes multiple manipulated regions, providing a more comprehensive benchmark for AIGC-based IMDL. Furthermore, we propose PhaseAware-Net (PANet), a semantic-forensic framework that introduces local phase modeling and semantic-forensic consistency learning to better localize semantically plausible yet forensically disrupted manipulated regions. Extensive experiments show that Impostor poses significant challenges to existing large vision-language models (LVLMs) and specialized IMDL methods, while PANet achieves superior performance on Impostor and multiple public benchmarks.
- Abstract(参考訳): 近年、画像編集の進歩により、局所的な画像操作の現実性と制御性が向上し、画像操作検出と局所化(IMDL)の新たな課題が提起されている。
しかし、既存のIMDLベンチマークには、視覚リアリズム、操作の多様性、ジェネレータのカバレッジに制限があるため、最近の画像操作の傾向を反映することは困難である。
これらの制限に対処するために、100Kの操作された画像を含む高品質なAI編集画像操作ローカライゼーションデータセットであるImpostorを紹介した。
Impostorは、シーン認識、編集計画、操作実行、品質検証、反復リフレクションを統合するクローズドループエージェントフレームワークであるCraftAgentによって構築され、多彩で視覚的に操作されたイメージを自動的に生成する。
さらに、Impostorには、3つの操作タイプにわたる7つの最新のAIGCモデルによって生成されたイメージが含まれており、複数の操作されたリージョンが含まれており、AIGCベースのIMDLのより包括的なベンチマークを提供する。
さらに、局所位相モデリングと意味法則整合学習を導入し、意味論的に検証可能なが、法学的に乱された操作領域のローカライズを向上する意味法学フレームワークであるPyseAware-Net(PANet)を提案する。
大規模な実験により、Impostorは既存の大規模視覚言語モデル(LVLM)と特殊なIMDLメソッドに重大な課題を呈し、PANetはImpostorと複数の公開ベンチマークで優れたパフォーマンスを達成している。
関連論文リスト
- Can Vision-Language Models Reason about AI Edits in Images? [78.04125956307838]
VLM(Vision-Language Models)は、強力な視覚的理解と推論能力のために、有望な代替手段を提供する。
簡単な精度と形式報酬を利用するGRPOベースのトレーニングフレームワークを提案する。
提案手法は,最先端画像フォージェリ検出器と比較して,競合検出と局所化性能を実現する。
論文 参考訳(メタデータ) (2026-07-30T16:23:40Z) - INSIGHT: An Interpretable Neural Vision-Language Framework for Reasoning of Generative Artifacts [0.0]
現在の法医学システムは、現実世界の条件下で急速に低下している。
ほとんどの検出器は不透明物として機能し、なぜ画像が合成物としてフラグ付けされるのかについての知見はほとんど得られない。
本稿では,AI生成画像のロバスト検出と透過的説明のための統合フレームワークであるINSIGHTを紹介する。
論文 参考訳(メタデータ) (2025-11-27T11:43:50Z) - ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation [81.52606410224136]
画像操作検出と局所化のための大規模ベンチマークである textbfManipBench を提案する。
また,マルチモーダル大言語モデル(MLLM)に基づくオールインワンモデルであるtextbfManipShieldを提案する。
論文 参考訳(メタデータ) (2025-11-18T08:50:17Z) - Semantic-Aware Reconstruction Error for Detecting AI-Generated Images [22.83053631078616]
本稿では,画像とキャプション誘導再構成のセマンティック・アウェア・リコンストラクション・エラー(SARE)を計測する新しい表現を提案する。
SAREは、さまざまな生成モデル間で偽画像を検出するための堅牢で差別的な機能を提供する。
また,SAREを背骨検出器に統合する融合モジュールを,クロスアテンション機構を介して導入する。
論文 参考訳(メタデータ) (2025-08-13T04:37:36Z) - Weakly-supervised Localization of Manipulated Image Regions Using Multi-resolution Learned Features [4.83420384410068]
現在のディープラーニングに基づく操作検出手法は、高い画像レベルの分類精度を達成するのに優れている。
実世界のシナリオにおけるピクセルワイズアノテーションの欠如は、既存の完全に制御された操作ローカライゼーション技術を制限する。
本稿では,画像レベルの操作検出ネットワークが生成するアクティベーションマップと,事前学習したモデルからのセグメンテーションマップを統合する,弱教師付きアプローチを提案する。
論文 参考訳(メタデータ) (2025-05-29T15:58:29Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - Context-Aware Weakly Supervised Image Manipulation Localization with SAM Refinement [52.15627062770557]
悪意のある画像操作は社会的リスクを生じさせ、効果的な画像操作検出方法の重要性を高めている。
画像操作検出の最近のアプローチは、完全に教師されたアプローチによって大きく推進されている。
本稿では,デュアルブランチトランスフォーマー-CNNアーキテクチャに基づく,弱教師付きフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-26T07:35:09Z) - EditScout: Locating Forged Regions from Diffusion-based Edited Images with Multimodal LLM [50.054404519821745]
本稿では,多モーダル大規模言語モデルを統合した新しいフレームワークを提案する。
我々のフレームワークはMagicBrush、AutoSplice、PerfBrushデータセットの有望な結果を達成する。
特に,本手法は,これまで目に見えなかった種類の編集を特徴とする自己構築型テストセットであるPerfBrushデータセットを最適化する。
論文 参考訳(メタデータ) (2024-12-05T02:05:33Z) - GIM: A Million-scale Benchmark for Generative Image Manipulation Detection and Localization [21.846935203845728]
我々はSAM, LLM, 生成モデルの強力な機能を統合するローカルな操作データ生成パイプラインを構築している。
1)大規模では、AIが操作する画像と実画像が100万組以上含まれている。
論文 参考訳(メタデータ) (2024-06-24T11:10:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。