論文の概要: A Benchmark Dataset for MLLM-Generated Image Detection: GPT Image2 & Nano Banana2
- arxiv url: http://arxiv.org/abs/2608.01258v1
- Date: Sun, 02 Aug 2026 14:09:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.132463
- Title: A Benchmark Dataset for MLLM-Generated Image Detection: GPT Image2 & Nano Banana2
- Title(参考訳): MLLM生成画像検出のためのベンチマークデータセット:GPT Image2とNano Banana2
- Abstract要約: 近年,マルチモーダル大言語モデル(MLLM)による画像のリアリズムが急速に向上している。
現在のMLLMの生成能力の強化は、AI生成画像検出にますます深刻な課題をもたらす。
本稿では,MLLMが生成した画像を検出するためのベンチマークデータセットを構築する。
- 参考スコア(独自算出の注目度): 32.0025259686302
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The realism of images generated by multimodal large language models (MLLMs), such as GPT Image2 and Nano Banana2, has improved rapidly in recent years. Compared with early generative models, current models have made clear progress in text rendering. They can produce high-quality images that closely resemble real-world application scenarios. The enhanced generation capabilities of current MLLMs pose increasingly severe challenges to AI-generated image detection. Detection is no longer limited to identifying obvious artifacts left by early generators. Instead, it requires systematic and realistic benchmarks for the new generation of generated content. However, most existing benchmarks are still built around early generative models and cannot fully evaluate the forensic challenges introduced by high-quality and multi-form generated images. To address this gap, this paper constructs a benchmark dataset for detecting images generated by MLLMs. The benchmark covers several realistic application scenarios and adopts three generation protocols to simulate direct generation, reference-based reconstruction, and local editing. Based on this benchmark, we evaluate detector degradation from traditional scenarios to MLLM-generated images and analyze false positive rates and false negative rates across three sample types, revealing the failure modes of existing methods. We further propose a structural-artifact-prior-guided dual-stream prompt framework (SAP-DSP) as a strong baseline. SAP-DSP uses dual-stream prompt learning and structure-aware routing fusion to improve representation learning. Extensive experiments show that the proposed benchmark exposes the performance degradation of existing detectors on high-quality generated images, while SAP-DSP achieves more stable detection results on this benchmark. Our code and dataset are publicly available at https://github.com/xbrainnet/SAP-DSP.
- Abstract(参考訳): GPT Image2やNano Banana2のようなマルチモーダル大言語モデル(MLLM)によって生成された画像のリアリズムは近年急速に改善されている。
初期の生成モデルと比較すると、現在のモデルはテキストレンダリングにおいて明らかに進歩している。
現実世界のアプリケーションシナリオによく似た、高品質なイメージを生成することができる。
現在のMLLMの生成能力の強化は、AI生成画像検出にますます深刻な課題をもたらす。
検出は、初期のジェネレータが残した明らかなアーティファクトを特定することに限定されない。
代わりに、新しい世代の生成されたコンテンツに対して、体系的で現実的なベンチマークが必要です。
しかし、既存のベンチマークのほとんどは初期生成モデルを中心に構築されており、高品質でマルチフォームな画像によってもたらされる法医学的課題を十分に評価することはできない。
このギャップに対処するため,MLLMが生成した画像を検出するためのベンチマークデータセットを構築した。
このベンチマークは、いくつかの現実的なアプリケーションシナリオをカバーし、直接生成、参照ベースの再構築、ローカル編集をシミュレートする3つの世代プロトコルを採用している。
このベンチマークに基づいて,従来のシナリオからMLLM生成画像への検出劣化を評価し,3種類のサンプルに対して偽陽性率と偽陰性率を解析し,既存手法の故障モードを明らかにする。
さらに,強力なベースラインとして,構造アーチファクト優先型デュアルストリームプロンプトフレームワーク(SAP-DSP)を提案する。
SAP-DSPは、表現学習を改善するために、二重ストリームプロンプト学習と構造対応ルーティング融合を使用する。
SAP-DSPはより安定した検出結果を得る一方,提案したベンチマークは,高品質な画像に対して既存の検出器の性能劣化を露呈することを示す。
私たちのコードとデータセットはhttps://github.com/xbrainnet/SAP-DSPで公開されています。
関連論文リスト
- More Images, More Problems? A Controlled Analysis of VLM Failure Modes [80.64323947730905]
大規模視覚言語モデル (LVLM) は目覚ましい能力を示しているが、複数の画像に対する理解と推論の能力は未解明のままである。
LVLMのマルチイメージ能力を厳格に評価する新しいベンチマークMIMICを紹介する。
論文 参考訳(メタデータ) (2026-01-12T18:45:13Z) - dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models [40.03969764207708]
Diffusion Multi-modal Large Language Models (dMLLMs) は画像生成と理解を統一する新しいアーキテクチャとして最近登場した。
提案するdMLLM-TTSは,2つの相補的スケーリング軸上で動作し,その全生成ポテンシャルを解放する新しいフレームワークである。
我々のフレームワークは線形探索の最大6倍の効率で生成品質を大幅に向上させる。
論文 参考訳(メタデータ) (2025-12-22T14:31:58Z) - FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges [85.24983823102262]
本稿では,テキスト・トゥ・イメージ(T2I)モデルと視覚言語モデル(VLM)を評価するための構造化手法を提案する。
我々は,挑戦的プロンプトで条件付きT2Iモデルにより生成された画像において,VLMが27の特定の障害モードを識別できるかどうかを検証した。
以上の結果から,現在の測定値ではこれらの誤差を捉えるには不十分であることが示唆された。
論文 参考訳(メタデータ) (2025-12-01T19:46:03Z) - Beyond Frequency: Scoring-Driven Debiasing for Object Detection via Blueprint-Prompted Image Synthesis [97.37770785712475]
オブジェクト検出のための世代ベースデバイアスフレームワークを提案する。
提案手法は,未表現オブジェクト群の性能ギャップを著しく狭める。
論文 参考訳(メタデータ) (2025-10-21T02:19:12Z) - Constantly Improving Image Models Need Constantly Improving Benchmarks [109.39018167487103]
本稿では,実際のモデル利用の証拠から直接ベンチマークを構築するためのフレームワークECHOを提案する。
GPT-4o Image Genにこのフレームワークを適用し,ソーシャルメディア投稿から収集した31,000以上のプロンプトのデータセットを構築した。
論文 参考訳(メタデータ) (2025-10-16T17:59:30Z) - Test-time Prompt Refinement for Text-to-Image Models [14.505841027491114]
我々は、TIRと呼ばれる基礎となるT2Iモデルの追加トレーニングを必要としないテスト時間プロンプトリファインメントフレームワークを導入する。
提案手法では,各生成ステップに続いて,事前訓練されたマルチモーダル大言語モデル(MLLM)が出力画像とユーザのプロンプトを解析する。
このクローズドループ戦略は、ブラックボックスT2Iモデルとのプラグアンドプレイ統合を維持しながら、複数のベンチマークデータセット間のアライメントと視覚的コヒーレンスを改善することを実証する。
論文 参考訳(メタデータ) (2025-07-22T20:30:13Z) - DFBench: Benchmarking Deepfake Image Detection Capability of Large Multimodal Models [43.86847047796023]
現在のディープフェイク検出方法は、生成モデルやコンテンツの多様性に制限のあるデータセットに依存することが多い。
textbfDFBenchは大規模なDeepFakeベンチマークで、リアル、AI編集、AI生成コンテンツにわたって54万のイメージが提供されている。
我々は,複数のLMMから合成された確率戦略を利用して,ディープフェイク検出のための混合エージェントであるtextbfMoA-DFを提案する。
論文 参考訳(メタデータ) (2025-06-03T15:45:41Z) - IDMR: Towards Instance-Driven Precise Visual Correspondence in Multimodal Retrieval [29.05476868272228]
インスタンス駆動型マルチモーダル画像検索(IDMR)は、テキスト記述シナリオにマッチしながら、クエリイメージと同じインスタンスを含む画像を取得するモデルを必要とする、新しいタスクである。
この能力をベンチマークするために,実世界の物体追跡と一対一のビデオデータを用いたIDMRベンチを開発した。
我々のMultimodal Large Language Model(MLLM)に基づく検索モデルは、1.2Mサンプルに基づいて訓練され、従来のベンチマークとゼロショットIDMRベンチの両方で最先端のアプローチより優れている。
論文 参考訳(メタデータ) (2025-04-01T16:47:20Z) - Efficient Test-Time Adaptation for Super-Resolution with Second-Order
Degradation and Reconstruction [62.955327005837475]
画像超解像(SR)は,低分解能(LR)から高分解能(HR)へのマッピングを,一対のHR-LRトレーニング画像を用いて学習することを目的としている。
SRTTAと呼ばれるSRの効率的なテスト時間適応フレームワークを提案し、SRモデルを異なる/未知の劣化型でテストドメインに迅速に適応させることができる。
論文 参考訳(メタデータ) (2023-10-29T13:58:57Z) - Parents and Children: Distinguishing Multimodal DeepFakes from Natural Images [60.34381768479834]
近年の拡散モデルの発展により、自然言語のテキストプロンプトから現実的なディープフェイクの生成が可能になった。
我々は、最先端拡散モデルにより生成されたディープフェイク検出に関する体系的研究を開拓した。
論文 参考訳(メタデータ) (2023-04-02T10:25:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。