論文の概要: AI-generated Images Challenge Visual Trust in High-risk Scenarios
- arxiv url: http://arxiv.org/abs/2607.22745v1
- Date: Thu, 23 Jul 2026 06:56:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.851421
- Title: AI-generated Images Challenge Visual Trust in High-risk Scenarios
- Title(参考訳): AI生成画像はリスクの高いシナリオで視覚的信頼に挑戦する
- Authors: Yi-Zhi Wang, Yichen Xiao, Linan Yue, Weibo Gao, Yichao Du, Pengfei Fang, Shimin Di, Min-Ling Zhang,
- Abstract要約: SafeIMGは、GPT Image 2.0を用いて生成された12のパブリックおよび個人安全シナリオにまたがる安全指向のベンチマークである。
SafeIMGは、検出器が合成画像を認識するかどうかを評価するだけでなく、それらの決定が人間の識別された異常を反映しているかどうかも評価する。
我々は,特殊合成画像検出器と視覚言語モデル(VLM)を評価し,どちらも信頼性のある検出を提供していないことを発見した。
- 参考スコア(独自算出の注目度): 79.40239296310791
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Rapid advances in image generation are eroding the evidentiary value of visual content in settings where authenticity can affect public safety and personal reputation. Yet existing detection benchmarks rarely examine synthetic images in public- and individual-safety contexts, where misleading visual content may carry substantial risks. Here we introduce SafeIMG, a safety-oriented benchmark spanning 12 public- and individual-safety scenarios generated using GPT Image 2. Unlike benchmarks centred on generic imagery and image-level labels, SafeIMG evaluates not only whether detectors recognise synthetic images, but also whether their decisions reflect human-identified anomalies. To this end, SafeIMG provides human annotations that localise suspicious regions and explain local artefacts and higher-level commonsense or physical inconsistencies. We evaluate specialized synthetic-image detectors and vision-language models (VLMs), and find that neither provides reliable detection. The strongest VLM identifies only 49.5% of generated images, whereas the best specialised detector identifies 33.1%, compared with 81.7% accuracy for human evaluators. Model explanations cover only 29.8\% of human-annotated anomalies and predominantly capture local defects in text, faces and hands. Their coverage falls to 15.0% for commonsense conflicts and 12.0% for physical inconsistencies, while detection performance deteriorates further after dissemination-induced image degradation. These findings show that current detectors lack the accuracy, explanatory alignment and robustness needed to evaluate AI-generated images reliably across public- and individual-safety settings.
- Abstract(参考訳): 画像生成の急速な進歩は、公共の安全と個人の評判に影響を及ぼす可能性のある設定において、視覚的コンテンツの明らかな価値を損なう。
しかし、既存の検出ベンチマークでは、誤解を招く視覚コンテンツが重大なリスクを負う公安と個人安全の文脈で合成画像を調べることはめったにない。
ここでは、安全指向ベンチマークであるSafeIMGを紹介します。
一般的な画像や画像レベルのラベルを中心としたベンチマークとは異なり、SafeIMGは、検出器が合成画像を認識するかどうかだけでなく、それらの決定が人間の識別された異常を反映しているかどうかも評価している。
この目的のために、SafeIMGは疑わしい地域をローカライズし、地元の工芸品や高レベルのコモンセンスや物理的不整合を説明する人間のアノテーションを提供する。
我々は,特殊合成画像検出器と視覚言語モデル(VLM)を評価し,どちらも信頼性のある検出を提供していないことを発見した。
最強のVLMは生成画像の49.5%しか特定していないが、最高の特殊化検出器は33.1%、人間評価器は81.7%の精度である。
モデル説明は、人間の注釈付き異常のうち29.8 %しかカバーせず、主にテキスト、顔、手の局所的な欠陥を捉えている。
カバー範囲はコモンセンスの衝突で15.0%、物理的不整合で12.0%に低下する一方、検出性能は拡散誘起画像劣化後にさらに悪化する。
これらの結果は、現在の検出器は、公安と個人の安全設定で確実にAI生成画像を評価するために必要な正確さ、説明的アライメント、堅牢性を欠いていることを示している。
関連論文リスト
- Forged Calamity: Benchmark for Cross-Domain Synthetic Disaster Detection in the Age of Diffusion [20.58307772592017]
3万枚の画像を含む合成災害検出のためのベンチマークデータセットであるForged Calamityを紹介した。
微調整およびゼロショット設定による実験は、現在の法医学的アプローチにおける一貫した弱点を明らかにしている。
これらの知見は、持続的な一般化ギャップと、ドメインおよびモデルに依存しない検出方法の緊急の必要性を浮き彫りにしている。
論文 参考訳(メタデータ) (2026-06-17T00:08:35Z) - VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety [3.1109025622085693]
マルチモーダル安全性を評価する包括的フレームワークであるVision Language Safety Understandingを提案する。
11種類の最先端モデルについて評価した結果, 系統的な共同理解の失敗が判明した。
我々のフレームワークは、現在のモデルにおける共同画像テキスト理解とアライメントギャップの弱点を明らかにする。
論文 参考訳(メタデータ) (2025-10-21T01:30:31Z) - Bridging the Gap Between Ideal and Real-world Evaluation: Benchmarking AI-Generated Image Detection in Challenging Scenarios [54.07895223545793]
本稿では,実世界ロバストネスデータセット(RRDataset)を導入し,3次元にわたる検出モデルの包括的評価を行う。
RRDatasetには7つの主要なシナリオの高品質なイメージが含まれている。
我々はRRDataset上で17の検出器と10の視覚言語モデル(VLM)をベンチマークし、大規模な人間実験を行った。
論文 参考訳(メタデータ) (2025-09-11T06:15:52Z) - RAID: A Dataset for Testing the Adversarial Robustness of AI-Generated Image Detectors [57.81012948133832]
本稿では,72kの多種多様かつ高い変換可能な対向例からなるRAID(Robust Evaluation of AI- generated Image Detectors)を提案する。
提案手法は,未知の検出器に高い成功率で転送する逆画像を生成する。
以上の結果から,現在最先端のAI生成画像検出器は,敵の例によって容易に認識できることが示唆された。
論文 参考訳(メタデータ) (2025-06-04T14:16:00Z) - Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition [12.054081112688074]
VLM(Vision-Language Models)は、視覚的コンテンツを解釈する能力を示しているが、安全クリティカルなシナリオにおける信頼性はまだ十分に調査されていない。
本稿では,200枚の合成画像(100対)と50枚の実世界の画像(25対)からなる診断ベンチマークVERIを紹介する。
各緊急シーンは、人間の検証によって視覚的に似ているが安全なものとペアリングされる。
論文 参考訳(メタデータ) (2025-05-21T10:57:40Z) - Epistemic Uncertainty for Generated Image Detection [107.62647907393377]
本稿では,創成モデルの時代において重要なセキュリティ問題に対処することを目的とした,てんかん不確実性によるAI生成画像検出のための新しいフレームワークを提案する。
我々の重要な洞察は、トレーニングとテストデータの分布の相違が、機械学習モデルのエピステマティック不確実性空間に顕著に現れていることに起因している。
論文 参考訳(メタデータ) (2024-12-08T11:32:25Z) - Semi-Truths: A Large-Scale Dataset of AI-Augmented Images for Evaluating Robustness of AI-Generated Image detectors [62.63467652611788]
実画像27,600枚、223,400枚、AI拡張画像1,472,700枚を含むSEMI-TRUTHSを紹介する。
それぞれの画像には、検出器のロバスト性の標準化と目標評価のためのメタデータが添付されている。
以上の結果から,現状の検出器は摂動の種類や程度,データ分布,拡張方法に様々な感度を示すことが示唆された。
論文 参考訳(メタデータ) (2024-11-12T01:17:27Z) - Diffusion Facial Forgery Detection [56.69763252655695]
本稿では,顔に焦点をあてた拡散生成画像を対象とした包括的データセットであるDiFFを紹介する。
人体実験といくつかの代表的な偽造検出手法を用いて,DiFFデータセットの広範な実験を行った。
その結果、人間の観察者と自動検出者の2値検出精度は30%以下であることが判明した。
論文 参考訳(メタデータ) (2024-01-29T03:20:19Z) - ArtiFact: A Large-Scale Dataset with Artificial and Factual Images for
Generalizable and Robust Synthetic Image Detection [0.3779860024918729]
本稿では,実世界の障害に直面した合成画像検出器の汎用性とロバスト性を評価する。
フィルタストライド削減戦略と組み合わせたマルチクラス分類方式は,社会的プラットフォーム障害に対処する。
ICIP 2022のIEEE VIPカップチャレンジでは、テスト1で8.34%、テスト2で1.26%、テスト3で15.08%と、他のトップチームよりも大幅に優れていた。
論文 参考訳(メタデータ) (2023-02-23T12:40:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。