論文の概要: Can Vision-Language Models Reason about AI Edits in Images?
- arxiv url: http://arxiv.org/abs/2607.28464v1
- Date: Thu, 30 Jul 2026 16:23:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.659497
- Title: Can Vision-Language Models Reason about AI Edits in Images?
- Title(参考訳): ビジョンランゲージモデルは画像中のAI編集について推論できるか?
- Abstract要約: VLM(Vision-Language Models)は、強力な視覚的理解と推論能力のために、有望な代替手段を提供する。
簡単な精度と形式報酬を利用するGRPOベースのトレーニングフレームワークを提案する。
提案手法は,最先端画像フォージェリ検出器と比較して,競合検出と局所化性能を実現する。
- 参考スコア(独自算出の注目度): 78.04125956307838
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Detection and localization of AI-tampered images are critical for trustworthy AI, yet modern generative models have made such manipulations increasingly difficult to identify. While traditional binary classifiers can detect image tampering, they lack interpretability and generalization. Vision-Language Models (VLMs) offer a promising alternative due to their strong visual understanding and reasoning capabilities; however, existing approaches typically rely on supervised finetuning with curated explanations rather than exploiting their inherent reasoning capabilities. In this work, we investigate whether VLMs can be trained to reason about AI-generated image edits using reinforcement learning (RL) rather than explicit reasoning supervision. Motivated by the success in Group Relative Policy Optimization (GRPO), an RL technique that incentivizes the model to reason by generating thinking traces prior to giving the final answer, we propose a GRPO-based training framework that utilizes simple accuracy and format rewards. Given an input image, the model produces a structured reasoning trace and predicts whether the image has been tampered with. A lightweight segmentation model is then guided by the reasoning output to generate pixel-level localization masks. Experiments across multiple image manipulation datasets demonstrate that our approach achieves competitive detection and localization performance compared to state-of-the-art image forgery detectors, despite requiring substantially weaker supervision. We introduce effective intersection over union (eff-IoU), a unified metric to jointly evaluate detection and localization. These results suggest that reinforcement learning provides an effective and scalable mechanism for teaching VLMs to reason about AI-generated content.
- Abstract(参考訳): AIに改ざんされた画像の検出とローカライゼーションは、信頼できるAIにとって重要であるが、現代の生成モデルは、そのような操作を識別することがますます困難になっている。
従来のバイナリ分類器は画像の改ざんを検出できるが、解釈性や一般化に欠ける。
VLM(Vision-Language Models)は、その強力な視覚的理解と推論能力のために、有望な代替手段を提供する。
本研究は,AI生成画像編集を明示的な推論監督ではなく,強化学習(RL)を用いて推論するために,VLMをトレーニングできるかどうかを検討するものである。
グループ相対的政策最適化(GRPO)の成功により、最終回答の前に思考トレースを生成することによってモデルに推論を動機付けるRL手法が提案され、簡単な精度と形式報酬を生かしたGRPOベースのトレーニングフレームワークが提案される。
入力画像が与えられた場合、モデルは構造化された推論トレースを生成し、画像が改ざんされたかどうかを予測する。
次に、軽量セグメンテーションモデルを推論出力でガイドし、画素レベルのローカライゼーションマスクを生成する。
複数の画像操作データセットをまたいだ実験により、我々の手法は、かなり監督が弱いにもかかわらず、最先端の画像偽造検出と比較して、競争力のある検出と位置決め性能を実現することを示した。
我々は,検出と局所化を共同で評価する統合計量である有効結合(eff-IoU)を導入する。
これらの結果から,強化学習はVLMにAI生成内容の推論を行うための効果的でスケーラブルなメカニズムを提供すると考えられる。
関連論文リスト
- Boosting Robust AIGI Detection with LoRA-based Pairwise Training [55.076681464804636]
現在のAIGI検出器はクリーンなデータセットで良好に動作しますが、その検出性能は"野生"に展開すると低下します。
本稿では,高度歪み下でのAIGIの堅牢な検出を実現するために,Lo-based Pairwise Training (RA) 戦略を提案する。
論文 参考訳(メタデータ) (2026-04-14T05:35:32Z) - From Evidence to Verdict: An Agent-Based Forensic Framework for AI-Generated Image Detection [19.240335260177382]
AIFo(Agent-based Image Forensics)は、マルチエージェントコラボレーションによる人間の法医学的調査をエミュレートする、トレーニング不要のフレームワークである。
従来の手法とは異なり,本フレームワークでは,リバース画像検索,メタデータ抽出,事前学習型分類器,VLM解析など,一連の法医学的ツールを用いている。
我々の総合的な評価は6000のイメージに及び、現代の生成プラットフォームや多様なオンラインソースの画像を含む現実世界のシナリオに挑戦する。
論文 参考訳(メタデータ) (2025-10-31T18:36:49Z) - ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection [51.93101033997245]
AI生成画像のリアリズムの増大は、誤情報やプライバシー侵害に対する深刻な懸念を引き起こしている。
我々は、AI生成画像検出のための新しい推論に基づく一般化可能なフレームワークThinkFakeを提案する。
我々は、ThinkFakeがGenImageベンチマークで最先端の手法より優れており、挑戦的なLOKIベンチマークで強力なゼロショットの一般化を示すことを示す。
論文 参考訳(メタデータ) (2025-09-24T07:34:09Z) - ForenX: Towards Explainable AI-Generated Image Detection with Multimodal Large Language Models [82.04858317800097]
ForenXは画像の真正性を識別するだけでなく、人間の思考に共鳴する説明を提供する新しい手法である。
ForenXは、強力なマルチモーダル大言語モデル(MLLM)を使用して、法医学的な手がかりを分析し、解釈する。
本稿では,AI生成画像における偽証拠の記述専用のデータセットであるForgReasonを紹介する。
論文 参考訳(メタデータ) (2025-08-02T15:21:26Z) - Foundations and Models in Modern Computer Vision: Key Building Blocks in Landmark Architectures [34.542592986038265]
本報告では,コンピュータビジョンにおけるキーデザインパターンの進化を,影響力のある6つの論文から分析する。
本稿では,残差接続を導入したResNetについて概説する。
画像パッチのシーケンスにトランスフォーマーアーキテクチャを適用し,新たなパラダイムを確立したビジョントランスフォーマー(ViT)について検討する。
論文 参考訳(メタデータ) (2025-07-31T09:08:11Z) - Interpretable and Reliable Detection of AI-Generated Images via Grounded Reasoning in MLLMs [43.08776932101172]
私たちは、バウンディングボックスと記述キャプションを付加したAI生成画像のデータセットを構築します。
次に、多段階最適化戦略によりMLLMを微調整する。
得られたモデルは、AI生成画像の検出と視覚的欠陥のローカライズの両方において、優れた性能を達成する。
論文 参考訳(メタデータ) (2025-06-08T08:47:44Z) - RIGID: A Training-free and Model-Agnostic Framework for Robust AI-Generated Image Detection [60.960988614701414]
RIGIDは、堅牢なAI生成画像検出のためのトレーニング不要でモデルに依存しない方法である。
RIGIDは、既存のトレーニングベースおよびトレーニング不要な検出器を著しく上回っている。
論文 参考訳(メタデータ) (2024-05-30T14:49:54Z) - Enhancing Large Vision Language Models with Self-Training on Image Comprehension [131.14381425260706]
本稿では、画像理解に特化して自己学習アプローチを強調する自己学習 on Image (STIC)を紹介する。
まず、ラベルのない画像を用いて、画像記述の好みを自己構築する。
抽出した視覚情報に対する推論をさらに自己改善するため,既存の命令調整データのごく一部をモデルに再利用する。
論文 参考訳(メタデータ) (2024-05-30T05:53:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。