論文の概要: Evidence-Guided Detection, Localization and Explanation for Text-Centric Image Forensics
- arxiv url: http://arxiv.org/abs/2609.02097v1
- Date: Wed, 02 Sep 2026 04:37:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.085691
- Title: Evidence-Guided Detection, Localization and Explanation for Text-Centric Image Forensics
- Title(参考訳): Evidence-Guided Detection, Localization and Explanation for Text-Centric Image Forensics
- Abstract要約: AIGCはテキスト中心の画像操作をますますアクセスしやすくしている。
本稿では,ACM Multimedia 2026におけるGenText-Forensics Challengeの解について述べる。
- 参考スコア(独自算出の注目度): 5.228601974168999
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The rapid progress of AIGC has made text-centric image manipulation increasingly accessible, creating new forensic challenges that require not only authenticity detection but also spatial grounding and evidence-based explanation. This paper presents our solution to the GenText-Forensics Challenge at ACM Multimedia 2026. We propose an evidence-guided detector-localizer-reasoner system, where an image-level detector provides a global authenticity prior, a dedicated localizer extracts tampered regions as spatial grounding evidence, and an MLLM-based reasoner generates structured forensic reports grounded in this expert forensic evidence. These modules are connected through a cascaded evidence flow: the detector gates the subsequent localization and prompting process, the localizer converts tamper responses into grounding boxes, and the reasoner is trained to synthesize the detector decision and localized evidence into the final report. As a key part of our method, we introduce iterative difficulty-aware mining to improve localization quality and apply report-mask consistency post-processing to align report grounding with predicted masks. On the official hidden test set, our system achieves a final score of 0.638 and ranks second in the challenge, validating the effectiveness of the proposed evidence-guided system. The code is available at https://github.com/peifengLiu42/ACMMM26-evidence-guided-detector-localizer-reasoner-system.
- Abstract(参考訳): AIGCの急速な進歩は、テキスト中心の画像操作をますますアクセスしやすくし、認証検出だけでなく、空間的根拠やエビデンスに基づく説明を必要とする新たな法医学的課題を生み出している。
本稿では,ACM Multimedia 2026におけるGenText-Forensics Challengeの解について述べる。
本稿では,画像レベルの検出器がグローバルな正当性を事前に提供し,専用ローカライザが空間的根拠として改ざんされた領域を抽出し,MLLMベースの推論器が,この専門的な法医学的証拠に基づく構造化された法医学的報告を生成する,エビデンス誘導型検出器・ローカライザ・リアソナーシステムを提案する。
これらのモジュールはカスケードされたエビデンスフローを介して接続される:検出器はその後のローカライゼーションとプロンプトのプロセスをゲートし、ローカライザはタンパー応答をグラウンドボックスに変換し、推論器は検出器の決定とローカライズされたエビデンスを最終報告に合成するように訓練される。
本手法の重要部分として,本手法では,局所化品質を向上させるために反復的困難を考慮したマイニングを導入し,予測マスクとの整合性を持たせるために,レポートマスク後処理を適用した。
公式の隠れテストセットでは, 最終スコア0.638を達成し, 課題の2位にランクインし, 提案したエビデンス誘導システムの有効性を検証した。
コードはhttps://github.com/peifengLiu42/ACMMM26-evidence-guided-detector-localizer-reasoner-systemで公開されている。
関連論文リスト
- From Detection to Localization: A Unified Forensics Framework for Fully Synthetic and Tampered Images [7.9180538960840385]
この研究は、統合されたマルチクラスフレームワークを導入することで既存の検出器を拡張する(実対完全生成対タンパー)。
画像認証の分類に加えて、このフレームワークにはセグメンテーションブランチが組み込まれ、改ざんされた領域のピクセルレベルのローカライゼーションを可能にする。
提案手法は、最近選択されたベンチマークよりも優れており、分類精度が向上し、ローカライゼーションタスクのIoUスコアが向上した効率的なソリューションを提供する。
論文 参考訳(メタデータ) (2026-09-02T14:16:44Z) - Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection [8.599317072232198]
本稿では,AIGI検出器であるDedeake-o3について述べる。
インタラクティブなビジュアル検索と検証対象の証拠のアライメントを組み合わせる。
Defake-o3は検出精度と説明品質の両方を改善する。
論文 参考訳(メタデータ) (2026-08-17T08:30:32Z) - Explainable Deepfake Detection Challenge [42.4485282926075]
ACM Multimedia 2026における説明可能なディープフェイク検出チャレンジは、このジョイント能力をベンチマークするために設計されている。
この評価は、分類指標と意味的類似性、単純性、意図認識の接地指標を組み合わせる。
この課題を通じて開発された手法は、次世代で説明可能なディープフェイク検出器の開発に寄与する。
論文 参考訳(メタデータ) (2026-07-23T07:42:43Z) - ForensicConcept: Transferable Forensic Concepts for AIGI Detection [81.29606528968698]
本稿では,検出器から明示的な法医学的概念を抽出し,背骨間の移動を可能にするフレームワークであるForensicConceptを提案する。
提案手法は,Transformer Attributionを用いて決定クリティカルパッチをローカライズし,それらをコンパクトな概念コードブックにまとめる。
論文 参考訳(メタデータ) (2026-06-05T08:25:34Z) - REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection [33.33464433821003]
マルチモーダル操作検出は、偽画像のペアを同時に識別し、改ざんした領域をローカライズすることを目的としている。
人間の比較推論に触発されて、我々はこのタスクを基準基底検証問題として再検討する。
本稿では,この比較パラダイム用に明示的に設計されたフレームワークであるREVEALを提案する。
論文 参考訳(メタデータ) (2026-05-27T13:24:41Z) - Mitigating Memorization in Text-to-Image Diffusion via Region-Aware Prompt Augmentation and Multimodal Copy Detection [53.789057575175065]
領域認識型prompt Augmentation(RAPTA)とAttention-Driven Multimodal Copy Detection(ADMCD)を示す。
RAPTAはオブジェクト検出器を使用して、正常な領域を見つけ、それらを意味論的に接地したプロンプトの変種に変換する。
ADMCDは、ローカルパッチ、グローバルセマンティック、テクスチャキューを軽量トランスフォーマーで集約し、融合表現を生成する。
実験により、RAPTAは高い合成品質を維持しながら過度な適合を減少させ、ADMCDはコピーを確実に検出し、単一モードの指標より優れることが示された。
論文 参考訳(メタデータ) (2026-03-13T15:16:27Z) - Beyond Artificial Misalignment: Detecting and Grounding Semantic-Coordinated Multimodal Manipulations [56.816929931908824]
マルチモーダルデータにおける意味的協調操作の検出の先駆者となった。
本稿では,RamDG(Retrieval-Augmented Manipulation Detection and Grounding)フレームワークを提案する。
我々のフレームワークは既存の手法よりも優れており、SAMMの精度は最先端の手法に比べて2.06%高い。
論文 参考訳(メタデータ) (2025-09-16T04:18:48Z) - Propose and Rectify: A Forensics-Driven MLLM Framework for Image Manipulation Localization [49.71303998618939]
本稿では,意味論的推論と法科学的な分析を橋渡しするPropose-Rectifyフレームワークを提案する。
提案手法は,具体的技術実証により,初期セマンティックな提案が体系的に検証され,拡張されることを保証し,包括的検出精度と局所化精度を実現する。
論文 参考訳(メタデータ) (2025-08-25T12:43:53Z) - Mixture-of-Noises Enhanced Forgery-Aware Predictor for Multi-Face Manipulation Detection and Localization [52.87635234206178]
本稿では,多面的操作検出と局所化に適したMoNFAPという新しいフレームワークを提案する。
このフレームワークには2つの新しいモジュールが含まれている: Forgery-aware Unified Predictor (FUP) Module と Mixture-of-Noises Module (MNM)。
論文 参考訳(メタデータ) (2024-08-05T08:35:59Z) - Detect Any Deepfakes: Segment Anything Meets Face Forgery Detection and
Localization [30.317619885984005]
本稿では,視覚的セグメンテーション基盤モデル,すなわちセグメンテーションモデル(SAM)をフォージェリ検出とローカライゼーションの対面に導入する。
SAMに基づいて,Multiscale Adapterを用いたDADFフレームワークを提案する。
提案するフレームワークは、エンドツーエンドのフォージェリーローカライゼーションと検出最適化をシームレスに統合する。
論文 参考訳(メタデータ) (2023-06-29T16:25:04Z) - Representative Forgery Mining for Fake Face Detection [52.896286647898386]
ディテクタの精緻化と注目の拡大を導くための注意ベースのデータ拡張フレームワークを提案します。
提案手法は,トップnのセンシティブな顔領域を追跡し,検出者に対して,以前無視された領域にさらに深く掘り下げて,より代表的な偽造を行うように促す。
論文 参考訳(メタデータ) (2021-04-14T03:24:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。