論文の概要: Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation
- arxiv url: http://arxiv.org/abs/2608.08009v1
- Date: Sat, 08 Aug 2026 08:41:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.602612
- Title: Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation
- Title(参考訳): マルチモーダルメディアマニピュレーションの検出とグラウンド化のためのエビデンスグラウンド法理推論
- Abstract要約: フェイクニュースはますます、モーダルな画像テキスト偽造に頼っている。
既存の手法では、決定的根拠のないブラックボックス検出結果を生成する。
本稿では,Evidence-Grounded Forensic Reasoningフレームワークに基づくマルチモーダル検出手法を提案する。
- 参考スコア(独自算出の注目度): 23.254574194880234
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fake news increasingly relies on cross-modal image-text forgeries, making transparent and verifiable reasoning chains an urgent need for Detecting and Grounding Multi-Modal Media Manipulation (DGM4). Existing methods produce black-box detection results without any decision rationale, limiting their reliability in forensic practice. Multi-modal Large Language Models (MLLMs) offer a natural path toward explainability, but applying them to DGM4 raises two difficulties. First, models tend to generate explanations disconnected from predicted evidence locations, producing unverified attribution. Second, enforcing evidence-conclusion consistency requires active optimization, yet uniform training signals fail to distinguish localization tokens from classification tokens, making multi-head joint training unreliable. We propose a multi-modal manipulation detector based on an Evidence-Grounded Forensic Reasoning (EFR) framework. EFR introduces an Anchor-and-Verify reasoning chain that enforces modality-isolated perception before cross-modal comparison, with conclusion coordinates as explicit anchors to which downstream evidence must spatially correspond. A verifiable reward system then enforces evidence-conclusion consistency during training, while a Modality-Decoupled Advantage (MDA) routing mechanism mitigats credit misassignment across prediction tasks. Experiments show that EFR achieves state-of-the-art performance while producing structured forensic reasoning records that explicitly bind explanations to evidence.
- Abstract(参考訳): フェイクニュースはますますクロスモーダルな画像テキストの偽造に頼り、透明で検証可能な推論チェーンは、検出とグラウンディングのマルチモーダルメディア操作(DGM4)の緊急なニーズとなる。
既存の方法では、決定的根拠のないブラックボックス検出結果が生成され、法医学的実践における信頼性が制限される。
MLLM(Multi-modal Large Language Models)は、説明可能性への自然な道を提供するが、それをDGM4に適用することは2つの困難を引き起こす。
第一に、モデルは予測された証拠の場所から切り離された説明を生成し、検証されていない帰属を生み出す傾向がある。
第二に、エビデンス・コンクルージョンの一貫性を強制するには、アクティブな最適化が必要であるが、均一なトレーニング信号は、ローカライゼーショントークンと分類トークンを区別することができず、マルチヘッドジョイントトレーニングは信頼できない。
本稿では,Evidence-Grounded Forensic Reasoning (EFR) フレームワークに基づくマルチモーダル検出手法を提案する。
EFRはAnchor-and-Verify推論連鎖を導入し、モーダル比較の前にモダリティを分離した認識を強制し、結論座標は下流の証拠が空間的に対応しなくてはならない明示的なアンカーとなる。
検証可能な報酬システムは、トレーニング中にエビデンス・一貫性を強制し、モダリティ・デカップリング・アドバンテージ(MDA)ルーティング機構は、予測タスク間の信用ミスを緩和する。
実験により、ERFは、証拠に説明を明示的に拘束する構造化された法医学的推論記録を作成しながら、最先端のパフォーマンスを達成することが示された。
関連論文リスト
- MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering [73.47440561592556]
トレーニング不要な属性生成手法であるMultAttnAttribを紹介する。
MultAttnAttribは、様々な属性生成方法よりも一貫して優れていることを示す。
提案手法は直接推論遅延の最大7分の1の属性を生成する。
論文 参考訳(メタデータ) (2026-07-01T19:29:19Z) - ForensicConcept: Transferable Forensic Concepts for AIGI Detection [81.29606528968698]
本稿では,検出器から明示的な法医学的概念を抽出し,背骨間の移動を可能にするフレームワークであるForensicConceptを提案する。
提案手法は,Transformer Attributionを用いて決定クリティカルパッチをローカライズし,それらをコンパクトな概念コードブックにまとめる。
論文 参考訳(メタデータ) (2026-06-05T08:25:34Z) - REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection [33.33464433821003]
マルチモーダル操作検出は、偽画像のペアを同時に識別し、改ざんした領域をローカライズすることを目的としている。
人間の比較推論に触発されて、我々はこのタスクを基準基底検証問題として再検討する。
本稿では,この比較パラダイム用に明示的に設計されたフレームワークであるREVEALを提案する。
論文 参考訳(メタデータ) (2026-05-27T13:24:41Z) - D-SECURE: Dual-Source Evidence Combination for Unified Reasoning in Misinformation Detection [9.049034101566642]
マルチモーダルな誤報は、現実的な即興編集と、流動的だが誤解を招くテキストを混在させ、検証が難しい説得的な投稿を生み出している。
D-SECUREは、内部操作検出と外部エビデンスに基づくニューススタイル投稿の推論を組み合わせたフレームワークである。
論文 参考訳(メタデータ) (2026-02-16T03:51:49Z) - Multimodal Fact-Level Attribution for Verifiable Reasoning [80.60864342985748]
マルチモーダル大言語モデル(MLLM)は、多段階推論と長文生成を含む実世界のタスクにますます利用されている。
既存のマルチモーダルグラウンドベンチマークと評価手法は、複雑なマルチモーダル推論における属性評価に失敗する。
我々は、直接観察以上の推論を必要とする設定において、ファクトレベルのマルチモーダル属性を評価するためのベンチマークであるMuRGAtを紹介する。
論文 参考訳(メタデータ) (2026-02-12T03:10:02Z) - Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts [74.47786985522762]
テキスト慣性(textual inertia)と呼ばれる重要な障害モードを特定し、矛盾する視覚的証拠を無視しながら、モデルは間違ったテキストに盲目的に固執する傾向がある。
本稿では,多種多様なLMMの推論連鎖に摂動を構造的に注入するLogicGraph摂動プロトコルを提案する。
その結果,10%未満の症例で自己修正が成功し,主に視覚的テキスト誤りの伝播に寄与することが判明した。
論文 参考訳(メタデータ) (2026-01-07T16:39:34Z) - Look As You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning [55.232400251303794]
Look As You Think (LAT)は、モデルをトレーニングし、一貫した帰属性を持った検証可能な推論パスを生成するための強化学習フレームワークである。
LATはシングルイメージとマルチイメージの両方でバニラモデルを一貫して改善し、平均ゲインは8.23%、IoU@0.5では47.0%となる。
論文 参考訳(メタデータ) (2025-11-15T02:50:23Z) - Abductive Inference in Retrieval-Augmented Language Models: Generating and Validating Missing Premises [0.0]
本稿では,帰納的推論をLLMに組み込むフレームワークを提案する。
帰納的推論とマルチホップQAベンチマークの実験結果から,本手法は解答精度と帰納的忠実度の両方を改善することが示された。
この研究は、RAGシステムの堅牢性と説明可能性を高めるための有望な方向として、帰納的推論を強調している。
論文 参考訳(メタデータ) (2025-11-06T03:37:24Z) - CRAVE: A Conflicting Reasoning Approach for Explainable Claim Verification Using LLMs [15.170312674645535]
CRAVE は、説明可能なクレーム VErification に対する Conflicting Reasoning Approach である。
大規模な言語モデルによって推論される矛盾する理性に基づいて、複雑なクレームを検証することができる。
CRAVEは最先端の手法よりもはるかに優れた性能を実現している。
論文 参考訳(メタデータ) (2025-04-21T07:20:31Z) - Prototype-based Aleatoric Uncertainty Quantification for Cross-modal
Retrieval [139.21955930418815]
クロスモーダル検索手法は、共通表現空間を共同学習することにより、視覚と言語モダリティの類似性関係を構築する。
しかし、この予測は、低品質なデータ、例えば、腐敗した画像、速いペースの動画、詳細でないテキストによって引き起こされるアレタリック不確実性のために、しばしば信頼性が低い。
本稿では, 原型に基づくAleatoric Uncertainity Quantification (PAU) フレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-29T09:41:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。