論文の概要: LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection
- arxiv url: http://arxiv.org/abs/2607.25962v1
- Date: Tue, 28 Jul 2026 16:45:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.936613
- Title: LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection
- Title(参考訳): LaP-Forensics:Lant-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection
- Authors: Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen,
- Abstract要約: 本稿では,RGBセマンティクスを再構築に基づく法医学的証拠で強化するフレームワークであるLaP-Forensicsを紹介する。
独立プロジェクタは、構造化されたWhere-What-Whyモデルの前にRGBイメージと残留マップを符号化し、テキスト解析とアーティファクトマスクを予測する。
実験では、UniversalFakeDetect上でのクロスジェネレータ検出と、公式のSynthScarsベンチマークでの競合アーティファクトローカライゼーションが示されている。
- 参考スコア(独自算出の注目度): 11.780720481629837
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent generative models can produce images with few obvious visual artifacts, weakening detectors and explanations that rely only on surface appearance. We present LaP-Forensics, a multimodal framework that augments RGB semantics with reconstruction-based forensic evidence. A frozen Stable Diffusion DDIM inversion-reconstruction model provides a fixed reconstruction reference, and its residual map measures local compatibility with that reference. Independent projectors encode the RGB image and residual map before a structured Where-What-Why model predicts a textual analysis and an artifact mask.Supervised fine-tuning is followed by Group Relative Policy Optimization (GRPO), whose reward combines mask overlap with output-structure and evidence-reference terms. These text-side terms encourage the model to refer to the consistency map but do not constitute a verifier of free-form textual truth. A separate image-level head fuses RGB and DDIM-residual class features. Experiments show cross-generator detection on UniversalFakeDetect and competitive artifact localization on the official SynthScars benchmark. Controlled cue-construction, inversion-horizon, component, reward-term, and counterfactual analyses support the utility of the residual stream under the evaluated settings, while free-form textual faithfulness and reliability under post-processing remain open limitations.
- Abstract(参考訳): 最近の生成モデルは、表面の外観にのみ依存する、明らかな視覚的アーティファクトがほとんどなく、検出器や説明が弱まる画像を生成することができる。
本稿では,RGBのセマンティクスを再構築に基づく法医学的証拠で強化するマルチモーダルフレームワークであるLaP-Forensicsを紹介する。
凍結した安定拡散DDIMインバージョン再構成モデルにより、固定された再構成参照が提供され、その残余写像はその参照との局所的互換性を測定する。
独立プロジェクタは、構造化されたWhere-What-Whyモデルがテキスト解析とアーティファクトマスクを予測する前にRGBイメージと残像マップをエンコードする。
これらのテキストサイド用語は、モデルに一貫性マップを参照するように促すが、自由形式のテキスト真理の検証を構成するものではない。
イメージレベルの別のヘッドは、RGBとDDIM-Residualクラス機能を融合する。
実験では、UniversalFakeDetect上でのクロスジェネレータ検出と、公式のSynthScarsベンチマークでの競合アーティファクトローカライゼーションが示されている。
制御されたキューコンストラクション、逆ホライゾン、コンポーネント、報酬項、および反ファクト分析は、評価された設定下での残留ストリームの有用性をサポートし、一方、後処理時の自由形式のテキスト忠実性と信頼性は、オープンな制限を維持している。
関連論文リスト
- HIR-ALIGN: Enhancing Hyperspectral Image Restoration via Diffusion-Based Data Generation [50.46910397782266]
ハイパスペクトル画像(HSI)の復元は、ノイズ、ぼかし、分解能損失などの劣化に悩まされるため、信頼性の高い解析に不可欠である。
本稿では,HIR-ALIGNを提案する。HIR-ALIGNは,限られたトレーニング画像と,ターゲット分布と密に一致した合成データとを付加して,ハイパースペクトル画像の復元を促進するための,プラグアンドプレイのターゲット適応型拡張フレームワークである。
論文 参考訳(メタデータ) (2026-05-13T14:14:13Z) - SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation [62.55421542903781]
生成された画像の空間的レイアウトを評価するために明示的に設計された検証可能な報酬モデルである textbfSpatialReward を提案する。
安定拡散とFLUXの実験により、空間的リワードをRLトレーニングに組み込むことで、空間的一貫性と全体的な生成品質が一貫して向上することが示された。
論文 参考訳(メタデータ) (2026-03-23T17:26:35Z) - ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval [64.14282916266998]
Composed Image Retrievalは、参照画像と修正テキストからなるハイブリッドクエリに基づいてターゲット画像を取得することを目的としている。
本稿では,診断・生成・再定義パイプラインに従うモデルに依存しないフレームワークであるReCALLを提案する。
CIRRとFashionIQの実験では、ReCALLは継続的に劣化した機能を再検討し、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-02T04:52:54Z) - INSIGHT: An Interpretable Neural Vision-Language Framework for Reasoning of Generative Artifacts [0.0]
現在の法医学システムは、現実世界の条件下で急速に低下している。
ほとんどの検出器は不透明物として機能し、なぜ画像が合成物としてフラグ付けされるのかについての知見はほとんど得られない。
本稿では,AI生成画像のロバスト検出と透過的説明のための統合フレームワークであるINSIGHTを紹介する。
論文 参考訳(メタデータ) (2025-11-27T11:43:50Z) - Semantic-Aware Reconstruction Error for Detecting AI-Generated Images [22.83053631078616]
本稿では,画像とキャプション誘導再構成のセマンティック・アウェア・リコンストラクション・エラー(SARE)を計測する新しい表現を提案する。
SAREは、さまざまな生成モデル間で偽画像を検出するための堅牢で差別的な機能を提供する。
また,SAREを背骨検出器に統合する融合モジュールを,クロスアテンション機構を介して導入する。
論文 参考訳(メタデータ) (2025-08-13T04:37:36Z) - Diffusion-based Layer-wise Semantic Reconstruction for Unsupervised Out-of-Distribution Detection [30.02748131967826]
教師なしのアウト・オブ・ディストリビューション(OOD)検出は、未ラベルのIn-Distribution(ID)トレーニングサンプルからのみ学習することで、ドメイン外のデータを識別することを目的としている。
現在の再構成手法は, 画素/機能空間における入力と対応する生成物間の再構成誤差を測定することで, 優れた代替手法を提供する。
拡散に基づく階層的意味再構成手法を提案する。
論文 参考訳(メタデータ) (2024-11-16T04:54:07Z) - Rethinking the Up-Sampling Operations in CNN-based Generative Network
for Generalizable Deepfake Detection [86.97062579515833]
我々は、アップサンプリング操作から生じる一般化された構造的アーティファクトをキャプチャし、特徴付ける手段として、NPR(Neighboring Pixel Relationships)の概念を紹介した。
tft28の異なる生成モデルによって生成されたサンプルを含む、オープンワールドデータセット上で包括的な分析を行う。
この分析は、新しい最先端のパフォーマンスを確立し、既存の手法よりも優れたtft11.6%の向上を示している。
論文 参考訳(メタデータ) (2023-12-16T14:27:06Z) - DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection [55.48770333927732]
本稿では,拡散型異常検出(Difusion-based Anomaly Detection, DAD)フレームワークを提案する。
画素空間オートエンコーダ、安定拡散の復調ネットワークに接続する潜在空間セマンティックガイド(SG)ネットワーク、特徴空間事前学習機能抽出器から構成される。
MVTec-ADとVisAデータセットの実験は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2023-12-11T18:38:28Z) - A Novel end-to-end Framework for Occluded Pixel Reconstruction with
Spatio-temporal Features for Improved Person Re-identification [0.842885453087587]
人の身元確認は、公共の安全を高めるために群衆の動きを監視し、追跡するために不可欠である。
本研究では、ディープニューラルネットワークからなるRGB画像/映像の効果的な閉塞検出・再構成フレームワークを開発することにより、有効な解を提案する。
具体的には、CNNベースのオクルージョン検出モデルが個々の入力フレームを分類し、次いでConv-LSTMおよびオートエンコーダを用いて、シーケンシャル(ビデオ)および非シーケンシャル(画像)データに対して、オクルードされたフレームに対応するオクルード画素を再構成する。
論文 参考訳(メタデータ) (2023-04-16T08:14:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。