論文の概要: VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics
- arxiv url: http://arxiv.org/abs/2608.11201v1
- Date: Tue, 11 Aug 2026 17:58:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:46.148345
- Title: VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics
- Title(参考訳): VidForensics-M1:AI生成ビデオフォレストのための検証可能な時間グラウンドを用いたメタ検出強化学習
- Abstract要約: 我々は,AIが生成するビデオ検出にtextbfmeta-detectionを導入し,信頼性の高い偽造検出を可能にする。
この知見に基づいて,ペア化されたリアルタイムビデオを生成する自動データ構築パイプラインを提案する。
textbfVidForensics-M1は、検証可能な時間的証拠を利用して、堅牢で一般化可能なAI生成ビデオ検出を実現する。
- 参考スコア(独自算出の注目度): 21.438987128589403
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in video generation models have significantly improved the realism of synthetic videos, blurring the boundary between generated and authentic content and raising concerns about misinformation. Existing MLLM-based detectors mainly rely on supervised fine-tuning or label-level reinforcement learning, where coarse supervision limits generalization to unseen scenarios and emerging video generators. To overcome these limitations, we are the first to introduce \textbf{meta-detection} into AI-generated video detection, enabling reliable forgery detection by jointly optimizing predicted labels and supporting evidence within reinforcement learning. This paradigm requires reliable evidence signals and effective mechanisms to integrate them into label-level optimization. Textual rationales provide semantic descriptions of forgery artifacts, but their generation and verification depend on external models, making supervision vulnerable to hallucinations and semantic biases. In contrast, temporal grounding provides more objective and verifiable evidence, as manipulated intervals can be precisely controlled during forgery construction. Based on this insight, we propose an automated data construction pipeline that generates paired real-fake videos by replacing temporal segments with boundary-frame-conditioned video generation models. Furthermore, we introduce \textbf{Evidence-Guided Reward Redistribution}, which performs evidence-aware credit assignment by redistributing rewards among label-correct responses according to evidence quality. This preserves reliable label supervision while encouraging detectors to acquire fine-grained and verifiable forgery localization capabilities. Extensive experiments demonstrate that \textbf{VidForensics-M1} effectively leverages verifiable temporal evidence to achieve robust and generalizable AI-generated video detection.
- Abstract(参考訳): 近年のビデオ生成モデルの進歩により、合成ビデオのリアリズムが大幅に改善され、生成されたコンテンツと本物のコンテンツの境界が曖昧になり、誤情報に対する懸念が高まっている。
既存のMLLMベースの検出器は、主に教師付き微調整またはラベルレベルの強化学習に依存しており、粗い監督は、目に見えないシナリオや新しいビデオジェネレータに一般化を制限する。
これらの制限を克服するため、AI生成ビデオ検出に \textbf{meta-detection} を導入し、予測ラベルを共同最適化し、強化学習における証拠を裏付けることで、信頼性の高い偽造検出を可能にする。
このパラダイムは、ラベルレベルの最適化にそれらを統合するために、信頼できる証拠信号と効果的なメカニズムを必要とする。
文的合理性は偽造品の意味的記述を提供するが、その生成と検証は外部モデルに依存し、幻覚や意味的偏見に弱い。
対照的に、時間的接地は、操作された間隔を偽造工事中に正確に制御できるため、より客観的で検証可能な証拠を提供する。
この知見に基づいて,時間セグメントを境界フレーム付きビデオ生成モデルに置き換えることで,ペア化されたリアルタイムビデオを生成する自動データ構築パイプラインを提案する。
さらに,証明品質に応じてラベル誤り応答の報酬を再分配することで,証拠に気付く信用割当を行う「textbf{Evidence-Guided Reward Redistribution}」を導入する。
これにより、信頼性の高いラベルの監視を保ちつつ、検出器に細粒度で検証可能なフォージェリーローカライゼーション能力を取得することを奨励する。
大規模な実験では、検証可能な時間的証拠を効果的に活用して、堅牢で一般化可能なAI生成ビデオ検出を実現する。
関連論文リスト
- Explainable Forensics of Manipulated Segments in Untrimmed Long Videos [50.190474724159465]
時間的AI生成セグメンテーションの局所化と説明のタスクを定式化する。
多様な操作パターンと豊富なアノテーション信号を備えた12,472の未トリミングビデオからなる大規模ベンチマークであるTASLEを紹介する。
そこで本稿では,MLLMに基づく精密な境界ローカライゼーションと解釈可能な推論のためのリファインメントモジュールと,効率的な長ビデオスキャンのためのバウンダリ感性提案生成モジュールを組み合わせた,粗大な法医学ベースラインであるMSLocを提案する。
論文 参考訳(メタデータ) (2026-06-01T15:48:38Z) - Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding [86.37002814396674]
ビデオ時間グラウンドのためのフォアシー・ツー・グラウンド(F2G)を提案する。
F2Gは予測的時間知覚とエビデンス駆動推論を統合している。
さまざまなベンチマークでグラウンド化の精度を一貫して向上させる。
論文 参考訳(メタデータ) (2026-05-21T04:03:25Z) - Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods [6.921364920053057]
トレーニング不要で理論上は正当化された検出器であるSTALLを導入し、ビデオの確率に基づくスコアを提供する。
我々は,2つの公開ベンチマーク上でSTALLを評価し,最新の生成モデルを用いた新しいベンチマークであるComGenVidを紹介する。
論文 参考訳(メタデータ) (2026-03-16T09:26:56Z) - VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning [42.22791607763693]
VideoVeritasは、きめ細かい認識と事実に基づく推論のためのフレームワークだ。
共同知覚選好と知覚Pretext Reinforcement Learningが使用される。
論文 参考訳(メタデータ) (2026-02-09T16:00:01Z) - EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning [58.42596067220998]
ディープフェイクビデオ技術は 芸術的な創造を 促進しただけでなく 偽情報を広めやすくした
従来のディープフェイクビデオ検出手法は、その原則の透明性の欠如や、偽造技術に対処する能力の不足といった問題に直面している。
本稿では,Deepfake Video Detection (EDVD) タスクを提案し,EDVD-LLaMAマルチモーダル推論フレームワークを設計する。
論文 参考訳(メタデータ) (2025-10-18T10:34:05Z) - BrokenVideos: A Benchmark Dataset for Fine-Grained Artifact Localization in AI-Generated Videos [63.03271511550633]
BrokenVideosは、3,254のAI生成ビデオのベンチマークデータセットで、微妙に注釈付けされたピクセルレベルのマスクが視覚的腐敗の領域を強調している。
実験の結果,BrokenVideosにおける人工物検出モデルの訓練状況とマルチモーダル大言語モデル(MLLM)が,破壊領域のローカライズ能力を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2025-06-25T03:30:04Z) - Seeing What Matters: Generalizable AI-generated Video Detection with Forensic-Oriented Augmentation [31.737159092430108]
我々は、異なる生成的アーキテクチャを研究し、バイアスがなく、障害に対して堅牢で、モデル間で共有される差別的特徴を探索し識別する。
本稿では,ウェーブレット分解に基づく新たなデータ拡張戦略を導入し,より関連する法医学的手がかりを活用するために,特定の周波数関連帯域を置き換える。
本手法は最先端検出器よりも精度が向上し, 非常に最近の生成モデルにおいても優れた結果が得られる。
論文 参考訳(メタデータ) (2025-06-20T07:36:59Z) - DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning [58.70446237944036]
DAVID-Xは、AI生成ビデオに詳細な欠陥レベル、時間空間アノテーションと有理書を組み合わせた最初のデータセットである。
DAVID-XR1は、視覚的推論の解釈可能な連鎖を提供するために設計されたビデオ言語モデルである。
以上の結果から,AI生成ビデオコンテンツの信頼性確認のための説明可能な検出手法が期待できることを示す。
論文 参考訳(メタデータ) (2025-06-13T13:39:53Z) - BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation [77.55074597806035]
GenBuster-200Kは、200Kの高解像度ビデオクリップを備えた、大規模で高品質なAI生成ビデオデータセットである。
BusterXは、マルチモーダル大言語モデル(MLLM)と強化学習を活用した、AI生成のビデオ検出および説明フレームワークである。
論文 参考訳(メタデータ) (2025-05-19T02:06:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。