論文の概要: HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales
- arxiv url: http://arxiv.org/abs/2607.08705v1
- Date: Thu, 09 Jul 2026 17:12:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.606135
- Title: HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales
- Title(参考訳): HumanForge: マルチエージェントフォージェリ合理化による人間中心のディープフェイクビデオベンチマーク
- Authors: Wenbo Xu, Zhimin Chen, Xiaojie Liang, Hengrui Liu, Wei Lu,
- Abstract要約: HumanForgeは、統合され、大規模で、マルチパラダイムな人間中心のビデオデータセットである。
Gen2Annoは、ソースプロファイリングからMoEベースの参照分析、クローズループ法医学的検証までの6つの特殊なエージェントをコーディネートし、18K以上の高忠実度ビデオセグメントを生成する。
- 参考スコア(独自算出の注目度): 7.669728085259526
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Rapid advancements in video diffusion models and temporal editing tools have enabled the generation of highly realistic human-centric videos, posing unprecedented challenges to digital content forensics. Existing benchmarks primarily focus on either face-swapping or global text-to-video synthesis, overlooking the crucial dimensions of human-object or human-human interactions and multi-modal alignment. To address these limitations, we introduce HumanForge, a unified, large-scale, and multi-paradigm human-centric video forgery dataset. To construct and annotate this dataset without labor-intensive manual labeling or hallucinated monolithic prompts, we propose Gen2Anno, a modular active multi-agent pipeline built on LangGraph. Gen2Anno coordinates six specialized agents-ranging from source profiling to MoE-based reference analysis and closed-loop forensic verification-to generate over 18K high-fidelity video segments and produce structured, contrastive omni-annotations containing binary decisions, fine-grained artifact categories, and spatio-temporal localization. Extensive benchmarks using state-of-the-art traditional detectors and Large Multimodal Models (LMMs) demonstrate the significant challenges of zero-shot generalization and fine-grained reasoning on HumanForge. Code and dataset will be publicly released.
- Abstract(参考訳): ビデオ拡散モデルと時間編集ツールの急速な進歩により、高度にリアルな人間中心のビデオが作成できるようになった。
既存のベンチマークは主に、対面スワッピングまたはグローバルなテキストとビデオの合成に焦点を当てており、人間とオブジェクト、人間と人間の相互作用とマルチモーダルアライメントの重要な次元を見下ろしている。
これらの制限に対処するために、統合され、大規模で、マルチパラダイムなヒューマン中心のビデオフォージェリデータセットであるHumanForgeを紹介します。
本稿では,LangGraph上に構築されたモジュール型アクティブマルチエージェントパイプラインであるGen2Annoを提案する。
Gen2Annoは、ソースプロファイリングからMoEベースの参照分析、クローズドループ法医学的検証までの6つの特殊なエージェントをコーディネートし、18K以上の高忠実度ビデオセグメントを生成し、バイナリ決定、きめ細かいアーティファクトカテゴリ、時空間的ローカライゼーションを含む構造化されたコントラスト的なオムニアノテーションを生成する。
最先端の従来型検出器とLMM(Large Multimodal Models)を用いた大規模なベンチマークでは、ゼロショットの一般化とHumanForgeのきめ細かい推論の重大な課題が示されている。
コードとデータセットが公開される。
関連論文リスト
- OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation [25.63459032324644]
我々は,人間の微細なモデリングのために設計された大規模マルチシーンデータセットであるOmniHumanを紹介する。
OmniHuman Benchmark (OHBench) は人中心オーディオビデオ合成のための科学的診断を提供する3段階評価システムである。
論文 参考訳(メタデータ) (2026-04-20T14:28:51Z) - MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation [48.84450712826316]
MSVBenchは、マルチショットビデオ生成に適した階層的なスクリプトと参照イメージを備えた最初の包括的なベンチマークである。
本稿では,大規模マルチモーダルモデルの高レベルな意味推論と,ドメイン固有のエキスパートモデルの微粒な知覚的厳密さを相乗化するハイブリッド評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-27T12:26:34Z) - RISE-Video: Can Video Generators Decode Implicit World Rules? [71.92434352963427]
テキスト画像合成(TI2V)の先駆的推論指向ベンチマークであるRISE-Videoを提案する。
RISE-Videoは、8つの厳格なカテゴリにまたがる、細心の注意深い人手によるサンプル467種からなる。
本研究では,LMM(Large Multimodal Models)を利用して人中心評価をエミュレートする自動パイプラインを提案する。
論文 参考訳(メタデータ) (2026-02-05T18:36:10Z) - The Quest for Generalizable Motion Generation: Data, Model, and Evaluation [66.57596758773309]
本稿では,ViGenからMoGenへの知識伝達を,データ,モデリング,評価という3つの重要な柱を通じて体系的に行うフレームワークを提案する。
まず,228,000個の高品質な動作サンプルからなる大規模データセットViMoGen-228Kを紹介する。
第2に,フローマッチングに基づく拡散変換器であるViMoGenを提案する。
第3に,動作品質,迅速な忠実度,一般化能力の詳細な評価を目的とした階層型ベンチマークであるMBenchを提案する。
論文 参考訳(メタデータ) (2025-10-30T17:59:27Z) - HumanSAM: Classifying Human-centric Forgery Videos in Human Spatial, Appearance, and Motion Anomaly [15.347208661111198]
HumanSAMは、人間中心のフォージェリーを、生成されたコンテンツでよく見られる3つの異なる種類のアーティファクトに分類することを目的としている。
HumanSAMは、バイナリとマルチクラスの偽造分類の両方において、最先端の手法と比較して有望な結果をもたらす。
論文 参考訳(メタデータ) (2025-07-26T12:03:47Z) - HumanVBench: Exploring Human-Centric Video Understanding Capabilities of MLLMs with Synthetic Benchmark Data [55.739633494946204]
我々は,ビデオMLLMの評価において,ギャップを埋めるために巧みに構築された,革新的なベンチマークであるHumanVBenchを紹介する。
HumanVBenchは、内的感情と外的表現、静的、動的、基本的、複雑にまたがる2つの主要な側面と、単一モーダルとクロスモーダルという2つの側面を慎重に検討する16のタスクで構成されている。
22のSOTAビデオMLLMの総合評価では、特にクロスモーダルおよび感情知覚において、現在のパフォーマンスに顕著な制限が示される。
論文 参考訳(メタデータ) (2024-12-23T13:45:56Z) - Human-Aware Motion Deblurring [197.53076361425363]
本稿では、前景(FG)と背景(BG)との間に動きのぼかしをアンタングルする人間認識型デブロアリングモデルを提案する。
提案モデルは三分岐エンコーダデコーダアーキテクチャに基づいている。
提案モデルには, エンド・ツー・エンド方式で, 監視, ヒューマン・アウェア・アテンション・メカニズムが組み込まれている。
論文 参考訳(メタデータ) (2020-01-19T12:16:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。