論文の概要: Ensemble Deep Learning Approaches for AI-Altered Video Detection
- arxiv url: http://arxiv.org/abs/2607.06872v1
- Date: Wed, 08 Jul 2026 00:09:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.240058
- Title: Ensemble Deep Learning Approaches for AI-Altered Video Detection
- Title(参考訳): AIを用いたビデオ検出のための深層学習手法
- Abstract要約: モデルアンサンブルを用いたマルチモーダルディープフェイク検出システムを開発した。
このシステムにはオーディオベースの検出のためのASISTと、ビデオフレームの視覚的特徴を分析するためのEfficientNet、XceptionNet、MesoNetが含まれる。
実験の結果, 平均精度は70%程度で, 未確認操作を中心的オープンチャレンジとして一般化した。
- 参考スコア(独自算出の注目度): 3.8721250720482305
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The increasing accessibility of artificial intelligence has led to a rapid rise in AI-generated videos, making it more difficult to distinguish between real and manipulated content. Many existing detection methods rely on a single model and often struggle to generalize across different types of deepfakes. In this work, we developed a multimodal deepfake detection system that combines both audio and visual analysis using an ensemble of models. The system includes AASIST for audio-based detection, and EfficientNet, XceptionNet, and MesoNet for analyzing visual features in video frames. The pipeline takes a video as input, separates the audio, and extracts face frames using MTCNN. Each model produces a score indicating the likelihood of the input being fake. These scores are then combined using ensemble strategies, including mean averaging and stacking. Mean fusion provides a simple and stable baseline, while stacking uses a trained meta-model to learn how to combine predictions more effectively. Results show that while individual models perform well on the datasets they were trained on, their performance drops when tested on more diverse datasets. The ensemble approach helps improve overall robustness by combining predictions from multiple models, leading to more consistent performance across different types of deepfakes. This suggests that using both audio and visual information together is a more reliable approach for deepfake detection. Our results highlight generalization to unseen manipulations as the central open challenge, with average accuracy around 70%.
- Abstract(参考訳): 人工知能のアクセシビリティ向上により、AI生成ビデオが急速に増加し、実際のコンテンツと操作されたコンテンツの区別がより困難になっている。
多くの既存の検出方法は単一のモデルに依存しており、しばしば異なる種類のディープフェイクをまたいで一般化するのに苦労する。
本研究では,モデルアンサンブルを用いた音声解析と視覚解析を組み合わせたマルチモーダルディープフェイク検出システムを開発した。
このシステムにはオーディオベースの検出のためのASISTと、ビデオフレームの視覚的特徴を分析するためのEfficientNet、XceptionNet、MesoNetが含まれる。
パイプラインは入力としてビデオを取り、音声を分離し、MCCNNを使用して顔フレームを抽出する。
各モデルは、入力が偽である可能性を示すスコアを生成する。
これらのスコアは、平均平均化や積み重ねなど、アンサンブル戦略を使って組み合わせられる。
平均融合は単純で安定したベースラインを提供し、スタックングはトレーニングされたメタモデルを使用して予測をより効果的に組み合わせる方法を学ぶ。
結果は、トレーニングしたデータセットで個々のモデルがうまく機能する一方で、より多様なデータセットでテストすると、パフォーマンスが低下することを示している。
アンサンブルアプローチは、複数のモデルからの予測を組み合わせることで全体的なロバスト性を改善するのに役立ち、異なるタイプのディープフェイクに対してより一貫性のあるパフォーマンスをもたらす。
これは、オーディオ情報と視覚情報を併用することがディープフェイク検出のためのより信頼性の高いアプローチであることを示唆している。
実験の結果, 平均精度は70%程度で, 未確認操作を中心的オープンチャレンジとして一般化した。
関連論文リスト
- ERF-BA-TFD+: A Multimodal Model for Audio-Visual Deepfake Detection [49.14187862877009]
本稿では,ERFと音声-視覚融合を組み合わせた新しいディープフェイク検出モデルであるERF-BA-TFD+を提案する。
我々のモデルは音声と映像の両方の特徴を同時に処理し、その相補的な情報を活用して検出精度とロバスト性を向上させる。
本研究では,DDL-AVデータセット上でのRF-BA-TFD+の評価を行った。
論文 参考訳(メタデータ) (2025-08-24T10:03:46Z) - Leveraging Pre-Trained Visual Models for AI-Generated Video Detection [54.88903878778194]
ビデオ生成の分野はDeepFakesを超えて進歩し、ジェネリックコンテンツでAI生成ビデオを検出する方法が緊急に必要になった。
本稿では,事前学習した視覚モデルを用いて,実写映像と実写映像を区別する手法を提案する。
提案手法は, 平均90%以上で高い検出精度を達成し, その有効性を裏付けるものである。
論文 参考訳(メタデータ) (2025-07-17T15:36:39Z) - Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework [19.53717894228692]
DeepfakesはAI合成マルチメディアデータで、誤情報を拡散するために悪用される可能性がある。
単一ストリームマルチモーダル学習フレームワークを用いた音声・視覚的ディープフェイク検出のための軽量ネットワークを提案する。
提案手法は非常に軽量であり,パラメータは0.48Mに留まるが,ユニモーダルとマルチモーダルの両方のディープフェイクに優れる。
論文 参考訳(メタデータ) (2025-06-09T02:13:04Z) - A Multimodal Framework for Deepfake Detection [0.0]
AIを使って合成メディアを作るDeepfakesは、ビデオやオーディオを説得力を持って修正して、現実を正しく表現する。
我々の研究は、革新的なマルチモーダルアプローチを通じて、ディープフェイクの重要な問題に対処する。
枠組みは視覚的・聴覚的分析を併用し,精度は94%であった。
論文 参考訳(メタデータ) (2024-10-04T14:59:10Z) - AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection [49.81915942821647]
本研究では、ディープフェイクビデオを検出するために、オーディオ・ヴィジュアル・トランスフォーマー・ベースのアンサンブルネットワーク(AVTENet)を導入する。
評価には、最近リリースされたマルチモーダルオーディオビデオFakeAVCelebデータセットを使用する。
AVTENetとその変種およびいくつかの既存手法をFakeAVCelebデータセットの複数のテストセット上で評価する。
論文 参考訳(メタデータ) (2023-10-19T19:01:26Z) - Glitch in the Matrix: A Large Scale Benchmark for Content Driven
Audio-Visual Forgery Detection and Localization [20.46053083071752]
新しいデータセットであるLocalized Visual DeepFake (LAV-DF) の提案とベンチマークを行う。
LAV-DFは、戦略的コンテンツ駆動型オーディオ、ビジュアルおよびオーディオ視覚操作で構成されている。
提案するベースライン手法であるBundary Aware Temporal Forgery Detection (BA-TFD)は3次元畳み込みニューラルネットワークに基づくアーキテクチャである。
論文 参考訳(メタデータ) (2023-05-03T08:48:45Z) - Mitigating Representation Bias in Action Recognition: Algorithms and
Benchmarks [76.35271072704384]
ディープラーニングモデルは、稀なシーンやオブジェクトを持つビデオに適用すると、パフォーマンスが悪くなります。
この問題にはアルゴリズムとデータセットの2つの異なる角度から対処する。
偏りのある表現は、他のデータセットやタスクに転送するとより一般化できることを示す。
論文 参考訳(メタデータ) (2022-09-20T00:30:35Z) - Automatic Curation of Large-Scale Datasets for Audio-Visual
Representation Learning [62.47593143542552]
本稿では,自動データセットキュレーションのためのサブセット最適化手法について述べる。
本研究では,高視聴覚対応の映像を抽出し,自己監視モデルが自動的に構築されているにもかかわらず,既存のスケールのビデオデータセットと類似したダウンストリームパフォーマンスを達成できることを実証した。
論文 参考訳(メタデータ) (2021-01-26T14:27:47Z) - Emotions Don't Lie: An Audio-Visual Deepfake Detection Method Using
Affective Cues [75.1731999380562]
本稿では,実・偽のディープフェイクマルチメディアコンテンツを検出する学習手法を提案する。
我々は,同じビデオから2つのオーディオと視覚の類似性を抽出し,解析する。
我々は,いくつかのSOTAディープフェイク検出手法との比較を行い,DFDCでは84.4%,DF-TIMITデータセットでは96.6%の動画AUCを報告した。
論文 参考訳(メタデータ) (2020-03-14T22:07:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。