論文の概要: Beyond Seeing Is Believing: On Crowdsourced Detection of Audiovisual Deepfakes
- arxiv url: http://arxiv.org/abs/2605.04797v1
- Date: Wed, 06 May 2026 11:48:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.798516
- Title: Beyond Seeing Is Believing: On Crowdsourced Detection of Audiovisual Deepfakes
- Title(参考訳): オーディエンス・ディープフェイクをクラウドソーシングで検出する「Beyond Seeing」
- Abstract要約: 本研究は,観衆が操作されたビデオと真正性をどのように区別するかを連続的に測定することで,聴覚的ディープフェイク検出について検討する。
我々は,AV-Deepfake1MとTrusted Media Challengeデータセットを用いて,Prolificのクラウドソーシング調査を行った。
結果は、群衆労働者が本物のビデオを操作したと誤分類することは滅多にないが、多くの操作を見逃し、合意はビデオ全体で制限されていることを示している。
- 参考スコア(独自算出の注目度): 4.186575888568895
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deepfakes are increasingly realistic and easy to produce, raising concerns about the reliability of human judgments in misinformation settings. We study audiovisual deepfake detection by measuring how consistently crowd workers distinguish authentic from manipulated videos and, when they flag a video as manipulated, how accurately they identify the manipulation type (audio-only, video-only, or audio-video) and how consistently they report manipulation timestamps. We run two matched crowdsourcing studies on Prolific using AV-Deepfake1M and the Trusted Media Challenge (TMC) dataset. We sample 48 videos per dataset (96 total) and collect 960 judgments (10 per video). Results show that crowd workers rarely misclassify authentic videos as manipulated, but they miss many manipulations, and agreement remains limited across videos. Aggregating multiple judgments per video stabilizes the authenticity signal, but it cannot recover manipulations that most workers consistently miss. Manipulation type identification is substantially noisier than authenticity detection even when workers detect a manipulation, with joint audio-video cases being particularly hard to recognize. Overall, these findings suggest that crowdsourcing can provide a scalable screening signal for audiovisual authenticity, while reliable modality attribution remains an open challenge.
- Abstract(参考訳): ディープフェイクはますます現実的になり、作りやすくなり、誤情報設定における人間の判断の信頼性への懸念が高まっている。
本研究では,観衆が操作されたビデオと真正性を連続的に区別し,ビデオが操作されたビデオにフラグを付けると,その操作タイプ(オーディオのみ,ビデオのみ,オーディオビデオ)を正確に識別し,操作タイムスタンプを確実に報告するかを測定することで,聴覚的ディープフェイク検出について検討する。
我々は,AV-Deepfake1MとTrusted Media Challenge (TMC)データセットを用いて,Prolificのクラウドソーシング調査を行った。
データセット毎の48の動画(96件)をサンプリングし、960の判断(ビデオ毎の10件)を収集します。
結果は、群衆労働者が本物のビデオを操作したと誤分類することは滅多にないが、多くの操作を見逃し、合意はビデオ全体で制限されていることを示している。
ビデオ毎に複数の判断を集約すると、認証信号は安定するが、ほとんどの作業者が常に見逃す操作を回復することはできない。
操作型識別は、作業者が操作を検出する場合であっても、真正性検出よりもかなりノイズが多く、共同音声ビデオケースの認識は特に困難である。
全体として、クラウドソーシングは、信頼性の高いモダリティ属性がオープンな課題であるのに対して、オーディオ視覚認証のためのスケーラブルなスクリーニング信号を提供できることを示唆している。
関連論文リスト
- When Seeing Is Not Believing -- A Benchmark for Search-Grounded Video Misinformation Detection [21.933691657055075]
EVID-Benchは、ビデオ誤情報検出のためのベンチマークである。
AI生成、シングルソース編集、マルチソース編集の3つのカテゴリにまたがる9つの操作タイプにまたがる222のビデオで構成されている。
最良のシステムは61.43%のポイントレベルの精度と43.24%のビデオレベルの精度しか達成していないが、AI生成による操作は特に困難である。
論文 参考訳(メタデータ) (2026-06-02T18:03:35Z) - SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment [74.05278327933006]
SAVeは,音声・視覚深度検出フレームワークで,映像の完全学習を行う。
SAVEは、タグ付けアーティファクトをエミュレートするために、オンザフライ、アイデンティティ保存、地域対応の自明な擬似操作を生成する。
クロスモーダルな証拠を捉えるために、SAVeはリップ音声同期もモデル化している。
論文 参考訳(メタデータ) (2026-03-26T08:01:35Z) - Circumventing shortcuts in audio-visual deepfake detection datasets with unsupervised learning [3.453303606167197]
私たちは、最も広く使われているオーディオビデオのディープフェイクデータセットの2つが、これまで特定されていなかった突発的な特徴である、主要な沈黙に悩まされていることを示しています。
フェイクビデオは、ごく短い沈黙の瞬間から始まり、この機能だけで、本物と偽のサンプルをほぼ完全に分離することができる。
本研究では,実データのみに基づく学習モデルによる教師なし学習から教師なし学習へのシフトを提案する。
論文 参考訳(メタデータ) (2024-11-29T18:58:20Z) - Deepfake detection in videos with multiple faces using geometric-fakeness features [79.16635054977068]
被害者や人物のディープフェイクは、脅迫、ゆがみ、金融詐欺の詐欺師によって使用される。
本研究では,映像中の顔の存在の動的度を特徴付ける幾何学的フェイクネス機能(GFF)を提案する。
我々は、ビデオに同時に存在する複数の顔でビデオを分析するために、我々のアプローチを採用している。
論文 参考訳(メタデータ) (2024-10-10T13:10:34Z) - AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection [49.81915942821647]
本研究では、ディープフェイクビデオを検出するために、オーディオ・ヴィジュアル・トランスフォーマー・ベースのアンサンブルネットワーク(AVTENet)を導入する。
評価には、最近リリースされたマルチモーダルオーディオビデオFakeAVCelebデータセットを使用する。
AVTENetとその変種およびいくつかの既存手法をFakeAVCelebデータセットの複数のテストセット上で評価する。
論文 参考訳(メタデータ) (2023-10-19T19:01:26Z) - Self-Supervised Video Forensics by Audio-Visual Anomaly Detection [19.842795378751923]
操作されたビデオには、視覚信号と音声信号の間に微妙な矛盾があることが多い。
本稿では,これらの不整合を識別できる異常検出に基づくビデオ法医学手法を提案する。
ビデオフレームと音声の時間同期をキャプチャする特徴セットを用いて、自動回帰モデルを訓練し、音声・視覚的特徴のシーケンスを生成する。
論文 参考訳(メタデータ) (2023-01-04T18:59:49Z) - FakeOut: Leveraging Out-of-domain Self-supervision for Multi-modal Video
Deepfake Detection [10.36919027402249]
人間の話し言葉の合成ビデオは、説得力のある方法で誤情報を拡散するのに使用することができる。
FakeOutは、事前トレーニングフェーズと適応フェーズの両方でマルチモーダルデータに依存する、新しいアプローチである。
提案手法は,オーディオ・ビジュアル・データセット上でのクロスデータセットの一般化を実現する。
論文 参考訳(メタデータ) (2022-12-01T18:56:31Z) - SceneFake: An Initial Dataset and Benchmarks for Scene Fake Audio Detection [54.74467470358476]
本稿では,シーンフェイク音声検出のためのデータセットSceneFakeを提案する。
操作されたオーディオは、オリジナルオーディオの音響シーンを改ざんするだけで生成される。
本論文では,SceneFakeデータセット上での擬似音声検出ベンチマーク結果について報告する。
論文 参考訳(メタデータ) (2022-11-11T09:05:50Z) - Audio-Visual Person-of-Interest DeepFake Detection [77.04789677645682]
本研究の目的は、現実世界で遭遇する様々な操作方法やシナリオに対処できるディープフェイク検出器を提案することである。
我々は、対照的な学習パラダイムを活用して、各アイデンティティに対して最も識別しやすい、移動面と音声セグメントの埋め込みを学習する。
本手法は,シングルモダリティ(オーディオのみ,ビデオのみ)とマルチモダリティ(オーディオビデオ)の両方を検出でき,低品質・低画質ビデオに対して堅牢である。
論文 参考訳(メタデータ) (2022-04-06T20:51:40Z) - Voice-Face Homogeneity Tells Deepfake [56.334968246631725]
既存の検出アプローチは、ディープフェイクビデオにおける特定のアーティファクトの探索に寄与する。
未探索の音声-顔のマッチングビューからディープフェイク検出を行う。
我々のモデルは、他の最先端の競合と比較して、大幅に性能が向上する。
論文 参考訳(メタデータ) (2022-03-04T09:08:50Z) - Watch Those Words: Video Falsification Detection Using Word-Conditioned
Facial Motion [82.06128362686445]
本稿では,安価なディープフェイクと視覚的に説得力のあるディープフェイクの両方を扱うためのマルチモーダルな意味法医学的アプローチを提案する。
帰属という概念を利用して、ある話者と他の話者を区別する個人固有の生体パターンを学習する。
既存の個人固有のアプローチとは異なり、この手法は口唇の操作に焦点を当てた攻撃にも有効である。
論文 参考訳(メタデータ) (2021-12-21T01:57:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。