論文の概要: What Do Deepfake Benchmarks Measure? An Audit Using Frozen Self-Supervised Representations
- arxiv url: http://arxiv.org/abs/2606.26384v1
- Date: Wed, 24 Jun 2026 21:10:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.083476
- Title: What Do Deepfake Benchmarks Measure? An Audit Using Frozen Self-Supervised Representations
- Title(参考訳): ディープフェイクベンチマークは何を測るのか?
- Abstract要約: ベンチマークはますます複雑でエンジニアリングされた検出器を駆動するが、もしこれらのベンチマークが現実世界のディープフェイクを反映していないなら、この複雑さは完全に間違った問題を解決しているかもしれない。
ビデオ, 画像, 音声のディープフェイクのベンチマークを, 故意に簡単な診断法を用いて実施する。
我々は,3つのモードにわたって,汎用的な自己教師付き表現に対する線形プローブがベスポーク検出器の性能に近づきつつあることを観察した。
- 参考スコア(独自算出の注目度): 9.75344282356567
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As deepfake generators approach perceptual indistinguishability, reliable detection becomes critical. Yet, detectors that score well on benchmarks routinely fail in the wild. A concerning feedback loop has emerged: benchmarks drive increasingly complex, engineered detectors, yet if those benchmarks do not reflect real-world deepfakes, this complexity may be solving the wrong problem entirely. This raises a prior question: what are these benchmarks actually measuring? We conduct an audit of video, image, and audio deepfake benchmarks using a deliberately simple diagnostic. If a linear probe on frozen, general-purpose self-supervised representations can approximate the performance of a bespoke detector, the benchmark is largely rewarding general modality understanding rather than forensic understanding. This has two implications: the benchmark may not reflect realistic threat models, and it raises the question of whether the bespoke detectors the probe approaches are truly learning forensic understanding. We observe, across three modalities, linear probes on general-purpose self-supervised representations closely approach the performance of bespoke detectors. We further show that generator-level difficulty is partly explained by Frechet geometry in the same representation space. Together, these results support a benchmark-audit view of deepfake detection: before high scores are read as evidence of forensic understanding, it is worth asking how much of the benchmark is already solved by general-purpose representations.
- Abstract(参考訳): ディープフェイクジェネレータが知覚的不一致に近づくと、信頼性の高い検出が重要になる。
しかし、ベンチマークでよく評価される検出器は、荒々しく失敗する。
ベンチマークはますます複雑でエンジニアリングされた検出器を駆動するが、もしこれらのベンチマークが現実世界のディープフェイクを反映していないなら、この複雑さは完全に間違った問題を解決しているかもしれない。
これらのベンチマークは実際に何を測定していますか?
ビデオ, 画像, 音声のディープフェイクのベンチマークを, 故意に簡単な診断法を用いて実施する。
凍結された汎用的な自己教師型表現上の線形プローブがベスモーク検出器の性能を近似できるなら、このベンチマークは法医学的な理解よりも一般的なモダリティの理解に大きく貢献する。
このベンチマークは、現実的な脅威モデルを反映していない可能性があり、プローブアプローチが真に法医学的理解を学習しているかどうかという疑問を提起する。
我々は,3つのモードにわたって,汎用的な自己教師付き表現に対する線形プローブがベスポーク検出器の性能に近づきつつあることを観察した。
さらに、生成元レベルの難しさは、同じ表現空間におけるフレシェ幾何学によって部分的に説明されることを示す。
これらの結果は、ディープフェイク検出のベンチマーク監査の視点を支持する:高いスコアが法医学的理解の証拠として読まれる前に、ベンチマークのどれ程が汎用的な表現によってすでに解決されているのかを尋ねる価値がある。
関連論文リスト
- Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks [2.4035041353107673]
我々はAIスキャナーを開発し、真実へのアクセス、ツールの故障、脆弱性の推測、回答フォーマットのあいまいさの4つの種類の妥当性問題を検出する。
我々のスキャナーは5つの広く使用されているベンチマークにおいて、ランダムな手動検査で捉えられないケースを含む、いくつかの検証された品質問題を特定した。
論文 参考訳(メタデータ) (2026-07-29T23:17:08Z) - PARALLAX: Separating Genuine Hallucination Detection from Benchmark Construction Artifacts [12.088141798203367]
大型言語モデル(LLM)は自信を持って幻覚する。
内部モデル状態からそれを検出することは、デプロイをより安全にするための道を提供する。
広範に使用されているベンチマークにおける高検出性能を実現するための最近の手法
この明らかな進歩の多くは、精査が生き残らないことを示している。
論文 参考訳(メタデータ) (2026-05-16T14:57:15Z) - Beyond Raw Detection Scores: Markov-Informed Calibration for Boosting Machine-Generated Text Detection [105.14032334647932]
機械生成テキスト(MGT)は偽情報やフィッシングなどのリスクを生じさせ、信頼性の高い検出の必要性を強調している。
MGTの統計的に区別可能な特徴を抽出するメトリックベース法は、オーバーフィットしがちな複雑なモデルベース法よりも実用的であることが多い。
本稿では,2つのコンテキスト検出スコアの関係をモデル化したマルコフ情報を用いたスコアキャリブレーション手法を提案する。
論文 参考訳(メタデータ) (2026-02-08T16:06:12Z) - Advancing Machine-Generated Text Detection from an Easy to Hard Supervision Perspective [108.30620357325559]
既存の機械生成テキスト(MGT)検出手法は、ラベルを「黄金標準」として暗黙的に仮定する
このような不正確な条件下での信頼性の高い監視を実現するための,容易かつハードな強化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-02T15:59:31Z) - Why Speech Deepfake Detectors Won't Generalize: The Limits of Detection in an Open World [11.238970239267248]
音声ディープフェイク検出器は、しばしばクリーンでベンチマークスタイルの条件で評価される。
しかしデプロイメントは、デバイスのシフト、サンプリング率、コーデック、環境、攻撃家族といったオープンな世界で発生します。
これにより、AIベースの検出器に対する"カバレッジ負債"が発生し、収集可能なデータよりも高速に成長するデータ盲点が生成される。
論文 参考訳(メタデータ) (2025-09-23T20:27:04Z) - Do Large Language Model Benchmarks Test Reliability? [66.1783478365998]
モデル信頼性の定量化について検討する。
信頼性評価におけるこのギャップにより、我々はいわゆるプラチナベンチマークの概念を提案する。
我々は、これらのプラチナベンチマークにおいて、幅広いモデルを評価し、実際、フロンティアLSMは、単純なタスクで失敗を示す。
論文 参考訳(メタデータ) (2025-02-05T18:58:19Z) - OoDIS: Anomaly Instance Segmentation and Detection Benchmark [57.89836988990543]
この作業は、インスタンスセグメンテーションとオブジェクト検出タスクを含むために、よく使われる異常セグメンテーションベンチマークを拡張します。
異常セグメンテーションおよびオブジェクト検出手法の評価は,これらの課題が未解決問題のままであることを示す。
論文 参考訳(メタデータ) (2024-06-17T17:59:56Z) - DeepfakeBench: A Comprehensive Benchmark of Deepfake Detection [55.70982767084996]
ディープフェイク検出の分野で見落とされがちな課題は、標準化され、統一され、包括的なベンチマークがないことである。
DeepfakeBenchと呼ばれる,3つの重要なコントリビューションを提供するディープフェイク検出のための,最初の包括的なベンチマークを提示する。
DeepfakeBenchには15の最先端検出方法、9CLデータセット、一連のDeepfake検出評価プロトコルと分析ツール、包括的な評価ツールが含まれている。
論文 参考訳(メタデータ) (2023-07-04T01:34:41Z) - Towards Computational Performance Engineering for Unsupervised Concept Drift Detection -- Complexities, Benchmarking, Performance Analysis [4.720921955899519]
コンセプトドリフト検出は、システムの信頼性を確保するために、多くのAIシステムにとって不可欠である。
これらのシステムは多くの場合、大量のデータを扱うか、リアルタイムに反応する必要がある。
ドリフト検出器は 総合的な性能評価で 計算要求や制約を満たさなければならない
論文 参考訳(メタデータ) (2023-04-17T14:39:56Z) - Pedestrian Detection: Domain Generalization, CNNs, Transformers and
Beyond [82.37430109152383]
その結果、現在の歩行者検知器は、クロスデータセット評価において、たとえ小さな領域シフトであっても処理が不十分であることがわかった。
限定的な一般化は、その方法と現在のデータ源の2つの主要な要因に帰着する。
本稿では、一般化を改善する進歩的な微調整戦略を提案する。
論文 参考訳(メタデータ) (2022-01-10T06:00:26Z) - Impact of Benign Modifications on Discriminative Performance of Deepfake
Detectors [11.881119750753648]
このような内容を特定するために、近年、多くのディープフェイク検出器が提案されている。
ディープフェイクは、エンターテイメントのような忠実なアプリケーションと、画像やビデオの偽造のような悪意ある意図された操作の両方で人気がある。
本稿では,より現実的な状況下でのディープフェイク検出器の性能を評価するための,より厳密で体系的な枠組みを提案する。
論文 参考訳(メタデータ) (2021-11-14T22:50:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。