論文の概要: VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection
- arxiv url: http://arxiv.org/abs/2607.06254v1
- Date: Tue, 07 Jul 2026 13:22:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.53234
- Title: VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection
- Title(参考訳): VendorBench-100:ディープフェイク画像検出のための一貫したクロスパラダイムベンチマーク
- Abstract要約: VendorBench-100は、ディープフェイク画像検出のためのクロスパラダイムなベンチマークである。
単一対角100画像コーパス,統一出力スキーマ,共通評価フレームワークを用いて36種類の代表モデルを評価する。
評価の結果,商用APIが最も高い性能を達成し,次いでビジョンLLMとオープンソース検出器が続いた。
- 参考スコア(独自算出の注目度): 0.04736448323490553
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deepfake image detection is currently served by three fundamentally different paradigms: commercial APIs, zero-shot vision-language models (LLMs), and open-source detectors. Despite their widespread use, these paradigms are rarely evaluated under a common protocol, making direct comparison difficult. We introduce VendorBench-100, a cross-paradigm benchmark that evaluates 36 representative models using a single adversarial 100-image corpus, a unified output schema, and a common evaluation framework. To ensure reliable assessment under the corpus's intentional class imbalance, models are ranked primarily by the Matthews correlation coefficient (MCC), with ROC-AUC reported as a threshold-independent measure of ranking ability. Rather than maximizing dataset size, VendorBench-100 emphasizes challenging real-world scenarios through a curated taxonomy of eight edge-case families, including face swaps, text-to-video stills, AI photo edits, avatar compositing, opaque-provenance images, and compressed research frames. Our evaluation shows that commercial APIs achieve the strongest median performance, followed by vision LLMs and open-source detectors. However, individual open-source models remain competitive with the best vision LLMs. More importantly, we identify a consistent divergence between ranking ability (ROC-AUC) and operating-point quality (MCC), demonstrating that strong score discrimination does not necessarily produce reliable default-threshold decisions. This metric disagreement, rather than any single leaderboard ranking, is the central finding of the benchmark. We release the complete evaluation framework and benchmark results to support reproducible future research. The source code and data are available at: https://github.com/sharayu-20/vendorbench-100
- Abstract(参考訳): 現在、Deepfakeイメージ検出には、商用API、ゼロショットビジョン言語モデル(LLM)、オープンソース検出器の3つの基本的パラダイムが提供されている。
広く使われているにもかかわらず、これらのパラダイムは共通のプロトコルで評価されることは稀であり、直接比較することが困難である。
我々は,1つの逆数100画像コーパス,統一出力スキーマ,共通評価フレームワークを用いて36の代表モデルを評価可能な,パラダイム横断ベンチマークであるVendorBench-100を紹介する。
コーパスの意図的クラス不均衡の下で信頼性の高い評価を保証するため、モデルは主にマシューズ相関係数(MCC)によってランク付けされ、ROC-AUCはランク付け能力のしきい値に依存しない尺度として報告されている。
データセットのサイズを最大化するのではなく、VendorBench-100は、顔スワップ、テキスト・トゥ・ビデオスチール、AI写真編集、アバター合成、不透明なプロパガンス画像、圧縮された研究フレームを含む8つのエッジケースファミリーのキュレートされた分類を通じて、現実のシナリオに挑戦することを強調している。
評価の結果,商用APIが最も高い性能を達成し,次いでビジョンLLMとオープンソース検出器が続いた。
しかしながら、個々のオープンソースモデルは、最高のビジョン LLM と競合するままである。
さらに重要なことは、ランキング能力(ROC-AUC)とオペレーティングポイント品質(MCC)の相反する相違点を同定し、強いスコアの判別が必ずしも信頼できるデフォルト閾値決定を生成するとは限らないことを示すことである。
この指標の不一致は、単一のリーダーボードランキングではなく、ベンチマークの中心的な発見である。
再現可能な将来の研究を支援するために、完全な評価フレームワークとベンチマーク結果をリリースする。
ソースコードとデータは、https://github.com/sharayu-20/vendorbench-100で入手できる。
関連論文リスト
- Scaling Vision-Language Models Is Not Enough to Mitigate Bias [17.05392655320793]
VLM(Vision-Language Models)は、現在ではマルチモーダルシステムの基礎となっているが、素早い相関に対する頑健さは、大規模にはあまり理解されていない。
本報告では, モデルサイズ, 24 のトレーニングデータセット, 3 つの評価ベンチマークを対象とし, 194 の公開 VLM に関する大規模な実証的研究を行った。
論文 参考訳(メタデータ) (2026-07-30T13:49:16Z) - A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models [0.0]
本稿では,絶対的正当性ではなく,モデル生成応答間の相対的嗜好を測定する,コンセンサスに基づく評価フレームワークを提案する。
我々は、プログラミング、一般知識、安全性、論理的推論、数学を含む、複数の領域にわたる最先端のLLMを用いて、制御された研究を行う。
スコアはリレーショナルインテリジェンス指数(RII)に集約され、モデルの反応が他のモデルでどれだけ頻繁に好まれるかを表す。
論文 参考訳(メタデータ) (2026-07-19T08:59:19Z) - MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation [88.7702943548674]
マルチショットオーディオビデオ生成のための,初の総合的なベンチマークと適応型ハイブリッド評価フレームワークであるMSAVBenchを紹介する。
私たちのベンチマークでは、ビデオ、オーディオ、ショット、参照の4つの重要な領域にまたがっており、多様なタスク設定、最大15のショット数、非現実的なシナリオに挑戦しています。
MSAVBenchは人間の判断と高度に一致し、スピアマンのランク相関は91.5%に達する。
論文 参考訳(メタデータ) (2026-05-19T17:59:33Z) - What Matters for Grocery Product Retrieval with Open Source Vision Language Models [0.0]
本稿では,GroceryVision Challenge の MPR タスクにおいて,190個のオープンソース VLM のゼロショット評価を行った。
生のWebスクレイプからフィルタリングデータセットへの切り替えは、最大16.6%の精度向上をもたらす。
最先端モデルは94.5%のRecall@5を達成するが、Recall@1では17.5%の低下を被り、対照的な埋め込みはクラスタカテゴリを効果的に活用するが、視覚的に類似したSKUをランク付けすることができないことが明らかになった。
論文 参考訳(メタデータ) (2026-05-18T08:20:13Z) - DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning [26.88130913151649]
画像差分キャプション(IDC)は、2つの画像の違いを正確に識別する言語記述を生成する。
DiffCap-Benchは10の異なるカテゴリをカバーする総合的なIDCベンチマークである。
また,人間の有意差分リストに基づくLCM-as-a-Judge評価プロトコルを提案する。
論文 参考訳(メタデータ) (2026-05-06T05:12:41Z) - EvaNet: Towards More Efficient and Consistent Infrared and Visible Image Fusion Assessment [63.853717062482815]
画像融合研究において評価は不可欠であるが、既存の指標のほとんどは、適切な適応なしに他の視覚タスクから直接借用されている。
画像融合に適した統合評価フレームワークを提案する。
我々の学習に基づく評価パラダイムは、様々な標準画像融合ベンチマークにおいて、優れた効率(最大1000倍高速)とより優れた一貫性を提供する。
論文 参考訳(メタデータ) (2026-04-03T09:12:16Z) - Learning More from Less: Unlocking Internal Representations for Benchmark Compression [37.69575776639016]
異種隠蔽状態を統一潜在空間に整列させて代表コアセットを構成するREPCOREを導入する。
5つのベンチマークと200以上のモデルの実験は、ランキングの相関と推定精度において、出力ベースラインよりも一貫した利得を示している。
論文 参考訳(メタデータ) (2026-01-31T13:11:39Z) - ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation [51.297873393639456]
ArtifactsBenchは自動ビジュアルコード生成評価のためのフレームワークである。
我々のフレームワークは、生成した各アーティファクトをレンダリングし、時間的スクリーンショットを通してその動的な振る舞いをキャプチャする。
我々は1,825の多様なタスクの新しいベンチマークを構築し、30以上の主要な大規模言語モデルを評価する。
論文 参考訳(メタデータ) (2025-07-07T12:53:00Z) - Out-of-Distribution Detection with Relative Angles [30.417495930986536]
本稿では, 分布内構造に対して計算されるOOD検出のための新しい角度に基づく計量法を提案する。
提案手法は,9つのImageNet事前学習モデルを用いて評価する。
論文 参考訳(メタデータ) (2024-10-06T15:36:07Z) - Revisiting Few-Shot Object Detection with Vision-Language Models [49.79495118650838]
我々は、最近の基礎視覚言語モデル(VLM)の文脈で、少数ショットオブジェクト検出(FSOD)のタスクを再考する。
我々は,任意の外部データ上で事前学習された検出器を評価する新しいベンチマークプロトコルであるFoundational FSODを提案する。
CVPR 2024 Foundational FSOD コンペティションについて論じ,コミュニティからの洞察を共有した。
論文 参考訳(メタデータ) (2023-12-22T07:42:00Z) - Preserving Knowledge Invariance: Rethinking Robustness Evaluation of Open Information Extraction [49.15931834209624]
実世界におけるオープン情報抽出モデルの評価をシミュレートする最初のベンチマークを示す。
我々は、それぞれの例が知識不変のcliqueである大規模なテストベッドを設計し、注釈付けする。
さらにロバスト性計量を解明することにより、その性能が全体の傾きに対して一貫して正確であるならば、モデルはロバストであると判断される。
論文 参考訳(メタデータ) (2023-05-23T12:05:09Z) - GREAT Score: Global Robustness Evaluation of Adversarial Perturbation using Generative Models [60.48306899271866]
GREATスコア(GREAT Score)と呼ばれる新しいフレームワークを提案する。
我々は,ロバストベンチにおける攻撃ベースモデルと比較し,高い相関性を示し,GREATスコアのコストを大幅に削減した。
GREAT Scoreは、プライバシーに敏感なブラックボックスモデルのリモート監査に使用することができる。
論文 参考訳(メタデータ) (2023-04-19T14:58:27Z) - Trusted Multi-View Classification [76.73585034192894]
本稿では,信頼された多視点分類と呼ばれる新しい多視点分類手法を提案する。
さまざまなビューをエビデンスレベルで動的に統合することで、マルチビュー学習のための新しいパラダイムを提供する。
提案アルゴリズムは,分類信頼性とロバスト性の両方を促進するために,複数のビューを併用する。
論文 参考訳(メタデータ) (2021-02-03T13:30:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。