論文の概要: Unleashing the Potential of Vision-Language Models for Generalizable AI-Generated Image Detection
- arxiv url: http://arxiv.org/abs/2608.04935v1
- Date: Wed, 05 Aug 2026 15:03:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.967244
- Title: Unleashing the Potential of Vision-Language Models for Generalizable AI-Generated Image Detection
- Title(参考訳): 一般化可能なAI生成画像検出のための視覚言語モデルの可能性
- Authors: Weihan Cai, Hao Tan, Zichang Tan, Jun Wan, Xinping Gao,
- Abstract要約: 我々は,視覚生成モデル Perception (PE) がAIGI検出の可能性が大きいことを示した。
PEは、その凍結した特徴空間において、DINOv3よりも強い局所前駆組織を示す。
法科学的な意味情報からプロトタイプを構築し,それらを教師付きデータで校正するセマンティックプロトタイプ(SPC)を提案する。
- 参考スコア(独自算出の注目度): 17.695017293111153
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent work has shown that a simple linear probe on frozen representations from modern vision foundation models (VFMs) can achieve state-of-the-art AIGI detection performance, substantially outperforming specialized detectors in challenging in-the-wild scenarios. This finding has established DINOv3 as the dominant foundation-model baseline for subsequent improvements. However, we find that the vision-language model Perception Encoder (PE) holds greater potential for AIGI detection, because its language-aligned representation preserves high-level provenance semantics. Specifically, PE exhibits stronger local provenance organization than DINOv3 in its frozen feature space. However, semantic-agnostic linear probing fails to exploit this structure, as PE-Linear still underperforms DINOv3-Linear by 4.1% on In-the-Wild. Based on this observation, we propose Semantic Prototype Calibration (SPC), which constructs category prototypes from forensic semantic information and calibrates them with supervised data. We apply SPC to PE and refer to the resulting detector as PE-SPC. Our analysis shows that this simple design achieves stronger generalization. Across cross-generator, post-processing, and in-the-wild benchmarks, PE-SPC surpasses the previous DINOv3 baseline and achieves new state-of-the-art results.
- Abstract(参考訳): 近年の研究では、現代の視覚基礎モデル(VFM)からの凍結表現に関する単純な線形プローブが、最先端のAIGI検出性能を達成できることが示されている。
この発見は、DINOv3をその後の改善のための主要な基盤モデルベースラインとして確立した。
しかし,視覚言語モデルPerception Encoder (PE) は,その言語対応表現がハイレベルな証明セマンティクスを保っているため,AIGI検出の潜在的な可能性を秘めている。
具体的には、PEは、その凍結した特徴空間において、DINOv3よりも強い局所前駆組織を示す。
PE-LinearはまだDINOv3-LinearをIn-the-Wild上で4.1%下回っている。
そこで本研究では,SPC(Semantic Prototype Calibration)を提案する。
SPC を PE に適用し,その結果の検出器を PE-SPC と呼ぶ。
この単純な設計がより強力な一般化を実現することを示す。
クロスジェネレータ、ポストプロセッシング、およびインザワイルドベンチマーク全体にわたって、PE-SPCは以前のDINOv3ベースラインを超え、新しい最先端結果を達成する。
関連論文リスト
- Cross-Domain Generalization Limits of Vision Foundation Models in Facial Deepfake Detection [2.538209532048867]
生成モデルは、超現実的な顔のディープフェイクの作成を可能にした。
伝統的なネットワークは表現の崩壊に悩まされ、局所化されたアーティファクトの指紋に過度に適合する。
本研究では、現代のビジョンファウンデーション・モデルが一般化可能な、アウト・オブ・ザ・ボックスな特徴抽出器として機能するかどうかを考察する。
論文 参考訳(メタデータ) (2026-05-24T09:33:46Z) - Vendi Novelty Scores for Out-of-Distribution Detection [5.450782029661113]
Vendi Novelty Score(VNS)はVendi Scores(VS)に基づくOOD検出器である。
VNSは線形時間であり、非パラメトリックであり、クラス条件(ローカル)とデータセットレベル(グローバル)のノベルティ信号とを自然に組み合わせている。
VNSは、トレーニングデータの1%しか使用せず、メモリやアクセス制限のある設定でのデプロイメントを可能にすると、このパフォーマンスを維持する。
論文 参考訳(メタデータ) (2026-02-10T18:30:29Z) - Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models [15.709482146201283]
現代のビジョン・ファンデーション・モデル(Vision Foundation Models)の凍結した特徴に基づいて訓練された単純な線形分類器は、新しい最先端技術を確立している。
この基準線は標準ベンチマーク上の特別な検出器と一致し、また、ウィジェット内のデータセット上では決定的に優れていることを示す。
我々は、AIの法医学におけるパラダイムシフトを提唱し、静的ベンチマークの過度な適合から、ファンデーションモデルの進化する世界の知識を現実の信頼性に活用することへと移行した。
論文 参考訳(メタデータ) (2026-02-02T07:20:02Z) - SSVP: Synergistic Semantic-Visual Prompting for Industrial Zero-Shot Anomaly Detection [55.54007781679915]
本稿では,多種多様な視覚的エンコーディングを効率よく融合させ,モデルの微粒化知覚を高めるSynergistic Semantic-Visual Prompting (SSVP)を提案する。
SSVPは、MVTec-AD上で93.0%のImage-AUROCと92.2%のPixel-AUROCで最先端のパフォーマンスを達成し、既存のゼロショットアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2026-01-14T04:42:19Z) - IRPO: Boosting Image Restoration via Post-training GRPO [59.588079259093035]
我々は低レベルのGRPOベースのポストトレーニングパラダイムIRPOを提案する。
まず,低レベルのポストトレーニングパラダイムのデータ定式化原理について検討する。
次に、客観的精度と人間の知覚的嗜好のバランスをとる報酬レベル基準をモデル化する。
論文 参考訳(メタデータ) (2025-11-30T09:42:24Z) - From Flight to Insight: Semantic 3D Reconstruction for Aerial Inspection via Gaussian Splatting and Language-Guided Segmentation [3.0477617036157136]
高忠実度3D再構成は, インフラ監視, 構造評価, 環境調査などの航空検査業務において重要である。
従来のフォトグラム法は幾何学的モデリングを可能にするが、意味論的解釈性に欠け、自動検査の有効性を制限している。
ニューラルレンダリングと3Dガウススプラッティング(3DGS)の最近の進歩は、効率的でフォトリアリスティックな再構築を提供するが、同様にシーンレベルの理解が欠如している。
言語誘導型3DセグメンテーションのためにFeature-3DGSを拡張するUAVベースのパイプラインを提案する。
論文 参考訳(メタデータ) (2025-05-23T02:35:46Z) - ACTRESS: Active Retraining for Semi-supervised Visual Grounding [52.08834188447851]
前回の研究であるRefTeacherは、疑似自信と注意に基づく監督を提供するために教師学生の枠組みを採用することで、この課題に取り組むための最初の試みである。
このアプローチは、Transformerベースのパイプラインに従う現在の最先端のビジュアルグラウンドモデルと互換性がない。
本稿では, ACTRESS を略したセミスーパービジョン視覚グラウンドのためのアクティブ・リトレーニング手法を提案する。
論文 参考訳(メタデータ) (2024-07-03T16:33:31Z) - DetCLIPv3: Towards Versatile Generative Open-vocabulary Object Detection [111.68263493302499]
DetCLIPv3は、オープンボキャブラリオブジェクト検出と階層ラベルの両方で優れた高性能検出器である。
DetCLIPv3は,1)Versatileモデルアーキテクチャ,2)高情報密度データ,3)効率的なトレーニング戦略の3つのコア設計によって特徴付けられる。
DetCLIPv3は、GLIPv2, GroundingDINO, DetCLIPv2をそれぞれ18.0/19.6/6 APで上回り、優れたオープン語彙検出性能を示す。
論文 参考訳(メタデータ) (2024-04-14T11:01:44Z) - Generalizable Industrial Visual Anomaly Detection with Self-Induction
Vision Transformer [5.116033262865781]
産業用視覚異常検出・局所化のための自己誘導型視覚変換器(SIVT)を提案する。
提案したSIVTは、まず、事前学習したCNNからプロパティ記述子として識別特徴を抽出し、抽出した特徴を自己監督的に再構成する。
その結果,AUROCでは2.8-6.3,APでは3.3-7.6の改善により,最先端検出性能を向上できることがわかった。
論文 参考訳(メタデータ) (2022-11-22T14:56:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。