論文の概要: PatchHead: Learning Spatial Patch Evidence for Generalizable AI-Generated Image Detection
- arxiv url: http://arxiv.org/abs/2608.09223v1
- Date: Mon, 10 Aug 2026 07:47:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.130326
- Title: PatchHead: Learning Spatial Patch Evidence for Generalizable AI-Generated Image Detection
- Title(参考訳): PatchHead: 一般化可能なAI生成画像検出のための空間的パッチエビデンス学習
- Authors: Shengbo Qi, Hongyi Fang, Benjia Zhou, Rui Mao,
- Abstract要約: 本稿では,DINOパッチトークンの2次元構造を保存し,近隣地域の証拠を統合する軽量な空間アグリゲーションヘッドであるPatchHeadを紹介する。
PatchHeadは、手動でキュレートされた9つのクロスデータセットベンチマークと、それに続く2つのデータセットで第1位、第2位である。
平均平衡精度(+3.0点)では91.6%から94.6%に改善され、最悪の場合の精度は82.4%から89.4%(+6.9点)に上昇する。
- 参考スコア(独自算出の注目度): 6.466210485064843
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI-generated image detectors generalize poorly when their training and test images originate from different generators or datasets. Despite the rich spatial representations produced by vision foundation models like DINO, existing detectors typically classify images using only the globally aggregated CLS token. We hypothesize that globally aggregating DINO features into a single CLS token obscures spatially distributed generation traces. To test this hypothesis, we introduce PatchHead, a lightweight spatial aggregation head that preserves the two-dimensional organization of DINO patch tokens and integrates evidence across neighboring regions. During training, we freeze the pretrained DINO backbone and optimize only the inserted LoRA adapters, PatchHead, and auxiliary projection head. Across nine cross-dataset benchmarks spanning manually curated and in-the-wild settings, PatchHead ranks first on seven datasets and second on the remaining two. It improves the strongest prior method from 91.6% to 94.6% in average balanced accuracy (+3.0 points) and raises the worst-case accuracy from 82.4% to 89.4% (+6.9 points), while introducing only 8.6% more trainable parameters and 0.08% additional FLOPs. Further qualitative analysis suggests that PatchHead (i) reduces class-conditional domain discrepancy, and (ii) redirects the representation from content-dominated saliency toward spatially distributed authenticity evidence. Together, these observations provide a representation-level account of why spatial patch aggregation transfers more reliably across generators and datasets than a single CLS-based global representation. Our code and models will be made available upon acceptance.
- Abstract(参考訳): AI生成画像検出器は、トレーニングとテスト画像が異なるジェネレータやデータセットに由来する場合に、十分に一般化する。
DINOのようなビジョンファウンデーションモデルによって生成される豊かな空間表現にもかかわらず、既存の検出器は通常、グローバルに集約されたCRSトークンのみを使用して画像を分類する。
我々は,DINOをグローバルに集約した単一CLSトークンが空間的に分散した生成トレースを隠蔽する,という仮説を立てた。
この仮説をテストするために、DINOパッチトークンの2次元構造を保存し、近隣地域の証拠を統合する軽量な空間アグリゲーションヘッドであるPatchHeadを導入する。
トレーニング中、トレーニング済みのDINOバックボーンを凍結し、挿入されたLoRAアダプタ、PatchHead、補助投射ヘッドのみを最適化する。
PatchHeadは、手動でキュレートされた9つのクロスデータセットベンチマークと、それに続く2つのデータセットで第1位、第2位である。
平均的平衡精度(+3.0点)では91.6%から94.6%に改善され、最悪の場合の精度は82.4%から89.4%(+6.9点)に上昇し、訓練可能なパラメータは8.6%、追加のFLOPは0.08%となった。
さらなる定性的分析からPatchHeadが示唆される
i)クラス条件ドメインの不一致を減らし、
(ii) 空間的分布の正当性証拠に対して、内容が支配される正当性から表現をリダイレクトする。
これらの観測は、なぜ空間的パッチアグリゲーションが単一のCLSベースのグローバル表現よりもジェネレータやデータセット間で確実に転送されるのかを、表現レベルで説明する。
私たちのコードとモデルは受け入れ次第利用可能になります。
関連論文リスト
- iSAGE: A Human-in-the-Loop Framework for Remote Sensing Semantic Segmentation via Sparse Point Supervision [0.1749935196721634]
既存のHuman-in-the-loopフレームワークは、余分なクリックを補助機械を介して密集した監視に拡張する。
本稿では, 任意の画素ではなく, 信頼度の高いモデル誤差をターゲットとした, 専門家によるクリックが, 厳密な監督と一致させるのに十分である,という仮説を立てる。
iSAGEは補助機械を使わずに動作する唯一の反復型人間-イン-ザ-ループフレームワークである。
論文 参考訳(メタデータ) (2026-06-08T20:09:35Z) - What matters for Representation Alignment: Global Information or Spatial Structure? [64.67092609921816]
表現アライメント(REPA)は、強い事前訓練された視覚エンコーダから中間拡散特徴への表現を蒸留することにより、生成訓練を導く。
本稿では,対象表現のどの側面が生成に重要であるか,そのテクスト・グロバル・リビジョン・セマンティック・情報について検討する。
我々はREPAの標準射影層を単純な畳み込み層に置き換え、外部表現のための空間正規化層を導入する。
論文 参考訳(メタデータ) (2025-12-11T16:39:53Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Improved Anomaly Detection through Conditional Latent Space VAE Ensembles [49.1574468325115]
条件付きラテント空間変分オートエンコーダ(CL-VAE)は、既知の不整形クラスと未知の不整形クラスを持つデータに対する異常検出のための前処理を改善した。
モデルでは異常検出の精度が向上し、MNISTデータセットで97.4%のAUCが達成された。
さらに、CL-VAEは、アンサンブルの利点、より解釈可能な潜在空間、モデルサイズに制限のある複雑なデータでパターンを学習する能力の増大を示す。
論文 参考訳(メタデータ) (2024-10-16T07:48:53Z) - Less is More: Fewer Interpretable Region via Submodular Subset Selection [54.07758302264416]
本稿では,上述の画像帰属問題を部分モジュラ部分選択問題として再モデル化する。
我々は、より正確な小さな解釈領域を発見するために、新しい部分モジュラー関数を構築する。
正しく予測されたサンプルに対しては,HSIC-Attributionに対する平均4.9%と2.5%の利得で,Deletion and Insertionスコアを改善した。
論文 参考訳(メタデータ) (2024-02-14T13:30:02Z) - Pre-processing training data improves accuracy and generalisability of
convolutional neural network based landscape semantic segmentation [2.8747398859585376]
オーストラリア,クイーンズランド州ウェット・トロピクスとアザートン・テーブルランズ上空の航空写真における土地利用土地被覆(LULC)の特徴のセマンティックセグメンテーションとCNN訓練のための様々なデータ準備方法を試行した。
これは、さまざまなトレーニングパッチ選択サンプリング戦略、パッチとバッチサイズ、データ拡張とスケーリングの試行とランキングによって実施された。
我々は、2018年のトレーニング画像上で5つのモデルを訓練し、2015年の試験画像に適用し、出力LULC分類により平均ユーザ精度0.84、生産精度0.87を達成した。
論文 参考訳(メタデータ) (2023-04-28T04:38:45Z) - Data Augmentation with norm-VAE for Unsupervised Domain Adaptation [26.889303784575805]
我々は,高次元同次特徴空間内の両領域に対して,明示的な領域適応を伴わない統一型分類器を学習する。
提案手法は,SPL(Selective Pseudo-Labelling)技術を用いて,対象領域の未ラベルサンプルを有効活用する。
本稿では,データ拡張戦略として,対象領域の合成特徴を生成する新しい生成モデルノルムVAEを提案する。
論文 参考訳(メタデータ) (2020-12-01T21:41:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。