論文の概要: A New Kind of Adversarial Example: Measuring the Human-Model Gap, and Its Relationship to OOD Detection
- arxiv url: http://arxiv.org/abs/2607.22722v1
- Date: Wed, 22 Jul 2026 00:44:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.842347
- Title: A New Kind of Adversarial Example: Measuring the Human-Model Gap, and Its Relationship to OOD Detection
- Title(参考訳): 人間モデルギャップの測定とOOD検出との関係
- Authors: Ali Borji,
- Abstract要約: 大きく、はっきりと見える摂動は、人間がもはや画像を認識しないにもかかわらず、モデルが元の正しい予測を維持する原因となる。
我々は、人間がモデルよりも本当に悪いパフォーマンスをしているか、標準配当(OOD)検出と校正ツールがそれをキャッチしているか、既存の防御がそれを緩和するかどうかを答える。
- 参考スコア(独自算出の注目度): 18.313155919803034
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Almost all adversarial attacks add an imperceptible perturbation to fool a model. We instead study the opposite: a large, clearly visible perturbation that causes the model to keep its original, correct prediction, even though a human would no longer recognize the image. Prior work showed such examples can be generated at scale but left three questions untested: whether humans really perform worse than the model, whether standard out-of-distribution (OOD) detection and calibration tools catch it, and whether existing defenses mitigate it. We answer all three on MNIST, CIFAR-10, and ImageNet. (i) An independent recognizer proxy drops to ~49% on CIFAR-10 while the model stays at 100% -- a gap a small human pilot (N=5) corroborates directly and that is not explained by signal loss (a matched-magnitude Gaussian control degrades recognizability faster); a CLIP zero-shot proxy confirms the gap at ImageNet scale too. (ii) Confidence- and energy-based OOD detectors and calibration are structurally blind (0% detection, ECE ~= 0), while a feature-space Mahalanobis detector flags 100% -- but is evaded by an adaptive attacker at no cost to success. (iii) No classical defense, including adversarial training (45% robust accuracy), reduces attack success (correlation with large-epsilon_l resistance r ~= 0). A mechanistic analysis further shows the attack destroys low-level texture far faster than edge/shape structure.
- Abstract(参考訳): ほぼ全ての敵攻撃は、モデルを騙すために知覚できない摂動を加える。
私たちはその逆について研究する:大きな目に見える摂動によって、人間がもはや画像を認識しなくても、モデルは元の正しい予測を維持することができる。
これまでの研究では、このような例を大規模に生成することはできたが、人間がモデルよりも本当に悪い結果を出すかどうか、標準のアウト・オブ・ディストリビューション(OOD)検出と校正ツールがそれをキャッチするかどうか、既存の防御がそれを緩和するかどうか、という3つの疑問を残した。
MNIST、CIFAR-10、ImageNetの3つすべてに答える。
(i)独立型認識器プロキシはCIFAR-10で約49%に低下し、モデルが100%に留まる -- 小さな人間のパイロット(N=5)が直接相関し、信号損失によって説明されないギャップ(一致したマグニチュードのガウス制御が認識可能性の低下を速くする) — CLIPゼロショットプロキシは、ImageNetスケールのギャップも確認する。
(二)信頼とエネルギーに基づくOOD検出器と校正は構造的に盲目であり(0%、ECE ~= 0)、特徴空間のマハラノビス検出器のフラグは100%である。
3) 対人訓練を含む古典的防御(45%の堅牢な精度)は,攻撃成功を減少させる(大エプシロン_l抵抗r~=0との相関)。
メカニスティック解析により、攻撃はエッジ/形状構造よりもはるかに早く低レベルのテクスチャを破壊することが示された。
関連論文リスト
- A Few Large Shifts: Layer-Inconsistency Based Minimal Overhead Adversarial Example Detection [13.109309606764754]
我々は、ターゲットモデル自体の内部の階層的不整合を利用するプラグイン検出フレームワークを導入する。
本手法は計算オーバーヘッドを無視して最先端検出性能を実現する。
論文 参考訳(メタデータ) (2025-05-19T00:48:53Z) - Elijah: Eliminating Backdoors Injected in Diffusion Models via
Distribution Shift [86.92048184556936]
DMの最初のバックドア検出・除去フレームワークを提案する。
DDPM, NCSN, LDMを含む3種類のDMを用いて, フレームワークのElijahを評価した。
提案手法では, モデルの有用性を著しく損なうことなく, 検出精度が100%に近づき, バックドア効果をゼロに抑えることができる。
論文 参考訳(メタデータ) (2023-11-27T23:58:56Z) - Disarming Steganography Attacks Inside Neural Network Models [4.750077838548593]
本稿では,AIモデル攻撃の解除と再構築に基づくゼロトラスト防止戦略を提案する。
本研究では,Qint8法とK-LRBP法に基づくモデル精度の低下を最小限に抑えながら,100%の防止率を示す。
論文 参考訳(メタデータ) (2023-09-06T15:18:35Z) - Discriminator-Free Generative Adversarial Attack [87.71852388383242]
生成的ベースの敵攻撃は、この制限を取り除くことができる。
ASymmetric Saliency-based Auto-Encoder (SSAE) は摂動を生成する。
SSAEが生成した敵の例は、広く使われているモデルを崩壊させるだけでなく、優れた視覚的品質を実現する。
論文 参考訳(メタデータ) (2021-07-20T01:55:21Z) - Adaptive Feature Alignment for Adversarial Training [56.17654691470554]
CNNは通常、敵攻撃に対して脆弱であり、セキュリティに敏感なアプリケーションに脅威をもたらす。
任意の攻撃強度の特徴を生成するための適応的特徴アライメント(AFA)を提案する。
本手法は任意の攻撃強度の特徴を自動的に整列するように訓練されている。
論文 参考訳(メタデータ) (2021-05-31T17:01:05Z) - Towards Adversarial Patch Analysis and Certified Defense against Crowd
Counting [61.99564267735242]
安全クリティカルな監視システムの重要性から、群衆のカウントは多くの注目を集めています。
近年の研究では、ディープニューラルネットワーク(DNN)の手法が敵の攻撃に弱いことが示されている。
群衆カウントモデルのロバスト性を評価するために,Momentumを用いた攻撃戦略としてAdversarial Patch Attackを提案する。
論文 参考訳(メタデータ) (2021-04-22T05:10:55Z) - Optimal Transport as a Defense Against Adversarial Attacks [4.6193503399184275]
敵対的攻撃は、訓練されたモデルを誤解させる画像に対して、人間の知覚できない摂動を見つけることができる。
従来の研究は、原画像と敵対画像の整合性をドメイン適応と同等に調整し、堅牢性を向上させることを目的としていた。
地上距離を忠実に反映した分布間の損失を用いることを提案する。
これによりSAT (Sinkhorn Adversarial Training) は敵の攻撃に対してより堅牢な防衛を行う。
論文 参考訳(メタデータ) (2021-02-05T13:24:36Z) - Probing Model Signal-Awareness via Prediction-Preserving Input
Minimization [67.62847721118142]
モデルが正しい脆弱性信号を捕捉して予測する能力を評価する。
SAR(Signal-Aware Recall)と呼ばれる新しい指標を用いて,モデルの信号認識を計測する。
その結果,90年代以降のリコールから60年代以降のリコールは,新たな指標で大幅に減少した。
論文 参考訳(メタデータ) (2020-11-25T20:05:23Z) - Adversarial Detection and Correction by Matching Prediction
Distributions [0.0]
この検出器は、MNISTとFashion-MNISTに対するCarini-WagnerやSLIDEのような強力な攻撃をほぼ完全に中和する。
本手法は,攻撃者がモデルと防御の両方について十分な知識を持つホワイトボックス攻撃の場合においても,なおも敵の例を検出することができることを示す。
論文 参考訳(メタデータ) (2020-02-21T15:45:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。