論文の概要: Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2606.03730v2
- Date: Thu, 04 Jun 2026 14:10:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-05 19:21:33.197911
- Title: Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models
- Title(参考訳): ファルス安定性を超える:ビジョンランゲージモデルにおけるテスト時間対角防御のための高雑音ドリフトゲーティング
- Authors: Hashmat Shadab Malik, Muzammal Naseer, Salman Khan,
- Abstract要約: CLIPのような視覚言語モデル(VLM)は、強いゼロショットの一般化を示すが、敵攻撃に対して非常に脆弱である。
最近のアプローチでは、CLIPの視覚的表現が摂動にどのように反応するかを利用する。
軽量ゲーティング信号として高雑音特徴ドリフトを用いた学習自由なプラグインドリフトゲート機構を提案する。
- 参考スコア(独自算出の注目度): 37.24612885977265
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models (VLMs) such as CLIP show strong zero-shot generalization but remain highly vulnerable to adversarial attacks. Adversarial training improves robustness but is computationally expensive, motivating test-time defenses. Recent approaches exploit how CLIP's visual representations respond to stochastic perturbations: aggregating predictions across noisy views, constructing Gaussian noise-averaged anchors and interpolating features toward them, or applying counter-perturbations. These strategies improve robustness but often degrade clean accuracy, yielding an unfavorable clean-robust trade-off. We revisit stochastic test-time defenses and identify an underexplored noise-regime transition in CLIP's representation space. Prior work explored perturbations mainly in the weak-noise regime, where adversarial examples can appear unusually stable (false stability). Our analysis shows this reverses as perturbation strength grows: beyond the weak-noise regime, adversarial representations become markedly more unstable than clean ones, giving a clearer separation signal. The transition is consistent across uniform and Gaussian noise, photometric and geometric transforms, datasets, and diverse attacks. It largely disappears in adversarially trained models, suggesting it is tied to the fragile local-basin geometry of adversarial representations in non-robust CLIP. We propose a training-free, plug-in drift-gated mechanism that uses high-noise feature drift as a lightweight gating signal to trigger existing test-time defenses only when adversarial-like instability is detected. Across 13 datasets it consistently improves the clean-robust trade-off. On eight fine-grained datasets, mean clean+adversarial accuracy rises from 65.7% to 71.4% for counterattack defenses and 68.4% to 73.2% for noise-anchoring; on ImageNet and four shifted variants, from 56.1% to 66.2% and 62.1% to 67.6%.
- Abstract(参考訳): CLIPのような視覚言語モデル(VLM)は、強いゼロショットの一般化を示すが、敵攻撃に対して非常に脆弱である。
敵の訓練は堅牢性を改善するが、計算に高価であり、テスト時の防御を動機付けている。
最近のアプローチでは、CLIPの視覚的表現が確率的摂動にどのように反応するかが活用されている。
これらの戦略は頑丈さを向上するが、しばしば清潔な精度を低下させ、好ましくない清潔さのトレードオフをもたらす。
確率的テストタイムディフェンスを再考し,CLIPの表現空間における過度な雑音-登録遷移を同定する。
以前の研究は、主に弱いノイズ状態の摂動を探究し、敵の例は異常に安定しているように見える(偽の安定性)。
我々の分析では、摂動強度が増大するにつれて、この逆が示される:弱いノイズの体制を超えて、敵の表現はクリーンなものよりも著しく不安定になり、より明確な分離信号を与える。
遷移は、均一ノイズ、ガウスノイズ、測光および幾何変換、データセット、多様な攻撃で一致している。
主に敵対的に訓練されたモデルで消失し、非ロマンスCLIPの逆表現の脆弱な局所基底幾何学と結びついていることが示唆される。
本稿では,高雑音特徴ドリフトを軽量なゲーティング信号として用いて,対向的な不安定が検出された場合にのみ既存のテストタイムディフェンスをトリガーする,訓練不要なプラグインドリフトゲート機構を提案する。
13を越えるデータセットは、クリーンでロバストなトレードオフを継続的に改善する。
8つのきめ細かいデータセットでは、平均的クリーン/敵の精度は65.7%から71.4%に上昇し、ノイズアンカリングでは68.4%から73.2%に上昇し、ImageNetでは56.1%から66.2%に、62.1%から67.6%に変化した。
関連論文リスト
- Multi-Axis Trust Modeling for Interpretable Account Hijacking Detection [1.0152838128195467]
本稿では,ハディスにインスパイアされたマルチ軸信頼モデリングフレームワークを提案する。
我々は,5つの信頼軸 – 長期的整合性(アダラ),行動精度(ダブト),文脈連続性(アイソナド),累積的評価,異常証拠 – を,ユーザアカウントに対して意味論的に意味のある行動特徴からなる26のコンパクトなセットに翻訳する。
CLUE-LDSクラウドアクティビティデータセットのフレームワークを,インジェクトされたアカウントハイジャックシナリオを用いて評価した。
論文 参考訳(メタデータ) (2026-02-20T19:36:30Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - Test-Time Defense Against Adversarial Attacks via Stochastic Resonance of Latent Ensembles [42.57676672281981]
敵攻撃に対するテスト時間防御機構を提案する。
モデルの予測を著しく変える、知覚できないイメージの摂動。
本研究では,画像分類における精度損失の68.1%,ステレオマッチングでは71.9%,光学フローでは29.2%まで回復することを示した。
論文 参考訳(メタデータ) (2025-10-03T17:57:25Z) - TAPT: Test-Time Adversarial Prompt Tuning for Robust Inference in Vision-Language Models [53.91006249339802]
視覚的対人攻撃に対するCLIPの推論ロバスト性を高めるため, TAPT(Test-Time Adversarial Prompt Tuning)と呼ばれる新しい防御手法を提案する。
TAPTは、CLIPの推論プロセスを堅牢化するために、防御的バイモーダル(テキストと視覚)のプロンプトを学習するテストタイムディフェンス手法である。
我々は、ImageNetなど10のゼロショットデータセットを含む11のベンチマークデータセットに対するTAPTの有効性を評価する。
論文 参考訳(メタデータ) (2024-11-20T08:58:59Z) - MeanSparse: Post-Training Robustness Enhancement Through Mean-Centered Feature Sparsification [34.49704185920974]
MeanSparseは、敵の例に対する畳み込みと注意に基づくニューラルネットワークの堅牢性を改善する方法である。
実験の結果,MeanSparseは75.28%の新しいロバストネス記録を達成した。
論文 参考訳(メタデータ) (2024-06-09T22:14:55Z) - Certified Robustness Against Natural Language Attacks by Causal
Intervention [61.62348826831147]
Causal Intervention by Semantic Smoothing (CISS)は、自然言語攻撃に対する堅牢性に向けた新しい枠組みである。
CISSは単語置換攻撃に対して確実に堅牢であり、未知の攻撃アルゴリズムによって摂動が強化されたとしても経験的に堅牢である。
論文 参考訳(メタデータ) (2022-05-24T19:20:48Z) - From Environmental Sound Representation to Robustness of 2D CNN Models
Against Adversarial Attacks [82.21746840893658]
本稿では, 各種環境音響表現(スペクトログラム)が, 被害者残差畳み込みニューラルネットワークの認識性能と対角攻撃性に与える影響について検討する。
DWTスペクトログラムでトレーニングしたResNet-18モデルでは高い認識精度が得られたが、このモデルに対する攻撃は敵にとって比較的コストがかかる。
論文 参考訳(メタデータ) (2022-04-14T15:14:08Z) - Towards Adversarial Patch Analysis and Certified Defense against Crowd
Counting [61.99564267735242]
安全クリティカルな監視システムの重要性から、群衆のカウントは多くの注目を集めています。
近年の研究では、ディープニューラルネットワーク(DNN)の手法が敵の攻撃に弱いことが示されている。
群衆カウントモデルのロバスト性を評価するために,Momentumを用いた攻撃戦略としてAdversarial Patch Attackを提案する。
論文 参考訳(メタデータ) (2021-04-22T05:10:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。