論文の概要: Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models
- arxiv url: http://arxiv.org/abs/2605.19956v1
- Date: Tue, 19 May 2026 15:10:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-20 15:03:09.464291
- Title: Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models
- Title(参考訳): 微粒化ロバスト性に向けて:視覚言語モデルのための注意誘導テスト時間プロンプトチューニング
- Abstract要約: A-TPTはテスト時間適応のために設計されたセマンティックス保存法である。
まず、敵攻撃下で生存する意味的に意味のある領域を特定するために、勾配注意ロールアウト機構を改良する。
そこで我々は,空間的に異なる拡張強度と多視点アンサンブルを誘導し,迅速なチューニングと推論を行う。
- 参考スコア(独自算出の注目度): 22.43559255963294
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Models (VLMs), such as CLIP, have achieved significant zero-shot performance on downstream tasks with various fine-tuning adaptation methods. However, recent studies have proven that adversarial attacks can significantly degrade the inference ability of VLMs, posing substantial risks to their practical applications. Prevalent test-time adaptation methods typically rely on multi-view augmentation to implement various fine-tuning strategies, which struggle to identify semantic information and are prone to destroying discriminative regions in fine-grained scenarios. To address these limitations, we propose Attention-Guided Test-Time Prompt Tuning (A-TPT), a semantics-preserving method designed for test-time adaptation. We first refine the gradient attention rollout mechanism to identify semantically meaningful regions surviving under adversarial attacks. Furthermore, we leverage them to guide the spatially varying augmentation intensities and multi-view ensemble for prompt tuning and inference. Extensive experiments demonstrate that A-TPT outperforms existing test-time adaptation methods on both adversarial and clean data. Codes are available at https://github.com/SEU-VIPGroup/A-TPT .
- Abstract(参考訳): CLIPのような視覚言語モデル(VLM)は、様々な微調整アダプティブ手法を用いて下流タスクにおいて大きなゼロショット性能を実現している。
しかし、近年の研究では、敵対的攻撃はVLMの推論能力を著しく低下させ、その実践的応用に重大なリスクをもたらすことが証明されている。
一般的なテスト時間適応法は、様々な微調整戦略を実装するために、多面的な拡張に依存しており、セマンティックな情報を識別するのに苦労し、きめ細かいシナリオで識別領域を破壊するのが困難である。
これらの制約に対処するため,テスト時間適応のためのセマンティクス保存手法であるAttention-Guided Test-Time Prompt Tuning (A-TPT)を提案する。
まず、敵攻撃下で生存する意味的に意味のある領域を特定するために、勾配注意ロールアウト機構を改良する。
さらに,空間的に異なる拡張強度と多視点アンサンブルを誘導し,迅速なチューニングと推論を行う。
A-TPTは、逆データとクリーンデータの両方において、既存のテスト時間適応法よりも優れていることを示す。
コードはhttps://github.com/SEU-VIPGroup/A-TPT で公開されている。
関連論文リスト
- PromptCD: Test-Time Behavior Enhancement via Polarity-Prompt Contrastive Decoding [85.22047087898311]
本稿では,より広範な拡張設定へのコントラストデコーディングを一般化するテスト時動作制御手法であるPolarity-Prompt Contrastive Decoding(PromptCD)を紹介する。
PromptCDは、目標行動のためのペアの正と負の導出プロンプトを構築し、望ましい結果を強化するためにモデル応答を対比する。
3H"アライメントの目的に関する実験では、一貫性と実質的な改善が示されている。
論文 参考訳(メタデータ) (2026-02-24T08:56:52Z) - SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models [21.133970394496327]
VLA(Vision-Language-Action)モデルが汎用ロボット制御の有望なパラダイムとして登場した。
現在のテストタイムスケーリング(TTS)メソッドでは、追加のトレーニング、検証、複数フォワードパスが必要になるため、デプロイには実用的ではない。
我々は,「自己不確実性」に基づく視覚的知覚と行動を協調的に調節するシンプルな推論戦略を提案する。
論文 参考訳(メタデータ) (2026-02-04T04:48:16Z) - Steering Vision-Language Pre-trained Models for Incremental Face Presentation Attack Detection [62.89126207012712]
顔提示攻撃検出(PAD)は、スプーフィング戦術やドメインと戦うために漸進的な学習を要求する。
過去のデータ保持を禁止し、リハーサルフリーラーニング(RF-IL)を必要とするプライバシー規制
論文 参考訳(メタデータ) (2025-12-22T04:30:11Z) - Contamination Detection for VLMs using Multi-Modal Semantic Perturbation [73.76465227729818]
オープンソースのVision-Language Models (VLM)は、ベンチマークタスクで最先端のパフォーマンスを達成した。
プレトレーニングコーパスは,テストセットリークによるパフォーマンスの低下という,実践者とユーザ双方にとって重要な懸念を提起する。
既存の検出手法が不整合性を示すか,不整合性を示すかを示す。
マルチモーダルなセマンティック摂動に基づく,新しい簡易かつ効果的な検出法を提案する。
論文 参考訳(メタデータ) (2025-11-05T18:59:52Z) - Think Twice before Adaptation: Improving Adaptability of DeepFake Detection via Online Test-Time Adaptation [1.7811840395202345]
ディープフェイク(DF)検出器は、現実世界の環境に展開する際、重大な課題に直面している。
ポストプロセッシング技術はDFサンプルで提示された成果物を不明瞭に生成する可能性があるため、性能が低下する。
本稿では,新しいオンラインテスト時間適応法であるThink Twice before Adaptation (textttT$2$A)を提案する。
論文 参考訳(メタデータ) (2025-05-24T16:58:53Z) - R-TPT: Improving Adversarial Robustness of Vision-Language Models through Test-Time Prompt Tuning [69.72249695674665]
視覚言語モデル(VLM)のためのロバストテスト時プロンプトチューニング(R-TPT)を提案する。
R-TPTは、推論段階における敵攻撃の影響を緩和する。
プラグアンドプレイの信頼性に基づく重み付きアンサンブル戦略を導入し,防御強化を図る。
論文 参考訳(メタデータ) (2025-04-15T13:49:31Z) - Augmented Contrastive Clustering with Uncertainty-Aware Prototyping for Time Series Test Time Adaptation [28.793983148042134]
テストタイム適応は、推論中にオンラインの未ラベルのテストデータのみを使用して、トレーニング済みのディープニューラルネットワークに適応することを目的としている。
既存のTTA手法は、もともと視覚タスク用に設計されたもので、実世界の時系列データの複雑な時間的ダイナミクスを効果的に扱えない可能性がある。
本稿では,時系列データに対する単純かつ効果的なTTA手法であるACCUP(Augmented Contrastive Clustering with Uncertainty-aware Prototyping)を提案する。
論文 参考訳(メタデータ) (2025-01-01T11:45:17Z) - TAPT: Test-Time Adversarial Prompt Tuning for Robust Inference in Vision-Language Models [53.91006249339802]
視覚的対人攻撃に対するCLIPの推論ロバスト性を高めるため, TAPT(Test-Time Adversarial Prompt Tuning)と呼ばれる新しい防御手法を提案する。
TAPTは、CLIPの推論プロセスを堅牢化するために、防御的バイモーダル(テキストと視覚)のプロンプトを学習するテストタイムディフェンス手法である。
我々は、ImageNetなど10のゼロショットデータセットを含む11のベンチマークデータセットに対するTAPTの有効性を評価する。
論文 参考訳(メタデータ) (2024-11-20T08:58:59Z) - Enhancing Test Time Adaptation with Few-shot Guidance [62.49199492255226]
深層ニューラルネットワークは、トレーニング(ソース)とテスト(ターゲット)データのドメインシフトに直面しながら、大きなパフォーマンス低下に直面することが多い。
TTA(Test Time Adaptation)法は,事前学習したソースモデルを用いて,配信外ストリーミングターゲットデータを処理する手法として提案されている。
本稿では,Few-Shot Test Time Adaptation (FS-TTA) を開発した。
論文 参考訳(メタデータ) (2024-09-02T15:50:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。