論文の概要: Robustifying Vision-Language Models via Test-Time Prompt Adaptation
- arxiv url: http://arxiv.org/abs/2607.09450v1
- Date: Fri, 10 Jul 2026 14:19:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.860834
- Title: Robustifying Vision-Language Models via Test-Time Prompt Adaptation
- Title(参考訳): テスト時間プロンプト適応によるロバスト化視覚言語モデル
- Abstract要約: サンプルレベルの推定から分布レベルのアライメントに移行するテストtImeプロンプト・タダプテーションフレームワークであるRITAを提案する。
特に、RITAは、拡張視覚特徴の分布をテキストプロトタイプと整合させ、敵対的外乱を緩和し、モーダルな意味的不一致を是正するために最適なトランスポートを使用する。
- 参考スコア(独自算出の注目度): 23.05168102474528
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pre-trained Vision-Language Models (VLMs) such as CLIP achieve strong zero-shot generalization, but their performance degrades sharply under adversarial perturbations. Existing test-time adaptation methods typically rely on sample-level confidence heuristics, overlooking the intrinsic distributional structure of the data. This sample-centric approach limits robustness, as it fails to distinguish confident adversarial mispredictions from true semantic consistency. In this work, we observe that adversarial distortion is structurally brittle: while holistic representations are corrupted, semantic integrity is often preserved in the distribution of augmented views. Motivated by this insight, we propose RITA, a Robust test-tIme prompt-TAdaptation framework that shifts from sample-level estimates to distribution-level alignment. Specifically, RITA employs optimal transport to align the distribution of augmented visual features with textual prototypes, mitigating adversarial outliers and rectifying cross-modal semantic misalignment. Furthermore, we introduce a dynamic cache to progressively accumulate reliable cues from the test stream for online refinement. Extensive experiments demonstrate that RITA significantly improves adversarial robustness without compromising clean accuracy.
- Abstract(参考訳): CLIPのような事前訓練されたビジョンランゲージモデル(VLM)は、ゼロショットの強い一般化を実現するが、その性能は敵の摂動によって著しく低下する。
既存のテスト時間適応法は、典型的にはサンプルレベルの信頼性ヒューリスティックに頼り、データの本質的な分布構造を見渡す。
このサンプル中心のアプローチは、信頼できる敵の誤予測と真の意味的一貫性を区別できないため、ロバスト性を制限する。
本研究は, 対角歪みが構造的に不安定であることを示すものであり, 全体論的な表現が破損する一方で, 意味的整合性は拡張ビューの分布にしばしば保存される。
この知見により、サンプルレベルの推定から分布レベルのアライメントに移行するRobust test-tIme prompt-TadaptationフレームワークであるRITAを提案する。
特に、RITAは、拡張視覚特徴の分布をテキストプロトタイプと整合させ、敵対的外乱を緩和し、モーダルな意味的不一致を是正するために最適なトランスポートを使用する。
さらに、オンラインリファインメントのためのテストストリームから、信頼性の高いキューを徐々に蓄積する動的キャッシュを導入する。
大規模な実験により,RITAはクリーンな精度を損なうことなく,対向ロバスト性を大幅に改善することが示された。
関連論文リスト
- Uncertainty-Aware Deepfake Detection via Multi-View Structural Learning [6.951909224842812]
セキュリティクリティカルなバイオメトリックおよび法医学的応用は、特に分布シフトの下で、正確な予測と信頼性の高い信頼推定を必要とする。
相補的な証拠源間の不整合による操作を識別する不確実性を考慮したディープフェイク検出フレームワークを提案する。
証拠ストリーム間の矛盾を予測的不確実性にリンクする不一致不確実性モデリング機構であるIBDC(Inter-Branch Disagreement)を導入する。
論文 参考訳(メタデータ) (2026-07-30T18:42:01Z) - PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning [80.94559742826083]
Reinforcement Learning with Verifiable Rewards (RLVR) は伝統的に、粗末で結果に基づく信号に依存している。
近年の研究では,高コストな外部モデルを必要としないステップレベルのガイダンスを提供することで,詳細なモデル固有の信号を提供することで,言語推論のトレーニングを効果的に向上することが示された。
一助文には有効であるが,この大域的な報酬を視覚言語推論(V-L)に適用することは準最適戦略である。
本稿では、報酬構造とタスクの不均一な性質を整合させることにより、この問題を解決するフレームワークであるパーセプション分解信頼回復(PDCR:Perception-Decomposed Confidence Reward)を提案する。
論文 参考訳(メタデータ) (2026-05-13T12:55:18Z) - FACTOR: Counterfactual Training-Free Test-Time Adaptation for Open-Vocabulary Object Detection [63.91351553178842]
FACTORはオープン語彙オブジェクト検出のためのトレーニング不要なテスト時間適応である。
属性依存性の予測を選択的に抑制するために、属性の感度、意味的関連性、予測のバリエーションを定量化する。
PASCAL-C, COCO-C, FoggyCityscapes の実験では、FACTOR が従来の TTA 法より一貫して優れていたことが示されている。
論文 参考訳(メタデータ) (2026-05-05T02:31:18Z) - Mitigating Error Amplification in Fast Adversarial Training [58.74042726356826]
FAT(Fast Adversarial Training)は、ネットワークに摂動不変表現の学習を促すことによって、モデルロバスト性の向上に有効であることが証明されている。
FATは、しばしば破滅的なオーバーフィッティング(CO)に悩まされ、モデルがトレーニングアタックに過度に適合し、目に見えないものへの一般化に失敗する。
本稿では、摂動予算と監視信号の両方を動的に調整する分散対応動的ガイダンス(DDG)戦略を提案する。
論文 参考訳(メタデータ) (2026-04-27T11:23:18Z) - AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models [12.774216017720642]
事前学習された視覚言語モデル(VLM)は強力なゼロショット一般化を示すが、敵の摂動に弱いままである。
本稿では,アライメントガイド付ファインチューニング(AGFT)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-31T08:17:27Z) - On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs [15.301640007799735]
単純な、制御されたテキストの摂動(キャプションや不正確なチェーン・オブ・シント(CoT)のトレース)は、堅牢性と信頼性が著しく低下していることを示している。
これらの脆弱性をよりよく理解するために、我々はRL微調整力学を分析し、精度と信頼のトレードオフを明らかにする。
論文 参考訳(メタデータ) (2026-02-13T01:12:00Z) - BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models [7.174865411448373]
テスト時間適応時の両モード間の非因果的特徴依存を緩和する二元的プロンプト最適化フレームワーク(BiPrompt)を提案する。
視覚面では、背景のアクティベーションを抑制し、因果領域と突発領域の間の予測一貫性を強制するために、構造化された注意誘導消去を用いる。
テキスト側では、クラス埋め込みを等方的意味空間に整合させる学習可能な再中心化機構である、バランスの取れたプロンプト正規化を導入している。
論文 参考訳(メタデータ) (2026-01-05T14:22:20Z) - Benchmarking Corruption Robustness of LVLMs: A Discriminative Benchmark and Robustness Alignment Metric [49.393713730706445]
汚損の堅牢性を評価するための識別サンプルを強調したベンチマークであるBench-Cを紹介する。
本稿では,ロバストネスアライメントスコア(RAS)を提案する。
論文 参考訳(メタデータ) (2025-11-24T12:07:56Z) - Enhancing CLIP Robustness via Cross-Modality Alignment [54.01929554563447]
視覚言語モデルのための最適なトランスポートベースフレームワークであるクロスモダリティアライメントを提案する。
COLAは、グローバルな画像テキストアライメントと特徴空間における局所的な構造的一貫性を復元する。
COLAはトレーニングフリーで、既存の微調整モデルと互換性がある。
論文 参考訳(メタデータ) (2025-10-28T03:47:44Z) - Object-Level Verbalized Confidence Calibration in Vision-Language Models via Semantic Perturbation [26.580361841501514]
視覚言語モデル(VLM)は様々なマルチモーダルタスクに優れるが、しばしばキャリブレーションに苦しむ。
この誤判定は、特にモデルが不正確または製造された情報を確実に提供した場合、ユーザーの信頼を損なう。
本稿では,文節摂動(CSP)フレームワークを新たに提案し,オブジェクト中心クエリの言語的信頼度を校正する手法を提案する。
論文 参考訳(メタデータ) (2025-04-21T04:01:22Z) - Robustness and Accuracy Could Be Reconcilable by (Proper) Definition [109.62614226793833]
強靭性と精度のトレードオフは、敵文学において広く研究されている。
局所的不変性の帰納的バイアスを課す不適切に定義された頑健な誤差に由来する可能性がある。
定義上、SCOREは、最悪のケースの不確実性に対処しながら、堅牢性と正確性の間の和解を促進する。
論文 参考訳(メタデータ) (2022-02-21T10:36:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。