論文の概要: Exposing Vulnerabilities in Visible-Infrared VLMs: A Unified Geometric Adversarial Framework with Cross-Task Transferability
- arxiv url: http://arxiv.org/abs/2605.22273v1
- Date: Thu, 21 May 2026 10:15:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.208197
- Title: Exposing Vulnerabilities in Visible-Infrared VLMs: A Unified Geometric Adversarial Framework with Cross-Task Transferability
- Title(参考訳): 可視赤外VLMにおける脆弱性の露光:クロスタスクトランスファービリティを備えた統一幾何対応フレームワーク
- Authors: Xiang Chen, Yuxian Dong, Chao Li, Chengyin Hu, Jiaju Han, Fengyu Zhang, Yiwei Wei, Jiahuan Long, Jiujiang Guo,
- Abstract要約: 視覚言語モデル(VLM)は多様なマルチモーダルタスクにおいて高い性能を達成しているが、視覚赤外線(VIS-IR)のシナリオにおけるその逆の堅牢性はいまだ未定である。
そこで我々は,VIS-IR VLM 攻撃のための曲面エッジフラクタル幾何対角パッチフレームワーク CFGPatch を提案する。
- 参考スコア(独自算出の注目度): 11.461885964494199
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) have achieved strong performance across diverse multimodal tasks, but their adversarial robustness in visible-infrared (VIS-IR) scenarios remains underexplored. This gap is critical because VIS-IR sensing is widely used in real-world perception systems to support reliable understanding under challenging imaging conditions. To address this cross-modal threat setting, we propose CFGPatch, a curved-edge fractal geometric adversarial patch framework for attacking VIS-IR VLMs. CFGPatch builds on triangular fractal geometry and replaces rigid straight-edged primitives with Bezier-curved elements, preserving multi-scale fractal self-similarity while introducing smoother contours, richer directional variation, and more flexible shape deformation. In addition, we design a modality-specific Fraser-spiral rendering mechanism to inject fine-grained texture distortions and misleading perceptual cues into visible and infrared images. By coupling global curved-fractal geometry with local spiral-based appearance interference, CFGPatch disrupts both shape perception and texture interpretation. We further adopt expectation over transformation (EOT) to improve robustness against common image-level transformations. Extensive experiments show that CFGPatch effectively fools VIS-IR VLMs and consistently outperforms standard patch baselines in attack effectiveness and robustness. Moreover, adversarial samples optimized for zero-shot classification transfer well to image captioning and visual question answering, demonstrating strong cross-task transferability and generalizability across downstream tasks.
- Abstract(参考訳): 視覚言語モデル(VLM)は多様なマルチモーダルタスクにおいて高い性能を達成しているが、視覚赤外線(VIS-IR)のシナリオにおけるその逆の堅牢性はいまだ検討されていない。
このギャップは、VIS-IRセンシングが現実の知覚システムで広く使われているため、困難な撮像条件下での信頼性の高い理解を支援するために重要である。
このようなクロスモーダルな脅威に対処するために, CFGPatch は, VIS-IR VLM を攻撃するための曲面エッジフラクタル幾何対逆パッチフレームワークである。
CFGPatchは三角形のフラクタル幾何の上に構築され、厳密なストレートエッジプリミティブをベジエ曲線要素に置き換え、スムーズな輪郭、よりリッチな方向変化、より柔軟な形状変形を導入しながら、マルチスケールのフラクタル自己相似性を維持する。
さらに, 微粒なテクスチャ歪みを注入し, 知覚的手がかりを視覚的・赤外線画像に誤誘導する, モダリティ特異的なフラザー・スピラルレンダリング機構を設計する。
グローバル曲線フラクタル幾何と局所スパイラルベースの外観干渉を結合することにより、CFGPatchは形状知覚とテクスチャ解釈の両方を妨害する。
我々は、共通の画像レベルの変換に対する堅牢性を改善するために、変換よりも期待(EOT)を採用する。
大規模な実験により、CFGPatchはVIS-IR VLMを効果的に騙し、攻撃の有効性と堅牢性において標準パッチベースラインを一貫して上回っていることが示された。
さらに、画像キャプションや視覚的質問応答に最適化されたゼロショット分類転送に最適化された逆数サンプルは、下流タスク間の強力なクロスタスク転送性と一般化性を示す。
関連論文リスト
- A Systematic Failure Analysis of Vision Foundation Models for Open Set Iris Presentation Attack Detection [6.472008340680056]
本研究は、近視画像を用いたオープンセット虹彩PADのための汎用視覚基盤モデルの系統的故障解析を行う。
その結果、基礎モデルは、類似したセンシング特性を持つデータセット間で転送可能であるが、未知の攻撃機器に対して確実に一般化できないことが示唆された。
これらの結果から,強いクローズドセットやクロスデータセットのパフォーマンスは,堅牢なオープンセットセキュリティの証拠として扱うべきではないことが示唆された。
論文 参考訳(メタデータ) (2026-05-18T18:41:26Z) - BGG: Bridging the Geometric Gap between Cross-View images by Vision Foundation Model Adaptation for Geo-Localization [50.74663742490919]
Cross-View Geo-Localization (CVGL) は画像検索により画像の位置を求める。
本稿では,視覚基礎モデル(VFM)に基づく画像間の幾何学的ギャップをブリッジするパラメータ効率の枠組みを提案する。
主にMFEA(Multi-granularity Feature Enhancement Adapter)と周波数対応構造アグリゲーション(FASA)モジュールを含んでいる。
論文 参考訳(メタデータ) (2026-05-11T10:46:33Z) - Physically-Induced Atmospheric Adversarial Perturbations: Enhancing Transferability and Robustness in Remote Sensing Image Classification [54.952203312050564]
敵対的攻撃は、リモートセンシング(RS)画像分類におけるディープラーニングモデルの信頼性に深刻な脅威をもたらす。
本稿ではフォグフール(FogFool)を提案する。
2つのベンチマークRSデータセットの実験は、FogFoolが優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-04-16T05:47:57Z) - Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patches for Infrared Vision-Language Models [21.429674567539607]
近赤外視覚言語モデル(IR-VLM)は、低可視環境におけるマルチモーダル知覚のための有望なパラダイムとして登場した。
既存の逆パッチ法は主にRGBベースのモデル用にクローズドセット設定で設計されている。
我々は、IR-VLMのためのユニバーサル物理対向パッチフレームワークであるユニバーサルカーブグリッドパッチ(UCGP)を提案する。
論文 参考訳(メタデータ) (2026-04-03T15:42:55Z) - Perception-Aware Multimodal Spatial Reasoning from Monocular Images [57.42071289037214]
単眼画像からの空間的推論は 自律運転には不可欠です
現在のヴィジュアルランゲージモデル(VLM)は、微粒な幾何学的知覚に苦慮している。
本稿では,VLMを明示的な対象中心の接地能力を持つ知覚認識型マルチモーダル推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-07T02:05:12Z) - Adversarial Patch Generation for Visual-Infrared Dense Prediction Tasks via Joint Position-Color Optimization [14.358458317718174]
視覚的赤外設定における逆パッチを生成するための共同位置色最適化フレームワーク(AP-PCO)を提案する。
我々は、赤外線グレースケール特性に応じてパッチの外観を制約するクロスモーダルカラー適応戦略を導入する。
視覚赤外高密度予測タスクの実験は、提案したAP-PCOが一貫して強力な攻撃性能を発揮することを示す。
論文 参考訳(メタデータ) (2026-02-27T19:26:17Z) - Multi-Sensor Matching with HyperNetworks [14.911092205861822]
ハイパーネットワークを活用し、マルチモーダルパッチマッチングを改善します。
本稿では,Siamese CNNを拡張した軽量な記述型学習アーキテクチャを提案する。
また、500Kペアのクロスプラットフォーム(地上/空中)VIS-IRパッチデータセットであるGAP-VIRをリリースしています。
論文 参考訳(メタデータ) (2026-01-18T09:19:33Z) - SIFT-Graph: Benchmarking Multimodal Defense Against Image Adversarial Attacks With Robust Feature Graph [0.6999740786886536]
敵攻撃は現代のディープビジョンモデルに根本的な脆弱性を露呈する。
本稿では,従来の視覚モデルの堅牢性を高めるマルチモーダル・ディフェンス・フレームワークであるSIFT-Graphを紹介する。
予備的な結果から,本手法は,勾配型ホワイトボックス攻撃に対する視覚モデルロバスト性を効果的に向上することが示された。
論文 参考訳(メタデータ) (2025-11-11T22:23:27Z) - Adaptive Transformers for Robust Few-shot Cross-domain Face
Anti-spoofing [71.06718651013965]
我々は、堅牢なクロスドメイン顔アンチスプーフィングのための適応型視覚変換器(ViT)を提案する。
私たちはVTをバックボーンとして採用し、その強度を利用して画素間の長距離依存を考慮します。
いくつかのベンチマークデータセットの実験では、提案されたモデルが堅牢かつ競合的なパフォーマンスを達成することが示されている。
論文 参考訳(メタデータ) (2022-03-23T03:37:44Z) - Intriguing Properties of Vision Transformers [114.28522466830374]
視覚変換器(ViT)は、様々なマシンビジョン問題にまたがって印象的な性能を誇示している。
我々は、この問題を広範囲の実験を通して体系的に研究し、高性能畳み込みニューラルネットワーク(CNN)との比較を行った。
ViTsの効果的な特徴は、自己認識機構によって可能なフレキシブルな受容と動的場によるものであることを示す。
論文 参考訳(メタデータ) (2021-05-21T17:59:18Z) - Deep Semantic Matching with Foreground Detection and Cycle-Consistency [103.22976097225457]
深層ネットワークに基づく弱い教師付きセマンティックマッチングに対処する。
本研究では,背景乱れの影響を抑えるために,前景領域を明示的に推定する。
複数の画像にまたがって予測変換を強制し、幾何的に可視かつ一貫したサイクル一貫性の損失を発生させる。
論文 参考訳(メタデータ) (2020-03-31T22:38:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。