論文の概要: AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.06485v1
- Date: Tue, 07 Jul 2026 16:46:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.591979
- Title: AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models
- Title(参考訳): AirflowAttack:赤外線リモートセンシングビジョンランゲージモデルに対する熱-空気-対流摂動
- Abstract要約: 我々は、赤外線リモートセンシング型視覚言語モデル(VLM)の最初の敵攻撃について、我々の知る限り、AirflowAttackを紹介する。
軽量発電機は、物理的に可塑性な気流パターンに向けて正規化された単一の入力非依存の1つを合成する。
5つのCLIPバックボーンで平均ゼロショットシーン分類攻撃成功率(ASR)は48.5%に達する。
- 参考スコア(独自算出の注目度): 5.275354453732142
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) are increasingly deployed on infrared (IR) remote sensing imagery in security-critical settings, yet their adversarial robustness remains unexamined. We present AirflowAttack, to our knowledge the first adversarial attack for IR remote-sensing VLMs and the first to weaponize thermal-airflow turbulence as the perturbation prior. A lightweight generator synthesizes a single input-agnostic perturbation regularized toward physically plausible airflow patterns. Optimized on one surrogate CLIP model, it attains a mean zero-shot scene-classification attack success rate (ASR, the fraction of samples whose top-1 class changes) of 48.5% across five diverse CLIP backbones, far exceeding four IR-specific physical baselines (27.7--37.0%). Applied to six state-of-the-art VLMs, it cuts scene-classification accuracy by up to 38.2% relative, yet paradoxically makes some models more confident in their IR analysis, confabulating the perturbation as genuine thermal evidence such as temperature gradients and convection. Ablations show the airflow prior raises physical plausibility at no measurable cost to attack success. Together with a benchmark spanning eleven models and four tasks, these findings expose critical vulnerabilities in the rapidly expanding IR VLM ecosystem.
- Abstract(参考訳): 視覚言語モデル(VLM)は、セキュリティクリティカルな環境で赤外線(IR)リモートセンシングイメージにますますデプロイされているが、その敵の堅牢性は検討されていない。
我々は、赤外線リモートセンシングVLMに対する最初の敵攻撃と、それ以前の摂動として最初に熱-気流乱流を兵器化したエアフローアタックについて紹介する。
軽量発電機は、物理的に可塑性な気流パターンに規則化された単一入力非依存の摂動を合成する。
1つのサロゲートCLIPモデルで最適化され、平均ゼロショットシーン分類攻撃成功率(ASR)は5つのCLIPバックボーンで48.5%に達し、4つのIR固有の物理的ベースライン(27.7-37.0%)をはるかに超えている。
6つの最先端のVLMに適用され、シーン分類の精度を38.2%まで削減するが、パラドックス的には赤外線分析に自信を持ち、温度勾配や対流のような真に熱的な証拠として摂動を非難するモデルもある。
アブレーションは、エアフローが、成功を攻撃するための測定可能なコストなしで、物理的な可視性を高めることを示している。
11のモデルと4つのタスクにまたがるベンチマークとともに、これらの発見は急速に拡大するIR VLMエコシステムにおける重大な脆弱性を明らかにする。
関連論文リスト
- InfraPatch: Cross-Task Targeted Grayscale Patch Attacks on Infrared-Adapted Vision-Language Models [9.310612317083928]
赤外線視覚適応モデル(IR-VLM)は、低視認性条件下でのマルチモーダル知覚のための有望なパラダイムとして登場した。
IR-VLMに対するデジタルグレースケールパッチ攻撃を対象とするフレームワークであるInfraPatchを提案する。
論文 参考訳(メタデータ) (2026-09-02T07:42:27Z) - ALLUDE: A Unified Evaluation System for Configurable Attacks in Differentiable Environments [57.11645440673911]
物体検出器のような視覚モデルに対するアドリアック攻撃は、しばしば限られた条件下で評価され、その性能は過小評価される。
ALLUDEはLinuxとWindowsにまたがって第一種評価機能を提供する。
論文 参考訳(メタデータ) (2026-07-19T05:02:58Z) - Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls [57.166020875486474]
我々は,事前学習した画像から映像への拡散モデルを制御可能な空中ビデオ生成装置に変換する方法であるtextbfAero-World を提案する。
実ビデオ-IMUペアで独立して訓練された冷凍潜伏空間物理学プローブは、LoRA微調整中に慣性・一貫性の異なる監視を提供する。
AeroBenchでは、アクションのみの微調整で平均AASを57.7から63.6に改善し、AirScapeよりも優れた品質制御トレードオフを提供する。
論文 参考訳(メタデータ) (2026-05-19T12:02:17Z) - Physically-Induced Atmospheric Adversarial Perturbations: Enhancing Transferability and Robustness in Remote Sensing Image Classification [54.952203312050564]
敵対的攻撃は、リモートセンシング(RS)画像分類におけるディープラーニングモデルの信頼性に深刻な脅威をもたらす。
本稿ではフォグフール(FogFool)を提案する。
2つのベンチマークRSデータセットの実験は、FogFoolが優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-04-16T05:47:57Z) - Physics-Informed Diffusion Model for Generating Synthetic Extreme Rare Weather Events Data [0.0]
伝統的なデータ拡張技術は、まれなカテゴリー4等価事象に特徴的な物理的一貫性と高強度勾配を維持するのに失敗する。
極端気象事象の合成多スペクトル衛星画像を生成するために,Context-UNetアーキテクチャに基づく物理インフォームド拡散モデルを提案する。
論文 参考訳(メタデータ) (2026-03-06T18:54:55Z) - When World Models Dream Wrong: Physical-Conditioned Adversarial Attacks against World Models [54.08784776767683]
本稿では,物理条件を乱す最初のホワイトボックス世界モデルアタックであるPhysCond-WMA(PhysCond-WMA)を提案する。
PhysCond-WMAは知覚の忠実さを維持しながら意味、論理、決定レベルの歪みを引き起こす。
論文 参考訳(メタデータ) (2026-02-21T07:22:37Z) - HATIR: Heat-Aware Diffusion for Turbulent Infrared Video Super-Resolution [17.384587661698028]
既存のビデオ超解像法 (VSR) は、赤外線と可視像の固有のモード差を無視したり、乱流による歪みの回復に失敗したりする。
乱流赤外ビデオスーパーリゾリューションのための熱認識拡散法を導入し, 拡散サンプリング経路に熱認識変形先行を注入する。
FLIR-IVSRは、FLIR T1050scカメラから一対のLR-HRシーケンスを合成した、乱流赤外VSRの最初のデータセットである。
論文 参考訳(メタデータ) (2026-01-08T07:49:02Z) - DIQ-H: Evaluating Hallucination Persistence in VLMs Under Temporal Visual Degradation [0.7874708385247353]
時間列の動的視覚劣化下でのVLMロバスト性を評価するための最初のベンチマークであるDIQ-Hを紹介する。
DIQ-Hは、モーションボケ、センサノイズ、圧縮アーティファクトなどの物理ベースの汚職を適用し、幻覚の持続性、エラー回復、時間的一貫性を測定する。
拡張性のあるアノテーションを実現するために,疑似地下構造を生成するUncertainty-Guided Iterative Refinement (UIR)を提案する。
論文 参考訳(メタデータ) (2025-12-03T17:22:29Z) - On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations [52.1029745126386]
視覚-言語-アクション(VLA)モデルでは、現実世界の摂動に対する堅牢性は、デプロイに不可欠である。
本稿では,VLA入力と出力の摂動に対するロバストVLAを提案する。
LIBEROの実験では、ロバストVLAは、pi0バックボーンで12.6%、OpenVLAバックボーンで10.4%のベースラインをはるかに上回っている。
論文 参考訳(メタデータ) (2025-09-26T14:42:23Z) - FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models [124.02734355214325]
Vision-Language-Action(VLA)モデルはロボティクスの急速な進歩を加速している。
敵画像はVLAモデルを「凍結」し、その後の命令を無視する。
FreezeVLAは、min-maxバイレベル最適化を通じて、アクション凍結攻撃を生成し、評価する。
論文 参考訳(メタデータ) (2025-09-24T08:15:28Z) - Breaking the Statistical Similarity Trap in Extreme Convection Detection [0.0]
ディープラーニング気象モデルの現在の評価指標は、希少で高影響のイベントを欠いている間、ぼやけた予測に報いる。
DARTは、粗大な大気予測を高解像度の衛星温度場に変換するという課題に対処するフレームワークである。
DARTは、背景/極端分解、物理的にモチベーションを得たオーバーサンプリング、タスク固有の損失関数を備えたデュアルデコーダアーキテクチャを採用している。
論文 参考訳(メタデータ) (2025-09-11T07:10:45Z) - SIRST-5K: Exploring Massive Negatives Synthesis with Self-supervised
Learning for Robust Infrared Small Target Detection [53.19618419772467]
単一フレーム赤外線小ターゲット検出(SIRST)は、乱雑な背景から小さなターゲットを認識することを目的としている。
Transformerの開発に伴い、SIRSTモデルのスケールは常に増大している。
赤外線小ターゲットデータの多彩な多様性により,本アルゴリズムはモデル性能と収束速度を大幅に改善する。
論文 参考訳(メタデータ) (2024-03-08T16:14:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。