論文の概要: GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation
- arxiv url: http://arxiv.org/abs/2607.21036v1
- Date: Thu, 23 Jul 2026 08:16:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.332518
- Title: GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation
- Title(参考訳): GeoThreat:リモートセンシング画像解釈のための大規模視覚言語モデルにおける移動可能な敵攻撃
- Abstract要約: 大規模視覚言語モデル(LVLM)に対する敵対的攻撃は、モーダルな意味理解において、その堅牢性を評価する効果的な手段となる。
リモートセンシング画像解釈のためのLVLMに対するトランスファー可能な対向攻撃法であるGeoThreatを提案する。
- 参考スコア(独自算出の注目度): 25.134254498593137
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adversarial attacks against large vision-language models (LVLMs) serve as an effective means of assessing their robustness in cross-modal semantic understanding. Existing studies mainly focus on corrupting visual inputs to induce predefined erroneous responses in general vision-language tasks, whereas corresponding investigations in remote sensing fields remain largely underexplored. Compared with natural image understanding, remote sensing image interpretation requires joint reasoning over local discriminative cues and global scene context. This poses additional challenges to achieving transferable semantic manipulation toward specified responses under black-box settings. To tackle these challenges, we propose GeoThreat, a transferable targeted adversarial attack method against LVLMs for remote sensing image interpretation. Specifically, GeoThreat modulates adversarial representations in accordance with the target content at both conceptual and perceptual levels. The class tokens from surrogate image encoders are employed as conceptual representations, while perceptual representations are distilled from patch tokens of the adversarial example through collaborative importance estimation. Beyond merely rolling out attention scores across layers, we incorporate adversarial-target similarity gradients to more faithfully characterize the relevance of local visual cues to the intended semantic manipulation. The perceptual representations are then dynamically aligned with target patch tokens in a cross-attentive manner, facilitating the adaptation of local cues toward designated semantic details. Finally, adversarial perturbations are iteratively updated via ensemble-based joint optimization of conceptual calibration and perceptual adaptation. Extensive experiments across diverse LVLMs demonstrate the superiority of GeoThreat in both transferability and controllability.
- Abstract(参考訳): 大規模視覚言語モデル(LVLM)に対する敵対的攻撃は、モーダルな意味理解において、その堅牢性を評価する効果的な手段となる。
既存の研究は主に、一般的な視覚言語タスクにおける事前定義された誤応答を誘発する視覚入力の破損に焦点を当てている。
自然な画像理解と比較して、リモートセンシング画像解釈は、局所的な識別的手がかりとグローバルなシーンコンテキストに対する共同推論を必要とする。
これにより、ブラックボックス設定下で特定の応答に対する転送可能なセマンティック操作を実現する上で、さらなる課題が生じる。
これらの課題に対処するために、リモートセンシング画像解釈のためのLVLMに対するトランスファー可能な対向攻撃法であるGeoThreatを提案する。
具体的には、GeoThreatは、概念レベルと知覚レベルの両方のターゲット内容に応じて、敵対表現を変調する。
代理画像エンコーダのクラストークンは概念的表現として、知覚的表現は協調的重要度推定によって敵のパッチトークンから蒸留される。
単にレイヤー間で注意スコアをロールアウトするだけでなく、目的のセマンティック操作に対する局所的な視覚的手がかりの関連性をより忠実に特徴付けるために、敵対的目標類似度勾配を組み込む。
知覚表現は、対象のパッチトークンを横断的に動的に整列し、指定されたセマンティックディテールへの局所的なキューの適応を容易にする。
最後に、対向的摂動は、概念的キャリブレーションと知覚適応のアンサンブルに基づく共同最適化によって反復的に更新される。
多様なLVLMの広範な実験は、GeoThreatの転送性と制御性の両方において優位性を示す。
関連論文リスト
- Semantic-Spatial Discriminability Enhancement for Generalized Visual Grounding [28.39401600080181]
汎用ビジュアルグラウンド(GVG)タスクは、参照表現に基づいて画像内のターゲットをローカライズすることを目的としている。
本稿では,汎用視覚接地のためのセマンティック・空間識別性向上(SSDE)フレームワークを提案する。
SSDEは、細粒度セマンティクスと空間的局所化における識別能力を高めることを目的としている。
論文 参考訳(メタデータ) (2026-08-31T04:37:36Z) - Primitive-Driven Compositional Forensic Visual Prompting for Open-World Face Anti-Spoofing [59.765442274924595]
視覚的特徴空間で完全に機能する合成視覚的プロンプト学習フレームワークを提案する。
このフレームワークは、学習可能なマイクロ法医学的プリミティブの共有セットを局所的な法医学的エビデンスユニットに洗練するためにパッチ対応の注意を払っている。
9つのオープンワールドプロトコルの実験は、最先端のパフォーマンス、強力なクロスドメインの一般化、そして目に見えない攻撃への堅牢な適応を示す。
論文 参考訳(メタデータ) (2026-08-18T04:18:08Z) - Warp-free Cross-view Geo-localization via Feature-space Consensus Mining [49.843311525678565]
ストリートレベルの画像と衛星画像の間に大きな違いがあるため、クロスビューのジオローカライゼーションは困難である。
本稿では,明示的な幾何学的ワープを完全に回避する,新しい統合ビュー・コンセンサス誘導学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-10T09:02:06Z) - Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models [57.870323273127234]
本研究の目的は,画像の持続的支配パターンに対して内的注意を喚起する新たな敵攻撃であるtextbfAttention Hijacking を提案することである。
提案手法は,クエリの特定の単語に対する操作された出力の依存性を低減する。
論文 参考訳(メタデータ) (2026-05-17T08:02:27Z) - Seeking Consensus: Geometric-Semantic On-the-Fly Recalibration for Open-Vocabulary Remote Sensing Semantic Segmentation [27.476148859056114]
SeeCoは、リモートセンシング画像におけるトレーニング不要のOVSSモデルのパフォーマンスを向上させるための、プラグアンドプレイフレームワークである。
デュアルコンセンサスを求めることにより、任意のOVSSモデルをオンザフライで再分類する。
8つのリモートセンシングOVSSベンチマークの実験は、一貫した利得を示している。
論文 参考訳(メタデータ) (2026-04-29T01:57:21Z) - Perception-Aware Multimodal Spatial Reasoning from Monocular Images [57.42071289037214]
単眼画像からの空間的推論は 自律運転には不可欠です
現在のヴィジュアルランゲージモデル(VLM)は、微粒な幾何学的知覚に苦慮している。
本稿では,VLMを明示的な対象中心の接地能力を持つ知覚認識型マルチモーダル推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-07T02:05:12Z) - SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models [73.19044613922911]
大規模視覚言語モデル(VLM)は、転送ベースの対向摂動に対して脆弱である。
SGHA-Attackは、複数のターゲット参照を採用し、中間層一貫性を強制するフレームワークである。
オープンソースおよび商用のブラックボックスVLMの実験は、SGHA-Attackが従来の方法よりも強力な目標転送性を実現することを示している。
論文 参考訳(メタデータ) (2026-02-02T03:10:41Z) - TRUST: Leveraging Text Robustness for Unsupervised Domain Adaptation [9.906359339999039]
視覚モデルの適応を導くために,言語モダリティの堅牢性を活用する新しいUDAアプローチを導入する。
視覚と言語の特徴空間を整合させるマルチモーダルなソフトコントラスト学習損失を提案する。
我々のアプローチは従来の手法よりも優れており、従来の(DomainNet)ドメインシフトと複雑な(GeoNet)ドメインシフトに新しい最先端の設定を施しています。
論文 参考訳(メタデータ) (2025-08-08T16:51:44Z) - Weakly-Supervised Image Forgery Localization via Vision-Language Collaborative Reasoning Framework [16.961220047066792]
ViLaCoは視覚言語の共同推論フレームワークで、事前訓練された視覚言語モデルから抽出した補助的セマンティックインスペクションを導入する。
ViLaCoは既存のWSIFL法を大幅に上回り、検出精度とローカライゼーション精度の両方で最先端の性能を達成する。
論文 参考訳(メタデータ) (2025-08-02T12:14:29Z) - Referring Remote Sensing Image Segmentation with Cross-view Semantics Interaction Network [65.01521002836611]
本稿では,これらの制約を解決するために,並列で統一されたセグメンテーション・フレームワークであるクロスビューセマンティック・インタラクション・ネットワーク(CSINet)を提案する。
関心の対象を観察する際の人間の行動によって動機づけられたネットワークは、遠隔および近距離からの視覚的手がかりを編成し、相乗的予測を行う。
すべてのエンコーディングステージでは、Cross-View Window-attention Module(CVWin)を使用して、グローバルおよびローカルセマンティクスをクローズビューおよびリモートビューブランチ機能に補完する。
論文 参考訳(メタデータ) (2025-08-02T11:57:56Z) - IteRPrimE: Zero-shot Referring Image Segmentation with Iterative Grad-CAM Refinement and Primary Word Emphasis [46.502962768034166]
Zero-shot Referring Imageは、トレーニングや微調整なしで参照式に最も適したインスタンスマスクを特定する。
従来のCLIPモデルでは、物体の相対的な空間的関係を識別する能力が顕著に低下していた。
IteRPrimEは従来の最先端のゼロショットメソッドよりも優れており、特にドメイン外のシナリオでは優れている。
論文 参考訳(メタデータ) (2025-03-02T15:19:37Z) - Enhancing Cross-Prompt Transferability in Vision-Language Models through Contextual Injection of Target Tokens [28.356269620160937]
我々は、勾配に基づく摂動を利用して、ターゲットトークンを視覚的・テキスト的両方の文脈に注入するコンテキストインジェクション攻撃(CIA)を提案する。
CIAは敵画像のクロスプロンプト転送性を高める。
論文 参考訳(メタデータ) (2024-06-19T07:32:55Z) - ZoomNeXt: A Unified Collaborative Pyramid Network for Camouflaged Object Detection [70.11264880907652]
最近のオブジェクト(COD)は、現実のシナリオでは極めて複雑で難しい、視覚的にブレンドされたオブジェクトを周囲に分割しようと試みている。
本研究では,不明瞭な画像を観察したり,ズームインしたりアウトしたりする際の人間の行動を模倣する,効果的な統合協調ピラミッドネットワークを提案する。
我々のフレームワークは、画像とビデオのCODベンチマークにおいて、既存の最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2023-10-31T06:11:23Z) - Enhancing the Self-Universality for Transferable Targeted Attacks [88.6081640779354]
本手法は,高次対角的摂動が標的攻撃に対してより伝達しやすい傾向にあることを示す。
異なる画像上の摂動を最適化する代わりに、異なる領域を最適化して自己ユニバーシティを実現することで、余分なデータを排除することができる。
特徴的類似性欠如により,本手法は,良性画像よりも対向性摂動の特徴が支配的となる。
論文 参考訳(メタデータ) (2022-09-08T11:21:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。