論文の概要: Two Sides of the Same Coin: Co-Evolving Search for Cross-Task Attacks on Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.02137v1
- Date: Mon, 03 Aug 2026 12:24:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.52839
- Title: Two Sides of the Same Coin: Co-Evolving Search for Cross-Task Attacks on Vision-Language Models
- Title(参考訳): 同じコインの2つの側面:視覚言語モデルにおけるクロスタスクアタックの共進化探索
- Authors: Xuanhui Lin, Junhao Dong, Mingrong Gong, Yucheng Chen, Xinghua Qu, Yew-Soon Ong,
- Abstract要約: 本稿では,統合視覚言語モデルのための進化計算誘導型クロスモーダルアタックフレームワークを提案する。
このフレームワークはテキスト空間と視覚空間の両方を適応的に検索する。
意味的負のガイダンスと局所的な摂動を共同最適化すると、逆の例が生成される。
- 参考スコア(独自算出の注目度): 38.73121090438608
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) exhibit strong generalization across multimodal tasks but remain vulnerable to adversarial perturbations. Existing attacks typically follow single-trajectory gradient optimization or task-specific objectives, limiting search-space exploration and cross-task transferability. We propose an evolutionary-computation-guided cross-modal attack framework for unified VLMs. The framework adaptively searches both textual and visual spaces. On the textual side, it evolves hard negative semantic embeddings around the source-category representation to provide diverse cross-modal repulsion. On the visual side, it maintains a population of object-region perturbations and combines momentum-based gradient updates with evolutionary selection, mutation, and crossover to more reliably explore multiple feasible trajectories. Jointly optimizing semantic negative guidance and localized perturbations generates adversarial examples that consistently shift source-object semantics toward target categories across vision-language tasks. Theoretical analyses show that the co-evolutionary search preserves perturbation feasibility, prevents degradation of the best observed fitness, and increases the probability of reaching high-margin adversarial regions compared with single-trajectory optimization. Experiments on Florence-2, OFA, and UnifiedIO-2 demonstrate strong overall attack performance across image captioning, object detection, region categorization, and object localization. Ablation studies further verify the complementary effectiveness of text-side semantic evolution and image-side perturbation evolution, as well as the framework's efficiency and cross-task transferability.
- Abstract(参考訳): 視覚言語モデル(VLM)は多モーダルタスクにまたがる強力な一般化を示すが、敵の摂動に弱いままである。
既存の攻撃は通常、単一軌道勾配最適化またはタスク固有の目的に従っており、探索空間探索とクロスタスク転送性を制限する。
本稿では,VLM統合のための進化計算誘導型クロスモーダルアタックフレームワークを提案する。
このフレームワークはテキスト空間と視覚空間の両方を適応的に検索する。
テキスト側では、ソースカテゴリ表現を囲むハードネガティブなセマンティック埋め込みを進化させ、多様なクロスモーダル反発を提供する。
視覚面では、対象領域の摂動の集団を維持し、運動量に基づく勾配の更新と進化的選択、突然変異、交叉を組み合わせ、複数の実現可能な軌道をより確実に探索する。
意味的負のガイダンスと局所的摂動を協調的に最適化すると、視覚言語タスクで対象のカテゴリにソースオブジェクトのセマンティクスを常にシフトする敵の例が生成される。
理論的解析により、共進化探索は摂動可能性を保ち、最もよく観察されたフィットネスの劣化を防ぎ、単一軌道最適化と比較して高い対向領域に到達する確率を高めることが示されている。
フローレンス2、OFA、UnifiedIO-2の実験では、画像キャプション、オブジェクト検出、領域分類、オブジェクトローカライゼーションにまたがる攻撃性能が強かった。
アブレーション研究は、テキスト側のセマンティック進化と画像側の摂動進化の相補的効果、およびフレームワークの効率性とクロスタスク転送性をさらに検証する。
関連論文リスト
- Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction [67.45032003041399]
本研究では,先進的かつ意味論的に誘導された摂動を通じて対向的伝達性を高めるセマンティック・ダイナミック・コントラシブ・アタック(SADCA)を提案する。
SADCAは、対立、正、負のサンプルを含む対照的な学習メカニズムを確立し、得られた摂動の意味的不整合を強化する。
複数のデータセットとモデルの実験により、SADCAは対向移動性を大幅に改善し、最先端の手法を一貫して超えることを示した。
論文 参考訳(メタデータ) (2026-03-05T05:46:16Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - Understanding and Enhancing Encoder-based Adversarial Transferability against Large Vision-Language Models [19.899086203883254]
大規模視覚言語モデル (LVLM) は、マルチモーダルタスクで顕著な成功を収めた。
視覚的な入力への依存は、大きな敵の脅威に晒される。
既存のエンコーダベースの攻撃は、LVLM全体ではなく、視覚エンコーダのみに最適化することで、入力画像を摂動させる。
本研究は,LVLMにおけるエンコーダを用いた対向転送性に関する最初の体系的研究である。
論文 参考訳(メタデータ) (2026-02-10T05:51:02Z) - Boosting the Local Invariance for Better Adversarial Transferability [4.75067406339309]
トランスファーベースの攻撃は、現実世界のアプリケーションに重大な脅威をもたらす。
LI-Boost (Local Invariance Boosting approach) と呼ばれる一般対向転送可能性向上手法を提案する。
標準のImageNetデータセットの実験では、LI-Boostがさまざまなタイプの転送ベースの攻撃を著しく強化できることが示された。
論文 参考訳(メタデータ) (2025-03-08T09:44:45Z) - Semantic-Aligned Adversarial Evolution Triangle for High-Transferability Vision-Language Attack [51.16384207202798]
視覚言語事前学習モデルは多モーダル逆例(AE)に対して脆弱である
従来のアプローチでは、画像とテキストのペアを拡大して、敵対的なサンプル生成プロセス内での多様性を高めている。
本稿では, 敵の多様性を高めるために, クリーン, ヒストリ, および現在の敵の例からなる敵の進化三角形からのサンプリングを提案する。
論文 参考訳(メタデータ) (2024-11-04T23:07:51Z) - Boosting Transferability in Vision-Language Attacks via Diversification along the Intersection Region of Adversarial Trajectory [8.591762884862504]
視覚言語事前学習モデルは多モーダル逆例(AE)の影響を受けやすい
我々は,AEsの多様性を拡大するために,対向軌道の交差領域に沿った多様化を利用することを提案する。
潜在的なオーバーフィッティングを緩和するため、最適化経路に沿った最後の交差点領域から逸脱する逆テキストを指示する。
論文 参考訳(メタデータ) (2024-03-19T05:10:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。