論文の概要: On Success and Simplicity: A Second Look at Transferable Vision-Language Attack Pipeline
- arxiv url: http://arxiv.org/abs/2607.14974v1
- Date: Thu, 16 Jul 2026 13:28:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.121323
- Title: On Success and Simplicity: A Second Look at Transferable Vision-Language Attack Pipeline
- Title(参考訳): 成功と単純性について:トランスファーブル・ビジョン・ランゲージ・アタック・パイプラインを振り返る
- Abstract要約: VLPM(Vision-Language Pre-Training Model)は、敵の攻撃に対して脆弱であることが知られている。
本稿では、このような高度な攻撃パイプラインがよりシンプルであり、より成功できることを実証する。
- 参考スコア(独自算出の注目度): 28.02815639523379
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language Pre-training Models (VLPMs) are known to be vulnerable to adversarial attacks. Recent transferable attacks on VLPMs have followed a common pipeline with complicated loss functions or multi-stage text/image attacks. However, in this paper, we demonstrate that such a sophisticated attack pipeline can be simpler yet more successful. Specifically, we identify three previously overlooked issues caused by inappropriate cross-modal interactions and excessive operations. To address them, we propose the Simple Vision-Language Attack (SimVLA) pipeline, which observably improves transferability and efficiency. Experiments on four datasets and three downstream tasks validate the superiority of our pipeline. For instance, on Flickr30k text-image retrieval dataset, our SimVLA outperforms the SOTA baseline in R@1 transferability by 8.01\%-14.71\%, while consuming only about 35.73\% of the time and 46.26\% of the max VRAM. Overall, the superiority of our SimVLA highlights the importance of leveraging domain knowledge (e.g., our proposed cross-modal word identification), while blindly pursuing intricate operations (e.g, complex loss functions and redundant multi-stage designs) may even be harmful. We hope our SimVLA can serve as a simple yet effective backbone for future extensions. Code is available at https://github.com/RYC-98/SimVLA.
- Abstract(参考訳): VLPM(Vision-Language Pre-Training Model)は、敵の攻撃に対して脆弱であることが知られている。
VLPMに対する最近の転送可能な攻撃は、複雑な損失関数や多段階のテキスト/画像攻撃を伴う共通のパイプラインに従っている。
しかし,本稿では,このような高度な攻撃パイプラインがよりシンプルであり,より成功できることを実証する。
具体的には、不適切な相互モーダル相互作用と過剰な操作によって引き起こされた、これまで見過ごされていた3つの問題を特定する。
そこで本研究では,SimVLA(Simple Vision-Language Attack)パイプラインを提案する。
4つのデータセットと3つの下流タスクの実験は、パイプラインの優位性を検証する。
例えば、Flickr30kのテキストイメージ検索データセットでは、SimVLAは、最大VRAMの35.73\%と46.26\%しか消費せず、R@1転送可能性のSOTAベースラインを8.01\%-14.71\%で上回っている。
全体として、SimVLAの優位性はドメイン知識を活用することの重要性(例えば、提案したクロスモーダルな単語識別)を強調する一方で、複雑な操作(複雑な損失関数や冗長な多段階設計など)を盲目的に追求することでさえ有害である。
当社のSimVLAが,将来的な拡張のシンプルな,かつ効果的なバックボーンとして機能できることを願っています。
コードはhttps://github.com/RYC-98/SimVLAで入手できる。
関連論文リスト
- Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model [60.85752511708308]
本稿では,リアルタイムマルチモーダル理解とインタラクションのための効率的なストリーミング基盤モデルであるMage-VLを提案する。
その中核として、我々のカスタムトークンであるMage-ViTは、動的エントロピーリッチな領域を選択的に符号化することで、一様フレームサンプリングを置き換える。
我々は、キャプションとAI駆動のパフォーマンス診断のためのプロンプトコード共同最適化を含むAI4AIデータパイプラインを確立する。
論文 参考訳(メタデータ) (2026-07-27T17:59:53Z) - One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models [4.743159345345865]
3つの視覚言語モデル(VLM)を横断するクロスモーダル・アンラーニング・トランスファーについて検討する。
モダリティにまたがる未学習のトランスファーが見つかるが、このトランスファーは非対称で不完全である。
伝達ギャップと浅部頑健性に対処するため,影響誘導型緩和戦略であるtextscCrossInfを提案する。
論文 参考訳(メタデータ) (2026-07-17T18:44:02Z) - TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions [52.61846373082384]
ショットトランジション検出(STD)は本質的に複雑なトランジションに苦しむ。
本稿では,STDのためのビジョン言語モデル(VLM)フレームワークであるTransVLMを提案する。
広範囲な実験により、TransVLMは全体的な性能が優れていることが示された。
論文 参考訳(メタデータ) (2026-04-30T15:05:06Z) - From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration [36.510721886563225]
高解像度マルチモーダル大言語モデル(MLLM)は、視覚トークンの爆発による計算コストの禁止に直面している。
トークンプルーニングやレイヤスポーシティといった既存のアクセラレーション戦略は、深刻な"バックボーン依存性"に悩まされている。
我々は,3段階の普遍的推論のライフサイクルを明らかにするために,切り離された行列エントロピーを利用する。
論文 参考訳(メタデータ) (2026-04-08T07:42:16Z) - VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models [33.120141513366136]
LVLM(Large Vision-Language Models)は、マルチモーダル理解と生成において顕著な能力を示す。
既存の効果的な攻撃は常にタスク固有のホワイトボックス設定に集中する。
我々は,LVLMのビジョンエンコーダのみをターゲットとした,シンプルで効果的なビジョンアタック(VEAttack)を提案する。
論文 参考訳(メタデータ) (2025-05-23T03:46:04Z) - COST: Contrastive One-Stage Transformer for Vision-Language Small Object Tracking [52.62149024881728]
本稿では,視覚言語(VL)追跡のための一段変圧器融合フレームワークを提案する。
ビデオとそれに対応する言語記述間の相互情報を最大化するコントラストアライメント戦略を導入する。
視覚言語変換器を活用することにより,効率的なマルチモーダル融合・推論機構を確立する。
論文 参考訳(メタデータ) (2025-04-02T03:12:38Z) - VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via
Pre-trained Models [46.14455492739906]
VL(Vision-Language)事前訓練モデルは、多くのマルチモーダルタスクにおいて優位性を示している。
既存のアプローチは主に、ホワイトボックス設定下での敵の堅牢性を探究することに焦点を当てている。
本稿では,VLATTACKを用いて,画像とテキストの摂動を単一モードレベルとマルチモードレベルの両方から分離し,対向サンプルを生成する。
論文 参考訳(メタデータ) (2023-10-07T02:18:52Z) - Set-level Guidance Attack: Boosting Adversarial Transferability of
Vision-Language Pre-training Models [52.530286579915284]
本稿では,視覚言語事前学習モデルの対角移動可能性について検討する。
伝達性劣化は、部分的にはクロスモーダル相互作用のアンダーユース化によって引き起こされる。
本稿では,高度に伝達可能なSGA(Set-level Guidance Attack)を提案する。
論文 参考訳(メタデータ) (2023-07-26T09:19:21Z) - Rethinking Hierarchicies in Pre-trained Plain Vision Transformer [76.35955924137986]
マスク付き画像モデリング(MIM)による自己教師付き事前学習型視覚変換器(ViT)は非常に効果的であることが証明されている。
カスタマイズされたアルゴリズムは、平易なViTのためにバニラと単純なMAEを使用する代わりに、例えばGreenMIMのような階層的なViTのために慎重に設計されるべきである。
本稿では,自己指導型事前学習から階層型アーキテクチャ設計を遠ざける新しいアイデアを提案する。
論文 参考訳(メタデータ) (2022-11-03T13:19:23Z) - Pushing the Limits of Simple Pipelines for Few-Shot Learning: External
Data and Fine-Tuning Make a Difference [74.80730361332711]
コンピュータビジョンにおいて、ほとんどショット学習は重要かつトピック的な問題である。
単純なトランスフォーマーベースのパイプラインは、標準ベンチマークで驚くほど優れたパフォーマンスが得られることを示す。
論文 参考訳(メタデータ) (2022-04-15T02:55:58Z) - Contrastive Visual-Linguistic Pretraining [48.88553854384866]
コントラスト的視覚言語事前学習は、コントラスト的学習に基づいて構築された視覚的自己監督的損失を構成する。
VQA, GQA, NLVR2などの下流タスクで評価した。
論文 参考訳(メタデータ) (2020-07-26T14:26:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。