論文の概要: FreqDoor: A Hidden Trojan in the Frequency Domain for Backdoor Attacks on Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.07048v1
- Date: Mon, 07 Sep 2026 05:11:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 01:53:59.244947
- Title: FreqDoor: A Hidden Trojan in the Frequency Domain for Backdoor Attacks on Vision-Language Models
- Title(参考訳): FreqDoor:ビジョンランゲージモデルに対するバックドア攻撃のための周波数領域の隠れトロイの木馬
- Abstract要約: 我々は、周波数領域にトリガを埋め込む訓練時間バックドアアタックであるtextsc FreqDoorを提案する。
Flickr8kでは、textsc FreqDoorが攻撃成功率99.6%$、99.8%$、9.4%$をそれぞれ達成している。
- 参考スコア(独自算出の注目度): 0.18352113484137622
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) have recently shown excellent progress in open-ended image-to-text generation. However, their multimodal nature makes them persistently vulnerable to backdoor attacks. Existing backdoor triggers for VLMs are either spatial, textual, or bimodal, which may yield localized or recognizable trigger patterns. In this work, we explore a different attack surface and propose \ textsc {FreqDoor}, a training-time backdoor attack that implants triggers in the frequency domain. \ textsc {FreqDoor} mixes amplitude-spectrum components from a trigger-source image selectively while preserving the phase of a clean image to generate a spatially distributed and visually imperceptible trigger without modifying the textual input. We evaluate the attack on BLIP-2, InstructBLIP, and LLaVA for image captioning and visual question answering. On Flickr8k, \ textsc {FreqDoor} achieves attack success rates of $99.6\%$, $99.8\%$, and $98.4\%$ on the three models, respectively, while preserving the semantic quality of the generated captions. On VQAv2, the corresponding attack success rates are $99.6\%$, $92.4\%$, and $79.6\%$.
- Abstract(参考訳): 視覚言語モデル(VLM)は、最近、画像からテキストへのオープンな生成において、優れた進歩を見せている。
しかし、そのマルチモーダルな性質は、バックドア攻撃に対して永続的に脆弱である。
VLMの既存のバックドアトリガーは、空間的、テキスト的、あるいはバイモーダル的であり、局所的または認識可能なトリガーパターンをもたらす可能性がある。
本研究では,異なる攻撃面を探索し,周波数領域にトリガを埋め込むトレーニングタイムバックドアアタックであるtextsc {FreqDoor}を提案する。
textsc {FreqDoor} は、クリーン画像の位相を保ちながら、トリガソース画像から振幅スペクトル成分を選択的に混合し、テキスト入力を変更することなく、空間的に分散され視覚的に受容できないトリガを生成する。
画像キャプションと視覚的質問応答に対するBLIP-2, InstructBLIP, LLaVAに対する攻撃について検討した。
Flickr8kでは、textsc {FreqDoor} は、生成されたキャプションのセマンティックな品質を維持しながら、攻撃の成功率99.6\%$、99.8\%$、9.4\%$をそれぞれ達成している。
VQAv2の攻撃成功率は99.6\%$、92.4\%$、79.6\%$である。
関連論文リスト
- Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs [23.18705886598491]
視覚言語モデル(VLM)のバックドアは通常静的脆弱性として扱われる。
プログラム可能なバックドアをVLMに埋め込むことができる。
任意のキャプション制御パラダイムの提案は、トレーニング後の標的選択を中毒から切り離す。
論文 参考訳(メタデータ) (2026-08-11T14:25:29Z) - CaptionFool: Universal Image Captioning Model Attacks [1.3011345529764784]
本稿では,最新のトランスフォーマーベースキャプションモデルに対する新たな攻撃であるCaptionFoolを提案する。
本攻撃は攻撃内容を含む任意のキャプションの生成において94-96%の成功率を達成した。
論文 参考訳(メタデータ) (2026-02-28T07:57:23Z) - $β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment [53.42377319350806]
$-CLIPは、多言語テキスト条件のコントラスト学習フレームワークである。
$-CALは、この階層に固有のセマンティックオーバーラップに対処する。
$-CLIPは、高密度視覚言語対応のための堅牢で適応的なベースラインを確立する。
論文 参考訳(メタデータ) (2025-12-14T13:03:20Z) - BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models [63.5775877701015]
textbfBackdoorVLMは視覚言語モデル(VLM)に対するバックドア攻撃を評価するための最初の総合的なベンチマークである。
BackdoorVLMは、マルチモーダルなバックドア脅威を、ターゲットされた拒絶、悪意のある注入、ジェイルブレイク、コンセプト置換、知覚的ハイジャックの5つのカテゴリに分類する。
2つのオープンソースのVLMと3つのマルチモーダルデータセットでテストし、テキスト、画像、バイモーダルトリガにまたがる12の代表的な攻撃手法を用いて、これらの脅威を評価する。
論文 参考訳(メタデータ) (2025-11-24T09:30:38Z) - SRD: Reinforcement-Learned Semantic Perturbation for Backdoor Defense in VLMs [57.880467106470775]
攻撃者は、トレーニングデータに知覚不能な摂動を注入することができ、モデルが悪意のある攻撃的制御されたキャプションを生成する。
本稿では,引き金の事前知識を伴わずにバックドア動作を緩和する強化学習フレームワークであるセマンティック・リワード・ディフェンス(SRD)を提案する。
SRDはDeep Q-Networkを使用して、機密画像領域に個別の摂動を適用するためのポリシーを学習し、悪意ある経路の活性化を妨害することを目的としている。
論文 参考訳(メタデータ) (2025-06-05T08:22:24Z) - T2IShield: Defending Against Backdoors on Text-to-Image Diffusion Models [70.03122709795122]
バックドア攻撃の検出, 局所化, 緩和のための総合防御手法T2IShieldを提案する。
バックドアトリガーによって引き起こされた横断アテンションマップの「アシミレーション現象」を見いだす。
バックドアサンプル検出のために、T2IShieldは計算コストの低い88.9$%のF1スコアを達成している。
論文 参考訳(メタデータ) (2024-07-05T01:53:21Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z) - Stealthy Targeted Backdoor Attacks against Image Captioning [16.409633596670368]
本稿では,画像キャプションモデルに対するバックドア攻撃を標的とした新たな手法を提案する。
本手法は,物体検出に普遍摂動技術を活用することで,まず特別なトリガを学習する。
我々のアプローチは、モデルクリーンパフォーマンスに無視できる影響を与えながら、高い攻撃成功率を達成することができる。
論文 参考訳(メタデータ) (2024-06-09T18:11:06Z) - VQAttack: Transferable Adversarial Attacks on Visual Question Answering
via Pre-trained Models [58.21452697997078]
本稿では,画像とテキストの摂動を設計モジュールで生成できる新しいVQAttackモデルを提案する。
5つの検証モデルを持つ2つのVQAデータセットの実験結果は、提案したVQAttackの有効性を示す。
論文 参考訳(メタデータ) (2024-02-16T21:17:42Z) - Mask and Restore: Blind Backdoor Defense at Test Time with Masked Autoencoder [50.1394620328318]
既存のバックドア防御手法では、いくつかのバリデーションデータとモデルパラメータにアクセスする必要があることが多い。
Masked AutoEncoder (BDMAE) を用いたブラインドバックドアディフェンスの提案
BDMAEは、画像の構造的類似性と、テスト画像とMAE復元の間のラベルの整合性を用いて、可能な局所的なトリガを検出する。
論文 参考訳(メタデータ) (2023-03-27T19:23:33Z) - Hidden Backdoors in Human-Centric Language Models [12.694861859949585]
私たちはテキストバックドア攻撃の秘密と自然なトリガーを作成します。
隠れたバックドアを2つの最先端のトリガー埋め込みメソッドにデプロイします。
提案した隠れバックドアは,3つの下流セキュリティクリティカルなNLPタスクに対して有効であることを示す。
論文 参考訳(メタデータ) (2021-05-01T04:41:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。