論文の概要: Decoy Images Amplify Caption-Mediated Defenses Against Encoded Jailbreaks
- arxiv url: http://arxiv.org/abs/2608.01043v2
- Date: Sun, 09 Aug 2026 19:46:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.40401
- Title: Decoy Images Amplify Caption-Mediated Defenses Against Encoded Jailbreaks
- Title(参考訳): 脱獄画像で監禁されたジェイルブレイクに対する防御が強化される
- Authors: Haoyu Zhang, Xiangchen Guan, Shibo Zheng, Mohammad Zandsalimy, Shanu Sushmita,
- Abstract要約: 画像入力と既存のブラックボックス防御との直感的相互作用を視覚-言語モデル上で報告する。
テキストのみのエンコード入力にASRをそのまま残したキャプション経由のディフェンス(ECSO)は、コンテンツフリーのデコイが添付されると最大7,3$ppまで低下する。
私たちはこれを、堅牢な防御ではなく、パイプラインの相互作用に関する観察として捉えています。
- 参考スコア(独自算出の注目度): 7.766839238117721
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We report a counter-intuitive interaction between image inputs and existing black-box defenses on Vision--Language Models (VLMs): pairing an encoded jailbreak prompt with an unrelated decoy image can sharply lower attack success rate (ASR). The operative change is in the defense pipeline, not in the image. Across five frontier VLMs, two encoded-attack families, and three black-box defenses, a caption-mediated defense (ECSO) that leaves ASR essentially unchanged on text-only encoded input drops it by up to $73$pp once a content-free decoy is attached; every non-saturated contrast is significant under exact McNemar tests. We advance two hypotheses for this pattern, supported by indirect evidence rather than pipeline introspection, since a black-box threat model precludes inspecting vendor internals: caption-mediated defenses branch on image presence, and intrinsic image-side safety engages on image-resident content. Three controls constrain the explanation. Blank-canvas and natural-photograph decoys reproduce the effect on every model, implicating image presence rather than content; the effect replicates on three open-weight VLMs served with no moderation layer, so it is not a vendor-filtering artifact; and a non-symbolic, meaning-based encoder reproduces it, so it is not specific to symbolic obfuscation. Attaching a decoy unconditionally is not deployable --- it raises benign refusal to $20$--$79\%$, an inflation of $+10$ to $+67$pp --- but gating attachment on a lightweight encoded-input detector returns benign refusal to the text baseline while preserving the safety gain wherever the detector fires, making detector recall the binding constraint. Under adaptive attacks that target the caption-mediated re-check, the effect degrades but holds. We frame this as an observation about pipeline interaction, not as a robust defense.
- Abstract(参考訳): 本稿では,視覚言語モデル(VLM)における画像入力と既存のブラックボックス防御との直感的相互作用について報告する。
運用上の変更は、イメージ内ではなく、ディフェンスパイプライン内にあります。
5つのフロンティアVLM、2つの符号化された攻撃家族、3つのブラックボックスディフェンス、字幕による防御(ECSO)は、テキストのみのエンコードされた入力にASRを基本的に変更せず、コンテンツフリーのデコイが取り付けられると最大7,3$ppまで低下する。
ブラックボックスの脅威モデルがベンダー内部の検査を妨げているため,パイプラインのイントロスペクションよりも間接的なエビデンスを裏付ける2つの仮説を推し進める。
3つのコントロールが説明を制約します。
ブランクキャンバスとナチュラルフォトグラフデコイは、全てのモデルに効果を再現し、内容よりも画像の存在を示唆する; この効果は、モデレーション層を持たない3つのオープンウェイトなVLMに複製されるので、ベンダーがフィルタリングするアーティファクトではない;そして、非シンボリックで意味に基づくエンコーダがそれを再現するので、象徴的難読化に特化しない。
デコイを無条件でアタッチすることは、デプロイできない -- - ベニグンの拒絶を20ドル-79\%、インフレーションを+10ドルから$+67$ppに引き上げる -- しかし、軽量なエンコードされた入力検出器へのアタッチメントは、ディテクターが発火する場所の安全を保ちながら、テキストベースラインにベニグの拒絶を返し、ディテクターをリコールする。
キャプションを介する再チェックをターゲットとするアダプティブアタックでは、効果は低下するが、保持される。
私たちはこれを、堅牢な防御ではなく、パイプラインの相互作用に関する観察として捉えています。
関連論文リスト
- Recover, Decode, Reguard: Guard-Agnostic Defense Amplification againstEncoded VLM Jailbreaks [7.287314790466206]
我々は視覚言語モデルのためのガード非依存のリカバリ・アンド・デコード増幅器を構築した。
我々はこれを11回の攻撃のアンサンブルに対して評価し、成功しても動作が失敗すると評価した。
これは我々の中心的な発見を露呈し、私たちが評価した非観念的回復防衛のための実証的な安全ユーティリティー天井である。
論文 参考訳(メタデータ) (2026-07-29T07:53:35Z) - Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack [78.02110947708535]
敵対的なイメージは、プロンプトインジェクションを通じて、マルチモーダルな大規模言語モデルに深刻なセキュリティ上の脅威をもたらす。
敵の攻撃を成功させるには、画像全体を一様に依存するのではなく、重要な画像トークンの小さなサブセットに依存していることを示す。
本稿では,これらのトークンを勾配解析により局所化し,マスキングにより中和するグラディエントトークンマスキング(GTM)を提案する。
論文 参考訳(メタデータ) (2026-05-24T17:51:34Z) - Disciplined Diffusion: Text-to-Image Diffusion Model against NSFW Generation [9.862349752373577]
テキスト・ツー・イメージ(T2I)拡散モデルでは、テキスト・プロンプトから高品質な画像を作成することができる。
有害な入力が与えられた場合、攻撃的または乱雑なイメージを生成できるため、安全上の懸念が生じる。
そこで我々は,Not Safe For Work (NSFW) 生成に対抗して,新しいロバストなテキストと画像の拡散である Disciplined Diffusion (DDiffusion) を提案する。
論文 参考訳(メタデータ) (2026-05-01T21:33:06Z) - Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs [19.511422290404138]
マルチモーダル・ジェイルブレイク戦略は 視覚データに固有の 複雑な意味構造に 関与できない
textbfMemJackは、視覚的セマンティクスを明示的に活用して自動ジェイルブレイク攻撃を組織化するフレームワークである。
MemJackはQwen3-VL-Plusに対して71.48%のASRを達成した。
論文 参考訳(メタデータ) (2026-04-14T11:44:59Z) - UniMark: Unified Adaptive Multi-bit Watermarking for Autoregressive Image Generators [1.7507301683087861]
本稿では,自動回帰画像生成のためのトレーニングフリーで統一された透かしフレームワークを提案する。
textbf Semantic Grouping (ASG)、 textbfBlockwise Multi-bit。
3つのARモデルを用いた実験により、画像品質(FID)、透かし検出精度、マルチビットメッセージ抽出における最先端性能が得られた。
論文 参考訳(メタデータ) (2026-04-12T16:22:24Z) - SemBind: Binding Diffusion Watermarks to Semantics Against Black-Box Forgery Attacks [74.76909939060833]
ブラックボックスの偽造攻撃は、証明と信頼に非常に大きなリスクをもたらす。
ブラックボックス偽造に抵抗する潜伏型透かしのフレームワークであるSemBindを提案する。
我々は,SemBindが有効である抗偽造の変異が,ブラックボックス偽造の誤認を著しく減少させることを示した。
論文 参考訳(メタデータ) (2026-01-28T07:02:40Z) - SRD: Reinforcement-Learned Semantic Perturbation for Backdoor Defense in VLMs [57.880467106470775]
攻撃者は、トレーニングデータに知覚不能な摂動を注入することができ、モデルが悪意のある攻撃的制御されたキャプションを生成する。
本稿では,引き金の事前知識を伴わずにバックドア動作を緩和する強化学習フレームワークであるセマンティック・リワード・ディフェンス(SRD)を提案する。
SRDはDeep Q-Networkを使用して、機密画像領域に個別の摂動を適用するためのポリシーを学習し、悪意ある経路の活性化を妨害することを目的としている。
論文 参考訳(メタデータ) (2025-06-05T08:22:24Z) - Divide-and-Conquer Attack: Harnessing the Power of LLM to Bypass Safety Filters of Text-to-Image Models [1.5408065585641535]
我々は、最先端TTIモデルの安全フィルタを回避するために、Divide-and-Conquer Attackを導入する。
我々はLLMを効果的に誘導するアタック・ヘルパーを設計し、非倫理的な描画意図を曖昧な記述に分解する。
本研究は,手工芸法や反復的TTIモデルクエリよりも,より深刻なセキュリティ上の意味を持つ。
論文 参考訳(メタデータ) (2023-12-12T10:04:43Z) - Divided Attention: Unsupervised Multi-Object Discovery with Contextually Separated Slots [65.302728042116]
意味的アノテーションがない場合の視覚知覚における物体の出現について検討する。
得られたモデルは、監督を受けておらず、事前訓練された特徴を一切使用していないが、画像の領域を複数の移動領域に分割することができる。
結果として得られる動き分節法は、未知のさまざまなオブジェクトをリアルタイムで処理することができる。
論文 参考訳(メタデータ) (2023-04-04T00:26:13Z) - Mask and Restore: Blind Backdoor Defense at Test Time with Masked Autoencoder [50.1394620328318]
既存のバックドア防御手法では、いくつかのバリデーションデータとモデルパラメータにアクセスする必要があることが多い。
Masked AutoEncoder (BDMAE) を用いたブラインドバックドアディフェンスの提案
BDMAEは、画像の構造的類似性と、テスト画像とMAE復元の間のラベルの整合性を用いて、可能な局所的なトリガを検出する。
論文 参考訳(メタデータ) (2023-03-27T19:23:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。