論文の概要: Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models
- arxiv url: http://arxiv.org/abs/2604.05853v2
- Date: Wed, 08 Apr 2026 04:16:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-09 14:06:05.167042
- Title: Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models
- Title(参考訳): ピクセル間の読み上げ:テキストと画像のモデルに対するインクリメンタルなジェイルブレイク攻撃
- Abstract要約: 現代のテキスト・トゥ・イメージ(T2I)モデルでは、正当性のある段落長のテキストを描画できるようになった。
我々は、敵がT2Iシステムを強制して有害なテキストペイロードを含む画像を生成する、記述的ジェイルブレイクを識別し、形式化する。
敵のプロンプトを3つの機能層に分解するブラックボックス攻撃フレームワークであるEtchを提案する。
- 参考スコア(独自算出の注目度): 31.243185346527255
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern text-to-image (T2I) models can now render legible, paragraph-length text, enabling a fundamentally new class of misuse. We identify and formalize the inscriptive jailbreak, where an adversary coerces a T2I system into generating images containing harmful textual payloads (e.g., fraudulent documents) embedded within visually benign scenes. Unlike traditional depictive jailbreaks that elicit visually objectionable imagery, inscriptive attacks weaponize the text-rendering capability itself. Because existing jailbreak techniques are designed for coarse visual manipulation, they struggle to bypass multi-stage safety filters while maintaining character-level fidelity. To expose this vulnerability, we propose Etch, a black-box attack framework that decomposes the adversarial prompt into three functionally orthogonal layers: semantic camouflage, visual-spatial anchoring, and typographic encoding. This decomposition reduces joint optimization over the full prompt space to tractable sub-problems, which are iteratively refined through a zero-order loop. In this process, a vision-language model critiques each generated image, localizes failures to specific layers, and prescribes targeted revisions. Extensive evaluations across 7 models on the 2 benchmarks demonstrate that Etch achieves an average attack success rate of 65.57% (peaking at 91.00%), significantly outperforming existing baselines. Our results reveal a critical blind spot in current T2I safety alignments and underscore the urgent need for typography-aware defense multimodal mechanisms.
- Abstract(参考訳): 現代のテキスト・トゥ・イメージ(T2I)モデルでは、正当性のある段落長のテキストを描画できるようになった。
我々は,敵対者がT2Iシステムを強制的に生成し,有害なテキストペイロード(例えば不正な文書)を視覚的な場面に埋め込んだ画像を生成する,記述的ジェイルブレイクを識別し,形式化する。
視覚的に不快なイメージを誘発する伝統的な描写されたジェイルブレイクとは異なり、インクリプティブアタックはテキストレンダリング機能自体を武器にしている。
既存のジェイルブレイク技術は粗い視覚操作のために設計されているため、キャラクタレベルの忠実さを維持しながら、多段安全フィルタをバイパスするのに苦労している。
この脆弱性を明らかにするために,敵対的プロンプトを3つの機能的直交層(セマンティックカモフラージュ,視覚空間アンカー,タイポグラフィエンコーディング)に分解するブラックボックス攻撃フレームワークであるEtchを提案する。
この分解により、全プロンプト空間上のジョイント最適化は、ゼロ次ループを通じて反復的に洗練されるトラクタブルなサブプロブレムに還元される。
このプロセスでは、視覚言語モデルが生成された各画像を批判し、特定のレイヤに障害をローカライズし、ターゲットとするリビジョンを処方する。
2つのベンチマークで7つのモデルに対して大規模な評価を行った結果、Etchは65.57%(91.00%)の攻撃成功率を達成し、既存のベースラインを著しく上回る結果となった。
以上の結果から,現在のT2I安全アライメントにおける重要な盲点が明らかとなり,タイポグラフィー対応型防衛マルチモーダル機構の緊急の必要性が浮き彫りになった。
関連論文リスト
- Automatic Red Teaming for Implicit Vulnerabilities of Text-to-Image Models [58.59008920408855]
本稿では,ターゲットモデルのパラメータへのアクセスを必要とせずに,暗黙の脆弱性を明らかにするためのAdvPIE(Adversarial Probing for Implicit VulnErabilities)を提案する。
AdvPIEは、審査員からのフィードバックに基づいて暗黙の敵のプロンプトを生成し、洗練するためのポリシーエージェントを採用する。
標準および安全性に適合したT2Iモデルの実験では、AdvPIE1が暗黙の脆弱性を効果的に発見している。
論文 参考訳(メタデータ) (2026-09-05T13:45:09Z) - TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models [6.9498303374340225]
I2Vシステムにおける3つの攻撃シナリオを調査し,時間的脆弱性を明らかにする。
I2Vシステムのための新しい時間的ジェイルブレイクフレームワークであるTempJailを提案する。
実験の結果、TempJailは従来の最先端の手法よりも23.3%の攻撃成功率を向上させることが示された。
論文 参考訳(メタデータ) (2026-08-27T11:15:39Z) - TYPO: Instruction-Dense Visual Jailbreaks against Commercial Closed-Source Image-Generation Models [20.273766655668478]
本稿では,画像生成モデルが画像内に詳細な,読みやすく,かつ行動可能な有害な命令を生成する,命令密度視覚ジェイルブレイクの概念を紹介する。
この脅威をインスタンス化するために、この安全性のギャップを生かすブラックボックスフレームワークであるTYPOを提案する。
タイポは、ASRの9つの代表的なジェイルブレイク攻撃を平均で50.2%上回っている。
論文 参考訳(メタデータ) (2026-07-27T16:41:36Z) - GhostPrompt: Jailbreaking Text-to-image Generative Models based on Dynamic Optimization [19.44247617251449]
動的プロンプト最適化とマルチモーダルフィードバックを組み合わせた最初の自動ジェイルブレイクフレームワークであるGhostPromptを紹介した。
最先端の性能を達成し、ShieldLM-7Bバイパス率を12.5%から99.0%に向上させた。
GPT-4.1を含む未知のフィルタに一般化し、DALLE 3を脱獄してNSFW画像を生成する。
論文 参考訳(メタデータ) (2025-05-25T05:13:06Z) - T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models [88.63040835652902]
テキストからビデオモデルへの攻撃はジェイルブレイク攻撃に弱いため、特別な方法で安全メカニズムをバイパスし、有害または安全でないコンテンツの生成につながる。
我々は、ジェイルブレイクの脅威からテキストからビデオモデルを守るために設計された包括的でモデルに依存しない防衛フレームワークであるT2VShieldを提案する。
本手法は,既存の防御の限界を特定するために,入力,モデル,出力の段階を体系的に解析する。
論文 参考訳(メタデータ) (2025-04-22T01:18:42Z) - Token-Level Constraint Boundary Search for Jailbreaking Text-to-Image Models [20.740929360321747]
テキスト・ツー・イメージ(T2I)生成は、不適切または有害なコンテンツの生成に関連するリスクを引き起こす。
我々は,テキストと画像チェッカーによって定義された決定境界付近のトークンを検索する,クエリベースのブラックボックスジェイルブレイク攻撃であるTBC-Attackを提案する。
提案手法は,T2Iモデルにまたがる最先端のジェイルブレイク攻撃を継続的に上回ります。
論文 参考訳(メタデータ) (2025-04-15T11:53:40Z) - Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense [55.77152277982117]
私たちは、jailbreak攻撃から防御するために設計された方法であるLayer-AdvPatcherを紹介します。
私たちは、自己拡張データセットを通じて、大規模言語モデル内の特定のレイヤにパッチを適用するために、未学習の戦略を使用します。
我々の枠組みは、脱獄攻撃の有害性と攻撃の成功率を減らす。
論文 参考訳(メタデータ) (2025-01-05T19:06:03Z) - HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models [28.28898114141277]
テキスト・トゥ・イメージ(T2I)モデルは画像生成と編集において顕著な成功を収めた。
これらのモデルには、特に不適切な、あるいは安全でない(NSFW)コンテンツを生成する場合に、多くの潜在的な問題がある。
本稿では,トークン探索攻撃手法であるHTS-Attackを提案する。
論文 参考訳(メタデータ) (2024-08-25T17:33:40Z) - Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt [60.54666043358946]
本稿では,テキストと視覚のプロンプトを協調的に最適化することにより,ジェイルブレイクを実行するバイモーダル・アドバイサル・プロンプト・アタック(BAP)を提案する。
特に,大規模言語モデルを用いてジェイルブレイクの失敗を分析し,テキストのプロンプトを洗練させるために連鎖推論を採用する。
論文 参考訳(メタデータ) (2024-06-06T13:00:42Z) - White-box Multimodal Jailbreaks Against Large Vision-Language Models [61.97578116584653]
本稿では,テキストと画像のモダリティを併用して,大規模視覚言語モデルにおけるより広範な脆弱性のスペクトルを利用する,より包括的戦略を提案する。
本手法は,テキスト入力がない場合に,逆画像プレフィックスをランダムノイズから最適化し,有害な応答を多様に生成することから始める。
様々な有害な指示に対する肯定的な反応を誘発する確率を最大化するために、対向テキスト接頭辞を、対向画像接頭辞と統合し、共最適化する。
論文 参考訳(メタデータ) (2024-05-28T07:13:30Z) - Latent Guard: a Safety Framework for Text-to-image Generation [64.49596711025993]
既存の安全対策は、容易に回避できるテキストブラックリストや有害なコンテンツ分類に基づいている。
テキスト・ツー・イメージ生成の安全性向上を目的としたフレームワークであるLatent Guardを提案する。
ブラックリストベースのアプローチにインスパイアされたLatent Guardは、T2Iモデルのテキストエンコーダの上に潜在空間を学習し、有害な概念の存在を確認することができる。
論文 参考訳(メタデータ) (2024-04-11T17:59:52Z) - Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models [10.70975463369742]
JPA(Jailbreaking Prompt Attack)について紹介する。
JPAは、アントロニムのグループを使用してテキスト埋め込みスペース内のターゲットの悪意ある概念を検索する。
プレフィックスプロンプトは離散語彙空間で最適化され、テキスト埋め込み空間において悪意ある概念を意味的に整合させる。
論文 参考訳(メタデータ) (2024-04-02T09:49:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。