論文の概要: TYPO: Instruction-Dense Visual Jailbreaks against Commercial Closed-Source Image-Generation Models
- arxiv url: http://arxiv.org/abs/2607.24897v1
- Date: Mon, 27 Jul 2026 16:41:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.575191
- Title: TYPO: Instruction-Dense Visual Jailbreaks against Commercial Closed-Source Image-Generation Models
- Title(参考訳): TYPO:商用クローズドソース画像生成モデルに対するインストラクション・ディエンス・ビジュアル・ジェイルブレイク
- Authors: Meng Xie, Li Zeng, Hangtao Zhang, Xianlong Wang, Ziqi Zhou, Pengpeng Qiao, Zhetao Li,
- Abstract要約: 本稿では,画像生成モデルが画像内に詳細な,読みやすく,かつ行動可能な有害な命令を生成する,命令密度視覚ジェイルブレイクの概念を紹介する。
この脅威をインスタンス化するために、この安全性のギャップを生かすブラックボックスフレームワークであるTYPOを提案する。
タイポは、ASRの9つの代表的なジェイルブレイク攻撃を平均で50.2%上回っている。
- 参考スコア(独自算出の注目度): 20.273766655668478
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent commercial image-generation models can generate high-quality images with readable text (e.g., posters, infographics, and manuals), attracting considerable attention. Yet we first show that this same capability also introduces a previously unreported safety vulnerability: these systems may refuse to generate harmful text directly, yet permit the same content when rendered as text within generated images, i.e., safety alignment does not reliably transfer from textual outputs to text embedded in images. In this paper, unlike existing visual jailbreaks against image-generation models, which primarily induce models to generate harmful visual objects or scenes, we introduce the concept of instruction-dense visual jailbreaks, in which image-generation models produce detailed, readable, and actionable harmful instructions within images. Such outputs can amplify harm because the rendered instructions can be readily read and widely spread. To instantiate this threat, we propose TYPO, a black-box framework that exploits this safety gap by automatically generating adversarial TYPOgraphy prompts, which covertly steer image-generation models to express harmful intent as highly legible, typographically structured text. Specifically, TYPO decomposes prompt generation into two channels: a textual channel for reframing the target intent, and a visual channel for specifying its presentation form. We formulate these two channels as a dual-channel textual-visual strategy space and optimize candidate strategy combinations through an adaptive combinatorial search. Extensive experiments across four commercial models (i.e., GPT-Image-2, Nano Banana Pro, Qwen-Image-2, and Seedream 5.0 Lite) show that TYPO substantially outperforms nine representative jailbreak attacks by 50.2% in ASR on average, while incurring an average query cost of only $0.04.
- Abstract(参考訳): 最近の商用画像生成モデルは、読みやすいテキスト(ポスター、インフォグラフィック、マニュアルなど)で高品質な画像を生成することができ、かなりの注目を集めている。
これらのシステムは、有害なテキストを直接生成することを拒否するが、生成した画像内のテキストとしてレンダリングされた場合、同じコンテンツを許可する。
本稿では、画像生成モデルに対する既存の視覚的ジェイルブレイクと異なり、主に有害な視覚オブジェクトやシーンを生成するモデルを誘導するが、画像生成モデルが画像内で詳細な、読みやすい、行動可能な有害な命令を生成するような、命令密度の視覚的ジェイルブレイクの概念を導入する。
このような出力は、描画された命令を容易に読み出し、広く拡散できるため、害を増幅することができる。
この脅威を即時化するため,敵対的TYPOのプロンプトを自動生成し,その安全性を活かしたブラックボックスフレームワークであるTYPOを提案する。
具体的には、TYPOはプロンプト生成を、2つのチャネルに分解する。
これら2つのチャネルを2チャンネルのテキスト-視覚戦略空間として定式化し、適応的な組合せ探索により候補戦略の組み合わせを最適化する。
4つの商用モデル(GPT-Image-2、Nano Banana Pro、Qwen-Image-2、Seedream 5.0 Lite)にわたる大規模な実験では、TYPOは平均で9つの代表的なジェイルブレイク攻撃を50.2%上回り、平均クエリコストは0.04ドルである。
関連論文リスト
- Imagine Before You Draw: Visual Prompt Engineering for Image Generation [67.81347924426714]
内部フレームワークにシームレスに統合可能なVisual Prompt Engineering (VPE)を提案する。
我々は,クラス条件生成,テキスト・ツー・イメージ生成,画像編集にまたがってVPEを検証する。
その結果, VPEはコンバージェンスを加速し, 天井の質を高め, 内部統合により, 編集保存性を大幅に向上することがわかった。
論文 参考訳(メタデータ) (2026-06-03T05:01:36Z) - Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models [31.243185346527255]
現代のテキスト・トゥ・イメージ(T2I)モデルでは、正当性のある段落長のテキストを描画できるようになった。
我々は、敵がT2Iシステムを強制して有害なテキストペイロードを含む画像を生成する、記述的ジェイルブレイクを識別し、形式化する。
敵のプロンプトを3つの機能層に分解するブラックボックス攻撃フレームワークであるEtchを提案する。
論文 参考訳(メタデータ) (2026-04-07T13:16:07Z) - VII: Visual Instruction Injection for Jailbreaking Image-to-Video Generation Models [57.128876964730644]
参照画像に映像生成を条件付けるI2V(Image-to-Video)生成モデルは、新たな視覚的指示追従能力を示す。
安全でないテキストプロンプトの悪意ある意図を、安全な参照画像の良心的な視覚的指示として偽装する、トレーニング不要で移動可能なジェイルブレイクフレームワークであるVisual Instruction Injection (VII)を提案する。
VIIは最大83.5%のアタック成功率を達成し、拒絶率をほぼゼロに抑え、既存のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2026-02-24T15:20:01Z) - SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models [74.11062256255387]
テキスト・ツー・イメージのモデルは、安全対策を回避し、有害なコンテンツを生成できる敵のプロンプトに対して非常に脆弱である。
SafeGuiderは, 生成品質を損なうことなく, 堅牢な安全制御を実現するための2段階のフレームワークである。
SafeGuiderは攻撃成功率の最小化において例外的な効果を示し、様々な攻撃シナリオで最大速度は5.48%である。
論文 参考訳(メタデータ) (2025-10-05T10:24:48Z) - Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models [73.43013217318965]
マルチモーダル・プロンプト・デカップリング・アタック(MPDA)
MPDAは画像モダリティを使用して、元の安全でないプロンプトの有害なセマンティックコンポーネントを分離する。
ビジュアル言語モデルは、生成したNSFW画像と元の安全でないプロンプトとのセマンティック一貫性を確保するために画像キャプションを生成する。
論文 参考訳(メタデータ) (2025-09-21T11:22:32Z) - Multimodal Pragmatic Jailbreak on Text-to-image Models [42.53834190690214]
この研究は、新しいタイプのjailbreakを導入し、T2Iモデルをトリガーして、ビジュアルテキストで画像を生成する。
我々は、2つのクローズドソース商用モデルを含む9つの代表的なT2Iモデルをベンチマークする。
我々の研究は、よりセキュアで信頼性の高いT2Iモデルに向けたさらなる開発基盤を提供する。
論文 参考訳(メタデータ) (2024-09-27T21:23:46Z) - Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models [10.70975463369742]
JPA(Jailbreaking Prompt Attack)について紹介する。
JPAは、アントロニムのグループを使用してテキスト埋め込みスペース内のターゲットの悪意ある概念を検索する。
プレフィックスプロンプトは離散語彙空間で最適化され、テキスト埋め込み空間において悪意ある概念を意味的に整合させる。
論文 参考訳(メタデータ) (2024-04-02T09:49:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。