論文の概要: Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate
- arxiv url: http://arxiv.org/abs/2609.01168v2
- Date: Wed, 02 Sep 2026 12:27:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.525056
- Title: Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate
- Title(参考訳): ひび割れによるテキスト・画像間のジェイルブレイク:マルチエージェント・ディベートによる異種安全フィルタのナビゲーション
- Authors: Kaiyan Wen, Shijie Zhang, Lu Yu, Guangdong Bai,
- Abstract要約: Text-to-image(T2I)モデルは、Not-Safe-For-Work(NSFW)コンテンツを提供するジェイルブレイク攻撃に対して脆弱なままである。
Crackは適応的ジェイルブレイク検索のためのマルチエージェントの議論フレームワークである。
本来の有害な意図を維持しながら、その探索方向を進化する層間制約に適応させる。
- 参考スコア(独自算出の注目度): 16.474993015566756
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-to-image (T2I) models remain vulnerable to jailbreak attacks that elicit Not-Safe-For-Work (NSFW) content, despite increasingly being guarded by heterogeneous, multi-layer safety stacks combining text filters, image classifiers, and cross-modal detectors. Existing jailbreak studies either optimize against individual filters or query the complete pipeline with aggregate feedback, making it difficult to identify the active constraint and adapt to conflicts across safety layers. In this paper, we introduce the Detection Surface, a unified geometric framework that characterizes the decision boundaries induced by heterogeneous T2I safety filters and their joint effect on the jailbreak search space. This formulation reveals that successful evasion is governed by a sparse and non-convex region shaped by cross-layer conflicts, where mutations that bypass one filter may increase exposure to another. Motivated by this analysis, we propose CRACK, a multi-agent debate framework for adaptive jailbreak search that decomposes jailbreak search into exploration, diagnosis, and arbitration. CRACK coordinates an Attack Agent, a Defense Agent, and a Judge Agent to iteratively generate prompt mutations, obtain layer-specific diagnostic feedback, and optimize mutation strategies through reward-guided refinement. Through repeated rounds of debate, CRACK adapts its search direction to the evolving cross-layer constraints while preserving the original harmful intent. Extensive experiments across multiple T2I models, datasets, and safety configurations show that CRACK achieves Attack Success Rates (ASR) of up to 99.63% under composite defenses, while requiring fewer queries than existing methods and maintaining semantic fidelity.
- Abstract(参考訳): テキスト・ツー・イメージ(T2I)モデルは、テキスト・フィルター、画像分類器、クロスモーダル・ディテクターを組み合わせた多層安全スタックによって守られつつも、Not-Safe-For-Work(NSFW)コンテンツを引き出すジェイルブレイク攻撃に弱いままである。
既存のjailbreak研究は、個々のフィルタに対して最適化するか、集約されたフィードバックでパイプライン全体をクエリする。
本稿では,不均一なT2I安全フィルタによって誘導される決定境界を特徴付ける統一的な幾何学的枠組みである検出面について紹介する。
この定式化により、脱出に成功した領域は層間衝突によって形成されたスパース領域と非凸領域によって制御され、あるフィルターをバイパスする突然変異が他のフィルターへの露出を増加させる可能性があることが明らかになった。
そこで本研究では,ジェイルブレイク検索を探索,診断,仲裁に分解する適応型ジェイルブレイク検索のためのマルチエージェントディベートフレームワークであるCRACKを提案する。
CRACKは、アタックエージェント、ディフェンスエージェント、およびジャッジエージェントをコーディネートし、即時突然変異を反復的に生成し、層特異的な診断フィードバックを取得し、報酬誘導精製により突然変異戦略を最適化する。
CRACKは何度も議論を重ね、元の有害な意図を保ちながら、その探索方向を進化する層間制約に適応させる。
複数のT2Iモデル、データセット、安全設定にわたる大規模な実験は、CRACKが99.63%の攻撃成功率(ASR)を複合防御下で達成し、既存のメソッドよりもクエリを少なくし、セマンティック忠実性を維持することを示している。
関連論文リスト
- SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense [77.70598852234149]
テキスト・トゥ・ビデオ(T2V)生成モデルは、現実世界のデプロイにおいてジェイルブレイク攻撃に対して脆弱である。
安全なクロスアテンション・ローカライゼーションと正規化のための機能レベル防衛機構であるSafeCAを提案する。
実験の結果、SafeCAは主流のT2Vモデルでジェイルブレイクの成功率を約20%削減することが示された。
論文 参考訳(メタデータ) (2026-08-11T14:01:24Z) - Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems [10.071877020102557]
テキスト・トゥ・イメージ(T2I)システムは通常、安全でない要求をブロックするためにジェネレータの前にプロンプトレベルの安全フィルタを持つ。
観測可能な不一致規則を用いて、摂動を高能率候補集合にスクリーニングするゼロクエリ・ジェイルブレイク・フレームワークを提案する。
平均攻撃成功率は29.2% (MHSC) と33.3% (Q16) に上昇する。
論文 参考訳(メタデータ) (2026-08-02T03:53:30Z) - Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models [41.174198293625885]
既存のジェイルブレイク法は、主にテキスト・ツー・イメージ攻撃に適応しており、T2Vシステムに適用すると顕著な欠点を被る。
我々は,T2Vモデルのための構造化,クエリ効率の高いジェイルブレイクフレームワークであるBSBを提案する。
我々は、Veo 3.1、Sora 2、Seedance、Kling v1など、主要な商用T2Vモデルに関する包括的な実験を行う。
論文 参考訳(メタデータ) (2026-07-19T14:52:31Z) - Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs [56.53007443197966]
大規模推論モデル(LRM)は推論および生成タスクにおいて顕著な機能を示した。
彼らの明確なチェーン・オブ・シント(CoT)メカニズムは、新しいセキュリティリスクをもたらし、特にジェイルブレイク攻撃に対して脆弱である。
AE-CoTと呼ばれる適応的な進化的CoTジェイルブレイクフレームワークを提案し、これらの制限を克服する。
論文 参考訳(メタデータ) (2026-05-23T10:11:32Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z) - Universally Unfiltered and Unseen:Input-Agnostic Multimodal Jailbreaks against Text-to-Image Model Safeguards [8.075914295122676]
我々は,T2Iの保護者に対するマルチモーダルジェイルブレイク攻撃手法であるUniversally Unfiltered and Unseen (U3)-Attackを提案する。
われわれのU3-Attackは、最先端のマルチモーダルジェイルブレイク攻撃であるMMA-Diffusionよりも4倍高い成功率を達成した。
論文 参考訳(メタデータ) (2025-07-30T10:06:38Z) - T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks [67.91652526657599]
我々は、T2Vジェイルブレイク攻撃を離散最適化問題として定式化し、T2V-OptJailと呼ばれる共同目的ベース最適化フレームワークを提案する。
いくつかのT2Vモデルに対して大規模な実験を行い、オープンソースモデルと実際の商用クローズドソースモデルの両方をカバーする。
提案手法は,攻撃成功率の観点から既存手法よりも11.4%,10.0%向上する。
論文 参考訳(メタデータ) (2025-05-10T16:04:52Z) - Token-Level Constraint Boundary Search for Jailbreaking Text-to-Image Models [20.740929360321747]
テキスト・ツー・イメージ(T2I)生成は、不適切または有害なコンテンツの生成に関連するリスクを引き起こす。
我々は,テキストと画像チェッカーによって定義された決定境界付近のトークンを検索する,クエリベースのブラックボックスジェイルブレイク攻撃であるTBC-Attackを提案する。
提案手法は,T2Iモデルにまたがる最先端のジェイルブレイク攻撃を継続的に上回ります。
論文 参考訳(メタデータ) (2025-04-15T11:53:40Z) - AdvQDet: Detecting Query-Based Adversarial Attacks with Adversarial Contrastive Prompt Tuning [93.77763753231338]
CLIP画像エンコーダを微調整し、2つの中間対向クエリに対して同様の埋め込みを抽出するために、ACPT(Adversarial Contrastive Prompt Tuning)を提案する。
我々は,ACPTが7つの最先端クエリベースの攻撃を検出できることを示す。
また,ACPTは3種類のアダプティブアタックに対して堅牢であることを示す。
論文 参考訳(メタデータ) (2024-08-04T09:53:50Z) - AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens [83.08119913279488]
本稿では,ジェイルブレイク攻撃と防衛技術における依存関係の体系的解析について述べる。
包括的な、自動化された、論理的な3つのフレームワークを提案します。
このアンサンブル・ジェイルブレイク・アタックと防衛の枠組みは,既存の研究を著しく上回る結果となった。
論文 参考訳(メタデータ) (2024-06-06T07:24:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。