論文の概要: Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems
- arxiv url: http://arxiv.org/abs/2608.00973v1
- Date: Sun, 02 Aug 2026 03:53:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.040245
- Title: Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems
- Title(参考訳): Mind the Gap:Zero-Query Jailbreaks by Filter-Generator Discrepancy in Text-to-Image Systems
- Abstract要約: テキスト・トゥ・イメージ(T2I)システムは通常、安全でない要求をブロックするためにジェネレータの前にプロンプトレベルの安全フィルタを持つ。
観測可能な不一致規則を用いて、摂動を高能率候補集合にスクリーニングするゼロクエリ・ジェイルブレイク・フレームワークを提案する。
平均攻撃成功率は29.2% (MHSC) と33.3% (Q16) に上昇する。
- 参考スコア(独自算出の注目度): 10.071877020102557
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-to-image (T2I) systems typically have prompt-level safety filters before the generator to block unsafe requests, yet such systems remain vulnerable to malicious jailbreak prompts. Transfer-based attacks construct adversarial prompts offline without querying the target, but they tend to overfit to a single surrogate. Moreover, they explore a large search space in which semantic or perceptual similarity alone cannot guarantee both filter evasion and preservation of the unsafe generation intent, wasting effort on low-potential candidates. We observe that the filter and the generator process the same prompt under different objectives and representations, and term this gap the Filter-Generator Discrepancy (FGD), which allows a perturbation to reduce a prompt's perceived risk to the filter while preserving the visual concept needed by the generator. Building on FGD, we propose a zero-query jailbreak framework that screens perturbations into a high-potential candidate set via observable discrepancy rules at the tokenization and semantic stages, and then performs a surrogate-ensemble evolutionary search that requires no access to the target. Experiments on six black-box pipelines and a commercial online service show that our method consistently outperforms representative baselines, raising the average attack success rate to 29.2\% (MHSC) and 33.3\% (Q16) across the six pipelines and improving over the strongest baseline by about 8 and 12 percentage points, respectively.
- Abstract(参考訳): テキスト・トゥ・イメージ(T2I)システムは通常、ジェネレータが安全でない要求をブロックする前のプロンプトレベルの安全フィルタを持つが、悪意のあるジェイルブレイクプロンプトに対して脆弱なままである。
転送ベースのアタックは、ターゲットに問い合わせることなくオフラインで敵のプロンプトを構成するが、単一のサロゲートにオーバーフィットする傾向がある。
さらに,意味的・知覚的類似性だけでフィルタ回避と安全でない生成意図の保存を保証できない大規模検索空間を探索する。
フィルタとジェネレータは同じプロンプトを異なる目的や表現の下で処理し、このギャップをFGD(Filter-Generator Discrepancy)と呼ぶことで、ジェネレータが必要とする視覚概念を保ちながら、摂動によってフィルタに対するプロンプトの認識リスクを低減することができる。
FGD上に構築されたゼロクエリ・ジェイルブレイク・フレームワークは,トークン化およびセマンティックステージにおける可観測的不一致規則により,摂動を高能率な候補集合にスクリーニングし,ターゲットへのアクセスを必要としないサロゲート・アンサンブル進化探索を行う。
6つのブラックボックスパイプラインと商用オンラインサービスの実験により、我々の手法は代表的ベースラインを一貫して上回り、平均攻撃成功率を6つのパイプラインで29.2\%(MHSC)、33.3\%(Q16)に引き上げ、最強ベースラインを約8ポイント、12ポイント改善した。
関連論文リスト
- Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate [16.474993015566756]
Text-to-image(T2I)モデルは、Not-Safe-For-Work(NSFW)コンテンツを提供するジェイルブレイク攻撃に対して脆弱なままである。
Crackは適応的ジェイルブレイク検索のためのマルチエージェントの議論フレームワークである。
本来の有害な意図を維持しながら、その探索方向を進化する層間制約に適応させる。
論文 参考訳(メタデータ) (2026-09-01T12:45:27Z) - Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics [50.36375380196006]
ジェイルブレイクプロンプトは、大規模な言語モデルにおけるアライメントガードレールをバイパスすることができる。
先行検出アプローチは固定距離空間に大きく依存する。
この仮定は,意図によって無視されるが,安全関連キーワードを含む疑似悪質なプロンプトの下で破られることを示す。
本稿では, LLM を入力を出力に変換する運動系として扱う Manifold Trajectory Kinetics (MTK) を提案する。
論文 参考訳(メタデータ) (2026-06-05T14:49:26Z) - Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack [78.02110947708535]
敵対的なイメージは、プロンプトインジェクションを通じて、マルチモーダルな大規模言語モデルに深刻なセキュリティ上の脅威をもたらす。
敵の攻撃を成功させるには、画像全体を一様に依存するのではなく、重要な画像トークンの小さなサブセットに依存していることを示す。
本稿では,これらのトークンを勾配解析により局所化し,マスキングにより中和するグラディエントトークンマスキング(GTM)を提案する。
論文 参考訳(メタデータ) (2026-05-24T17:51:34Z) - The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring [1.0262304700896199]
我々は, JailBreakV-28Kから125個の有害シードプロンプトに912個の合成戦略を適用し,114,000個の敵プロンプトを構築した。
私たちは、推論時に有害なシードから、流動的なjailbreakプロンプトを合成するモデルを作ります。
安全フィルタ回避率は0.29-0.51 MalであるAutoDANとAmpleGCGは24-39対40-140である。
論文 参考訳(メタデータ) (2026-05-09T23:51:18Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - GuardPhish: Securing Open-Source LLMs from Phishing Abuse [0.7009487789080343]
オフラインおよびエンタープライズ環境でのオープンソースのLarge Language Models(LLM)は、ほとんど検討されていないセキュリティリスクを導入している。
大規模マルチベクトルフィッシングプロンプトデータセットであるGuardPhishを用いて,この脆弱性を調査した。
決定論的5つのモデルアンサンブルをラベル付けに用いて、ほぼ完全なモデル間合意を実現する。
論文 参考訳(メタデータ) (2026-04-19T08:02:57Z) - TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking [52.72486831074384]
サフィックスベースのジェイルブレイク攻撃は、敵のサフィックス、すなわち短いトークンシーケンスを付加し、LLMを安全でない出力にステアリングする。
提案するTrapSuffixは,推論パイプラインを変更することなく,トラップアラインな動作をベースモデルに注入する,軽量な微調整手法である。
様々なサフィックスベースのジェイルブレイク設定で、TrapSuffixは平均攻撃成功率を0.01%以下に下げ、平均追跡成功率87.9%を達成する。
論文 参考訳(メタデータ) (2026-02-06T11:43:56Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - GuardNet: Graph-Attention Filtering for Jailbreak Defense in Large Language Models [5.550877102788988]
大規模言語モデル(LLM)は、ジェイルブレイク攻撃の影響を受けやすくなっている。
これらの攻撃はLLM出力の安全性、信頼性、信頼性を損なう。
推論に先立ってjailbreakプロンプトを検出しフィルタする階層的なフィルタリングフレームワークであるGuardNetを提案する。
論文 参考訳(メタデータ) (2025-09-27T01:21:12Z) - JPS: Jailbreak Multimodal Large Language Models with Collaborative Visual Perturbation and Textual Steering [73.962469626788]
マルチモーダルな大規模言語モデル(MLLM)に対するジェイルブレイク攻撃は重要な研究課題である。
JPS, UnderlineJailbreak MLLMs with collaborative visual underlinePerturbation and textual underlineSteering。
論文 参考訳(メタデータ) (2025-08-07T07:14:01Z) - GhostPrompt: Jailbreaking Text-to-image Generative Models based on Dynamic Optimization [19.44247617251449]
動的プロンプト最適化とマルチモーダルフィードバックを組み合わせた最初の自動ジェイルブレイクフレームワークであるGhostPromptを紹介した。
最先端の性能を達成し、ShieldLM-7Bバイパス率を12.5%から99.0%に向上させた。
GPT-4.1を含む未知のフィルタに一般化し、DALLE 3を脱獄してNSFW画像を生成する。
論文 参考訳(メタデータ) (2025-05-25T05:13:06Z) - Mind the Inconspicuous: Revealing the Hidden Weakness in Aligned LLMs' Refusal Boundaries [22.24239212756129]
複数のシーケンス(eos)トークンを単に追加するだけで、コンテキストセグメンテーションと呼ばれる現象が発生します。
本稿では, eos トークンを付加することにより, BOOST ジェイルブレイク攻撃の簡単な方法を提案する。
論文 参考訳(メタデータ) (2024-05-31T07:41:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。