論文の概要: AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models
- arxiv url: http://arxiv.org/abs/2607.06120v1
- Date: Tue, 07 Jul 2026 10:27:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.49473
- Title: AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models
- Title(参考訳): AEGIS:テキスト・画像モデルにおける視覚的同期ジェイルブレイクに対するメカニズムガイドによる防御
- Abstract要約: AEGISは、同一の脆弱な頭部のみに類似性を認識した反発を適用する推論時防御である。
良性の忠実さを保ち、硬い負の概念の抑制を回避し、各背骨の臨界頭部を再同定した後、SD 2.1とFLUX.1に転移する。
- 参考スコア(独自算出の注目度): 22.925421768193956
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-image diffusion models have achieved high visual fidelity and broad adoption, but remain vulnerable to safety violations when adversaries exploit them to synthesize illicit content. Existing alignment paradigms, from input sanitization to structural feature pruning, are largely organized around unsafe concepts explicitly exposed during filtering, editing, or localization. This leaves a blind spot for visual synonym attacks (VSA), a jailbreak where benign-looking prompts elicit prohibited imagery through implicit visual associations. As a result, current defenses face a safety-utility dilemma: they may either under-mitigate VSA threats or over-suppress visually similar benign concepts. The core challenge is that VSA hides the unsafe target at the textual surface while revealing it through generation-time visual-semantic convergence. In this work, we therefore shift from static suppression of pre-specified unsafe concepts to dynamic tracing of how unsafe semantics emerge during generation. Our mechanistic analysis shows that VSA and explicit unsafe prompts converge through sparse semantic-injecting attention heads, which serve as inference-time bottlenecks for prohibited visual semantics. Based on this insight, we propose AEGIS (Adaptive Evasion Guard via Identification and Steering), an inference-time defense that applies similarity-aware repulsion only at the identified vulnerable heads. Evaluated against 16 baselines, AEGIS improves both safety and utility. On SD 1.4, it reduces ASR to $\mathbf{0.00}/\mathbf{0.03}$ for in-domain violence/nudity VSA and achieves ASRs $\le \mathbf{0.09}$ on out-of-domain explicit and adversarial attacks. It preserves benign fidelity, avoids suppressing hard-negative concepts, and transfers to SD 2.1 and FLUX.1 after re-identifying the critical heads for each backbone.
- Abstract(参考訳): テキストと画像の拡散モデルは、高い視覚的忠実さと広く採用されているが、敵が不正なコンテンツを合成するためにそれらを利用する場合、安全違反に弱いままである。
既存のアライメントパラダイムは、入力のサニタイズから構造的特徴プルーニングまで、主にフィルタリング、編集、ローカライゼーションの間、明示された安全でない概念に基づいて構成されている。
これは視覚的シノニム攻撃(VSA)の盲点を残しており、視覚的アソシエーション(暗黙の視覚的アソシエーション)を通じて、良心的な表情が禁止されたイメージを誘惑するジェイルブレイクである。
結果として、現在の防衛は安全ユーティリティジレンマに直面している。それらはVSAの脅威を過度に軽減するか、視覚的に類似した良性の概念を過度に抑圧する可能性がある。
主な課題は、VSAがテキスト表面で安全でないターゲットを隠蔽し、生成時のビジュアル・セマンティック・コンバージェンスを通じてそれを明らかにすることである。
そこで本研究では,事前に特定された安全でない概念の静的な抑制から,生成時に安全でないセマンティクスがどのように出現するかの動的トレースへと移行する。
我々の力学解析によると、VSAと明示的な安全でないプロンプトは、視覚的意味論の推論時間ボトルネックとして機能するスパース・セマンティック・インジェクション・アテンションヘッドを通じて収束している。
そこで本研究では,AEGIS(Adaptive Evasion Guard via Identification and Steering)を提案する。
AEGISは16のベースラインに対して評価され、安全性と実用性の両方を改善している。
SD 1.4では、ASRを$\mathbf{0.00}/\mathbf{0.03}$に還元し、ドメイン内暴力/ニュディティVSAに対して$\le \mathbf{0.09}$を達成する。
良性の忠実さを保ち、硬い負の概念の抑制を回避し、各背骨の臨界頭部を再同定した後、SD 2.1とFLUX.1に転移する。
関連論文リスト
- SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense [77.70598852234149]
テキスト・トゥ・ビデオ(T2V)生成モデルは、現実世界のデプロイにおいてジェイルブレイク攻撃に対して脆弱である。
安全なクロスアテンション・ローカライゼーションと正規化のための機能レベル防衛機構であるSafeCAを提案する。
実験の結果、SafeCAは主流のT2Vモデルでジェイルブレイクの成功率を約20%削減することが示された。
論文 参考訳(メタデータ) (2026-08-11T14:01:24Z) - The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models [49.67749928542536]
テキスト・ツー・イメージ(T2I)拡散モデルの安全性の確保は,有害な世代を抑えることを目的としている。
近年の手法は高いユーティリティで高い安全性を提供するように思われるが、この結論は主に粗いグローバルユーティリティメトリクスに依存している。
構造的評価で実用性を測定すると、この錯覚は壊れる:OnA(質問回答を用いたテキストから画像への忠実度評価)
本研究では,組込み拡散とプロンプト間関係構造を明示的に保存する安全アライメント目標であるStructureAware Geometric Regularization (SAGE)を提案する。
論文 参考訳(メタデータ) (2026-07-01T04:00:27Z) - SACE: Concept Erasure at the Semantic Singularity in Visual Autoregressive Models [10.865745057624833]
本稿では、視覚的自己回帰(VAR)モデルのための最初のスケールアウェアの概念消去フレームワーク(SACE)を紹介する。
厳密な介入を第1スケールに収束させることで,高エントロピーサンプリング劣化を防止するために,エントロピー規則化された消去対象を結合する。
論文 参考訳(メタデータ) (2026-06-14T13:39:00Z) - Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation [54.38271718421492]
敵の密輸攻撃は人間とAIの能力ギャップを悪用する。
有害なコンテンツを人間の読みやすい視覚形式にエンコードする。
我々は緩和戦略の予備的な調査を行う。
論文 参考訳(メタデータ) (2026-04-08T11:13:16Z) - Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models [9.123902853709206]
LVLM(Large Vision-Language Models)は、有害なコンテンツを抑えるために安全アライメントを行う。
本稿では,LVLMを誘導し,良性前提から有害な論理を合成するシステム欠陥を同定する。
提案手法は,ベニグインプットのセマンティック衝突を編成するために,モデルの命令追従機能を利用する。
論文 参考訳(メタデータ) (2026-03-10T06:18:48Z) - Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images [15.316817046650208]
マルチモーダルな大言語モデル(MLLM)は、視覚的な入力が有害な出力を可能にする、安全性のミスアライメントに直面している。
創発的不整合に基づく自己充満機構に着想を得て,視覚自己充満アライメント(VSFA)を提案する。
VSFAファイントゥネス視覚言語モデル(VLM)は、脅威関連画像を中心に構築された中立的なVQAタスクにおいて、安全ラベルを含まない。
論文 参考訳(メタデータ) (2026-03-09T15:20:53Z) - The Illusion of Forgetting: Attack Unlearned Diffusion via Initial Latent Variable Optimization [51.835894707552946]
非学習型防衛は拡散モデル(DM)からNot-Safe-For-Work概念を浄化すると主張している
本研究では,未学習が言語記号と基礎知識のマッピングを部分的に破壊し,休眠記憶として残り続けることを示す。
IVOは、壊れたマッピングを再構築することで、これらの休眠記憶を再活性化する簡潔で強力な攻撃フレームワークである。
論文 参考訳(メタデータ) (2026-01-30T02:39:51Z) - Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models [93.5740266114488]
コンストラクティブ・セーフティ・アライメント(CSA)は、悪意のある誤用を防ぎつつ、脆弱性のあるユーザを安全で有益な結果へと積極的に誘導する。
Oy1は、高度な汎用能力を保ちながら、オープンモデル間の最先端の安全性を達成する。
私たちは、責任あるユーザ中心AIをサポートするために、Oy1、コード、ベンチマークをリリースしています。
論文 参考訳(メタデータ) (2025-09-02T03:04:27Z) - AdversariaL attacK sAfety aLIgnment(ALKALI): Safeguarding LLMs through GRACE: Geometric Representation-Aware Contrastive Enhancement- Introducing Adversarial Vulnerability Quality Index (AVQI) [21.209413521884297]
LLMに対する敵の脅威は、現在の防衛が適応できるよりも急速にエスカレートしている。
ALKALIは, 厳格にキュレートされた最初の逆数ベンチマークである。
本稿では、遅延空間正規化と協調するアライメントフレームワークGRACEを紹介する。
論文 参考訳(メタデータ) (2025-06-10T15:14:17Z) - SRD: Reinforcement-Learned Semantic Perturbation for Backdoor Defense in VLMs [57.880467106470775]
攻撃者は、トレーニングデータに知覚不能な摂動を注入することができ、モデルが悪意のある攻撃的制御されたキャプションを生成する。
本稿では,引き金の事前知識を伴わずにバックドア動作を緩和する強化学習フレームワークであるセマンティック・リワード・ディフェンス(SRD)を提案する。
SRDはDeep Q-Networkを使用して、機密画像領域に個別の摂動を適用するためのポリシーを学習し、悪意ある経路の活性化を妨害することを目的としている。
論文 参考訳(メタデータ) (2025-06-05T08:22:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。