論文の概要: DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization
- arxiv url: http://arxiv.org/abs/2608.17067v1
- Date: Mon, 17 Aug 2026 19:13:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.113612
- Title: DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization
- Title(参考訳): DiSCO:分散誘導コントラッシブ・プロンプト最適化によるテキスト・画像生成の回避
- Authors: Tong Zhang, Motasem Alfarra, Carlos Hinojosa, Christos Louizos, Bernard Ghanem,
- Abstract要約: DiSCOはゼロショットで厳密にブラックボックスのディフェンスで、プラグイン・アンド・プレイモジュールとしてプロンプトレベルで完全に動作する。
我々は,DiSCOが無防備モデルと防御モデルの両方の安全性を継続的に向上することを示した。
ブラックボックスでアーキテクチャに依存しないモジュールとして、DiSCOはどんなテキスト・ツー・イメージ・システムにも容易に適用できる。
- 参考スコア(独自算出の注目度): 65.89030524420933
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: As text-to-image generative models advance, they raise critical safety concerns, particularly the generation of Not-Safe-For-Work (NSFW) content such as violence and nudity, further exacerbated by red-teaming adversarial attacks. Existing defenses predominantly operate under white-box assumptions, relying on text encoder optimization, weight editing, or inference-time intervention, and fundamentally cannot scale to proprietary models. Black-box alternatives based on LLM prompt rewriting offer broader applicability, yet fail in a critical regime we identify as the \textit{benign adversarial} problem: prompts that are linguistically safe but still trigger harmful generation due to the model's learned data distribution. We propose DiSCO, a zero-shot, strictly black-box defense that operates entirely at the prompt level as a plug-and-play module, requiring no model retraining, fine-tuning, or access to model internals. DiSCO performs distribution-guided suffix expansion via beam search, optimized through contrastive scoring over safe and unsafe image pools generated by the target model itself, with iterative adaptive feedback until safe content is produced. We demonstrate that DiSCO consistently enhances the safety of both undefended and defended models on the I2P benchmark under multiple red-teaming attacks, achieving 37.7% and 25.13% ASR reduction, respectively, while maintaining semantic fidelity and improving image coherence. As a black-box, architecture-agnostic module, DiSCO can be readily applied to any text-to-image system without necessitating any changes to the model itself.
- Abstract(参考訳): テキスト・ツー・イメージ生成モデルが進歩するにつれて、特に暴力やヌードのような安全でない労働(NSFW)コンテンツの生成に対する重要な安全上の懸念が高まる。
既存の防衛は、テキストエンコーダの最適化、重み付けの編集、推論時間の介入に頼って、主にホワイトボックスの仮定の下で運用されており、基本的にプロプライエタリなモデルにスケールできない。
LLMをベースとしたブラックボックスの代替案は、より広範な適用性を提供するが、重要なシステムでは失敗する: 言語的に安全だが、学習したデータ分布のために有害な生成を引き起こすプロンプト。
ゼロショットで厳密なブラックボックスディフェンスであるDiSCOは、プラグイン・アンド・プレイモジュールとして即時動作し、モデル再トレーニング、微調整、モデル内部へのアクセスを必要としない。
DiSCOはビームサーチにより分布誘導接尾辞展開を行い、ターゲットモデル自体が生成する安全で安全でない画像プールに対するコントラストスコアを最適化し、安全なコンテンツが生成されるまで反復的な適応フィードバックを行う。
我々は,DiSCOが,複数のリピート攻撃によるI2Pベンチマークにおける無防備モデルと防御モデルの両方の安全性を一貫して向上し,それぞれ37.7%と25.13%のASR削減を実現し,セマンティック忠実度を維持し,画像コヒーレンスを向上させることを実証した。
ブラックボックスでアーキテクチャに依存しないモジュールとして、DiSCOはモデル自体の変更を必要とせずに、どんなテキスト・ツー・イメージ・システムにも容易に適用できる。
関連論文リスト
- SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models [67.84174763413178]
我々はSafeRedirを紹介した。SafeRedirは、迅速な埋め込みリダイレクトによる堅牢なアンラーニングのための軽量な推論時フレームワークである。
SafeRedirは,効果的な非学習能力,意味的・知覚的保存能力,堅牢な画像品質,対人攻撃に対する耐性の向上を実現している。
論文 参考訳(メタデータ) (2026-01-13T15:01:38Z) - SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models [74.11062256255387]
テキスト・ツー・イメージのモデルは、安全対策を回避し、有害なコンテンツを生成できる敵のプロンプトに対して非常に脆弱である。
SafeGuiderは, 生成品質を損なうことなく, 堅牢な安全制御を実現するための2段階のフレームワークである。
SafeGuiderは攻撃成功率の最小化において例外的な効果を示し、様々な攻撃シナリオで最大速度は5.48%である。
論文 参考訳(メタデータ) (2025-10-05T10:24:48Z) - Robustifying Vision-Language Models via Dynamic Token Reweighting [28.675118345987887]
大きな視覚言語モデル(VLM)は、ジェイルブレイク攻撃に対して非常に脆弱である。
マルチモーダル・ジェイルブレイク攻撃を緩和する新しい推論時防御法を提案する。
視覚的モダリティによって誘導される安全関連分布シフトの新しい定式化を導入する。
論文 参考訳(メタデータ) (2025-05-22T03:00:39Z) - SC-Pro: Training-Free Framework for Defending Unsafe Image Synthesis Attack [13.799517170191919]
最近の研究では、安全チェッカーは敵の攻撃に対して脆弱性があることが示されており、NSFW(Not Safe For Work)イメージを生成することができる。
NSFW画像を生成する敵攻撃に対して容易に防御できる訓練不要のフレームワークであるSC-Proを提案する。
論文 参考訳(メタデータ) (2025-01-09T16:43:21Z) - Direct Unlearning Optimization for Robust and Safe Text-to-Image Models [29.866192834825572]
モデルが潜在的に有害なコンテンツを生成する能力を取り除くために、未学習の技術が開発されている。
これらの手法は敵の攻撃によって容易に回避され、生成した画像の安全性を確保するには信頼性が低い。
T2IモデルからNot Safe For Work(NSFW)コンテンツを除去するための新しいフレームワークであるDirect Unlearning Optimization (DUO)を提案する。
論文 参考訳(メタデータ) (2024-07-17T08:19:11Z) - FLIRT: Feedback Loop In-context Red Teaming [79.63896510559357]
ブラックボックスモデルを評価し,その脆弱性を明らかにする自動レッドチーム化フレームワークを提案する。
私たちのフレームワークは、レッドチームモデルに対するフィードバックループでコンテキスト内学習を使用し、それらを安全でないコンテンツ生成にトリガーします。
論文 参考訳(メタデータ) (2023-08-08T14:03:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。