論文の概要: The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models
- arxiv url: http://arxiv.org/abs/2607.00402v1
- Date: Wed, 01 Jul 2026 04:00:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.709204
- Title: The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models
- Title(参考訳): テキスト・画像拡散モデルにおける安全アライメントにおける高実用性の検討
- Authors: Adeel Yousaf, Soumik Ghosh, James Beetham, Amrit Singh Bedi, Mubarak Shah,
- Abstract要約: テキスト・ツー・イメージ(T2I)拡散モデルの安全性の確保は,有害な世代を抑えることを目的としている。
近年の手法は高いユーティリティで高い安全性を提供するように思われるが、この結論は主に粗いグローバルユーティリティメトリクスに依存している。
構造的評価で実用性を測定すると、この錯覚は壊れる:OnA(質問回答を用いたテキストから画像への忠実度評価)
本研究では,組込み拡散とプロンプト間関係構造を明示的に保存する安全アライメント目標であるStructureAware Geometric Regularization (SAGE)を提案する。
- 参考スコア(独自算出の注目度): 49.67749928542536
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Safety alignment of text-to-image (T2I) diffusion models aims to suppress harmful generations while preserving utility on benign prompts. Recent methods often appear to deliver high safety with high utility, but this conclusion rests largely on coarse global utility metrics (e.g., FID, CLIPScore) that are insensitive to fine-grained semantic correctness, creating an illusion of high utility. We show that when utility is measured with structured evaluation, this illusion breaks: on TIFA (Text-to-Image Faithfulness evaluation with Question Answering), safety-aligned models suffer substantial drops in semantic fidelity, including failures in object counts, attributes, and relationships. To diagnose the source of this gap, we analyze the text-encoder prompt embedding space and uncover semantic collapse, a contraction of embedding spread coupled with distortion of inter-prompt similarity structure, which strongly correlates with structured utility loss. Guided by this insight, we propose StructureAware Geometric Regularization (SAGE), a safety alignment objective that explicitly preserves embedding spread and inter-prompt relational structure during adaptation. Our method restores structured utility (TIFA +5.0% over prior state-of-the-art) while maintaining strong safety performance and competitive coarse-grained utility scores. Our source code and trained models are available at https://adeelyousaf.github.io/SAGE_ECCV26_Project_Page/.
- Abstract(参考訳): テキスト・ツー・イメージ(T2I)拡散モデルの安全性の確保は,有害な世代を抑えることを目的としている。
近年の手法は高いユーティリティで高い安全性を提供するように思われるが、この結論は、大まかに大まかなグローバルユーティリティメトリクス(例えば、FID、CLIPScore)に基づいており、細粒度のセマンティックな正確さに敏感であり、高ユーティリティの錯覚を生み出している。
TIFA(Text-to- Image Faithfulness Evaluation with Question Answering)では,オブジェクト数,属性,関係性などの意味的忠実度が著しく低下する。
このギャップの根源を診断するために,テキストエンコーダの埋め込み空間とセマンティック崩壊を解析し,組込みの収縮とプロンプト間類似性構造の歪みが相関し,構造的効用損失と強く相関することを示した。
本研究は,組込み拡散と適応時の相互関係構造を明示的に保存する安全アライメント目標であるStructureAware Geometric Regularization (SAGE)を提案する。
提案手法は, 高い安全性性能と粗粒度を有する実用性スコアを維持しつつ, 構造化ユーティリティ(TIFA+5.0%)を復元する。
私たちのソースコードとトレーニングされたモデルは、https://adeelyousaf.github.io/SAGE_ECCV26_Project_Page/で利用可能です。
関連論文リスト
- AIFIND: Artifact-Aware Interpreting Fine-Grained Alignment for Incremental Face Forgery Detection [23.80607349547519]
AIFIND, Artifact-Aware Interpreting Fine-Grained Alignment for Incremental Face Forgery Detectionを提案する。
セマンティックアンカーを使用して、漸進的な学習を安定化します。
論文 参考訳(メタデータ) (2026-04-17T16:17:12Z) - SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models [67.84174763413178]
我々はSafeRedirを紹介した。SafeRedirは、迅速な埋め込みリダイレクトによる堅牢なアンラーニングのための軽量な推論時フレームワークである。
SafeRedirは,効果的な非学習能力,意味的・知覚的保存能力,堅牢な画像品質,対人攻撃に対する耐性の向上を実現している。
論文 参考訳(メタデータ) (2026-01-13T15:01:38Z) - SPQR: A Standardized Benchmark for Modern Safety Alignment Methods in Text-to-Image Diffusion Models [30.264600432509415]
SPQRは、安全に整合した拡散モデルが良質な微調整の下でいかに安全性、実用性、堅牢性を維持するかを評価するための単一のスコア付き計量である。
我々は,多言語・ドメイン固有・アウト・オブ・ディストリビューション分析とカテゴリー別分解を行い,良質な微調整後に安全アライメントが失敗するかどうかを識別する。
論文 参考訳(メタデータ) (2025-11-24T14:46:20Z) - Value-Aligned Prompt Moderation via Zero-Shot Agentic Rewriting for Safe Image Generation [11.663809872664103]
現在の防衛は、生産物を生産品質を犠牲にしたり、高いコストを発生させることなく、人的価値と整合させるのに苦労している。
我々は、より安全でより有用なテキスト・ツー・イメージ・ジェネレーションのためのゼロショットエージェント・フレームワークであるVALORを紹介した。
VALORは、階層化されたプロンプト分析とヒューマンアラインな値推論を統合している。
論文 参考訳(メタデータ) (2025-11-12T09:52:47Z) - SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models [74.11062256255387]
テキスト・ツー・イメージのモデルは、安全対策を回避し、有害なコンテンツを生成できる敵のプロンプトに対して非常に脆弱である。
SafeGuiderは, 生成品質を損なうことなく, 堅牢な安全制御を実現するための2段階のフレームワークである。
SafeGuiderは攻撃成功率の最小化において例外的な効果を示し、様々な攻撃シナリオで最大速度は5.48%である。
論文 参考訳(メタデータ) (2025-10-05T10:24:48Z) - SafeCtrl: Region-Based Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress [48.20360860166279]
SafeCtrlは軽量で非侵襲的なプラグインで、まず安全でないコンテンツを正確にローカライズします。
強硬なA-to-B置換を行う代わりに、SafeCtrlは有害なセマンティクスを抑える。
論文 参考訳(メタデータ) (2025-08-16T04:28:52Z) - Safe Text-to-Image Generation: Simply Sanitize the Prompt Embedding [16.188657772178747]
本研究では,不適切な概念を迅速に埋め込むことで,テキスト・ツー・イメージモデルの安全性を高めるEmbeded Sanitizer (ES)を提案する。
ESは、その潜在的な有害性を示すプロンプトにおいて各トークンにスコアを割り当てる最初の解釈可能な安全な生成フレームワークである。
論文 参考訳(メタデータ) (2024-11-15T16:29:02Z) - Exploring Robustness of Unsupervised Domain Adaptation in Semantic
Segmentation [74.05906222376608]
クリーンな画像とそれらの逆の例との一致を、出力空間における対照的な損失によって最大化する、逆向きの自己スーパービジョンUDA(ASSUDA)を提案する。
i) セマンティックセグメンテーションにおけるUDA手法のロバスト性は未解明のままであり, (ii) 一般的に自己スーパービジョン(回転やジグソーなど) は分類や認識などのイメージタスクに有効であるが, セグメンテーションタスクの識別的表現を学習する重要な監視信号の提供には失敗している。
論文 参考訳(メタデータ) (2021-05-23T01:50:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。