論文の概要: UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation
- arxiv url: http://arxiv.org/abs/2607.16828v1
- Date: Sat, 18 Jul 2026 14:03:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.267495
- Title: UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation
- Title(参考訳): UniNDM:テキスト・画像生成におけるセクシャルコンテンツに対する統一型ノイズ駆動検出・緩和フレームワーク
- Abstract要約: 本稿では,拡散過程におけるノイズダイナミクスのレンズを通して,安全機構を再考する統合ノイズ駆動フレームワークを提案する。
我々の重要な洞察は、早期の予測ノイズは、正常な内容と性的な内容の間に固有の分離性を示すことである。
我々は,計算オーバーヘッドがほとんどなく,精度の高い軽量ノイズベース検出器を開発した。
- 参考スコア(独自算出の注目度): 90.0896070825457
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Despite the impressive generative capabilities of text-to-image diffusion models, they remain vulnerable to implicit sexual prompts, where subtle cues disguised as benign terms or adversarial tokens unexpectedly generate the inappropriate content due to model biases or latent correlations in training data. Existing safety mechanisms face fundamental limitations: detection methods primarily identify explicit content and fail to capture implicit malicious intent, while mitigation approaches rely on static negative prompts inadequate for diverse implicit scenarios. To address these challenges, we propose UniNDM, a unified noise-driven framework that rethinks safety mechanisms through the lens of noise dynamics in diffusion processes. Our key insight is that early-stage predicted noise exhibits inherent separability between normal and sexually explicit content, which we theoretically demonstrates quadratically increasing semantic concentration with timestep. Leveraging this property, we develop a lightweight noise-based detector achieving superior accuracy with virtually no computational overhead. For mitigation, we introduce noise-enhanced adaptive negative guidance: dynamically generating context-specific negative prompts via large language models to handle diverse implicit content, while optimizing initial noise by suppressing attention concentration on explicit tokens to provide comprehensive protection. Besides the U-Net-based diffusion models, we further extend our framework to emerging Diffusion Transformer architectures through region-constrained semantic guidance tailored for their unified multimodal attention. Comprehensive experiments across U-Net models and DiT models on both natural and adversarial datasets demonstrate substantial improvements over state-of-the-art methods, including SLD, UCE, Safree, etc. Our code is publicly available at https://github.com/Aries-iai/UniNDM.
- Abstract(参考訳): テキストと画像の拡散モデルの印象的な生成能力にもかかわらず、それらは暗黙の性的プロンプトに弱いままであり、そこでは微妙な手がかりが不適切な言葉や敵のトークンとして偽装され、トレーニングデータにおけるモデルバイアスや潜在的相関によって予期せず不適切な内容が生成される。
既存の安全性メカニズムは基本的な制限に直面している: 検出方法は、主に明示的なコンテンツを識別し、暗黙的な悪意のある意図をキャプチャできない。
これらの課題に対処するために、拡散過程におけるノイズダイナミクスのレンズを通して安全機構を再考する統合ノイズ駆動フレームワークUniNDMを提案する。
我々の重要な洞察は、早期の予測ノイズは、正常な内容と性的明示的な内容の間に固有の分離性を示しており、理論的には時間経過とともに意味的濃度が2次的に増加することを示している。
この特性を生かして,計算オーバーヘッドがほとんどなく精度の高い軽量ノイズベース検出器を開発した。
本研究では,暗黙的コンテンツを多様に扱うために,大規模言語モデルを用いて動的に文脈特異的な負のプロンプトを生成するとともに,明示的トークンに対する注意集中を抑えて初期ノイズを最適化し,包括的保護を実現する。
U-Netベースの拡散モデルに加えて、我々は、これらの統合マルチモーダルアテンションに適した領域制約付きセマンティックガイダンスにより、我々のフレームワークをさらに進化させた拡散トランスフォーマーアーキテクチャに拡張する。
自然と敵対両方のデータセット上のU-NetモデルとDiTモデルにわたる総合的な実験は、SLD、UCE、Safreeなど、最先端の手法よりも大幅に改善されている。
私たちのコードはhttps://github.com/Aries-iai/UniNDMで公開されています。
関連論文リスト
- Noise as a Probe: Membership Inference Attacks on Diffusion Models Leveraging Initial Noise [51.179816451161635]
拡散モデルは画像生成において顕著な進歩を遂げているが、そのデプロイの増加はプライバシに関する深刻な懸念を引き起こす。
広範に使われているノイズスケジュールは、画像のセマンティック情報を完全に排除することができない。
本稿では,初期雑音に意味情報を注入し,モデル生成結果を解析してメンバーシップを推定する,シンプルで効果的なメンバーシップ推論攻撃を提案する。
論文 参考訳(メタデータ) (2026-01-29T12:29:01Z) - Lost in the Noise: How Reasoning Models Fail with Contextual Distractors [57.31788955167306]
推論モデルとエージェントAIシステムの最近の進歩は、多様な外部情報への依存度を高めている。
NoisyBenchは、RAGの11のデータセット、推論、アライメント、ツール使用タスクに対して、モデルロバスト性を体系的に評価する包括的なベンチマークである。
評価の結果,文脈的障害に直面した場合,最先端モデルでは最大80%の破滅的な性能低下がみられた。
論文 参考訳(メタデータ) (2026-01-12T05:43:51Z) - Dual Attention Guided Defense Against Malicious Edits [70.17363183107604]
本稿では,DANP(Dual Attention-Guided Noise Perturbation)免疫法を提案する。
本手法は,悪意ある編集に対する印象的な免疫力を示し,その手法が最先端の性能を達成することを実証した。
論文 参考訳(メタデータ) (2025-12-16T12:01:28Z) - NDM: A Noise-driven Detection and Mitigation Framework against Implicit Sexual Intentions in Text-to-Image Generation [41.058425895887616]
テキスト・ツー・イメージ(T2I)モデルは不適切なコンテンツを生成するのに弱い。
暗黙の性的プロンプトは、しばしば良心的な言葉に変装して、予想外の性的内容を引き起こす可能性がある。
我々は,最初のノイズ駆動型検出・緩和フレームワークであるNDMを提案する。
論文 参考訳(メタデータ) (2025-10-17T15:37:02Z) - Mitigating the Noise Shift for Denoising Generative Models via Noise Awareness Guidance [54.88271057438763]
ノイズアウェアネスガイダンス (NAG) は、事前に定義された騒音スケジュールと整合性を保つために、サンプリング軌道を明示的に制御する補正手法である。
NAGは一貫してノイズシフトを緩和し、主流拡散モデルの生成品質を大幅に改善する。
論文 参考訳(メタデータ) (2025-10-14T13:31:34Z) - Detect-and-Guide: Self-regulation of Diffusion Models for Safe Text-to-Image Generation via Guideline Token Optimization [22.225141381422873]
有害なコンテンツを生成するテキストと画像の拡散モデルに対する懸念が高まっている。
概念アンラーニングや安全ガイダンスのようなポストホックモデルの介入技術は、これらのリスクを軽減するために開発されている。
本稿では,自己診断と詳細な自己制御を行うための安全生成フレームワークであるDector-and-Guide(DAG)を提案する。
DAGは最先端の安全な生成性能を実現し、有害性軽減とテキスト追跡性能を現実のプロンプトでバランスさせる。
論文 参考訳(メタデータ) (2025-03-19T13:37:52Z) - Constrained Discrete Diffusion [61.81569616239755]
本稿では,拡散過程における微分可能制約最適化の新たな統合であるCDD(Constrained Discrete Diffusion)を紹介する。
CDDは直接、離散拡散サンプリングプロセスに制約を課し、トレーニング不要で効果的なアプローチをもたらす。
論文 参考訳(メタデータ) (2025-03-12T19:48:12Z) - MIGA: Mutual Information-Guided Attack on Denoising Models for Semantic Manipulation [39.12448251986432]
深層認知モデルを直接攻撃するためのMIGA(Mutual Information-Guided Attack)を提案する。
MIGAは、敵対的摂動を通じて意味的コンテンツを保存するモデルの能力を戦略的に破壊する。
以上の結果から,デノベーションモデルは必ずしも堅牢ではなく,現実のアプリケーションにセキュリティリスクをもたらす可能性が示唆された。
論文 参考訳(メタデータ) (2025-03-10T06:26:34Z) - An Effective Deployment of Diffusion LM for Data Augmentation in Low-Resource Sentiment Classification [2.0930389307057427]
感性分類(SC)は、ドメイン固有のコンテキスト、不均衡なラベル分布、少数ショットシナリオなど、低リソースの課題に悩まされることが多い。
我々はDiffusion LMを提案し、強力なラベル関連トークンを再構成することでドメイン内の知識を捕捉し、擬似サンプルを生成する。
論文 参考訳(メタデータ) (2024-09-05T02:51:28Z) - A Cheaper and Better Diffusion Language Model with Soft-Masked Noise [62.719656543880596]
Masked-Diffuse LMは言語モデリングのための新しい拡散モデルであり、言語の言語的特徴に触発されている。
具体的には,テキストデータのノイズを改善するために,戦略的ソフトマスキングによってテキストに劣化を加える言語情報処理を設計する。
我々は,我々のMasked-Diffuse LMが,高効率の最先端拡散モデルよりも優れた生成品質を達成できることを実証した。
論文 参考訳(メタデータ) (2023-04-10T17:58:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。