論文の概要: Safe Image Generation via Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.05908v1
- Date: Mon, 05 Oct 2026 07:24:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 03:17:55.45664
- Title: Safe Image Generation via Reinforcement Learning
- Title(参考訳): 強化学習による安全な画像生成
- Abstract要約: 最近のテキスト・ツー・イメージ(T2I)モデルは目覚ましい画像生成性能を実現するが、NSFW(Not-Safe-For-Work)コンテンツを生成できる。
本研究では,中間表現から発生したNSFW信号を検出する次世代安全フレームワークを提案する。
- 参考スコア(独自算出の注目度): 23.73320512301939
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent Text-to-Image (T2I) models achieve remarkable visual image generation performance, but they can still generate NSFW (Not-Safe-For-Work) contents, including violent or explicit images. Existing safety checker mechanisms are largely confined to pre-generation filtering (e.g. prompt-level text classifiers) or post-hoc moderation applied after an image is completely synthesized. However, adversarial attack methods operate over a much broader space. This imbalance highlights the need for a safety mechanism that intervenes during the generation process. We propose an in-generation safety framework that monitors the denoising trajectory and detects emerging NSFW signals from intermediate representations. Rather than merely detecting NSFW generations, our method applies reinforcement learning to generate safe images from NSFW prompts. By coupling in-generation detection with controllable steering, our approach mitigates unsafe trajectories even when NSFW signals emerge after generation has already begun. Experiments results show that our method consistently outperforms existing safe image generation methods across both standard and adversarial evaluation sets, while preserving perceptual quality and prompt fidelity. Code will be released upon acceptance.
- Abstract(参考訳): 最近のテキスト・ツー・イメージ(T2I)モデルは、目覚ましい画像生成性能を達成するが、暴力的または明示的な画像を含むNAFW(Not-Safe-For-Work)コンテンツを生成することができる。
既存の安全チェック機構は、画像が完全に合成された後に適用される前世代フィルタリング(例えばプロンプトレベルのテキスト分類器)やポストホックモデレーションに限られる。
しかし、敵攻撃法はより広い範囲で機能する。
この不均衡は、生成プロセス中に介入する安全メカニズムの必要性を強調します。
本研究では,中間表現から発生したNSFW信号を検出する次世代安全フレームワークを提案する。
本手法は,単にNSFW世代を検出するのではなく,NSFWプロンプトから安全な画像を生成するために強化学習を適用する。
制御可能なステアリングと世代内検出を結合することにより,NSFW信号が生成開始後も安全でない軌道を緩和する。
実験結果から,本手法は,知覚品質を保ち,忠実度を保ちながら,従来の安全画像生成手法よりも常に優れていることがわかった。
コードは受理時にリリースされる。
関連論文リスト
- Introspective Attention Modulation for Safe Text-to-Image Generation [37.67434449197168]
State-of-the-the-art flow based text-to-image (T2I)モデルは、優れた生成能力を示すが、安全でないコンテンツを生成するには弱い。
本稿では,推論時イントロスペクションによるモデル注意力の制御により,安全性を実現するユニークなアプローチを提案する。
論文 参考訳(メタデータ) (2026-07-16T12:53:45Z) - SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models [67.84174763413178]
我々はSafeRedirを紹介した。SafeRedirは、迅速な埋め込みリダイレクトによる堅牢なアンラーニングのための軽量な推論時フレームワークである。
SafeRedirは,効果的な非学習能力,意味的・知覚的保存能力,堅牢な画像品質,対人攻撃に対する耐性の向上を実現している。
論文 参考訳(メタデータ) (2026-01-13T15:01:38Z) - SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models [74.11062256255387]
テキスト・ツー・イメージのモデルは、安全対策を回避し、有害なコンテンツを生成できる敵のプロンプトに対して非常に脆弱である。
SafeGuiderは, 生成品質を損なうことなく, 堅牢な安全制御を実現するための2段階のフレームワークである。
SafeGuiderは攻撃成功率の最小化において例外的な効果を示し、様々な攻撃シナリオで最大速度は5.48%である。
論文 参考訳(メタデータ) (2025-10-05T10:24:48Z) - SafeCtrl: Region-Based Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress [48.20360860166279]
SafeCtrlは軽量で非侵襲的なプラグインで、まず安全でないコンテンツを正確にローカライズします。
強硬なA-to-B置換を行う代わりに、SafeCtrlは有害なセマンティクスを抑える。
論文 参考訳(メタデータ) (2025-08-16T04:28:52Z) - SC-Pro: Training-Free Framework for Defending Unsafe Image Synthesis Attack [13.799517170191919]
最近の研究では、安全チェッカーは敵の攻撃に対して脆弱性があることが示されており、NSFW(Not Safe For Work)イメージを生成することができる。
NSFW画像を生成する敵攻撃に対して容易に防御できる訓練不要のフレームワークであるSC-Proを提案する。
論文 参考訳(メタデータ) (2025-01-09T16:43:21Z) - Detecting and Interpreting NSFW Prompts in Text-to-Image Models through Uncovering Harmful Semantics [48.93115678681624]
悪意のあるユーザは、T2I(text-to-image)モデルを使用してNot-Safe-for-Work(NSFW)イメージを生成する。
我々は,NSFWプロンプトを検出するために,T2Iモデルの隠れ状態を利用するフレームワークであるHiddenGuardを提案する。
実験の結果,HiddenGuardは商用およびオープンソースのモデレーションツールよりも大幅に優れていた。
論文 参考訳(メタデータ) (2024-12-24T03:17:45Z) - ShieldDiff: Suppressing Sexual Content Generation from Diffusion Models through Reinforcement Learning [7.099258248662009]
テキスト・ツー・イメージ(T2I)モデルは、不快な内容の安全でない画像を生成する可能性がある。
我々の研究では、T2IモデルからNSFW(職場では安全ではない)コンテンツ生成を排除することに重点を置いています。
本稿では,CLIP(Contrastive Language- Image Pre-Trening)とヌード報酬(nudity rewards)から構成される独自の報酬関数を提案する。
論文 参考訳(メタデータ) (2024-10-04T19:37:56Z) - SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models [28.23494821842336]
テキスト・ツー・イメージ・モデルは、安全でない作業用コンテンツ(NSFW)を生成するために騙されることがある。
我々は、テキスト・ツー・イメージ・モデルによる性的コンテンツ生成を緩和するフレームワークであるSafeGenを紹介する。
論文 参考訳(メタデータ) (2024-04-10T00:26:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。