論文の概要: FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding
- arxiv url: http://arxiv.org/abs/2604.07879v1
- Date: Thu, 09 Apr 2026 06:49:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 18:34:05.744325
- Title: FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding
- Title(参考訳): FlowGuard: 線形潜時復号による拡散モデルの軽量インジェネレーション安全検出に向けて
- Authors: Jinghan Yang, Yihe Fan, Xudong Pan, Min Yang,
- Abstract要約: 拡散に基づく画像生成モデルは、Not-Safe-For-Work(NSFW)コンテンツを生成する可能性があるため、安全性のリスクが生じる。
中間段階を検査するクロスモデルインジェネレーション検出フレームワークであるFlowGuardを紹介する。
安全でないコンテンツを早期に検出することで、FlowGuardは計算コストを削減するために不要な拡散ステップを削減する。
- 参考スコア(独自算出の注目度): 17.56754189325627
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion-based image generation models have advanced rapidly but pose a safety risk due to their potential to generate Not-Safe-For-Work (NSFW) content. Existing NSFW detection methods mainly operate either before or after image generation. Pre-generation methods rely on text prompts and struggle with the gap between prompt safety and image safety. Post-generation methods apply classifiers to final outputs, but they are poorly suited to intermediate noisy images. To address this, we introduce FlowGuard, a cross-model in-generation detection framework that inspects intermediate denoising steps. This is particularly challenging in latent diffusion, where early-stage noise obscures visual signals. FlowGuard employs a novel linear approximation for latent decoding and leverages a curriculum learning approach to stabilize training. By detecting unsafe content early, FlowGuard reduces unnecessary diffusion steps to cut computational costs. Our cross-model benchmark spanning nine diffusion-based backbones shows the effectiveness of FlowGuard for in-generation NSFW detection in both in-distribution and out-of-distribution settings, outperforming existing methods by over 30% in F1 score while delivering transformative efficiency gains, including slashing peak GPU memory demand by over 97% and projection time from 8.1 seconds to 0.2 seconds compared to standard VAE decoding.
- Abstract(参考訳): 拡散に基づく画像生成モデルは急速に進歩しているが、Not-Safe-For-Work(NSFW)コンテンツを生成する可能性があるため、安全リスクが生じる。
既存のNSFW検出法は主に画像生成の前後で動作する。
プレジェネレーションの手法はテキストのプロンプトに依存しており、迅速な安全と画像の安全性のギャップに悩まされている。
ポストジェネレーション法は最終出力に分類器を適用するが、中間ノイズ画像には適さない。
この問題に対処するため,中間段階を検査するモデル間インジェネレーション検出フレームワークであるFlowGuardを紹介した。
これは、初期ノイズが視覚信号を隠蔽する潜伏拡散において特に困難である。
FlowGuardは、潜伏復号に新しい線形近似を採用し、訓練を安定させるためにカリキュラム学習アプローチを利用している。
安全でないコンテンツを早期に検出することで、FlowGuardは計算コストを削減するために不要な拡散ステップを削減する。
9つの拡散ベースのバックボーンにまたがるクロスモデルベンチマークでは、FlowGuardが、分布内および分布外の両方において次世代のNSFW検出に有効であることを示し、既存のメソッドをF1スコアで30%以上上回り、GPUメモリのピーク要求を97%以上削減し、8.1秒から0.2秒までの投影時間を含む変換効率の向上を実現した。
関連論文リスト
- Kelp: A Streaming Safeguard for Large Models via Latent Dynamics-Guided Risk Detection [29.51645496888383]
Kelpは、LM生成パイプライン内でのストリーミングリスク検出を可能にする、新しいプラグインフレームワークである。
Kelpは、最先端のポストホックガードレールと以前のプラグインプローブを一貫して上回っている。
論文 参考訳(メタデータ) (2025-10-09T14:42:50Z) - SC-Pro: Training-Free Framework for Defending Unsafe Image Synthesis Attack [13.799517170191919]
最近の研究では、安全チェッカーは敵の攻撃に対して脆弱性があることが示されており、NSFW(Not Safe For Work)イメージを生成することができる。
NSFW画像を生成する敵攻撃に対して容易に防御できる訓練不要のフレームワークであるSC-Proを提案する。
論文 参考訳(メタデータ) (2025-01-09T16:43:21Z) - Self-Guidance: Boosting Flow and Diffusion Generation on Their Own [35.56845917727121]
自己誘導(SG)は、低品質サンプルの生成を抑えることにより、生成画像の品質を著しく向上させることができる。
SGは、異なる雑音レベルにおける元の拡散または流れモデルのサンプリングスコア関数に依存する。
我々は、異なるアーキテクチャでテキスト・ツー・イメージとテキスト・ツー・ビデオ生成に関する広範な実験を行う。
論文 参考訳(メタデータ) (2024-12-08T06:32:27Z) - Fast constrained sampling in pre-trained diffusion models [80.99262780028015]
任意の制約下で高速で高品質な生成を可能にするアルゴリズムを提案する。
我々の手法は、最先端のトレーニングフリー推論手法に匹敵するか、超越した結果をもたらす。
論文 参考訳(メタデータ) (2024-10-24T14:52:38Z) - Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think [72.48325960659822]
生成のための大規模拡散モデルの訓練における主要なボトルネックは、これらの表現を効果的に学習することにある。
本稿では,RePresentation Alignment (REPA) と呼ばれる単純な正規化を導入し,ノイズの多い入力隠れ状態の投影を,外部の事前学習された視覚エンコーダから得られるクリーンな画像表現と整合させる手法を提案する。
我々の単純な戦略は、一般的な拡散やDiTsやSiTsといったフローベースのトランスフォーマーに適用した場合、トレーニング効率と生成品質の両方に大きな改善をもたらす。
論文 参考訳(メタデータ) (2024-10-09T14:34:53Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z) - Denoising Diffusion Autoencoders are Unified Self-supervised Learners [58.194184241363175]
本稿では,拡散モデルにおけるネットワーク,すなわち拡散オートエンコーダ(DDAE)が,自己教師型学習者の統合であることを示す。
DDAEはすでに、補助エンコーダを使わずに、中間層内で線形分離可能な表現を強く学習している。
CIFAR-10 と Tiny-ImageNet の線形評価精度は95.9% と 50.0% である。
論文 参考訳(メタデータ) (2023-03-17T04:20:47Z) - Diffusion Models for Adversarial Purification [69.1882221038846]
対人浄化(Adrial purification)とは、生成モデルを用いて敵の摂動を除去する防衛方法の分類である。
そこで我々は,拡散モデルを用いたDiffPureを提案する。
提案手法は,現在の対人訓練および対人浄化方法よりも優れ,最先端の成果を達成する。
論文 参考訳(メタデータ) (2022-05-16T06:03:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。