論文の概要: No Concept Escapes the Audit: Auditing-Aware Unlearning for Verifiable Concept Erasure in Diffusion Models
- arxiv url: http://arxiv.org/abs/2610.05401v1
- Date: Sun, 04 Oct 2026 17:37:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 14:03:11.889439
- Title: No Concept Escapes the Audit: Auditing-Aware Unlearning for Verifiable Concept Erasure in Diffusion Models
- Title(参考訳): オーディットを脱却する概念:拡散モデルにおける概念消去の検証を意識したアンラーニング
- Abstract要約: テキスト・ツー・イメージの拡散モデルは禁止コンテンツを生成することができ、マシン・アンラーニングを通じて概念の消去を動機付ける。
テキストコンディショニングをバイパスし、デノナイジングネットワークを直接探索する潜時空間監査は、削除された概念が内部表現から回復可能であることを示す。
本稿では,有効概念消去拡散モデル(AVCE, Auditing-Aware Unlearning for Verible Concept Erasure Diffusion Models)を提案する。
- 参考スコア(独自算出の注目度): 26.550534449986518
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-image diffusion models can generate prohibited content, which motivates concept erasure through machine unlearning. Most erasure methods intervene at the text interface, through prompt modification or localized updates to text-conditioning weights, and they are evaluated by what the model outputs for given prompts. Such evaluation cannot see what the network still encodes. Latent-space auditing, which bypasses text conditioning and probes the denoising network directly, shows that erased concepts remain recoverable from internal representations. We find that this also holds for methods built to be robust against adversarial prompts, and that the problem grows with the number of erased concepts. We propose Auditing-Aware Unlearning for Verifiable Concept Erasure in Diffusion Models (AVCE), a framework that grounds erasure in the model's latent representations. AVCE audits the embedding neighborhood of each concept and condenses the discovered vulnerable directions into an anchor at the weakest geometric point. It edits cross-attention and self-attention projections in closed form at this anchor, then fine-tunes the two pathways with pathway-level auditing losses, using orthogonal gradient projection to consolidate multiple concepts. Experiments on SD v1.5, SDXL, and Flux 1.0 across object, explicit-content, and artistic-style unlearning show that AVCE reduces attack success rates by 5.07x and improves auditing scores by 3.84x over the strongest baseline, while preserving competitive generation quality.
- Abstract(参考訳): テキスト・ツー・イメージの拡散モデルは禁止コンテンツを生成することができ、マシン・アンラーニングを通じて概念の消去を動機付ける。
ほとんどの消去法はテキストインターフェースに介入し、テキスト条件の重み付けを即時修正または局所化することで、モデルが与えられたプロンプトに対して出力するものによって評価される。
このような評価は、ネットワークがまだエンコードしているものを見ることができない。
テキストコンディショニングをバイパスし、デノナイジングネットワークを直接探索する潜時空間監査は、削除された概念が内部表現から回復可能であることを示す。
また、これは敵のプロンプトに対して堅牢であるように構築された手法にも当てはまり、その問題は消去された概念の数によって増加する。
本稿では,モデルの潜在表現の消去を基礎とした,拡散モデルにおける検証可能な概念消去のための監査意識の未学習(AVCE)を提案する。
AVCEは各概念の埋め込み近傍を監査し、発見された脆弱な方向を最も弱い幾何学点のアンカーに凝縮する。
このアンカーでクロスアテンションと自己アテンションプロジェクションを閉じた形で編集し、その後、直交勾配プロジェクションを使用して2つの経路を微調整し、複数の概念を統合する。
SD v1.5、SDXL、Flux 1.0を対象物、明示的コンテンツ、芸術的なアンラーニングで実験したところ、AVCEは攻撃成功率を5.07倍に下げ、最強のベースラインで監査スコアを3.84倍改善し、競争力のある生成品質を維持している。
関連論文リスト
- Interpreting Object-Dependent Concept Brittleness in Text-to-Image Diffusion Models [105.53190946111586]
我々はこの現象をオブジェクト依存概念の脆さと呼ぶ。
これらの障害を監査し、最小限に修正する、解釈可能性指向のフレームワークを提案する。
複数の拡散バックボーンにまたがるスタイルと属性の故障事例について,提案手法の評価を行った。
論文 参考訳(メタデータ) (2026-09-09T09:07:40Z) - EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders [103.46709005379591]
概念消去は、事前訓練されたモデルから不要なセマンティクスを取り除くことによって、原則化された救済を提供する。
既存のアプローチは一般に粗い品質で動作し、概念表現の微細で分散した性質と不一致である。
外科的概念の消去を実現するためにスパースオートエンコーダを利用する新しいフレームワークであるEraseSAEを提案する。
論文 参考訳(メタデータ) (2026-09-03T10:23:37Z) - PROBE: Diagnosing Residual Concept Capacity in Erased Text-to-Video Diffusion Models [9.957850061310054]
テキスト・ツー・ビデオ(T2V)拡散モデルの概念技術は、センシティブなコンテンツの相当な抑制を報告している。
本稿では,T2Vモデルにおけるテクストの潜在的な消去概念を定量化する診断プロトコル PROBE を紹介する。
論文 参考訳(メタデータ) (2026-03-23T04:01:13Z) - Fine-Grained Erasure in Text-to-Image Diffusion-based Foundation Models [56.35484513848296]
FADE(Fine grained Attenuation for Diffusion Erasure)は、テキストから画像への生成モデルのための非学習アルゴリズムである。
関連する概念に最小限の影響で目標概念を排除し、最先端の手法よりも保持性能が12%向上した。
論文 参考訳(メタデータ) (2025-03-25T15:49:48Z) - TRCE: Towards Reliable Malicious Concept Erasure in Text-to-Image Diffusion Models [53.937498564603054]
近年のテキスト・画像拡散モデルの進歩により、フォトリアリスティックな画像生成が可能になったが、NSFW画像のような悪意のあるコンテンツを生成するリスクもある。
リスクを軽減するため,概念消去手法が研究され,モデルが特定の概念を学習しやすくする。
本稿では,2段階のコンセプト消去戦略を用いて,信頼性の高い消去と知識保存の効果的なトレードオフを実現するTRCEを提案する。
論文 参考訳(メタデータ) (2025-03-10T14:37:53Z) - Unlearning or Concealment? A Critical Analysis and Evaluation Metrics for Unlearning in Diffusion Models [7.9993879763024065]
本稿では,拡散モデルにおける未学習の5つの手法の理論的,実証的研究について述べる。
概念検索スコア(textbfCRS)と概念信頼スコア(textbfCCS)の2つの新しい評価指標を導入する。
論文 参考訳(メタデータ) (2024-09-09T14:38:31Z) - Ring-A-Bell! How Reliable are Concept Removal Methods for Diffusion Models? [52.238883592674696]
Ring-A-Bellは、T2I拡散モデルのためのモデルに依存しないレッドチームツールである。
これは、不適切なコンテンツの生成に対応する拡散モデルに対する問題的プロンプトを特定する。
この結果から,安全プロンプトベンチマークの操作により,既存の安全メカニズムを回避できると考えられるプロンプトを変換できることが示唆された。
論文 参考訳(メタデータ) (2023-10-16T02:11:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。