論文の概要: EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders
- arxiv url: http://arxiv.org/abs/2609.03629v1
- Date: Thu, 03 Sep 2026 10:23:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.017975
- Title: EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders
- Title(参考訳): EraseSAE:スパースオートエンコーダによるテキスト・ビデオ拡散モデルの手術的概念消去
- Authors: Xinghao Wang, Dong Li, Wei Yu, Yingwei Pan, Tao Gong, Qi Chu, Nenghai Yu, Ting Yao,
- Abstract要約: 概念消去は、事前訓練されたモデルから不要なセマンティクスを取り除くことによって、原則化された救済を提供する。
既存のアプローチは一般に粗い品質で動作し、概念表現の微細で分散した性質と不一致である。
外科的概念の消去を実現するためにスパースオートエンコーダを利用する新しいフレームワークであるEraseSAEを提案する。
- 参考スコア(独自算出の注目度): 103.46709005379591
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in text-to-video (T2V) diffusion models have demonstrated remarkable generative capabilities, yet their reliance on loosely curated training data raises pressing safety and copyright concerns. Concept erasure offers a principled remedy by removing unwanted semantics from pretrained models while preserving remaining concepts. However, existing approaches typically operate at a coarse granularity misaligned with the fine-grained, distributed nature of concept representations, leading to incomplete removal or degraded generation quality. We argue that surgical erasure fundamentally requires intervention at the level of monosemantic features, where each unit encodes a single interpretable concept. To this end, we propose EraseSAE, a novel framework that leverages sparse autoencoders to achieve surgical concept erasure in DiT-based T2V diffusion models via a principled decompose-attribute-erase pipeline. We first introduce the Partitioned Convolutional Sparse Autoencoder, which decomposes dense spatiotemporal activations into disentangled, interpretable sparse features while preserving spatiotemporal coherence. A contrastive attribution mechanism then contrasts activations from paired prompts to isolate concept-specific feature kernels. At inference, timestep-resolved spatiotemporal masks derived from the identified kernels confine erasure to regions where the target concept is active, leaving unrelated content intact. Extensive experiments across diverse diffusion models and concept erasure tasks demonstrate that EraseSAE achieves precise and robust concept removal with minimal quality degradation, substantially outperforming state-of-the-art methods. The code is available at https://github.com/HiDream-ai/EraseSAE.
- Abstract(参考訳): テキスト・ツー・ビデオ(T2V)拡散モデルの最近の進歩は、顕著な生成能力を示しているが、ゆるやかにキュレートされたトレーニングデータに依存しているため、安全性や著作権の懸念が高まる。
概念消去は、未学習のモデルから不要なセマンティクスを取り除き、残った概念を保存することによって、原則化された救済を提供する。
しかし、既存のアプローチは通常、概念表現の微細で分散した性質と不一致な粒度で動作し、不完全な除去や劣化した生成品質をもたらす。
外科的消去には,各ユニットが単一の解釈可能な概念を符号化する単意味的特徴のレベルへの介入が基本的に必要である,と我々は主張する。
そこで本稿では,DiTをベースとしたT2V拡散モデルにおける外科的概念消去を実現するために,スパースオートエンコーダを利用した新しいフレームワークであるEraseSAEを提案する。
まず,分割畳み込みスパースオートエンコーダを導入し,時空間コヒーレンスを保ちながら,高密度な時空間的アクティベーションをアンタングル化して解釈可能なスパース特徴に分解する。
対照的な帰属機構は、ペア化されたプロンプトからのアクティベーションと対比して、概念固有の特徴カーネルを分離する。
推測において、特定されたカーネルに由来する時間分解時空間マスクは、ターゲット概念がアクティブな領域に消去を限定し、無関係な内容を残す。
多様な拡散モデルと概念消去タスクにわたる広範囲な実験により、EraseSAEは最小品質の劣化を伴って正確で堅牢な概念除去を実現し、最先端の手法を大幅に上回ることを示した。
コードはhttps://github.com/HiDream-ai/EraseSAEで公開されている。
関連論文リスト
- Uni-AdaVD: Universal Concept Erasure for Visual Generation via Orthogonal Value Decomposition [62.947473058878565]
視覚生成のための普遍的推論時概念消去フレームワークUni-AdaVDを提案する。
この結果から,Uni-AdaVDは現代の視覚生成モデルに対して,効率的かつ適応的な安全機構を提供する可能性が示唆された。
論文 参考訳(メタデータ) (2026-07-16T03:16:51Z) - Differential Vector Erasure: Unified Training-Free Concept Erasure for Flow Matching Models [49.10620605347065]
本研究では,フローマッチングモデルに特化して設計されたトレーニング不要な概念消去手法である差分ベクトル消去(DVE)を提案する。
我々の重要な洞察は、意味論的概念は生成フローを管理する速度場の方向構造に暗黙的に符号化されていることである。
推論中、DVEは速度場を微分方向に投影することで概念固有の成分を選択的に除去し、無関係な意味論に影響を与えることなく正確な概念抑圧を可能にする。
論文 参考訳(メタデータ) (2026-02-01T08:05:45Z) - TRACE: Trajectory-Constrained Concept Erasure in Diffusion Models [0.0]
概念消去は、生成モデルにおいて特定の概念情報を削除または抑制することを目的としている。
Trajectory-Constrained Attentional Concept Erasure (TRACE) は拡散モデルから対象概念を消去する新しい手法である。
TRACEは最先端のパフォーマンスを実現し、ANT、EraseAnything、MACEといった最近の手法よりも、除去効率と出力品質の点で優れています。
論文 参考訳(メタデータ) (2025-05-29T10:15:22Z) - CURE: Concept Unlearning via Orthogonal Representation Editing in Diffusion Models [7.68494752148263]
CUREは、事前訓練された拡散モデルの重み空間で直接動作する、トレーニング不要の概念未学習フレームワークである。
スペクトル消去器は、安全な属性を保持しながら、望ましくない概念に特有の特徴を特定し、分離する。
CUREは、対象とする芸術スタイル、オブジェクト、アイデンティティ、明示的なコンテンツに対して、より効率的で徹底的な除去を実現する。
論文 参考訳(メタデータ) (2025-05-19T03:53:06Z) - Sparse Autoencoder as a Zero-Shot Classifier for Concept Erasing in Text-to-Image Diffusion Models [17.694838443796026]
Interpret then Deactivate (ItD) は、T2I拡散モデルにおける正確な概念除去を可能にする新しいフレームワークである。
ItDはスパースオートエンコーダを使用して、各概念を複数の機能の組み合わせとして解釈する。
さらなるトレーニングを必要とせずに、簡単に複数の概念を消去できる。
論文 参考訳(メタデータ) (2025-03-12T14:46:40Z) - TRCE: Towards Reliable Malicious Concept Erasure in Text-to-Image Diffusion Models [53.937498564603054]
近年のテキスト・画像拡散モデルの進歩により、フォトリアリスティックな画像生成が可能になったが、NSFW画像のような悪意のあるコンテンツを生成するリスクもある。
リスクを軽減するため,概念消去手法が研究され,モデルが特定の概念を学習しやすくする。
本稿では,2段階のコンセプト消去戦略を用いて,信頼性の高い消去と知識保存の効果的なトレードオフを実現するTRCEを提案する。
論文 参考訳(メタデータ) (2025-03-10T14:37:53Z) - Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models [76.39651111467832]
本稿では,Reliable and Efficient Concept Erasure (RECE)を提案する。
派生した埋め込みによって表現される不適切なコンテンツを緩和するために、RECEはそれらをクロスアテンション層における無害な概念と整合させる。
新たな表現埋め込みの導出と消去を反復的に行い、不適切な概念の徹底的な消去を実現する。
論文 参考訳(メタデータ) (2024-07-17T08:04:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。