Fugu-MT 論文翻訳(概要): Pruning for Robust Concept Erasing in Diffusion Models

論文の概要: Pruning for Robust Concept Erasing in Diffusion Models

arxiv url: http://arxiv.org/abs/2405.16534v1
Date: Sun, 26 May 2024 11:42:20 GMT
ステータス: 翻訳完了
システム内更新日: 2024-05-28 20:39:12.301330
Title: Pruning for Robust Concept Erasing in Diffusion Models
Title（参考訳）: 拡散モデルにおけるロバスト概念消去のためのプルーニング
Authors: Tianyun Yang, Juan Cao, Chang Xu,
Abstract要約: 概念消去のための新しいプルーニングベースの戦略を導入する。本手法は, 除去対象概念に関連する重要なパラメータを選択的に抽出し, 概念関連ニューロンの感度を低下させる。実験の結果, 逆入力に抵抗するモデルの能力は著しく向上した。
参考スコア（独自算出の注目度）: 27.67237515704348
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Despite the impressive capabilities of generating images, text-to-image diffusion models are susceptible to producing undesirable outputs such as NSFW content and copyrighted artworks. To address this issue, recent studies have focused on fine-tuning model parameters to erase problematic concepts. However, existing methods exhibit a major flaw in robustness, as fine-tuned models often reproduce the undesirable outputs when faced with cleverly crafted prompts. This reveals a fundamental limitation in the current approaches and may raise risks for the deployment of diffusion models in the open world. To address this gap, we locate the concept-correlated neurons and find that these neurons show high sensitivity to adversarial prompts, thus could be deactivated when erasing and reactivated again under attacks. To improve the robustness, we introduce a new pruning-based strategy for concept erasing. Our method selectively prunes critical parameters associated with the concepts targeted for removal, thereby reducing the sensitivity of concept-related neurons. Our method can be easily integrated with existing concept-erasing techniques, offering a robust improvement against adversarial inputs. Experimental results show a significant enhancement in our model's ability to resist adversarial inputs, achieving nearly a 40% improvement in erasing the NSFW content and a 30% improvement in erasing artwork style.
Abstract（参考訳）: 画像を生成するという印象的な能力にもかかわらず、テキストから画像への拡散モデルは、NSFWコンテンツや著作権付きアートワークのような望ましくないアウトプットを生成できる。この問題に対処するために、最近の研究では、問題のある概念を消すための微調整モデルパラメータに焦点を当てている。しかし、既存の手法は、巧妙に製作されたプロンプトに直面すると望ましくない出力をしばしば再現するため、ロバスト性に大きな欠陥を示す。これは、現在のアプローチの根本的な制限を明らかにし、オープンな世界における拡散モデルの展開のリスクを高める可能性がある。このギャップに対処するために、概念関連ニューロンを見つけ、これらのニューロンは敵のプロンプトに対して高い感度を示すので、攻撃下で再び消去と再活性化を行う際には、非活性化される可能性がある。堅牢性を向上させるため,我々は概念消去のための新しいプルーニングベースの戦略を導入する。本手法は, 除去対象概念に関連する重要なパラメータを選択的に抽出し, 概念関連ニューロンの感度を低下させる。提案手法は,既存の概念評価手法と容易に統合でき,対向入力に対する堅牢な改善を提供する。実験結果から,NSFW内容の消去は40%,アートスタイルの消去は30%に向上した。

関連論文リスト

When Are Concepts Erased From Diffusion Models? [44.89615668122767]
概念消去とは、モデルが特定の概念を生成するのを選択的に阻止する能力である。拡散モデルにおける消去機構の2つの概念モデルを提案する。概念がモデルから真に消去されたかどうかを徹底的に評価するために,独立した評価スイートを導入する。
論文参考訳（メタデータ） (2025-05-22T17:59:09Z)
Erased or Dormant? Rethinking Concept Erasure Through Reversibility [8.454050090398713]
我々は、統一概念編集と消去安定拡散という2つの代表的な概念消去手法を評価する。消去された概念は、最小限の適応の後、しばしばかなりの視覚的忠実度で再帰することを示す。本研究は,既存の概念消去アプローチにおける限界を明らかにするものである。
論文参考訳（メタデータ） (2025-05-22T03:26:46Z)
TRCE: Towards Reliable Malicious Concept Erasure in Text-to-Image Diffusion Models [45.393001061726366]
近年のテキスト・画像拡散モデルの進歩により、フォトリアリスティックな画像生成が可能になったが、NSFW画像のような悪意のあるコンテンツを生成するリスクもある。リスクを軽減するため,概念消去手法が研究され,モデルが特定の概念を学習しやすくする。本稿では,2段階のコンセプト消去戦略を用いて,信頼性の高い消去と知識保存の効果的なトレードオフを実現するTRCEを提案する。
論文参考訳（メタデータ） (2025-03-10T14:37:53Z)
DuMo: Dual Encoder Modulation Network for Precise Concept Erasure [75.05165577219425]
非ターゲット概念に対する最小限の障害を伴う不適切なターゲット概念の正確な消去を実現するDuMo(Dual Encoder Modulation Network)を提案する。提案手法は, 明示的コンテンツ消去, カートゥーン概念除去, アーティスティックスタイル消去における最先端性能を実現し, 代替手法よりも明らかに優れている。
論文参考訳（メタデータ） (2025-01-02T07:47:34Z)
AdvAnchor: Enhancing Diffusion Model Unlearning with Adversarial Anchors [61.007590285263376]
セキュリティ上の懸念から、研究者たちは微調整によって不適切な概念を学ばざるを得なくなった。最近の微調整手法は、望ましくない概念を排除し、他の概念を保存することの間のかなりの性能のトレードオフを示す。本稿では,貿易問題を軽減するために,敵対的アンカーを生成する新しいアプローチであるAdvAnchorを提案する。
論文参考訳（メタデータ） (2024-12-28T04:44:07Z)
Towards Lifelong Few-Shot Customization of Text-to-Image Diffusion [50.26583654615212]
テキストと画像の拡散のための一生にわたる数ショットのカスタマイズは、最小限のデータで新しいタスクのための既存のモデルを継続的に一般化することを目的としている。本研究では,破滅的な忘れる問題を,関連する概念と過去の概念の2つに分類し,分類する。実データの追加やオリジナルの概念データのオフライン再生に頼っている既存の方法とは異なり,本手法では,新しい概念を学習しながら,事前知識の蒸留を行うことが可能である。
論文参考訳（メタデータ） (2024-11-08T12:58:48Z)
Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models [76.39651111467832]
本稿では,Reliable and Efficient Concept Erasure (RECE)を提案する。派生した埋め込みによって表現される不適切なコンテンツを緩和するために、RECEはそれらをクロスアテンション層における無害な概念と整合させる。新たな表現埋め込みの導出と消去を反復的に行い、不適切な概念の徹底的な消去を実現する。
論文参考訳（メタデータ） (2024-07-17T08:04:28Z)
Safeguard Text-to-Image Diffusion Models with Human Feedback Inversion [51.931083971448885]
本稿では,Human Feedback Inversion (HFI) というフレームワークを提案する。実験の結果,画像品質を維持しながら,好ましくないコンテンツ生成を著しく削減し,公的な領域におけるAIの倫理的展開に寄与することが示された。
論文参考訳（メタデータ） (2024-07-17T05:21:41Z)
Six-CD: Benchmarking Concept Removals for Benign Text-to-image Diffusion Models [58.74606272936636]
テキスト・ツー・イメージ(T2I)拡散モデルは、テキスト・プロンプトと密接に対応した画像を生成する際、例外的な機能を示す。モデルは、暴力やヌードの画像を生成したり、不適切な文脈で公共の人物の無許可の肖像画を作成するなど、悪意ある目的のために利用することができる。悪質な概念や望ましくない概念の発生を防ぐために拡散モデルを変更する概念除去法が提案されている。
論文参考訳（メタデータ） (2024-06-21T03:58:44Z)
ConceptPrune: Concept Editing in Diffusion Models via Skilled Neuron Pruning [10.201633236997104]
大規模テキスト・画像拡散モデルでは、印象的な画像生成能力が示されている。提案するConceptPruneでは,まず,望ましくない概念を生成するための事前学習モデル内の重要な領域を同定する。芸術的スタイル、ヌード性、オブジェクトの消去、ジェンダーのデバイアスなど、さまざまな概念に対する実験は、ターゲットのコンセプトをごくわずかに刈って効率よく消去できることを実証している。
論文参考訳（メタデータ） (2024-05-29T16:19:37Z)
Removing Undesirable Concepts in Text-to-Image Diffusion Models with Learnable Prompts [23.04942433104886]
本稿では,学習可能なプロンプトをモジュールに組み込むことにより,テキストから画像への拡散モデルから望ましくない概念を除去する手法を提案する。この学習可能なプロンプトは追加記憶として働き、望ましくない概念の知識を捉える。本研究では, 安定拡散モデルにおける本手法の有効性を実証し, 最先端消去法よりも優れていることを示す。
論文参考訳（メタデータ） (2024-03-18T23:42:04Z)
Separable Multi-Concept Erasure from Diffusion Models [52.51972530398691]
大規模拡散モデルから安全でない概念を排除するために,分離可能なマルチコンセプト消去器(SepME)を提案する。後者は最適化可能なモデルウェイトを分離し、各ウェイトインクリメントは特定の概念の消去に対応する。広範囲にわたる実験は, 概念の排除, モデル性能の保存, 各種概念の消去・回復における柔軟性の確保に, アプローチの有効性を示すものである。
論文参考訳（メタデータ） (2024-02-03T11:10:57Z)
All but One: Surgical Concept Erasing with Model Preservation in Text-to-Image Diffusion Models [22.60023885544265]
大規模なデータセットには、性的に明示的な、著作権のある、または望ましくないコンテンツが含まれており、モデルがそれらを直接生成することができる。拡散モデルにおける概念消去に取り組むために、ファインチューニングアルゴリズムが開発された。これらの課題をすべて解決する新しいアプローチを提示します。
論文参考訳（メタデータ） (2023-12-20T07:04:33Z)
Receler: Reliable Concept Erasing of Text-to-Image Diffusion Models via Lightweight Erasers [24.64639078273091]
テキストから画像への拡散モデルにおける概念消去は、対象概念に関連する画像の生成から事前学習された拡散モデルを無効にすることを目的としている。軽量エローザ(レセラー)による信頼性概念消去の提案
論文参考訳（メタデータ） (2023-11-29T15:19:49Z)
Towards Safe Self-Distillation of Internet-Scale Text-to-Image Diffusion Models [63.20512617502273]
テキストから画像への拡散モデルにおいて,問題のあるコンテンツ生成を防止するため,SDDと呼ばれる手法を提案する。本手法は,画像の全体的な品質を劣化させることなく,生成した画像から有害なコンテンツをはるかに多く除去する。
論文参考訳（メタデータ） (2023-07-12T07:48:29Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。