論文の概要: TILDE: TILt-based Distributional Erasure for Concept Unlearning
- arxiv url: http://arxiv.org/abs/2607.06432v1
- Date: Tue, 07 Jul 2026 15:59:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.580149
- Title: TILDE: TILt-based Distributional Erasure for Concept Unlearning
- Title(参考訳): TILDE:概念学習のためのTILtベースの分散消去
- Authors: Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji,
- Abstract要約: テキストから画像への拡散モデルにおける概念のアンラーニングは、安全で実用的なデプロイに不可欠である。
本稿では,分散アライメント問題として,非学習の概念を定式化するTILDEを提案する。
我々はこの原理を残差$nabla$-GFlowNetトレーニングでインスタンス化する。
- 参考スコア(独自算出の注目度): 42.10036183563499
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Concept unlearning in text-to-image diffusion models is critical for safe and practical deployment: with rising privacy concerns, copyright disputes, trademark constraints, and safety regulations, deployed systems must be able to suppress unwanted concepts after training. Existing methods often remove the target concept effectively, but practical unlearning also requires an equally fundamental property: the unlearned model should retain quality, diversity, and semantic coverage on benign generation. The gold standard is a retain-only model trained from scratch without the unwanted data. However, common erasure objectives do not specify which post-unlearning distribution should approximate this reference, leaving retention as an implicit consequence of the update rule. We propose TILDE, TILt-based Distributional Erasure, which formulates concept unlearning as a distributional alignment problem: the desired target is the minimum-deviation conditional distribution from the pretrained model under a forgetting constraint. This energy-tilted, anchor-free target suppresses concept-expressing images while preserving benign relative mass for each prompt. We instantiate this principle with residual $\nabla$-GFlowNet training, which learns the score correction induced by the forget energy relative to the pretrained diffusion model. Across objects, artistic styles, and characters, TILDE achieves strong forgetting while improving retention and distributional fidelity over prior baselines.
- Abstract(参考訳): プライバシーの懸念、著作権の論争、商標の制約、安全規制が高まり、デプロイされたシステムは、トレーニング後の望ましくない概念を抑制できなければならない。
既存の手法は、しばしばターゲットの概念を効果的に除去するが、実践的なアンラーニングは、同様に基本的な性質も必要である: 未学習のモデルは良質な世代における品質、多様性、意味的なカバレッジを保持するべきである。
金の標準は、望ましくないデータなしでゼロから訓練された保持のみのモデルである。
しかし、一般的な消去目的は、どの学習後分布をこの基準に近似すべきかを規定せず、保持は更新規則の暗黙の結果として残されている。
本稿では,TILDE(TILt-based Distributional Erasure)を提案する。これは,非学習概念を分布アライメント問題として定式化したものである。
このエネルギータイル付きアンカーフリーターゲットは、各プロンプトの良性相対質量を保ちながら概念表現画像を抑制する。
我々は、この原理を残差$\nabla$-GFlowNetトレーニングでインスタンス化し、事前訓練された拡散モデルと比較して、忘れエネルギーによって誘導されるスコア補正を学習する。
TILDEは、オブジェクト、芸術スタイル、キャラクタ全体にわたって、保持性や分布の忠実さを以前のベースラインよりも向上させながら、強い忘れ事を達成する。
関連論文リスト
- Erasing Without Collateral Damage: Precise Concept Removal in Diffusion Models [10.269961654607108]
トレーニング不要の概念消去は、テキスト間拡散モデルを制御するための魅力的なメカニズムである。
しかし、正確な消去は、しばしば意味論的に関連する非ターゲット概念を損なうコストがかかる。
原ターゲット方向を宇宙空間に意識した方向で置き換えるクローズドフォームの概念消去演算子であるCAREを紹介する。
論文 参考訳(メタデータ) (2026-07-06T16:21:09Z) - CoreUnlearn: Rethinking Concept Unlearning through Disentangled Component-Level Erasure in Text-guided Diffusion Models [72.22994966489551]
CoreUnlearnは、望ましくないコンセプトの消去クリティカルなコンポーネントを混乱させ、取り除くことを目的としている。
モデル全体のパフォーマンスへの影響を最小限に抑えて、効果的な概念消去を実現する。
論文 参考訳(メタデータ) (2026-06-01T04:09:45Z) - Projected Gradient Unlearning for Text-to-Image Diffusion Models: Defending Against Concept Revival Attacks [6.0599090126776565]
現在のアンラーニングメソッドは共通の弱点を共有している。 下流データでモデルが微調整されたときに、削除された概念が返される。
我々は,予測勾配学習を分類から拡散領域に適応させ,ポストホックハードニングのステップとした。
このアプローチはスタイルの概念の復活を排除し、メタ・アンラーニングに必要な2時間に対して約6分で実行される、オブジェクトの概念に対して大幅に遅延する。
論文 参考訳(メタデータ) (2026-04-22T19:39:56Z) - AEGIS: Adversarial Target-Guided Retention-Data-Free Robust Concept Erasure from Diffusion Models [36.91937453334139]
概念消去は、拡散モデル(DM)が有害なコンテンツを生成するのを防ぐのに役立ちますが、現在の手法は保持のトレードオフに直面します。
本稿では,頑健性と保持性の両方を向上する保持データフリーフレームワークであるAdversarial Erasure with Gradient Informed Synergy (AEGIS)を紹介する。
論文 参考訳(メタデータ) (2026-02-06T15:27:42Z) - CURE: Concept Unlearning via Orthogonal Representation Editing in Diffusion Models [7.68494752148263]
CUREは、事前訓練された拡散モデルの重み空間で直接動作する、トレーニング不要の概念未学習フレームワークである。
スペクトル消去器は、安全な属性を保持しながら、望ましくない概念に特有の特徴を特定し、分離する。
CUREは、対象とする芸術スタイル、オブジェクト、アイデンティティ、明示的なコンテンツに対して、より効率的で徹底的な除去を実現する。
論文 参考訳(メタデータ) (2025-05-19T03:53:06Z) - Fine-Grained Erasure in Text-to-Image Diffusion-based Foundation Models [56.35484513848296]
FADE(Fine grained Attenuation for Diffusion Erasure)は、テキストから画像への生成モデルのための非学習アルゴリズムである。
関連する概念に最小限の影響で目標概念を排除し、最先端の手法よりも保持性能が12%向上した。
論文 参考訳(メタデータ) (2025-03-25T15:49:48Z) - Continual Unlearning for Foundational Text-to-Image Models without Generalization Erosion [56.35484513848296]
本研究は,基本生成モデルから複数の特定の概念を対象とする除去を可能にする新しいパラダイムである連続的アンラーニングを導入する。
本稿では,望ましくない概念の生成を選択的に解き放つような一般化エロージョン(DUGE)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-03-17T23:17:16Z) - TRCE: Towards Reliable Malicious Concept Erasure in Text-to-Image Diffusion Models [53.937498564603054]
近年のテキスト・画像拡散モデルの進歩により、フォトリアリスティックな画像生成が可能になったが、NSFW画像のような悪意のあるコンテンツを生成するリスクもある。
リスクを軽減するため,概念消去手法が研究され,モデルが特定の概念を学習しやすくする。
本稿では,2段階のコンセプト消去戦略を用いて,信頼性の高い消去と知識保存の効果的なトレードオフを実現するTRCEを提案する。
論文 参考訳(メタデータ) (2025-03-10T14:37:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。