論文の概要: BARRIER: Bounded Activation Regions for Robust Information Erasure
- arxiv url: http://arxiv.org/abs/2605.15737v1
- Date: Fri, 15 May 2026 08:46:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-18 21:22:26.226144
- Title: BARRIER: Bounded Activation Regions for Robust Information Erasure
- Title(参考訳): BARRIER:ロバスト情報消去のための境界活性化領域
- Authors: Jan Miksa, Patryk Krukowski, Przemysław Spurek, Dawid Damian Rymarczyk, Marcin Sendera,
- Abstract要約: 本稿では,機械学習のためのパラダイムシフトフレームワークであるBARRIERを提案する。
干渉の軌跡を静的モデル重みから隠れ層活性化の動的幾何学にシフトさせる。
BARRIERは分類器と拡散モデル間での最先端のトレードオフと一致することを示す。
- 参考スコア(独自算出の注目度): 2.058044172429281
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Machine unlearning has reached a critical bottleneck. As traditional weight-space interventions focus primarily on erasing targeted concepts, they often fail to prevent the unintended suppression of other significant representations. This leads to substantial collateral damage, with essential knowledge being forgotten, because these methods lack formal mathematical guarantees for the preservation of neutral concepts. To avoid degradation, they are frequently forced into conservative updates. We propose BARRIER (Bounded Activation Regions for Robust Information Erasure), a paradigm-shifting framework that shifts the locus of intervention from static model weights to the dynamic geometry of hidden-layer activations. Unlike existing methods, BARRIER employs Interval Arithmetic (IA) on SVD-based projections of the activation space to encapsulate the specific target region within a bounding hypercube. By driving unlearning updates exclusively within this forget interval and mathematically bounding the model response on the complement, we ensure rigorous protection of the retain distribution. This geometric construction transforms the preservation of knowledge from an empirical heuristic into a formal optimization target with a probabilistic tail bound on functional drift. Crucially, this stability permits highly aggressive unlearning updates within the forget region. Empirical evaluations demonstrate that BARRIER matches state-of-the-art trade-offs across classifiers and diffusion models, maximizing targeted concept erasure while safeguarding the integrity of all other representations. Our code is available at https://github.com/OneAndZero24/BARRIER.
- Abstract(参考訳): 機械学習は重大なボトルネックに到達した。
伝統的な重み空間の介入は主に対象概念の消去に焦点を当てているため、意図しない他の重要な表現の抑制を防げないことが多い。
これらの手法は中立概念の保存のための公式な数学的保証を欠いているため、本質的な知識は忘れられている。
劣化を避けるため、しばしば保守的な更新を余儀なくされる。
BARRIER(Bounded Activation Regions for Robust Information Erasure)は,静的モデルウェイトから隠れ層アクティベーションの動的幾何学へ介入の軌跡をシフトさせるパラダイムシフトフレームワークである。
既存の方法とは異なり、BARRIERはSVDベースのアクティベーション空間の投影にInterval Arithmetic (IA) を用いて、特定のターゲット領域を束縛されたハイパーキューブ内にカプセル化する。
この例外区間内でのみ未学習更新を駆動し, 補数に対するモデル応答を数学的に拘束することにより, 保持分布の厳密な保護を確保する。
この幾何学的構成は、経験的ヒューリスティックからの知識の保存を、関数的ドリフトに束縛された確率的尾を持つ形式的最適化ターゲットに変換する。
重要な点として、この安定性は、忘れ領域内で高度に攻撃的な未学習更新を可能にする。
実証的な評価は、BARRIERが分類器と拡散モデル間の最先端のトレードオフと一致し、ターゲット概念の消去を最大化し、他のすべての表現の完全性を保護していることを示している。
私たちのコードはhttps://github.com/OneAndZero24/BARRIERで利用可能です。
関連論文リスト
- AEGIS: Adversarial Target-Guided Retention-Data-Free Robust Concept Erasure from Diffusion Models [36.91937453334139]
概念消去は、拡散モデル(DM)が有害なコンテンツを生成するのを防ぐのに役立ちますが、現在の手法は保持のトレードオフに直面します。
本稿では,頑健性と保持性の両方を向上する保持データフリーフレームワークであるAdversarial Erasure with Gradient Informed Synergy (AEGIS)を紹介する。
論文 参考訳(メタデータ) (2026-02-06T15:27:42Z) - The Illusion of Forgetting: Attack Unlearned Diffusion via Initial Latent Variable Optimization [51.835894707552946]
非学習型防衛は拡散モデル(DM)からNot-Safe-For-Work概念を浄化すると主張している
本研究では,未学習が言語記号と基礎知識のマッピングを部分的に破壊し,休眠記憶として残り続けることを示す。
IVOは、壊れたマッピングを再構築することで、これらの休眠記憶を再活性化する簡潔で強力な攻撃フレームワークである。
論文 参考訳(メタデータ) (2026-01-30T02:39:51Z) - Geometric-Disentangelment Unlearning [106.99160454669902]
忘れたサンプルへの勾配は しばしば 保持された知識を傷つける
本稿では,GU(Geometric-disment Unlearning)を提案する。
本手法はプラグ・アンド・プレイであり,既存の勾配に基づくアンラーニング手法と併用することで副作用を軽減できる。
論文 参考訳(メタデータ) (2025-11-21T09:58:25Z) - SPEAR++: Scaling Gradient Inversion via Sparsely-Used Dictionary Learning [48.41770886055744]
Federated Learningは最近、現実世界のシナリオへのデプロイが増えている。
いわゆる勾配反転攻撃の導入は、プライバシー保護特性に挑戦している。
本稿では,ReLU活性化を伴う線形層の勾配の理論的解析に基づくSPEARを紹介する。
新たな攻撃であるSPEAR++は、DPノイズに対する堅牢性やFedAvgアグリゲーションなど、SPEARの望ましい特性をすべて保持しています。
論文 参考訳(メタデータ) (2025-10-28T09:06:19Z) - Revoking Amnesia: RL-based Trajectory Optimization to Resurrect Erased Concepts in Diffusion Models [38.38751366738881]
概念消去技術は、安全と著作権の観点から不適切なコンテンツ生成を防止するため、T2I拡散モデルに広く展開されている。
確立された消去方法は 劣化した効果を示し 真のメカニズムに関する疑問を提起する
提案するトラジェクトリ最適化フレームワークである textbfRevAm は,デノナイジング過程を動的に操ることで,消去された概念を復活させる。
論文 参考訳(メタデータ) (2025-09-30T07:46:19Z) - CURE: Concept Unlearning via Orthogonal Representation Editing in Diffusion Models [7.68494752148263]
CUREは、事前訓練された拡散モデルの重み空間で直接動作する、トレーニング不要の概念未学習フレームワークである。
スペクトル消去器は、安全な属性を保持しながら、望ましくない概念に特有の特徴を特定し、分離する。
CUREは、対象とする芸術スタイル、オブジェクト、アイデンティティ、明示的なコンテンツに対して、より効率的で徹底的な除去を実現する。
論文 参考訳(メタデータ) (2025-05-19T03:53:06Z) - Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models [76.39651111467832]
本稿では,Reliable and Efficient Concept Erasure (RECE)を提案する。
派生した埋め込みによって表現される不適切なコンテンツを緩和するために、RECEはそれらをクロスアテンション層における無害な概念と整合させる。
新たな表現埋め込みの導出と消去を反復的に行い、不適切な概念の徹底的な消去を実現する。
論文 参考訳(メタデータ) (2024-07-17T08:04:28Z) - Learn from the Past: A Proxy Guided Adversarial Defense Framework with
Self Distillation Regularization [53.04697800214848]
敵対的訓練(AT)は、ディープラーニングモデルの堅牢性を固める上で重要な要素である。
AT方式は、目標モデルの防御のために直接反復的な更新を頼りにしており、不安定な訓練や破滅的なオーバーフィッティングといった障害に頻繁に遭遇する。
汎用プロキシガイド型防衛フレームワークLAST(bf Pbf astから学ぶ)を提案する。
論文 参考訳(メタデータ) (2023-10-19T13:13:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。