論文の概要: Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models
- arxiv url: http://arxiv.org/abs/2606.31699v2
- Date: Wed, 01 Jul 2026 18:42:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 15:16:32.256981
- Title: Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models
- Title(参考訳): 拡散モデルにおける未学習のためのスパースオートエンコーダに触るな
- Abstract要約: 概念レベルの操作のための解釈可能なツールとしてスパースオートエンコーダ(SAE)が提案されている。
SAEは拡散モデル活性化のセマンティック概念を確実に検出・ローカライズするが、その潜在空間への直接的介入はしばしば分布外活性化を誘導する。
我々は、SAEアクティベーションを純粋にセマンティック検出器として使用し、ターゲットオブジェクトを含むイメージ領域を特定し、それらのパッチ埋め込みを、それを含まない領域に置き換える。
- 参考スコア(独自算出の注目度): 11.366541829206199
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse autoencoders (SAEs) have recently been proposed as interpretable tools for concept-level manipulation, under the assumption that isolated features can serve as controllable intervention points. In this work, we systematically evaluate this assumption in the context of object erasure and steering in diffusion models. We show that while SAEs reliably detect and localize semantic concepts within diffusion model activations, direct intervention in their latent space frequently induces out-of-distribution activations, resulting in severe visual artifacts. To disentangle detection from intervention, we use SAE activations purely as semantic detectors to identify image regions containing the target object, and replace those patch embeddings with the ones that do not contain it. This detection-based replacement preserves the diffusion model's activation statistics and produces significantly cleaner erasure results than latent steering. Our findings reveal a fundamental gap between concept detection and concept intervention in diffusion models: monosemantic or sparse features are not inherently suitable as control knobs for steering. These results position SAEs as powerful interpretability tools for analyzing generative models, but highlight important limitations when used for direct manipulation, such as unlearning.
- Abstract(参考訳): スパースオートエンコーダ (SAE) は、分離された特徴が制御可能な介入点として機能できるという仮定のもと、近年、概念レベルの操作のための解釈可能なツールとして提案されている。
本研究では,拡散モデルにおけるオブジェクト消去とステアリングの文脈において,この仮定を体系的に評価する。
SAEは拡散モデル活性化のセマンティックな概念を確実に検出し、局所化するが、その潜在空間への直接的介入は、しばしば分布外活性化を誘発し、深刻な視覚的アーティファクトをもたらす。
介入による検出を阻害するために、SAEアクティベーションを純粋にセマンティック・ディテクターとして使用し、対象物を含む画像領域を特定し、それらのパッチ埋め込みを含まないものと置き換える。
この検出に基づく置換は、拡散モデルの活性化統計を保存し、潜在ステアリングよりもかなりクリーンな消去結果を生成する。
本研究は, 拡散モデルにおける概念検出と概念介入の基本的なギャップを明らかにし, 単意味的・スパース的特徴は, ステアリングの制御ノブとして本質的には適していないことを示した。
これらの結果は、SAEを生成モデルを解析するための強力な解釈可能性ツールとして位置づけるが、非学習のような直接操作に使用する際の重要な制限を強調している。
関連論文リスト
- Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique [1.1172382217477128]
AIエージェントとしてデプロイされるLarge Language Models (LLM)は、しばしばユーザ仕様のグラウンド障害を示す。
既存の検出方法は、幻覚をローカライズしないか、禁忌の推論遅延を発生しないため、実行可能でリアルタイムな修正を提供することができない。
フリーズベースLCM世代と並行して動作する軽量低ランクアダプタ(LoRA)であるLatent Criticを導入する。
論文 参考訳(メタデータ) (2026-08-11T03:26:16Z) - Scaling Pretrained Representations Enables Label-Free Out-of-Distribution Detection Without Fine-Tuning [5.008779702997125]
最新の事前学習モデルでは, 正確なラベル自由分布検出に十分な幾何学的構造をエンコードしている。
以上の結果から, ラベルフリーなOOD検出は, 凍結した後骨が露出する形状に強く依存していることが示唆された。
論文 参考訳(メタデータ) (2026-05-07T03:45:52Z) - CASL: Concept-Aligned Sparse Latents for Interpreting Diffusion Models [45.90361318326864]
拡散モデルの内部的な活性化は、リッチな意味情報を符号化するが、そのような表現を解釈することは依然として困難である。
拡散モデルのスパース潜在次元を意味論的概念と整合させる教師付きフレームワークであるCASL(Concept-Aligned Sparse Latents)を紹介する。
編集方法と異なり、CASL-Steerは因果プローブとしてのみ使用され、概念に整合した潜伏者が生成コンテンツにどのように影響するかを明らかにする。
論文 参考訳(メタデータ) (2026-01-21T20:14:17Z) - Did Models Sufficient Learn? Attribution-Guided Training via Subset-Selected Counterfactual Augmentation [61.248535801314375]
Subset-Selected Counterfactual Augmentation (SS-CA)
我々は,モデル予測を選択的に変更可能な最小空間領域集合を識別するために,対実的LIMAを開発した。
実験により,SS-CAは分布内テストデータ(ID)の一般化を改善し,分布外ベンチマーク(OOD)において優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-11-15T08:39:22Z) - LLM-Assisted Semantic Guidance for Sparsely Annotated Remote Sensing Object Detection [25.9348571356454]
リモートセンシングオブジェクト検出のためのLLM支援セマンティックガイダンスフレームワーク
Dense Pseudo-Label Assignmentメカニズムは、ラベルなしデータと疎ラベル付きデータの両方に擬似ラベルを適応的に割り当てる。
Adaptive Hard-Negative Reweighting Module による教師付き学習領域の安定化
論文 参考訳(メタデータ) (2025-09-21T08:05:43Z) - Orthogonal Subspace Decomposition for Generalizable AI-Generated Image Detection [58.87142367781417]
航法的に訓練された検出器は、限定的で単調な偽のパターンに過度に適合する傾向にあり、特徴空間は高度に制約され、低ランクになる。
潜在的な治療法の1つは、ビジョンファウンデーションモデルに事前訓練された知識を取り入れて、機能領域を広げることである。
主要なコンポーネントを凍結し、残ったコンポーネントのみを適用することで、フェイクパターンを学習しながら、トレーニング済みの知識を保存します。
論文 参考訳(メタデータ) (2024-11-23T19:10:32Z) - Unsupervised Model Diagnosis [49.36194740479798]
本稿では,ユーザガイドを使わずに,意味論的対実的説明を生成するために,Unsupervised Model Diagnosis (UMO)を提案する。
提案手法は意味論における変化を特定し可視化し,その変化を広範囲なテキストソースの属性と照合する。
論文 参考訳(メタデータ) (2024-10-08T17:59:03Z) - Diffusion-Based Particle-DETR for BEV Perception [94.88305708174796]
Bird-Eye-View (BEV)は、自律走行車(AV)における視覚知覚のための最も広く使われているシーンの1つである。
近年の拡散法は、視覚知覚のための不確実性モデリングに有望なアプローチを提供するが、BEVの広い範囲において、小さな物体を効果的に検出することができない。
本稿では,BEVにおける拡散パラダイムと最先端の3Dオブジェクト検出器を組み合わせることで,この問題に対処する。
論文 参考訳(メタデータ) (2023-12-18T09:52:14Z) - Weakly-supervised Contrastive Learning for Unsupervised Object Discovery [52.696041556640516]
ジェネリックな方法でオブジェクトを発見できるため、教師なしのオブジェクト発見は有望である。
画像から高レベルな意味的特徴を抽出する意味誘導型自己教師学習モデルを設計する。
オブジェクト領域のローカライズのための主成分分析(PCA)を導入する。
論文 参考訳(メタデータ) (2023-07-07T04:03:48Z) - Feature Alignment by Uncertainty and Self-Training for Source-Free
Unsupervised Domain Adaptation [1.6498361958317636]
ほとんどの教師なし領域適応(UDA)手法は、ラベル付きソースイメージがモデル適応中に利用できると仮定する。
本稿では,事前学習したソースモデルと未ラベルのターゲット画像のみを用いる,ソースフリーなUDA手法を提案する。
本手法は,データ拡張を取り入れ,特徴発生器を2つの整合性目標で訓練することにより,アレータリックな不確実性を捕捉する。
論文 参考訳(メタデータ) (2022-08-31T14:28:36Z) - DAAIN: Detection of Anomalous and Adversarial Input using Normalizing
Flows [52.31831255787147]
我々は、アウト・オブ・ディストリビューション(OOD)インプットと敵攻撃(AA)を検出する新しい手法であるDAINを導入する。
本手法は,ニューラルネットワークの内部動作を監視し,活性化分布の密度推定器を学習する。
当社のモデルは,特別なアクセラレータを必要とせずに,効率的な計算とデプロイが可能な単一のGPUでトレーニングすることが可能です。
論文 参考訳(メタデータ) (2021-05-30T22:07:13Z) - Unsupervised Anomaly Detection with Adversarial Mirrored AutoEncoders [51.691585766702744]
本稿では,識別器のミラー化ワッサースタイン損失を利用して,よりセマンティックレベルの再構築を行う逆自動エンコーダの変種を提案する。
我々は,再建基準の代替として,異常スコアの代替尺度を提案した。
提案手法は,OOD検出ベンチマークにおける異常検出の最先端手法よりも優れている。
論文 参考訳(メタデータ) (2020-03-24T08:26:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。