論文の概要: Do LLMs Really Forget? Hidden-State Leakage in Model Unlearning and How to Fix it
- arxiv url: http://arxiv.org/abs/2609.36612v1
- Date: Tue, 29 Sep 2026 03:26:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.15199
- Title: Do LLMs Really Forget? Hidden-State Leakage in Model Unlearning and How to Fix it
- Title(参考訳): LLMは本当に忘れられるのか? モデル学習における隠れた状態漏洩とその修正法
- Abstract要約: 出力レベルのリークを除去しても、機密情報がモデルに隠された表現に符号化されることが示される。
本研究では,隠蔽表現から抽出可能な情報を対角的に最小化する未学習目的である Probe-Adversarial Suppression (PARS) を提案する。
- 参考スコア(独自算出の注目度): 18.074391380273262
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Unlearning in large language models (LLMs) is typically evaluated at the output level, where a model appears to suppress sensitive or undesirable content. In this work, we show that such evaluations can create an illusion of forgetting: even when output-level leakage is eliminated, sensitive information can remain encoded in the model's hidden representations. We first provide a theoretical analysis establishing a fundamental separation between output suppression and representational erasure. Specifically, we show that the decoder can be made arbitrarily insensitive to sensitive directions, driving output-level leakage to zero, while the hidden representations retain the underlying information. To empirically validate this phenomenon, we train generative probe decoders on hidden states across transformer layers, enabling layer-wise measurement of information leakage. Across three widely used benchmarks, TOFU, MUSE, and WMDP, and state-of-the-art unlearning methods, we find that substantial sensitive information remains recoverable from hidden representations, even when standard output-level metrics indicate successful unlearning. To address this gap, we propose Probe-Adversarial Representation Suppression (PARS), an unlearning objective that adversarially minimizes the extractable information from hidden representations. PARS directly targets representational leakage and provides significantly stronger guarantees of erasure under adversarial probing and relearning attacks, outperforming all evaluated baselines. Our results highlight a fundamental limitation of existing unlearning paradigms and suggest that true forgetting in LLMs requires controlling not only model outputs, but also the information encoded in hidden representations. Codes are available at https://github.com/OptimAI-Lab/HiddenStateUnlearning.
- Abstract(参考訳): 大規模言語モデル(LLM)における未学習は、一般的には出力レベルで評価され、モデルが機密性や望ましくない内容を抑制するように見える。
出力レベルのリークが除去されたとしても、機密情報はモデルの隠された表現に符号化され続けることができる。
まず、出力抑制と表現消去の基本的な分離を確立する理論分析を行う。
具体的には,デコーダの出力レベルリークをゼロに抑えながら,デコーダを任意に感度に抑えられることを示す。
この現象を実証的に検証するために、トランスフォーマー層にまたがる隠れ状態に生成プローブデコーダを訓練し、情報漏洩の層単位での測定を可能にする。
ToFU,MUSE,WMDPの3つの広く使用されているベンチマークや最先端の未学習手法では,標準出力レベルの指標が未学習の成功を示す場合でも,隠れ表現からかなりの機密情報が回復可能であることが判明した。
このギャップに対処するために,隠れ表現から抽出可能な情報を対角的に最小化する未学習の目的である Probe-Adversarial Representation Suppression (PARS) を提案する。
PARSは直接的に表現リークをターゲットとし、敵の探索および再学習攻撃による消去の保証を著しく強化し、評価されたすべてのベースラインを上回ります。
この結果から,LLMにおける真の忘れは,モデル出力だけでなく,隠れ表現に符号化された情報も制御する必要があることが示唆された。
コードはhttps://github.com/OptimAI-Lab/HiddenStateUnlearningで入手できる。
関連論文リスト
- Test-Time Unlearning via Sparse Autoencoder [55.4290003355764]
ARIAは,モデルウェイトをそのまま残して,世代が無視関連状態に入る場合にのみ,不要な知識へのアクセスをゲートするテスト時アンラーニング手法である。
ARIAは、思考モデルと命令モデルの両方にわたるウェイトベースベースラインに対する忘れがちなトレードオフを改善します。
論文 参考訳(メタデータ) (2026-09-14T18:58:09Z) - From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks [49.57538588967748]
LLM(Large Language Model)は、複雑なベンチマークでは優れているにもかかわらず、単語中の文字数などの基本的な記号的タスクにおいて失敗を示す。
我々は、LLaMA、Qwen、Gemmaなど、現代のアーキテクチャにまたがる一貫した現象を発見した。
LLMにおけるシンボリック推論失敗は,表現不足やスケール不足によるものではなく,モデル計算グラフ内の構造的干渉によるものであることを示す。
論文 参考訳(メタデータ) (2026-04-01T11:40:12Z) - REMIND: Input Loss Landscapes Reveal Residual Memorization in Post-Unlearning LLMs [0.1784233255402269]
機械学習は、モデルから特定のトレーニングデータの影響を、完全な再トレーニングを必要とせずに取り除くことを目的としている。
未学習データの微妙な残差を検出するための新しい評価手法であるREMINDを提案する。
未学習のデータは、より平坦で、より急なロスランドスケープをもたらす一方、保持または関連のないデータは、より鋭く、より揮発性のあるパターンを示す。
論文 参考訳(メタデータ) (2025-11-06T09:58:19Z) - LLM Unlearning on Noisy Forget Sets: A Study of Incomplete, Rewritten, and Watermarked Data [69.5099112089508]
大規模言語モデル(LLM)は、顕著な生成能力を示すが、機密データを記憶することで倫理的およびセキュリティ上の懸念を引き起こす。
この研究は、ノイズのある忘れセットと呼ばれる、摂動的または低忠実な忘れデータの下での未学習に関する最初の研究を提示する。
コアセマンティック信号が保存されている場合、未学習は摂動に対して驚くほど堅牢である。
論文 参考訳(メタデータ) (2025-10-10T05:10:49Z) - Scalable and Robust LLM Unlearning by Correcting Responses with Retrieved Exclusions [49.55618517046225]
Webスケールのコーパスリスクを記憶し、センシティブな情報を暴露する言語モデル。
本稿では,新しいアンラーニングフレームワークであるCorrective Unlearning with Retrieved Exclusions (CURE)を提案する。
CUREは、リークのモデル出力を確認し、安全な応答に修正する。
論文 参考訳(メタデータ) (2025-09-30T09:07:45Z) - Unlearning Isn't Invisible: Detecting Unlearning Traces in LLMs from Model Outputs [23.538087984484207]
大規模言語モデル(LLM)のための機械学習(MU)は、特定の望ましくないデータや知識を訓練されたモデルから取り除こうとする。
未学習のトレース検出という新たな脆弱性を特定します。
非学習トレースを90%以上の精度で検出できることを示す。
論文 参考訳(メタデータ) (2025-06-16T21:03:51Z) - Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs [38.837810490068556]
大規模言語モデル(LLM)におけるアンラーニングは、指定されたデータを削除することを目的としているが、その効果は通常、正確性や複雑度のようなタスクレベルのメトリクスで評価される。
最小限の微調整によって元の動作が容易に復元される間、モデルは忘れることができることを実証する。
この表現可能性の現象は、情報は単に抑圧されているだけであり、真に消去されていないことを示唆している。
論文 参考訳(メタデータ) (2025-05-22T16:02:10Z) - Model Surgery: Modulating LLM's Behavior Via Simple Parameter Editing [63.20133320524577]
パラメータの小さなサブセットを編集することで、大きな言語モデル(LLM)の特定の振る舞いを効果的に調節できることを示す。
我々の手法は、RealToxicityPromptsデータセットで最大90.0%の毒性を減少させ、ToxiGenで49.2%を達成する。
論文 参考訳(メタデータ) (2024-07-11T17:52:03Z) - Improving Input-label Mapping with Demonstration Replay for In-context
Learning [67.57288926736923]
In-context Learning (ICL)は、大規模な自己回帰言語モデルの出現する能力である。
Sliding Causal Attention (RdSca) と呼ばれる新しいICL法を提案する。
ICL実験において,本手法は入力ラベルマッピングを大幅に改善することを示す。
論文 参考訳(メタデータ) (2023-10-30T14:29:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。