論文の概要: Confess What You Know: Forget-Set Misalignment with Model Knowledge in LLM Unlearning
- arxiv url: http://arxiv.org/abs/2609.00605v1
- Date: Tue, 01 Sep 2026 02:47:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.245576
- Title: Confess What You Know: Forget-Set Misalignment with Model Knowledge in LLM Unlearning
- Title(参考訳): 知っていることの矛盾:LLMアンラーニングにおけるモデル知識との相違
- Authors: Miso Kim, Georu Lee, Seungwon Jeong, Woojin Lee,
- Abstract要約: このギャップを忘れセットの誤認識と呼び,2つの症例を同定する。
アンラーニングでは、忘れられたセットは記憶された情報を省略し、リークは継続する。
Out-of-Knowledge Unlearningでは、アルゴリズムは学習したことのない知識を“忘れる”ように駆動され、パラメータを摂動させ、ユーティリティを劣化させる。
本稿では,モデルが記憶した知識を抽出し,形式化し,モデルに整合した左折集合を構成するデータブラインドフレームワークを提案する。
- 参考スコア(独自算出の注目度): 9.140696856930457
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Machine unlearning for large language models (LLMs) often assumes that a pre-defined forget set matches what the model has memorized, but this frequently breaks in realistic privacy settings where the original training data is inaccessible. We term this gap forget-set misalignment and identify two cases. In Under Unlearning, the forget set omits memorized information and leakage persists. In Out-of-Knowledge Unlearning, the algorithm is driven to "forget" knowledge the model never learned, perturbing parameters and degrading utility. Using gradient-level analysis, we show these behaviors arise from misaligned unlearning targets rather than specific optimization choices. We then propose CONfession-to-Forget-Set (CONFS), a data-blind framework that constructs model-aligned forget sets by eliciting and formalizing the model's memorized knowledge. Across synthetic, multimodal, and real-world benchmarks, CONFS approaches Gold-standard performance on several metrics and achieves a competitive forgetting-utility balance, while preserving utility better than other data-blind forget-set constructions.
- Abstract(参考訳): 大規模言語モデル(LLMs)の機械学習では、事前に定義されたエラーセットがモデルが記憶したものと一致すると仮定されることが多いが、これは元のトレーニングデータがアクセスできない現実的なプライバシ設定でしばしば破られる。
このギャップを忘れセットの誤認識と呼び,2つの症例を同定する。
アンラーニングでは、忘れられたセットは記憶された情報を省略し、リークは継続する。
Out-of-Knowledge Unlearningでは、アルゴリズムは学習したことのない知識を“忘れる”ように駆動され、パラメータを摂動させ、ユーティリティを劣化させる。
勾配レベル解析を用いて、これらの挙動は特定の最適化選択ではなく、学習対象が一致していないことから生じることを示す。
次に、モデルに記憶された知識を抽出し、形式化し、モデルに整合した左折集合を構成するデータブラインドフレームワークであるConfession-to-Forget-Set(CONFS)を提案する。
合成、マルチモーダル、および実世界のベンチマーク全体にわたって、CONFSはゴールドスタンダードのパフォーマンスをいくつかのメトリクスにアプローチし、競合するリクティングユーティリティバランスを達成しつつ、他のデータブラインドのリクティングセット構成よりも有効性を保っている。
関連論文リスト
- Forget Narrowly, Retain Broadly: Unlearning as an Asymmetric Generalization Problem [16.147107064302435]
本研究では,現実のファクト・ドメインの無視保持構造をキャプチャするプロトコルと学習コーパスを開発する。
JensUn++は,3つのLLM間での最高の忘れがちなユーティリティトレードオフを実現する未学習アルゴリズムである。
論文 参考訳(メタデータ) (2026-07-10T09:31:29Z) - SHRED: Retain-Set-Free Unlearning via Self-Distillation with Logit Demotion [39.17638540496959]
SHRED (Self-distillation via High-surprisal-only Retain-free Entropy Demotion) は、キーインサイトに基づいて構築された、保持セットなしのアンラーニング手法である。
高情報トークンはモデルの記憶された知識に集中し、低情報トークンは一般的な言語能力を反映する。
SHREDは再学習攻撃やメンバシップ推論攻撃に対して堅牢であり、連続的なアンラーニングの実行が多数あった後も安定したユーティリティを維持している。
論文 参考訳(メタデータ) (2026-05-08T09:25:18Z) - LLM Unlearning on Noisy Forget Sets: A Study of Incomplete, Rewritten, and Watermarked Data [69.5099112089508]
大規模言語モデル(LLM)は、顕著な生成能力を示すが、機密データを記憶することで倫理的およびセキュリティ上の懸念を引き起こす。
この研究は、ノイズのある忘れセットと呼ばれる、摂動的または低忠実な忘れデータの下での未学習に関する最初の研究を提示する。
コアセマンティック信号が保存されている場合、未学習は摂動に対して驚くほど堅牢である。
論文 参考訳(メタデータ) (2025-10-10T05:10:49Z) - BLUR: A Bi-Level Optimization Approach for LLM Unlearning [100.90394814817965]
未学習問題の階層構造をモデル化することが重要であると論じる。
本稿では,より優れた性能を実現する新しいアルゴリズムであるBi-Level UnleaRning(textttBLUR)を提案する。
論文 参考訳(メタデータ) (2025-06-09T19:23:05Z) - GUARD: Generation-time LLM Unlearning via Adaptive Restriction and Detection [36.38245533018162]
大規模言語モデル(LLM)は、多様なドメインにまたがる膨大な知識を記憶する強力な能力を示している。
既存の未学習の取り組みは、通常、モデルを忘れデータ、データ保持、キャリブレーションモデルといったリソースで微調整する。
本稿では,LLM生成時の動的アンラーニングを実現するフレームワークであるAdaptive Restriction and Detection (GUARD) による生成時アンラーニングを提案する。
論文 参考訳(メタデータ) (2025-05-19T16:26:58Z) - CodeUnlearn: Amortized Zero-Shot Machine Unlearning in Language Models Using Discrete Concept [5.345828824625758]
コードブック機能とスパースオートエンコーダ(SAEs)を用いた新しいアンラーニング手法を提案する。
ボトルネックを利用して、アクティベーション空間を分解し、情報の流れを規制することにより、モデルの性能を無関係なデータに保ちながら、ターゲットとなる情報を効率的に解き放つ。
論文 参考訳(メタデータ) (2024-10-08T10:26:22Z) - TOFU: A Task of Fictitious Unlearning for LLMs [99.92305790945507]
Webからの大量のコーパスに基づいてトレーニングされた大規模な言語モデルは、法的および倫理的懸念を提起する機密データやプライベートデータを再現することができる。
トレーニングデータに存在する情報を忘れるためにモデルをチューニングするアンラーニングは、トレーニング後のプライベートデータを保護する手段を提供する。
未学習の理解を深めるためのベンチマークであるTOFUを紹介する。
論文 参考訳(メタデータ) (2024-01-11T18:57:12Z) - Retrieval-Enhanced Contrastive Vision-Text Models [61.783728119255365]
そこで本研究では,メモリから取得したクロスモーダルな情報を推論時に表現することで,その埋め込みを洗練できる視覚テキストモデルを提案する。
注目すべきことに、これは凍ったCLIPの上に軽量の単層核融合トランスを用いて行うことができる。
検索強化コントラスト訓練(RECO)がCLIPの性能を大幅に向上することを示す。
論文 参考訳(メタデータ) (2023-06-12T15:52:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。