論文の概要: What to Forget in Unlearning? Forget Set Curation for Language Models
- arxiv url: http://arxiv.org/abs/2608.14855v1
- Date: Fri, 14 Aug 2026 19:51:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.102878
- Title: What to Forget in Unlearning? Forget Set Curation for Language Models
- Title(参考訳): アンラーニングで何を忘れるべきか? 言語モデルのためのセットキュレーションを忘れる
- Abstract要約: 依頼者が、どの曲、文書、引用文、あるいはほぼ重複しているかを知ることなく、曲や本の再生を中止するよう、モデルに求める方法を示す。
そこで我々はCleanSlate, 曲や本に対する冗長な出力抑制のためのベンチマーク, モデル固有の抽出プロファイル, コンテンツ基底QA, 能力保持評価を紹介する。
- 参考スコア(独自算出の注目度): 24.23267387545857
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Machine unlearning aims to remove targeted data or behaviors from a trained model without retraining from scratch. Yet most evaluations assume that the examples to forget are already known. In realistic language-model deployments, a requester may ask a model to stop reproducing a song or book without knowing which spans, documents, quotations, or near-duplicates in a trillion-token corpus support that behavior. We study this missing upstream problem, forget set curation: mapping a suppression request to the data passed to an unlearning algorithm. We introduce CleanSlate, a benchmark for verbatim output suppression over songs and books, with model-specific extraction profiles, content-grounded QA, and capability-retention evaluations. CleanSlate exposes two failure modes. Natural lexical and exact-substring curators often yield forget sets that lead to weak suppression. An evaluation-aware curator suppresses requested continuations almost completely, but causes collateral regression on non-requested content and model-dependent capability loss. These results show that practical unlearning is not only an optimization problem once a forget set is given: the data chosen for forgetting determines both what can be unlearnt and what else is damaged.
- Abstract(参考訳): Machine Unlearningは、トレーニングされたモデルからターゲットデータや振る舞いを、スクラッチから再トレーニングすることなく削除することを目的としている。
しかし、ほとんどの評価は、忘れるべき例が既に知られていると仮定している。
現実的な言語モデルデプロイメントでは、要求者は、その振る舞いをサポートする数兆のコーパスにおいて、どのスパン、文書、引用、またはほぼ重複するかを知らずに、モデルに曲や本の再生を停止するよう要求することができる。
我々は、この欠落した上流問題について研究し、セットキュレーションを忘れる:非学習アルゴリズムに渡されるデータに抑圧要求をマッピングする。
そこで我々はCleanSlate, 曲や本に対する冗長な出力抑制のためのベンチマーク, モデル固有の抽出プロファイル, コンテンツ基底QA, 能力保持評価を紹介する。
CleanSlateは2つの障害モードを公開する。
自然の語彙的および正確に従属するキュレーターは、しばしば弱抑制に繋がる忘れの集合を生じる。
評価対応キュレーターは要求された継続をほぼ完全に抑制するが、要求外のコンテンツに対する相互回帰とモデル依存能力損失を引き起こす。
これらの結果から, 無視セットが与えられると, 実践的アンラーニングは最適化問題に留まらず, 忘れることに選択されたデータは, 未学習と損傷の両方を判定することがわかった。
関連論文リスト
- CUNO: Curriculum and Preference Optimization for Stable Graph Unlearning under Mass Deletion [9.068618482899327]
グラフアンラーニングは、スクラッチから再トレーニングすることなく、トレーニングされたグラフモデルから指定されたトレーニングデータの影響を取り除く。
カリキュラムベースのグラフアンラーニングフレームワークであるCUNOを提案する。
CUNOは破滅的な未学習を継続的に軽減し、50%の削除でも元のユーティリティの半分以上を維持している。
論文 参考訳(メタデータ) (2026-09-08T04:39:34Z) - Source-Free Class Relearning: Diagnosing Forgetting in Class Unlearning [22.455121713091245]
クラスアンラーニングは、モデルが保持クラスのパフォーマンスを維持しながら指定された忘れクラスを認識する能力を削除することを目的としている。
本研究では,厳密なソースフリー環境での授業再学習について検討し,未学習のモデルのみを用いて,忘れたクラスを復元できるかどうかを問う。
論文 参考訳(メタデータ) (2026-09-02T02:45:56Z) - Fast Unlearning at Scale via Margin Self-Correction [52.46927918952516]
言語モデルアンラーニングは、トレーニングモデルを更新して、選択したトレーニング例を見ていないかのように振る舞う。
MASCは、既存のベースラインの計算コストのごく一部で、競争力のある忘れがちなトレードオフを達成する。
論文 参考訳(メタデータ) (2026-06-01T21:49:54Z) - Rethinking Machine Unlearning: Models Designed to Forget via Key Deletion [18.166109788922153]
モデルを直接訓練して、忘れることを支援する新しいパラダイムである、設計によるアンラーニングを提案する。
我々はこのアイデアを、モデルウェイトからインスタンス固有の記憶を分離するメモリ拡張トランスフォーマーであるKEY deletion (MUNKEY)を介して、Machine UNlearningでインスタンス化する。
その結果、設計によるアンラーニングは、予測性能を維持しながら、高速でデプロイ指向のアンラーニングを可能にすることが判明した。
論文 参考訳(メタデータ) (2026-03-16T09:33:29Z) - LLM Unlearning on Noisy Forget Sets: A Study of Incomplete, Rewritten, and Watermarked Data [69.5099112089508]
大規模言語モデル(LLM)は、顕著な生成能力を示すが、機密データを記憶することで倫理的およびセキュリティ上の懸念を引き起こす。
この研究は、ノイズのある忘れセットと呼ばれる、摂動的または低忠実な忘れデータの下での未学習に関する最初の研究を提示する。
コアセマンティック信号が保存されている場合、未学習は摂動に対して驚くほど堅牢である。
論文 参考訳(メタデータ) (2025-10-10T05:10:49Z) - Model Collapse Is Not a Bug but a Feature in Machine Unlearning for LLMs [54.167494079321465]
LLMの現在のアンラーニング方法は、それらを微調整データに組み込むことで、削除しようとしているプライベート情報に基づいて最適化されている。
本研究では,未学習目標を学習対象に含まない新しい非学習手法-部分的モデル崩壊(PMC)を提案する。
論文 参考訳(メタデータ) (2025-07-06T03:08:49Z) - FUNU: Boosting Machine Unlearning Efficiency by Filtering Unnecessary Unlearning [9.472692023087223]
本研究では不必要な未学習につながるデータポイントを同定するFUNUを提案する。
FUNUの理論的解析を行い,その有効性を検証するための広範囲な実験を行った。
論文 参考訳(メタデータ) (2025-01-28T01:19:07Z) - MUSE: Machine Unlearning Six-Way Evaluation for Language Models [109.76505405962783]
言語モデル(LM)は、プライベートおよび著作権のあるコンテンツを含む大量のテキストデータに基づいて訓練される。
総合的な機械学習評価ベンチマークであるMUSEを提案する。
人気のある8つのアンラーニングアルゴリズムがハリー・ポッターの本やニュース記事をいかに効果的に解き放つかをベンチマークする。
論文 参考訳(メタデータ) (2024-07-08T23:47:29Z) - Ethicist: Targeted Training Data Extraction Through Loss Smoothed Soft
Prompting and Calibrated Confidence Estimation [56.57532238195446]
本研究では,対象とするトレーニングデータ抽出のためのEthicistという手法を提案する。
メモリ化を誘発するため、モデルを固定しながらソフトなプロンプト埋め込みをチューニングする。
我々は,最近提案された公開ベンチマークにおいて,エティシストが抽出性能を著しく向上することを示す。
論文 参考訳(メタデータ) (2023-07-10T08:03:41Z) - Machine Unlearning of Features and Labels [72.81914952849334]
機械学習モデルにおけるアンラーニングとラベルのファーストシナリオを提案する。
提案手法は,影響関数の概念に基づいて,モデルパラメータのクローズドフォーム更新によるアンラーニングを実現する。
論文 参考訳(メタデータ) (2021-08-26T04:42:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。