論文の概要: Forget Narrowly, Retain Broadly: Unlearning as an Asymmetric Generalization Problem
- arxiv url: http://arxiv.org/abs/2607.09236v1
- Date: Fri, 10 Jul 2026 09:31:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.816817
- Title: Forget Narrowly, Retain Broadly: Unlearning as an Asymmetric Generalization Problem
- Title(参考訳): 狭義に、広義に維持する:非対称な一般化問題としてのアンラーニング
- Abstract要約: 本研究では,現実のファクト・ドメインの無視保持構造をキャプチャするプロトコルと学習コーパスを開発する。
JensUn++は,3つのLLM間での最高の忘れがちなユーティリティトレードオフを実現する未学習アルゴリズムである。
- 参考スコア(独自算出の注目度): 16.147107064302435
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Machine unlearning in LLMs is the targeted removal of specific knowledge while preserving all other capabilities, critical for privacy and safety. Yet existing benchmarks measure it unreliably. They miss knowledge that resurfaces under paraphrased or indirect queries, a failure we call under-forgetting, and lack the semantic, syntactic, and lexical probes needed to verify that unrelated knowledge is preserved, a failure we call over-forgetting. Both failures reflect an asymmetric generalization problem. Forget evaluation must cover diverse query formulations of the same target facts, testing whether forgetting holds beyond exact training prompts. Retain evaluation must probe a far larger and implicitly defined set, namely every fact disjoint from the forget target. The retain set thus defines the effective forget set, yet current datasets provide no fine-grained annotation of this forget-retain boundary. We address this with SUITE, an evaluation protocol and training corpus that captures forget-retain structure for real-world factual domains. Methods trained on SUITE improve substantially, showing that training data is as important as algorithmic design. Building on the obtained insights, we introduce JensUn++, an unlearning algorithm that achieves the best forget-retain utility trade-off across three LLMs, in both sequential and joint unlearning settings. Code and datasets are available at https://amitpeleg.github.io/forget-narrowly-retain-broadly
- Abstract(参考訳): LLMにおける機械学習は、プライバシと安全性に不可欠な他のすべての機能を保ちながら、特定の知識を標的に除去することである。
しかし、既存のベンチマークでは信頼性が低い。
彼らは、パラフレーズまたは間接的なクエリの下で再浮上する知識、下鍛造と呼ばれる失敗、無関係な知識が保存されていることを検証するのに必要な意味論的、構文的、語彙的プローブが欠如していること、過剰鍛造(over-forgetting)と呼ばれる失敗を見逃している。
どちらの失敗も非対称な一般化問題を反映している。
ターゲット評価は、同じターゲットの事実の様々なクエリ定式化をカバーし、正確にトレーニングのプロンプトを越えて、忘れることが成り立つかどうかをテストする必要がある。
保持評価は、はるかに大きく暗黙的に定義された集合、すなわち、すべての事実が忘れられたターゲットから切り離されていることを調査しなければならない。
これにより、retain セットは有効な forget セットを定義するが、現在のデータセットはこの forget-retain 境界の細かいアノテーションを提供しない。
本研究は,実世界の実世界の実世界領域の忘れがちな構造をキャプチャする評価プロトコルであるSUITEを用いて,この問題に対処する。
SUITEで訓練された手法は大幅に改善され、トレーニングデータがアルゴリズム設計と同じくらい重要であることが示された。
得られた知見に基づいて、逐次的および共同的なアンラーニング設定において、3つのLLM間で最高の忘れられるユーティリティトレードオフを実現する、未学習アルゴリズムであるJensUn++を紹介した。
コードとデータセットはhttps://amitpeleg.github.io/forget-narrowly-retain-broadlyで入手できる。
関連論文リスト
- Confess What You Know: Forget-Set Misalignment with Model Knowledge in LLM Unlearning [9.140696856930457]
このギャップを忘れセットの誤認識と呼び,2つの症例を同定する。
アンラーニングでは、忘れられたセットは記憶された情報を省略し、リークは継続する。
Out-of-Knowledge Unlearningでは、アルゴリズムは学習したことのない知識を“忘れる”ように駆動され、パラメータを摂動させ、ユーティリティを劣化させる。
本稿では,モデルが記憶した知識を抽出し,形式化し,モデルに整合した左折集合を構成するデータブラインドフレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-01T02:47:43Z) - PreUnlearn: Auditing Collateral Knowledge Damage Before Large Language Model Unlearning [12.982098269346773]
データ中心の観点から,大規模言語モデルの機械学習について検討する。
我々は一貫した崩壊パターンを見いだす: 横方向の損傷は、忘れられた集合の近くで最強であり、意味的な距離で弱まるが、ドメイン境界で消えることはない。
我々は,学習前予測タスクとして忘れセット監査を定式化し,下流の損傷を最も予測するデータの特徴を分析した。
論文 参考訳(メタデータ) (2026-06-16T20:32:11Z) - How Hard Can It Be? Hardness-Aware Multi-Objective Unlearning [75.97729821186815]
機械学習は、プライバシー、著作権、バイアスの懸念による特定の忘れられたトレーニングデータの影響を取り除くことを目的としている。
我々は,品質の特定の改善を保証することを目的として,未学習のアルゴリズムを導出する。
私たちの硬度測定は、ユーティリティの劣化が避けられない場合にユーザーに通知します。
論文 参考訳(メタデータ) (2026-06-01T11:49:47Z) - Measuring the Depth of LLM Unlearning via Activation Patching [3.590648050085134]
大規模言語モデル(LLM)のアンラーニングは、プライバシ保護とAI安全性にとって重要なポストホックメカニズムとして登場した。
既存の出力レベルのメトリクスは、この知識が内部表現から回復可能であることを検出できない。
本研究では,アクティベーションパッチによるアンラーニングの力学深さを定量化する指標として,Unlearning Depth Score (UDS)を提案する。
論文 参考訳(メタデータ) (2026-05-23T14:52:28Z) - Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning [19.83087496179494]
大規模言語モデル(LLM)におけるアンラーニングは、全体的なユーティリティを保ちながら有害なトレーニングデータを削除することを目的としている。
既存の方法は、しばしば幻覚、異常なトークン配列の生成、不整合な振る舞い、安全と信頼の懸念を高める。
本稿では,保持された知識に対する実用性と誠実さの両立を含む,非学習的誠実さの形式的定義を提案する。
論文 参考訳(メタデータ) (2026-05-09T07:50:27Z) - SHRED: Retain-Set-Free Unlearning via Self-Distillation with Logit Demotion [39.17638540496959]
SHRED (Self-distillation via High-surprisal-only Retain-free Entropy Demotion) は、キーインサイトに基づいて構築された、保持セットなしのアンラーニング手法である。
高情報トークンはモデルの記憶された知識に集中し、低情報トークンは一般的な言語能力を反映する。
SHREDは再学習攻撃やメンバシップ推論攻撃に対して堅牢であり、連続的なアンラーニングの実行が多数あった後も安定したユーティリティを維持している。
論文 参考訳(メタデータ) (2026-05-08T09:25:18Z) - LLM Unlearning on Noisy Forget Sets: A Study of Incomplete, Rewritten, and Watermarked Data [69.5099112089508]
大規模言語モデル(LLM)は、顕著な生成能力を示すが、機密データを記憶することで倫理的およびセキュリティ上の懸念を引き起こす。
この研究は、ノイズのある忘れセットと呼ばれる、摂動的または低忠実な忘れデータの下での未学習に関する最初の研究を提示する。
コアセマンティック信号が保存されている場合、未学習は摂動に対して驚くほど堅牢である。
論文 参考訳(メタデータ) (2025-10-10T05:10:49Z) - Maximally-Informative Retrieval for State Space Model Generation [59.954191072042526]
テスト時に特定のクエリに対するモデル不確実性を最小化するために、Retrieval In-Context Optimization (RICO)を導入する。
文書検索に外部に依存した従来の検索強化生成(RAG)とは異なり,本手法はモデルから直接のフィードバックを利用する。
モデル勾配を用いた標準のトップ$kの検索は、最適化手順を近似し、残余損失への接続を提供することを示す。
論文 参考訳(メタデータ) (2025-06-13T18:08:54Z) - BLUR: A Bi-Level Optimization Approach for LLM Unlearning [100.90394814817965]
未学習問題の階層構造をモデル化することが重要であると論じる。
本稿では,より優れた性能を実現する新しいアルゴリズムであるBi-Level UnleaRning(textttBLUR)を提案する。
論文 参考訳(メタデータ) (2025-06-09T19:23:05Z) - GUARD: Generation-time LLM Unlearning via Adaptive Restriction and Detection [36.38245533018162]
大規模言語モデル(LLM)は、多様なドメインにまたがる膨大な知識を記憶する強力な能力を示している。
既存の未学習の取り組みは、通常、モデルを忘れデータ、データ保持、キャリブレーションモデルといったリソースで微調整する。
本稿では,LLM生成時の動的アンラーニングを実現するフレームワークであるAdaptive Restriction and Detection (GUARD) による生成時アンラーニングを提案する。
論文 参考訳(メタデータ) (2025-05-19T16:26:58Z) - Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models [81.62767292169225]
我々は,その一般化に着目して,大規模言語モデルにおける知識の忘れについて検討する。
確率摂動に基づく新しいアンラーニングパラダイムであるPerMUを提案する。
TOFU、Harry Potter、ZsRE、WMDP、MUSEなど、さまざまなデータセットで実験が行われている。
論文 参考訳(メタデータ) (2025-02-27T11:03:33Z) - MUSE: Machine Unlearning Six-Way Evaluation for Language Models [109.76505405962783]
言語モデル(LM)は、プライベートおよび著作権のあるコンテンツを含む大量のテキストデータに基づいて訓練される。
総合的な機械学習評価ベンチマークであるMUSEを提案する。
人気のある8つのアンラーニングアルゴリズムがハリー・ポッターの本やニュース記事をいかに効果的に解き放つかをベンチマークする。
論文 参考訳(メタデータ) (2024-07-08T23:47:29Z) - TOFU: A Task of Fictitious Unlearning for LLMs [99.92305790945507]
Webからの大量のコーパスに基づいてトレーニングされた大規模な言語モデルは、法的および倫理的懸念を提起する機密データやプライベートデータを再現することができる。
トレーニングデータに存在する情報を忘れるためにモデルをチューニングするアンラーニングは、トレーニング後のプライベートデータを保護する手段を提供する。
未学習の理解を深めるためのベンチマークであるTOFUを紹介する。
論文 参考訳(メタデータ) (2024-01-11T18:57:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。