論文の概要: Stress Testing Unlearning Algorithms
- arxiv url: http://arxiv.org/abs/2608.22527v2
- Date: Tue, 01 Sep 2026 15:56:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.438023
- Title: Stress Testing Unlearning Algorithms
- Title(参考訳): ストレステストアンラーニングアルゴリズム
- Authors: Noam Diamant, Neta Glazer, Ethan Fetaya,
- Abstract要約: 大規模言語モデル(LLM)では、入力と出力のあいまいさのため、アンラーニングは難しい。
WMDP++はWMDPの拡張であり、未学習情報のターゲット外付けと境界問題に対する体系的評価を取り入れている。
- 参考スコア(独自算出の注目度): 10.510226262026755
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recently, machine unlearning, the removal of specific training data influence from a model, has gained increasing attention. In large language models (LLMs), unlearning is particularly challenging due to the ambiguity of inputs and outputs. Con- sequently, rigorous evaluation is critical for assessing both safety and utility, and for driving progress in unlearning meth- ods. We identify two key shortcomings in existing unlearning benchmarks: (1) they do not actively test whether unlearned information can still be forcibly extracted, and (2) they fail to evaluate performance preservation on boundary questions, be- nign queries that are semantically close to the unlearned con- tent. Here we introduce WMDP++, an extension of WMDP that addresses these gaps by incorporating targeted extrac- tion of unlearned information and systematic evaluation on boundary questions. WMDP++ provides a more stringent and informative benchmark for evaluating unlearning in LLMs.
- Abstract(参考訳): 近年,モデルから特定のトレーニングデータの影響を除去する機械学習が注目されている。
大規模言語モデル(LLM)では、入力と出力のあいまいさのため、アンラーニングは特に困難である。
同時に、厳密な評価は、安全性と実用性の両方を評価し、未学習のメスの進歩を促進するために重要である。
既存のアンラーニングベンチマークでは,(1)未学習情報を強制的に抽出できるかどうかを積極的に検証せず,(2)未学習のコンテントにセマンティックに近接する良質なクエリに対して,境界問題の性能保存を評価できない,という2つの欠点が指摘されている。
ここではWMDP++を紹介する。WMDPの拡張は、未学習情報のターゲット外付けと境界問題に対する体系的評価を組み込むことにより、これらのギャップに対処するものである。
WMDP++は、LLMにおける未学習を評価するために、より厳密で情報的なベンチマークを提供する。
関連論文リスト
- OpenUnlearning: Accelerating LLM Unlearning via Unified Benchmarking of Methods and Metrics [82.0813150432867]
我々は,大規模言語モデル(LLM)のアンラーニング手法とメトリクスをベンチマークするための標準フレームワークであるOpenUnlearningを紹介する。
OpenUnlearningは、13のアンラーニングアルゴリズムと16のさまざまな評価を3つの主要なベンチマークで統合する。
また、多様なアンラーニング手法をベンチマークし、広範囲な評価スイートとの比較分析を行う。
論文 参考訳(メタデータ) (2025-06-14T20:16:37Z) - Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset [92.99416966226724]
我々は、未学習アルゴリズムの有効性を頑健に評価するために設計された新しいVLMアンラーニングベンチマークであるFacial Identity Unlearning Benchmark (FIUBench)を紹介する。
情報ソースとその露出レベルを正確に制御する2段階評価パイプラインを適用した。
FIUBench 内の 4 つのベースライン VLM アンラーニングアルゴリズムの評価により,すべての手法がアンラーニング性能に制限されていることが明らかとなった。
論文 参考訳(メタデータ) (2024-11-05T23:26:10Z) - A Closer Look at Machine Unlearning for Large Language Models [46.245404272612795]
大型言語モデル(LLM)は機密または著作権のあるコンテンツを記憶し、プライバシーと法的懸念を高める。
LLMの機械学習におけるいくつかの問題について議論し、可能なアプローチについての洞察を提供する。
論文 参考訳(メタデータ) (2024-10-10T16:56:05Z) - Towards Effective Evaluations and Comparisons for LLM Unlearning Methods [97.2995389188179]
本稿では,大規模言語モデルにおける機械学習評価の精度向上を図る。
評価指標の堅牢性と、競合する目標間のトレードオフという、2つの重要な課題に対処します。
論文 参考訳(メタデータ) (2024-06-13T14:41:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。