論文の概要: Eight Methods to Evaluate Robust Unlearning in LLMs
- arxiv url: http://arxiv.org/abs/2402.16835v1
- Date: Mon, 26 Feb 2024 18:57:37 GMT
- ステータス: 処理完了
- システム内更新日: 2024-02-28 19:33:15.542466
- Title: Eight Methods to Evaluate Robust Unlearning in LLMs
- Title(参考訳): LLMにおけるロバスト・アンラーニングの評価方法
- Authors: Aengus Lynch, Phillip Guo, Aidan Ewart, Stephen Casper, Dylan
Hadfield-Menell
- Abstract要約: まず、既存の未学習評価のテクニックと限界について調査する。
We apply a comprehensive tests for the robustness and competitiveness of unlearning in the "Who's Harry Potter" model。
- 参考スコア(独自算出の注目度): 9.916880146677851
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Machine unlearning can be useful for removing harmful capabilities and
memorized text from large language models (LLMs), but there are not yet
standardized methods for rigorously evaluating it. In this paper, we first
survey techniques and limitations of existing unlearning evaluations. Second,
we apply a comprehensive set of tests for the robustness and competitiveness of
unlearning in the "Who's Harry Potter" (WHP) model from Eldan and Russinovich
(2023). While WHP's unlearning generalizes well when evaluated with the
"Familiarity" metric from Eldan and Russinovich, we find i)
higher-than-baseline amounts of knowledge can reliably be extracted, ii) WHP
performs on par with the original model on Harry Potter Q&A tasks, iii) it
represents latent knowledge comparably to the original model, and iv) there is
collateral unlearning in related domains. Overall, our results highlight the
importance of comprehensive unlearning evaluation that avoids ad-hoc metrics.
- Abstract(参考訳): 機械学習は、大きな言語モデル(LLM)から有害な能力や記憶されたテキストを取り除くのに役立つが、それを厳格に評価する標準的な方法はまだ存在しない。
本稿では,既存の未学習評価の手法と限界を最初に調査する。
第2に,eldan and russinovich (2023) による "who's harry potter" (whp) モデルにおけるアンラーニングの堅牢性と競争力について,包括的なテストセットを適用する。
whpのアンラーニングは、eldanとrussinovichの"親密性"の指標で評価するとうまく一般化するが、
一 ベースライン以上の知識を確実に抽出することができる。
二 WHPは、ハリー・ポッターのQ&A作業の原型と同等の動作をする。
三 原案と相反する潜在知識を表現し、かつ、
四 関連領域に傍観的未学習があること。
総じて,アドホックなメトリクスを回避した総合的アンラーニング評価の重要性を強調する。
関連論文リスト
- Evaluating Generative Language Models in Information Extraction as Subjective Question Correction [49.729908337372436]
本稿では,新しい評価手法SQC-Scoreを提案する。
主観的質問訂正の原則に着想を得て,新しい評価手法SQC-Scoreを提案する。
3つの情報抽出タスクの結果から,SQC-Scoreは基準値よりもアノテータの方が好ましいことが示された。
論文 参考訳(メタデータ) (2024-04-04T15:36:53Z) - Machine Unlearning for Traditional Models and Large Language Models: A Short Survey [11.539080008361662]
機械学習は、データを削除し、ユーザーの要求に応じてモデルへの影響を減らすことを目的としている。
本稿では,従来のモデルとLarge Language Models(LLMs)の両方の非学習を分類し,検討する。
論文 参考訳(メタデータ) (2024-04-01T16:08:18Z) - Rethinking Machine Unlearning for Large Language Models [87.85043572895296]
大規模言語モデル(LLM)の領域における機械学習の研究
このイニシアチブは、望ましくないデータの影響(機密情報や違法情報など)と関連するモデル機能を排除することを目的としている。
論文 参考訳(メタデータ) (2024-02-13T20:51:58Z) - The Generative AI Paradox on Evaluation: What It Can Solve, It May Not
Evaluate [17.77014177096838]
本稿では,ジェネレーションタスクにおけるLarge Language Models (LLMs) が同等に評価できるという仮定を考察する。
質問応答(QA)における3つのLLMと1つのオープンソースLMの性能評価と,TriviaQAデータセットを用いた評価課題について述べる。
論文 参考訳(メタデータ) (2024-02-09T06:16:08Z) - F-Eval: Asssessing Fundamental Abilities with Refined Evaluation Methods [111.46455901113976]
F-Evalは、表現、常識、論理などの基本能力を評価するためのバイリンガル評価ベンチマークである。
参照不要な主観的タスクに対しては,APIモデルによるスコアの代替として,新たな評価手法を考案する。
論文 参考訳(メタデータ) (2024-01-26T13:55:32Z) - Active Transfer Learning for Efficient Video-Specific Human Pose
Estimation [16.415080031134366]
ヒューマン・ポース(HP)推定は幅広い応用のために活発に研究されている。
本稿では,アクティブラーニング(AL)とトランスファーラーニング(TL)を組み合わせて,HP推定器を個々のビデオ領域に効率よく適応させる手法を提案する。
論文 参考訳(メタデータ) (2023-11-08T21:56:29Z) - Improving Open Information Extraction with Large Language Models: A
Study on Demonstration Uncertainty [52.72790059506241]
オープン情報抽出(OIE)タスクは、構造化されていないテキストから構造化された事実を抽出することを目的としている。
一般的なタスク解決手段としてChatGPTのような大きな言語モデル(LLM)の可能性にもかかわらず、OIEタスクの最先端(教師付き)メソッドは遅れている。
論文 参考訳(メタデータ) (2023-09-07T01:35:24Z) - KoLA: Carefully Benchmarking World Knowledge of Large Language Models [56.672981891304005]
我々は知識指向LLMアセスメントベンチマーク(KoLA)を構築した。
能力モデリングでは、人間の認知を模倣して知識関連能力の4段階の分類を作成し、19ドルのタスクをカバーしている。
データには、LLMによって事前訓練されたコーパスであるウィキペディアと、継続的に収集される新興コーパスの両方を使用し、目に見えないデータを扱う能力と知識の進化を評価することを目的としています。
論文 参考訳(メタデータ) (2023-06-15T17:20:46Z) - Evaluating Machine Unlearning via Epistemic Uncertainty [78.27542864367821]
本研究では,不確実性に基づく機械学習アルゴリズムの評価を行う。
これは私たちの最良の知識の一般的な評価の最初の定義です。
論文 参考訳(メタデータ) (2022-08-23T09:37:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。