論文の概要: Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning
- arxiv url: http://arxiv.org/abs/2605.08765v1
- Date: Sat, 09 May 2026 07:50:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.872908
- Title: Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning
- Title(参考訳): 学習者が嘘をつく:LLMの学習における誠実さの評価と改善
- Abstract要約: 大規模言語モデル(LLM)におけるアンラーニングは、全体的なユーティリティを保ちながら有害なトレーニングデータを削除することを目的としている。
既存の方法は、しばしば幻覚、異常なトークン配列の生成、不整合な振る舞い、安全と信頼の懸念を高める。
本稿では,保持された知識に対する実用性と誠実さの両立を含む,非学習的誠実さの形式的定義を提案する。
- 参考スコア(独自算出の注目度): 19.83087496179494
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Unlearning in large language models (LLMs) aims to remove harmful training data while preserving overall utility. However, we find that existing methods often hallucinate, generate abnormal token sequences, or behave inconsistently, raising safety and trust concerns. According to prior literature on LLM honesty, such behaviors are often associated with dishonesty. This motivates us to investigate the notion of honesty in the context of model unlearning. We propose a formal definition of unlearning honesty, which includes: (1) preserving both utility and honesty on retained knowledge, and (2) ensuring effective forgetting while encouraging the model to acknowledge its limitations and respond consistently to questions related to forgotten knowledge. To systematically evaluate the honesty of unlearning, we introduce a suite of metrics that cover utility, honesty on the retained set, effectiveness of forgetting, rejection rate and refusal stability in Q&A and MCQ settings. Evaluating 9 methods across 3 mainstream families shows that all current methods fail to meet these standards. After experimental and theoretical analyses, we present ReVa, a representation-alignment procedure that fine-tunes feature-randomized unlearned models to better acknowledge forgotten knowledge. On Q&A tasks from the forget set, ReVa achieves the highest rejection rate after two rounds of interaction, nearly doubling the performance of the second-best method. Remarkably, It also improves honesty on the retained set. We release our data and code at https://github.com/renjiegu.
- Abstract(参考訳): 大規模言語モデル(LLM)におけるアンラーニングは、全体的なユーティリティを保ちながら有害なトレーニングデータを削除することを目的としている。
しかし、既存の方法では、しばしば幻覚や異常なトークン配列を発生させるか、矛盾なく振る舞うことがあり、安全性と信頼の懸念が高まる。
LLMの誠実さに関する以前の文献によると、このような行動は不当さと関連付けられていることが多い。
このことは、モデルアンラーニングの文脈における誠実さの概念を調査する動機となっている。
本研究では,(1)保持知識の実用性と誠実性の両方を維持すること,(2)モデルに限界を認識し,忘れられた知識に関連する質問に一貫して応答するように促しながら,効果的な忘れを確実にすること,を含む,非学習的誠実性の形式的定義を提案する。
未学習の誠実さを体系的に評価するために, 有効性, 維持された集合に対する誠実さ, 忘れることの有効性, 拒絶率, およびQ&AおよびMCQ設定における拒絶安定性を網羅する一連の指標を導入する。
3つの主流ファミリーで9つのメソッドを評価することは、現在のすべてのメソッドがこれらの標準を満たしていないことを示している。
実験および理論的解析の後、忘れられた知識をよりよく認識するために、微調整された特徴ランダム化未学習モデルを表現調整するReVaを提案する。
ディザップセットからのQ&Aタスクでは、ReVaは2ラウンドのインタラクションの後、最も高い拒絶率を達成し、第2のベストメソッドのパフォーマンスをほぼ2倍にします。
注目すべきは、保持されたセットの誠実性も向上することです。
データとコードはhttps://github.com/renjiegu.comで公開しています。
関連論文リスト
- Forget Narrowly, Retain Broadly: Unlearning as an Asymmetric Generalization Problem [16.147107064302435]
本研究では,現実のファクト・ドメインの無視保持構造をキャプチャするプロトコルと学習コーパスを開発する。
JensUn++は,3つのLLM間での最高の忘れがちなユーティリティトレードオフを実現する未学習アルゴリズムである。
論文 参考訳(メタデータ) (2026-07-10T09:31:29Z) - Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning [58.725080160369494]
Distinguishable Deletion (mathrmD2$)は、特定のトークンではなく、潜在表現の応答分布を制限するパラダイムである。
本稿では,知識の存在と未学習コンテンツと保持コンテンツとの分離を定量化するエネルギー指標を提案する。
実験の結果、EUAは以前の方法よりも大幅に優れており、$mathrmD2$の優位性を示している。
論文 参考訳(メタデータ) (2026-05-16T03:15:35Z) - SHRED: Retain-Set-Free Unlearning via Self-Distillation with Logit Demotion [39.17638540496959]
SHRED (Self-distillation via High-surprisal-only Retain-free Entropy Demotion) は、キーインサイトに基づいて構築された、保持セットなしのアンラーニング手法である。
高情報トークンはモデルの記憶された知識に集中し、低情報トークンは一般的な言語能力を反映する。
SHREDは再学習攻撃やメンバシップ推論攻撃に対して堅牢であり、連続的なアンラーニングの実行が多数あった後も安定したユーティリティを維持している。
論文 参考訳(メタデータ) (2026-05-08T09:25:18Z) - REBEL: Hidden Knowledge Recovery via Evolutionary-Based Evaluation Loop [11.291998503454854]
LLMの機械学習は、訓練されたモデルから機密データや著作権データを除去することを目的としている。
標準的な評価基準は、真の知識の除去のために表面的な情報抑圧を間違えることの多い良心的なクエリに依存している。
本稿では,未学習データの復元がまだ可能であるかどうかを調査するために設計された,敵対的プロンプト生成のための進化的アプローチであるREBELを紹介する。
論文 参考訳(メタデータ) (2026-02-05T22:54:56Z) - Leak@$k$: Unlearning Does Not Make LLMs Forget Under Probabilistic Decoding [18.830386174815583]
我々は,既存の未学習手法のほとんどすべてが,実際には真の忘れを達成できないことを示す。
textttleak@$k$は、忘れられた知識が再び現れる可能性を定量化する新しいメタ評価指標である。
論文 参考訳(メタデータ) (2025-11-07T02:30:05Z) - Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations [103.16279860448874]
新たな二分探索強化報酬(RAR)を用いたオンライン強化学習手法を提案する。
オープンエンド世代では、バイナリRARは幻覚率を39.3%減少させる。
短い形式の質問応答では、モデルは、パラメトリック知識の不足に直面した時に、戦略的に"I don't know"を出力して、控えめに学習する。
論文 参考訳(メタデータ) (2025-10-20T16:45:43Z) - Forget to Know, Remember to Use: Context-Aware Unlearning for Large Language Models [17.249936460923045]
大規模な言語モデルは、機密情報や削除が必要な時代遅れの知識を符号化することができる。
Unlearningは、モデルユーティリティ全体を保持しながら、特定の知識を削除することを目的とした、完全なリトレーニングの効率的な代替手段である。
論文 参考訳(メタデータ) (2025-10-20T15:03:45Z) - Unlearning That Lasts: Utility-Preserving, Robust, and Almost Irreversible Forgetting in LLMs [31.768387661474904]
大規模言語モデル(LLM)におけるアンラーニングでは、事前訓練されたモデルから特定の情報を正確に除去する。
これは、事前訓練中に取得した個人データや有害な知識を削除することで、LLMの安全性を確保するために重要である。
JensUnを導入し、Jensen-Shannon Divergenceをセットを忘れたり、保持したりするためのトレーニングの目的として活用する。
大規模な実験では、JensUnは競合するメソッドよりも忘れやすいトレードオフを実現し、再学習に強いレジリエンスを示しています。
論文 参考訳(メタデータ) (2025-09-02T20:38:53Z) - Existing Large Language Model Unlearning Evaluations Are Inconclusive [105.55899615056573]
いくつかの評価では、モデルにかなりの新しい情報を導入し、真の未学習のパフォーマンスを隠蔽する可能性があることを示す。
評価結果はタスクによって大きく異なることを示し、現在の評価ルーチンの一般化性を損なうことを示した。
今後の未学習評価には,情報注入の最小化とタスク認識のダウンストリームという2つの原則を提案する。
論文 参考訳(メタデータ) (2025-05-31T19:43:00Z) - Unlearning vs. Obfuscation: Are We Truly Removing Knowledge? [20.952703558942453]
難読化と難読化を正式に区別し,探索に基づく評価フレームワークを導入する。
自動生成された複数質問に対するモデル予測分布をフラット化する新しい未学習手法であるDF-MCQを提案する。
実験の結果,DF-MCQは90%以上の拒絶率とランダムな選択レベルの不確実性で未学習を実現することがわかった。
論文 参考訳(メタデータ) (2025-05-05T14:21:08Z) - Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models [81.62767292169225]
我々は,その一般化に着目して,大規模言語モデルにおける知識の忘れについて検討する。
確率摂動に基づく新しいアンラーニングパラダイムであるPerMUを提案する。
TOFU、Harry Potter、ZsRE、WMDP、MUSEなど、さまざまなデータセットで実験が行われている。
論文 参考訳(メタデータ) (2025-02-27T11:03:33Z) - Towards Effective Evaluations and Comparisons for LLM Unlearning Methods [97.2995389188179]
本稿では,大規模言語モデルにおける機械学習評価の精度向上を図る。
評価指標の堅牢性と、競合する目標間のトレードオフという、2つの重要な課題に対処します。
論文 参考訳(メタデータ) (2024-06-13T14:41:00Z) - Alignment for Honesty [105.72465407518325]
最近の研究は、大きな言語モデル(LLM)を有用性と無害性と整合させることに大きく貢献している。
本稿は,LLMが知識の欠如に積極的に回答を拒むことを確実にする,エンフォネストリーにおけるアライメントの重要性を論じる。
これらの課題に対処するために、まずは正確な問題定義を確立し、儒教の分析に触発された「誠実さ」を定義します。
論文 参考訳(メタデータ) (2023-12-12T06:10:42Z) - Improving the Reliability of Large Language Models by Leveraging
Uncertainty-Aware In-Context Learning [76.98542249776257]
大規模言語モデルはしばしば「ハロシン化」の課題に直面している
本研究では,不確実性に応答してモデルが出力を拡張あるいは拒否することを可能にする,不確実性を考慮したコンテキスト内学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-07T12:06:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。