論文の概要: Leak-Resistant Unlearning: A New Benchmark for Evaluating Multi-Hop Reasoning Consistency and Recovery Robustness
- arxiv url: http://arxiv.org/abs/2608.04519v1
- Date: Wed, 05 Aug 2026 06:53:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.765252
- Title: Leak-Resistant Unlearning: A New Benchmark for Evaluating Multi-Hop Reasoning Consistency and Recovery Robustness
- Title(参考訳): Leak-Resistant Unlearning: マルチホップ推論一貫性とリカバリロバスト性を評価するための新しいベンチマーク
- Authors: Haoting Qian, Qingjie Zhang, Zhicong Huang, Cheng Hong, Han Qiu,
- Abstract要約: 機械のアンラーニング手法のベンチマークは、大きな言語モデル(LLM)からセンシティブな知識が取り除かれるかどうかを理解するために重要である。
多様な推論経路とリカバリ攻撃を横断する堅牢なLLM知識の除去を理解するために,アンラーニングを新しいベンチマークとして導入する。
- 参考スコア(独自算出の注目度): 9.988890658939471
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Benchmarking machine unlearning methods is critical to understand whether sensitive knowledge is removed from large language models (LLMs) or not. Current unlearning benchmarks include mainly single-hop questions and a narrow set of multi-hop questions. Although effective, they still face two challenges. (1) Knowledge is not isolated, whereby diverse multi-hop reasoning paths can potentially induce knowledge leakage than normal queries. (2) Unlearning may be fragile: unlearned knowledge can be partially recovered through recovery attacks such as lightweight post-unlearning adaptation, making static evaluation insufficient. Therefore, in this paper, we introduce \unlearning as a novel benchmark to understand robust LLM knowledge removal across diverse reasoning paths and recovery attacks. We experiment with this benchmark on 3 models, 6 unlearning methods, and 2 carefully curated datasets. Results show that existing methods are vulnerable to multi-hop reasoning paths and recovery attacks. We further explore the trade-off among forget quality, robustness, and model utility for LLM unlearning.
- Abstract(参考訳): 機械のアンラーニング手法のベンチマークは、大きな言語モデル(LLM)からセンシティブな知識が取り除かれるかどうかを理解するために重要である。
現在のアンラーニングベンチマークには、主にシングルホップの質問と、限定されたマルチホップの質問が含まれている。
効果はあるものの、2つの課題に直面している。
1) 知識は孤立せず, 多様なマルチホップ推論経路は, 通常のクエリよりも知識リークを引き起こす可能性がある。
2)未学習は脆弱である可能性があり,未学習後の軽度適応などの回復攻撃によって,未学習の知識を部分的に回復することができるため,静的評価は不十分である。
そこで,本稿では,多種多様な推論経路とリカバリ攻撃を横断する堅牢なLLM知識の除去を理解するための新しいベンチマークとして,Shaunlearningを紹介した。
我々はこのベンチマークを、3つのモデル、6つの未学習メソッド、2つの慎重にキュレートされたデータセットで実験した。
その結果,既存手法はマルチホップ推論パスやリカバリ攻撃に対して脆弱であることがわかった。
さらに,LLMアンラーニングにおける品質,堅牢性,モデルユーティリティのトレードオフについて検討する。
関連論文リスト
- Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning [58.725080160369494]
Distinguishable Deletion (mathrmD2$)は、特定のトークンではなく、潜在表現の応答分布を制限するパラダイムである。
本稿では,知識の存在と未学習コンテンツと保持コンテンツとの分離を定量化するエネルギー指標を提案する。
実験の結果、EUAは以前の方法よりも大幅に優れており、$mathrmD2$の優位性を示している。
論文 参考訳(メタデータ) (2026-05-16T03:15:35Z) - Before Forgetting, Learn to Remember: Revisiting Foundational Learning Failures in LVLM Unlearning Benchmarks [17.78493115982036]
LVLM(Large Vision-Language Models)は、機密性の高い個人情報を意図せずに記憶することで、プライバシー上のリスクを引き起こす。
信頼性の高いマルチホップおよびマルチイメージ記憶ベンチマークであるReMemを紹介する。
我々はReMemがLVLMの学習行動と未学習行動の両方を診断するための厳格で信頼性の高いフレームワークを提供することを示した。
論文 参考訳(メタデータ) (2026-05-05T13:42:31Z) - The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning [54.67958855362658]
複雑な構造化クエリを用いたアンラーニングテストを強調する動的フレームワークを提案する。
提案手法はまず,対象モデル(事前学習)から知識を抽出し,単純なクエリからマルチホップチェーンまで,対象プローブを構築する。
本フレームワークは,テストセットを手作業で構築することなく,非学習手法の実用的でスケーラブルな評価を可能にする。
論文 参考訳(メタデータ) (2026-03-11T19:51:33Z) - Understanding the Dilemma of Unlearning for Large Language Models [50.54260066313032]
Unlearningは、大きな言語モデル(LLM)から特定の知識を取り除こうとしている。
提案するunPactは,帰納的帰属とコントリビューショントラッキングによるアンラーニングのための解釈可能なフレームワークである。
論文 参考訳(メタデータ) (2025-09-29T12:15:19Z) - KBM: Delineating Knowledge Boundary for Adaptive Retrieval in Large Language Models [69.99274367773997]
大規模言語モデル(LLM)は知識を動的に変化させ、未知の静的情報を扱うのにしばしば苦労する。
Retrieval-Augmented Generation (RAG) はこれらの課題に対処するために使われ、LLMの性能向上に大きな影響を与えている。
本稿では,ある質問の既知/未知を表現し,RAGを起動する必要があるかどうかを判断するための知識境界モデル(KBM)を提案する。
論文 参考訳(メタデータ) (2024-11-09T15:12:28Z) - Breaking Chains: Unraveling the Links in Multi-Hop Knowledge Unlearning [38.03304773600225]
大きな言語モデル(LLM)は、しばしば個人または著作権のあるデータを含む巨大な情報ストアとして機能し、それらをゼロから再トレーニングすることは不可能である。
MUNCHは、マルチホップクエリをサブクエストに分解し、最終的な意思決定における未学習モデルの不確実性を活用する、単純な不確実性に基づくアプローチである。
論文 参考訳(メタデータ) (2024-10-17T07:00:15Z) - Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models [19.015202590038996]
我々は、未学習モデルを攻撃する動的かつ自動化されたフレームワークであるDynamic Unlearning Attack (DUA)を設計する。
学習過程の堅牢性を効果的に向上する普遍的な枠組みであるLatent Adrial Unlearning (LAU)を提案する。
LAUは学習効率を53.5%以上改善し、近隣の知識の11.6%以下に減らし、モデルの一般的な能力にはほとんど影響を与えないことを示した。
論文 参考訳(メタデータ) (2024-08-20T09:36:04Z) - Towards Effective Evaluations and Comparisons for LLM Unlearning Methods [97.2995389188179]
本稿では,大規模言語モデルにおける機械学習評価の精度向上を図る。
評価指標の堅牢性と、競合する目標間のトレードオフという、2つの重要な課題に対処します。
論文 参考訳(メタデータ) (2024-06-13T14:41:00Z) - ReST meets ReAct: Self-Improvement for Multi-Step Reasoning LLM Agent [50.508669199496474]
外部知識に基づいて推論と行動を行うReAct-style LLMエージェントを開発した。
エージェントをReSTライクな手法で改良し,従来の軌道上で反復的に訓練する。
引き起こされた大きなモデルから始まり、アルゴリズムのたった2イテレーションの後に、微調整された小さなモデルを生成することができる。
論文 参考訳(メタデータ) (2023-12-15T18:20:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。