論文の概要: The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning
- arxiv url: http://arxiv.org/abs/2608.14229v1
- Date: Fri, 14 Aug 2026 12:03:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.373065
- Title: The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning
- Title(参考訳): LLMアンラーニングのための適応的な人気度
- Abstract要約: AdaPopを提案する。このAdaPopは、各エポックの保持ペナルティを調整するデュアル・アセンティブ・コントローラを介して、リザーブ・アセット・バランスを自動化する。
3つのモデルファミリと2つのベンチマークで、AdaPopはパラフレーズクエリの競合メソッドよりも5倍少ないコンテントをリークし、逆の修正では1.6倍も少ない。
- 参考スコア(独自算出の注目度): 59.19460954480119
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Popular facts are memorised more deeply during pretraining and resist removal longer than rare ones, yet existing LLM unlearning methods apply uniform gradient pressure regardless of training-data frequency. We propose the AdaPop (Adaptive Popularity) method, which combines local token confidence with a per-fact popularity-dependent exponent derived from an external proxy (e.g., Wikidata sitelinks, LLM-as-Judge), and automates the forget-retain balance via a dual-ascent controller that adjusts the retain penalty each epoch. Across three model families and two benchmarks, AdaPop leaks ~5x less forgotten content than competing methods under paraphrased queries and ~1.6x less under adversarial reformulations. We support our analysis with internal metrics: under our method, forget-set hidden states move further from the pre-unlearning model's states than under other methods, while retain-set representations remain close.
- Abstract(参考訳): 従来のLLMアンラーニング法では、トレーニングデータ頻度に関わらず、均一な勾配圧力を適用している。
本稿では,AdaPop(Adaptive Popularity)手法を提案する。AdaPopは,外部プロキシ(Wikidata sitelinks, LLM-as-Judge)から派生したファクト当たりの人気依存指数と,各エポックの保持率を調整した2段階の制御器を用いて,レガシ保持バランスを自動化する手法である。
3つのモデルファミリと2つのベンチマークで、AdaPopはパラフレーズクエリの競合メソッドよりも約5倍少ないコンテントをリークし、敵の修正では約1.6倍少ない。
提案手法では,隠された状態が学習前のモデルの状態から他の手法よりも遠ざかっているのに対して,保持セットの表現は近いままである。
関連論文リスト
- PURGE: Projected Unlearning via Retain-Guided Erasure [5.069332646113575]
PURGEは、単純だが未発見の観測(継続学習(CL)と機械未学習(MU))に基づいて構築された機械学習アルゴリズムである。
CLは古いタスクを忘れずに新しいタスクを学習しようとします。MUは、反対方向に同じ根底にある緊張力を表す保持パフォーマンスを損なうことなく、特定のデータを消去しようとします。
PURGEは、MIA AUROCを0.5(理想)に近い精度で達成し、勾配上昇、KLユニフォーム、プライバシーユーティリティフロンティアのいくつかのベースラインを達成しながら、常に96%以上の精度を維持している。
論文 参考訳(メタデータ) (2026-06-02T15:53:01Z) - SHRED: Retain-Set-Free Unlearning via Self-Distillation with Logit Demotion [39.17638540496959]
SHRED (Self-distillation via High-surprisal-only Retain-free Entropy Demotion) は、キーインサイトに基づいて構築された、保持セットなしのアンラーニング手法である。
高情報トークンはモデルの記憶された知識に集中し、低情報トークンは一般的な言語能力を反映する。
SHREDは再学習攻撃やメンバシップ推論攻撃に対して堅牢であり、連続的なアンラーニングの実行が多数あった後も安定したユーティリティを維持している。
論文 参考訳(メタデータ) (2026-05-08T09:25:18Z) - PrivUn: Unveiling Latent Ripple Effects and Shallow Forgetting in Privacy Unlearning [21.354585495856345]
大規模言語モデル(LLM)は、トレーニング中に個人情報を記憶し、重大なプライバシー上の懸念を引き起こす。
機械学習は有望なソリューションとして登場したが、プライバシ攻撃に対する真の有効性はまだ不明だ。
論文 参考訳(メタデータ) (2026-04-23T21:01:53Z) - Anatomy of Unlearning: The Dual Impact of Fact Salience and Model Fine-Tuning [59.19460954480119]
忘れられた知識が事前学習や教師付き微調整に由来するかどうかを考察する。
実験の結果,事前学習モデルとSFTモデルは未学習に対して異なる反応を示した。
論文 参考訳(メタデータ) (2026-02-23T08:58:48Z) - Closing the Distribution Gap in Adversarial Training for LLMs [50.33186122381395]
LLMの対抗訓練は、敵に対する堅牢性を確実に改善する最も有望な方法の1つである。
現在の対人訓練アルゴリズムは、トレーニングセットにおける敵の損失を最小限に抑えるが、データ分布を不十分にカバーし、一見単純な攻撃の脆弱性をもたらすと我々は主張する。
そこで我々は,プロンプトと応答の真の結合分布を近似するために,DAT(Distributal Adversarial Training)を提案する。
論文 参考訳(メタデータ) (2026-02-16T22:34:52Z) - Diffusion Policies creating a Trust Region for Offline Reinforcement Learning [66.17291150498276]
本稿では,拡散信頼型Q-Learning (DTQL) という2つの政策アプローチを導入する。
DTQLは、トレーニングと推論の両方において反復的なデノレーションサンプリングの必要性を排除し、計算的に極めて効率的である。
DTQLは、D4RLベンチマークタスクの大部分において、他のメソッドよりも優れているだけでなく、トレーニングや推論速度の効率性も示すことができる。
論文 参考訳(メタデータ) (2024-05-30T05:04:33Z) - Alpaca against Vicuna: Using LLMs to Uncover Memorization of LLMs [61.04246774006429]
本稿では,攻撃者によるLSMエージェントを用いたブラックボックスプロンプト最適化手法を提案する。
ベースラインプレフィックス・サフィックス測定と比較すると,命令ベースのプロンプトは,トレーニングデータと23.7%のオーバラップで出力を生成する。
以上の結果から,命令調整モデルでは,ベースモデルと同等に事前学習データを公開することが可能であり,他のLSMが提案する命令を用いることで,新たな自動攻撃の道を開くことが可能であることが示唆された。
論文 参考訳(メタデータ) (2024-03-05T19:32:01Z) - To Copy Rather Than Memorize: A Vertical Learning Paradigm for Knowledge
Graph Completion [35.05965140700747]
我々は、より正確な予測のために、埋め込みモデルを拡張し、関連する事実のトリプルからターゲット情報を明示的にコピーできるようにする。
また、より効率的な最適化のための新しい相対距離ベース負サンプリング手法(ReD)を提案する。
論文 参考訳(メタデータ) (2023-05-23T14:53:20Z) - One-shot Federated Learning without Server-side Training [42.59845771101823]
クライアントとサーバ間の通信コストを削減する手段として,ワンショットのフェデレーション学習が人気を集めている。
既存のワンショットFL法のほとんどは知識蒸留に基づいているが、蒸留に基づくアプローチでは追加のトレーニングフェーズが必要であり、公開されているデータセットや生成された擬似サンプルに依存する。
本研究では,サーバサイドのトレーニングなしで,ローカルモデル上で1ラウンドのパラメータアグリゲーションを実行するという,新しいクロスサイロ設定について考察する。
論文 参考訳(メタデータ) (2022-04-26T01:45:37Z) - Voting-based Approaches For Differentially Private Federated Learning [87.2255217230752]
この研究はPapernotらによる非フェデレーションプライバシ学習の知識伝達にインスパイアされている。
我々は,各局所モデルから返されるデータラベル間で投票を行うことで,勾配を平均化する代わりに2つの新しいDPFLスキームを設計する。
我々のアプローチはDPFLの最先端技術に対するプライバシーとユーティリティのトレードオフを大幅に改善します。
論文 参考訳(メタデータ) (2020-10-09T23:55:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。