論文の概要: Efficient machine unlearning with minimax optimality
- arxiv url: http://arxiv.org/abs/2604.05669v1
- Date: Tue, 07 Apr 2026 10:09:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.759156
- Title: Efficient machine unlearning with minimax optimality
- Title(参考訳): 最小限最適性を用いた効率的な機械学習
- Abstract要約: 機械学習は、完全な再トレーニングのコストを伴わずに、特定のデータサブセットの影響を排除することを目的としている。
汎用的な損失関数と理論的保証を備えた機械学習のための統計的枠組みを提案する。
その結果, 推定誤差は, オーラル項に分解され, 未学習コストは, 忘れ率と忘れモデルバイアスによって決定されることがわかった。
- 参考スコア(独自算出の注目度): 23.988995429722383
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: There is a growing demand for efficient data removal to comply with regulations like the GDPR and to mitigate the influence of biased or corrupted data. This has motivated the field of machine unlearning, which aims to eliminate the influence of specific data subsets without the cost of full retraining. In this work, we propose a statistical framework for machine unlearning with generic loss functions and establish theoretical guarantees. For squared loss, especially, we develop Unlearning Least Squares (ULS) and establish its minimax optimality for estimating the model parameter of remaining data when only the pre-trained estimator, forget samples, and a small subsample of the remaining data are available. Our results reveal that the estimation error decomposes into an oracle term and an unlearning cost determined by the forget proportion and the forget model bias. We further establish asymptotically valid inference procedures without requiring full retraining. Numerical experiments and real-data applications demonstrate that the proposed method achieves performance close to retraining while requiring substantially less data access.
- Abstract(参考訳): GDPRなどの規制を遵守し、バイアスや破損したデータの影響を軽減するために、効率的なデータ削除を求める声が高まっている。
これは機械学習の分野を動機付けており、これは完全な再トレーニングのコストを伴わずに、特定のデータサブセットの影響を排除することを目的としている。
本研究では,一般的な損失関数を持つ機械学習の統計的枠組みを提案し,理論的保証を確立する。
特に2乗損失に対して、未学習最小広場(ULS)を開発し、事前学習した推定器、サンプルを忘れ、残余データの小さなサブサンプルが利用可能である場合に、残余データのモデルパラメータを推定するための最小限の最適性を確立する。
その結果, 推定誤差は, オーラル項に分解され, 未学習コストは, 忘れ率と忘れモデルバイアスによって決定されることがわかった。
さらに、完全再トレーニングを必要とせず、漸近的に有効な推論手順を確立する。
数値実験と実データ応用により,提案手法はデータアクセスを大幅に削減しつつ,再学習に近い性能を実現することを示した。
関連論文リスト
- Can Small Training Runs Reliably Guide Data Curation? Rethinking Proxy-Model Practice [109.9635246405237]
データ品質に関する実験結果が、ハイパーパラメータのトレーニングに微調整を加えることで、反転できることを示す。
評価プロトコルに簡単なパッチを導入し、プロキシモデルのトレーニングに学習率を削減した。
実験により,データキュレーションの4つの重要な次元をカバーする23種類のデータレシピに対して,このアプローチを検証した。
論文 参考訳(メタデータ) (2025-12-30T23:02:44Z) - Density-Aware Farthest Point Sampling [2.9434930072968584]
本稿では,新しいサンプリング手法であるDA-FPS(Density-Aware Farthest Point Smpling)を紹介する。
DA-FPSは重み付き充填距離をデータ駆動で推定するための近似最小値を提供する。
その結果, DA-FPSは, 他のサンプリング手法と比較して平均絶対誤差を著しく低減することがわかった。
論文 参考訳(メタデータ) (2025-09-16T16:19:14Z) - When to Forget? Complexity Trade-offs in Machine Unlearning [23.507879460531264]
Machine Unlearning(MU)は、トレーニングされたモデルから特定のデータポイントの影響を取り除くことを目的としている。
本研究では,非学習手法の効率を解析し,この問題に対するミニマックス時間における第1の上限値と第2の上限値の設定を行う。
未学習度比の位相図 – 最高の未学習手法の計算コストと完全なモデル再学習を比較する新しいメトリクスを提供する。
論文 参考訳(メタデータ) (2025-02-24T16:56:27Z) - DUPRE: Data Utility Prediction for Efficient Data Valuation [49.60564885180563]
Data Shapleyのような協調ゲーム理論に基づくデータ評価では、データユーティリティを評価し、複数のデータサブセットに対してMLモデルを再トレーニングする必要がある。
我々のフレームワークである textttDUPRE は、モデル再学習による評価ではなく、データユーティリティを予測することによって、サブセット評価当たりのコストを削減できる代替手法を採用しています。
具体的には、いくつかのデータサブセットのデータユーティリティを評価すると、textttDUPREは、他のすべてのデータサブセットの有用性を予測するために、emphGaussianプロセス(GP)回帰モデルに適合する。
論文 参考訳(メタデータ) (2025-02-22T08:53:39Z) - Pseudo-Probability Unlearning: Towards Efficient and Privacy-Preserving Machine Unlearning [59.29849532966454]
本稿では,PseudoProbability Unlearning (PPU)を提案する。
提案手法は,最先端の手法に比べて20%以上の誤りを忘れる改善を実現している。
論文 参考訳(メタデータ) (2024-11-04T21:27:06Z) - Hessian-Free Online Certified Unlearning [8.875278412741695]
ほぼ瞬時にデータを除去するオンライン・アンラーニングアルゴリズムを開発した。
提案手法は,非学習および一般化保証の観点から,最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-04-02T07:54:18Z) - Self-Supervised Dataset Distillation for Transfer Learning [77.4714995131992]
ラベルなしデータセットを、効率的な自己教師付き学習(SSL)のための小さな合成サンプル群に蒸留する新しい問題を提案する。
両レベル最適化におけるSSL目標に対する合成サンプルの勾配は、データ拡張やマスキングから生じるランダム性から、テキストバイアスを受けていることを最初に証明する。
転送学習を含む様々な応用における本手法の有効性を実証的に検証する。
論文 参考訳(メタデータ) (2023-10-10T10:48:52Z) - On minimizing the training set fill distance in machine learning regression [0.552480439325792]
本研究では,選択した集合の充填距離を最小化することを目的としたデータ選択手法を提案する。
FPSを用いてトレーニングセットを選択することで、ガウスカーネル回帰アプローチの特定の場合のモデルの安定性を向上させることができることを示す。
論文 参考訳(メタデータ) (2023-07-20T16:18:33Z) - Leveraging Unlabeled Data to Predict Out-of-Distribution Performance [63.740181251997306]
実世界の機械学習デプロイメントは、ソース(トレーニング)とターゲット(テスト)ディストリビューションのミスマッチによって特徴づけられる。
本研究では,ラベル付きソースデータとラベルなしターゲットデータのみを用いて,対象領域の精度を予測する手法を検討する。
本稿では,モデルの信頼度をしきい値として学習し,精度をラベルなし例のごく一部として予測する実践的手法である平均閾値保持信頼度(ATC)を提案する。
論文 参考訳(メタデータ) (2022-01-11T23:01:12Z) - Risk Minimization from Adaptively Collected Data: Guarantees for
Supervised and Policy Learning [57.88785630755165]
経験的リスク最小化(Empirical Risk Minimization, ERM)は、機械学習のワークホースであるが、適応的に収集されたデータを使用すると、そのモデルに依存しない保証が失敗する可能性がある。
本研究では,仮説クラス上での損失関数の平均値を最小限に抑えるため,適応的に収集したデータを用いた一般的な重み付きERMアルゴリズムについて検討する。
政策学習では、探索がゼロになるたびに既存の文献のオープンギャップを埋める率-最適後悔保証を提供する。
論文 参考訳(メタデータ) (2021-06-03T09:50:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。