論文の概要: High-Dimensional Asymptotics and Dataset Selection for Private Transfer Learning
- arxiv url: http://arxiv.org/abs/2610.02578v1
- Date: Thu, 01 Oct 2026 23:19:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.122023
- Title: High-Dimensional Asymptotics and Dataset Selection for Private Transfer Learning
- Title(参考訳): プライベートトランスファー学習のための高次元漸近とデータセット選択
- Abstract要約: 複数の異種源を用いた高次元回帰によるデータセット選択の問題をモデル化する。
当社は、ラベルのみに、または機能とラベルを共同で、$$$0の差分プライバシーに関して、プライバシを保証する。
これは、理論上は、プライベートトランスファーラーニングの基盤となる。
- 参考スコア(独自算出の注目度): 33.61175529565959
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: To commit to buying external data or participate in collaborative learning, one must decide whether the additional data will improve prediction enough to justify the cost. This comes with several challenges: (i) the decision often relies only on aggregated statistics available publicly, rather than individual-level data; (ii) covariate and model shifts can induce negative transfer, so the additional data deteriorates rather than improves performance; (iii) if the data is sensitive, its privatization requires the injection of noise, which can also offset the benefit of a larger sample size. In this paper, we model the problem of dataset selection through high-dimensional regression with multiple heterogeneous sources and a weighted ridge estimator. Our approach uses only summary statistics and it gives privacy guarantees either on labels only or jointly on features and labels, in terms of $ρ$-zero-concentrated differential privacy. The main technical contribution is a deterministic equivalent of the test error, which captures the interactions between sample size, covariance structure, model shift, regularization and privacy noise. Our theory allows to optimize hyperparameters (weights and ridge regularizers) and, more broadly, to decide when private external datasets are useful without accessing the data itself but only relying on population-level quantities. This provides a theoretically tractable foundation for private transfer learning, which we support via experiments on both synthetic and real-world datasets.
- Abstract(参考訳): 外部データを購入したり、共同学習に参加するためには、追加のデータがコストを正当化するのに十分な予測を改善するかどうかを判断する必要がある。
これにはいくつかの課題があります。
一 決定は、個人レベルのデータではなく、一般に利用可能な集計統計にのみ依存することも多い。
(二)共変量及びモデルシフトは負の転送を誘導しうるので、付加データは性能を向上するよりむしろ劣化する。
三 データが感度が高い場合、その民営化にはノイズの注入が必要で、より大きなサンプルサイズの利点を相殺することができる。
本稿では,複数の異種音源と重み付きリッジ推定器を用いた高次元回帰によるデータセット選択の問題をモデル化する。
当社のアプローチでは,サマリ統計のみを使用しており,機能やラベルのラベルのみに,あるいは共同で,$ρ$-0の差分プライバシーを保証しています。
主な技術的貢献は、サンプルサイズ、共分散構造、モデルシフト、正規化、プライバシノイズの間の相互作用をキャプチャする、テストエラーの決定論的等価性である。
我々の理論では、ハイパーパラメータ(ウェイトとリッジ正規化器)を最適化し、より広い範囲で、プライベートな外部データセットがデータ自体にアクセスすることなく、人口レベルの量のみに依存しているかどうかを決定することができる。
これは理論上は、プライベートトランスファー学習の基盤を提供するもので、我々は、合成データセットと実世界のデータセットの両方で実験を通してサポートしています。
関連論文リスト
- Towards Understanding Valuable Preference Data for Large Language Model Alignment [85.38864561060088]
大規模言語モデル(LLM)のアライメントは通常、人間の好みの比較から学習することで達成される。
新たに提案したTruncated Influence Function (TIF) を用いた検証データに対する個人の影響によるデータ品質の評価を行う。
この目的のために、我々はそれらを組み合わせ、様々なエラーソースをオフセットし、単純だが効果的なデータ選択ルールをもたらす。
論文 参考訳(メタデータ) (2025-10-15T06:57:55Z) - High-Dimensional Differentially Private Quantile Regression: Distributed Estimation and Statistical Inference [0.26784722398800515]
分散環境での高次元データに対する微分プライベート量子回帰法を提案する。
我々は、反復的な更新を行い、ほぼ最適な統計精度と正式なプライバシー保証を確保する、微分プライベートな推定アルゴリズムを開発した。
論文 参考訳(メタデータ) (2025-08-07T09:47:44Z) - A CLIP-Powered Framework for Robust and Generalizable Data Selection [51.46695086779598]
実世界のデータセットは、しばしば冗長でノイズの多いデータを含み、トレーニング効率とモデルパフォーマンスに悪影響を及ぼす。
データ選択は、データセット全体から最も代表的なサンプルを特定することを約束している。
より堅牢で一般化可能なサンプル選択にマルチモーダル情報を活用するCLIPを利用した新しいデータ選択フレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-15T03:00:58Z) - Private Estimation when Data and Privacy Demands are Correlated [5.755004576310333]
微分プライバシーは、統計クエリーのプライバシーを確保するための現在のゴールドスタンダードである。
単変量データに対する経験的平均推定の問題とカテゴリーデータに対する周波数推定について考察する。
提案アルゴリズムは,PAC誤差と平均二乗誤差の両方で理論的性能を保証する。
論文 参考訳(メタデータ) (2024-07-15T22:46:02Z) - Differentially Private Linear Regression with Linked Data [3.9325957466009203]
コンピュータ科学の数学的概念である差分プライバシーは、堅牢なプライバシー保証を提供する上昇するツールである。
最近の研究は、個々の統計および機械学習タスクの微分プライベートバージョンの開発に焦点を当てている。
相関データを用いた線形回帰のための2つの微分プライベートアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-08-01T21:00:19Z) - Mean Estimation with User-level Privacy under Data Heterogeneity [54.07947274508013]
異なるユーザーは、非常に多くの異なるデータポイントを持っているかもしれない。
すべてのユーザが同じディストリビューションからサンプルを採取していると仮定することはできない。
本研究では,データの分布と量の両方でユーザデータが異なる異質なユーザデータの単純なモデルを提案する。
論文 参考訳(メタデータ) (2023-07-28T23:02:39Z) - Rethinking Data Heterogeneity in Federated Learning: Introducing a New
Notion and Standard Benchmarks [65.34113135080105]
我々は、現在のセットアップにおけるデータ不均一性の問題が必ずしも問題であるだけでなく、FL参加者にとって有益であることを示す。
私たちの観察は直感的である。
私たちのコードはhttps://github.com/MMorafah/FL-SC-NIIDで利用可能です。
論文 参考訳(メタデータ) (2022-09-30T17:15:19Z) - Differentially Private Multi-Party Data Release for Linear Regression [40.66319371232736]
Differentially Private (DP) データリリースは、データ対象のプライバシを損なうことなくデータを広める、有望なテクニックである。
本稿では、異なる利害関係者が同じデータ対象グループに属する不整合な属性セットを所有するマルチパーティ設定に焦点を当てる。
提案手法は,データセットサイズが増大する最適(プライベートでない)解に収束することを示す。
論文 参考訳(メタデータ) (2022-06-16T08:32:17Z) - Data Sharing Markets [95.13209326119153]
我々は、各エージェントがデータの買い手および売り手の両方になり得る設定について検討する。
両データ交換(データ付きトレーディングデータ)と一方データ交換(お金付きトレーディングデータ)の2つの事例を考察する。
論文 参考訳(メタデータ) (2021-07-19T06:00:34Z) - P3GM: Private High-Dimensional Data Release via Privacy Preserving
Phased Generative Model [23.91327154831855]
本稿では,プライバシ保護型位相生成モデル(P3GM)を提案する。
P3GMは2段階の学習プロセスを採用し、ノイズに対して堅牢にし、学習効率を向上させる。
最先端の手法と比較して、生成したサンプルはノイズが少なく、データ多様性の観点からも元のデータに近いように見える。
論文 参考訳(メタデータ) (2020-06-22T09:47:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。