論文の概要: Private Synthetic Data Meets Ensemble Learning
- arxiv url: http://arxiv.org/abs/2310.09729v1
- Date: Sun, 15 Oct 2023 04:24:42 GMT
- ステータス: 処理完了
- システム内更新日: 2023-10-18 01:56:52.493609
- Title: Private Synthetic Data Meets Ensemble Learning
- Title(参考訳): プライベート合成データとアンサンブル学習
- Authors: Haoyuan Sun, Navid Azizan, Akash Srivastava, Hao Wang
- Abstract要約: 機械学習モデルが合成データに基づいてトレーニングされ、実際のデータにデプロイされると、しばしばパフォーマンス低下が発生する。
実データを用いた場合のパフォーマンス向上を目標として,下流モデルのトレーニングのための新たなアンサンブル戦略を導入する。
- 参考スコア(独自算出の注目度): 15.425653946755025
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When machine learning models are trained on synthetic data and then deployed
on real data, there is often a performance drop due to the distribution shift
between synthetic and real data. In this paper, we introduce a new ensemble
strategy for training downstream models, with the goal of enhancing their
performance when used on real data. We generate multiple synthetic datasets by
applying a differential privacy (DP) mechanism several times in parallel and
then ensemble the downstream models trained on these datasets. While each
synthetic dataset might deviate more from the real data distribution, they
collectively increase sample diversity. This may enhance the robustness of
downstream models against distribution shifts. Our extensive experiments reveal
that while ensembling does not enhance downstream performance (compared with
training a single model) for models trained on synthetic data generated by
marginal-based or workload-based DP mechanisms, our proposed ensemble strategy
does improve the performance for models trained using GAN-based DP mechanisms
in terms of both accuracy and calibration of downstream models.
- Abstract(参考訳): 機械学習モデルが合成データに基づいてトレーニングされ、次に実データにデプロイされると、合成データと実データの分散シフトによるパフォーマンス低下がしばしば発生する。
本稿では,実データを用いた場合の性能向上を目的とした,下流モデルのトレーニングのための新しいアンサンブル戦略を提案する。
差分プライバシ(DP)機構を複数回並列に適用することにより,複数の合成データセットを生成し,これらのデータセットでトレーニングされた下流モデルをアンサンブルする。
各合成データセットは実際のデータ分散からさらに逸脱するかもしれないが、総合的にサンプルの多様性を増加させる。
これにより、下流モデルの分散シフトに対する堅牢性を高めることができる。
広範にわたる実験により,狭帯域ベースあるいはワークロードベースのDP機構によって生成された合成データに基づいて学習したモデルに対して,アンサンブルはダウンストリーム性能を向上しないが,提案手法は,下流モデルの精度とキャリブレーションの両面から,GANベースのDP機構を用いて訓練したモデルの性能を向上させる。
関連論文リスト
- zGAN: An Outlier-focused Generative Adversarial Network For Realistic Synthetic Data Generation [0.0]
ブラックスワン」は古典的な機械学習モデルの性能に挑戦している。
本稿では、外部特性を持つ合成データを生成する目的で開発されたzGANモデルアーキテクチャの概要について述べる。
リアルな合成データ生成の有望な結果と、モデル性能のアップリフト能力を示す。
論文 参考訳(メタデータ) (2024-10-28T07:55:11Z) - On the Diversity of Synthetic Data and its Impact on Training Large Language Models [34.00031258223175]
大規模言語モデル(LLM)は、多種多様な高品質な事前学習データの必要性を強調している。
合成データは、データの不足とアクセシビリティの課題に対する、実行可能なソリューションとして現れます。
本研究では, 事前学習および微調整段階における合成データ多様性の下流効果について検討した。
論文 参考訳(メタデータ) (2024-10-19T22:14:07Z) - Synthetic location trajectory generation using categorical diffusion
models [50.809683239937584]
拡散モデル(DPM)は急速に進化し、合成データのシミュレーションにおける主要な生成モデルの一つとなっている。
本稿では,個人が訪れた物理的位置を表す変数列である合成個別位置軌跡(ILT)の生成にDPMを用いることを提案する。
論文 参考訳(メタデータ) (2024-02-19T15:57:39Z) - Towards Theoretical Understandings of Self-Consuming Generative Models [56.84592466204185]
本稿では,自己消費ループ内で生成モデルを訓練する新たな課題に取り組む。
我々は,このトレーニングが将来のモデルで学習したデータ分布に与える影響を厳格に評価するための理論的枠組みを構築した。
カーネル密度推定の結果は,混合データトレーニングがエラー伝播に与える影響など,微妙な洞察を与える。
論文 参考訳(メタデータ) (2024-02-19T02:08:09Z) - Federated Learning with Projected Trajectory Regularization [65.6266768678291]
フェデレーション学習は、ローカルデータを共有せずに、分散クライアントから機械学習モデルの共同トレーニングを可能にする。
連合学習における重要な課題の1つは、クライアントにまたがる識別できない分散データを扱うことである。
本稿では,データ問題に対処するための予測軌道正則化(FedPTR)を備えた新しいフェデレーション学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-12-22T02:12:08Z) - Assessment of Differentially Private Synthetic Data for Utility and
Fairness in End-to-End Machine Learning Pipelines for Tabular Data [3.555830838738963]
差分プライベート(DP)合成データセットは、個々のデータプロバイダのプライバシを保持しながらデータを共有するためのソリューションである。
機械学習モデルの訓練と評価に最も効果的な合成データ生成手法を同定する。
論文 参考訳(メタデータ) (2023-10-30T03:37:16Z) - Let's Synthesize Step by Step: Iterative Dataset Synthesis with Large
Language Models by Extrapolating Errors from Small Models [69.76066070227452]
※データ合成*はラベル付きデータの少ない小さなモデルをトレーニングするための有望な方法です。
本稿では,この分散ギャップを縮めるデータ合成フレームワークであるStep* (**S3**) による合成ステップを提案する。
提案手法は,合成データセットと実データとのギャップを小さくすることで,小型モデルの性能を向上させる。
論文 参考訳(メタデータ) (2023-10-20T17:14:25Z) - On the Stability of Iterative Retraining of Generative Models on their own Data [56.153542044045224]
混合データセットに対する生成モデルの訓練が与える影響について検討する。
まず、初期生成モデルがデータ分布を十分に近似する条件下で反復学習の安定性を実証する。
我々は、正規化フローと最先端拡散モデルを繰り返し訓練することにより、合成画像と自然画像の両方に関する我々の理論を実証的に検証する。
論文 参考訳(メタデータ) (2023-09-30T16:41:04Z) - Synthetic data, real errors: how (not) to publish and use synthetic data [86.65594304109567]
生成過程が下流MLタスクにどのように影響するかを示す。
本稿では、生成プロセスモデルパラメータの後方分布を近似するために、Deep Generative Ensemble (DGE)を導入する。
論文 参考訳(メタデータ) (2023-05-16T07:30:29Z) - Analyzing Effects of Fake Training Data on the Performance of Deep
Learning Systems [0.0]
ディープラーニングモデルは、クラス不均衡や分散シフトに対する堅牢性の欠如など、さまざまな問題に悩まされることが多い。
GAN(Generative Adversarial Networks)の出現により、高品質な合成データを生成することが可能になった。
本研究では, 各種合成データと原データとを混合した場合, アウト・オブ・ディストリビューションデータに対するモデルの堅牢性と, 予測の一般品質に影響を及ぼす影響を解析する。
論文 参考訳(メタデータ) (2023-03-02T13:53:22Z) - An Analysis of the Deployment of Models Trained on Private Tabular
Synthetic Data: Unexpected Surprises [4.129847064263057]
異なるプライベート(DP)合成データセットは、機械学習モデルをトレーニングするための強力なアプローチである。
差分プライベートな合成データ生成が分類に与える影響について検討する。
論文 参考訳(メタデータ) (2021-06-15T21:00:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。