論文の概要: Differentially Private Synthetic Data via APIs 4: Tabular Data
- arxiv url: http://arxiv.org/abs/2606.08259v1
- Date: Sat, 06 Jun 2026 17:08:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:06.002686
- Title: Differentially Private Synthetic Data via APIs 4: Tabular Data
- Title(参考訳): API経由の異なるプライベートな合成データ 4: タブラルデータ
- Authors: Toan Tran, Arturs Backurs, Zinan Lin, Victor Reis, Li Xiong, Sergey Yekhanin,
- Abstract要約: 最先端の手法は、しばしば低次辺クエリエラーを最小限に抑え、高次相関による課題を見落としることに重点を置いている。
このギャップに対処するため、DP準拠の画像とテキスト合成のために開発されたPrivate Evolutionフレームワークを拡張した。
- 参考スコア(独自算出の注目度): 14.625539540842672
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper investigates the problem of generating synthetic tabular data with differential privacy (DP) guarantees, enabling data sharing in sensitive domains. Despite extensive study, state-of-the-art methods often focus on minimizing low-order marginal query errors and overlook the challenges posed by high-order correlations. To address this gap, we extend the Private Evolution (PE) framework, originally developed for DP-compliant image and text synthesis, to tabular data. We introduce Tab-PE -- an algorithm for synthetic tabular data generation under DP constraints. Tab-PE iteratively improves a candidate dataset via an evolutionary process that leverages tabular-specialized operators to produce variations, privately scores them, and selects the highest-quality samples to retain and propagate. In contrast to the original PE, which relies on large foundation models, Tab-PE employs heuristic operators with significantly lower computational costs, making PE more practical and scalable for tabular data. Through extensive experiments on real-world and simulation datasets, we demonstrate that Tab-PE substantially outperforms prior baselines on datasets exhibiting high-order correlations. Compared to the best baseline -- AIM, Tab-PE improves classification accuracy by up to 10% while running 28 times faster.
- Abstract(参考訳): 本稿では、機密ドメインにおけるデータ共有を可能にするために、差分プライバシー(DP)保証付き合成表データ生成の問題について検討する。
大規模な研究にもかかわらず、最先端の手法は、低次の辺りのクエリエラーを最小限に抑え、高次の相関によって引き起こされる課題を見逃すことに重点を置いていることが多い。
このギャップに対処するため,DP準拠の画像とテキスト合成のために開発されたPrivate Evolution (PE) フレームワークを表データに拡張した。
DP制約下での合成表データ生成アルゴリズムであるTab-PEを導入する。
Tab-PEは進化的プロセスを通じて候補データセットを反復的に改善し、表の特殊化演算子を利用してバリエーションを生成し、それらをプライベートにスコアし、保持および伝播する高品質なサンプルを選択する。
大規模な基礎モデルに依存したオリジナルのPEとは対照的に、Tab-PEは計算コストを大幅に削減したヒューリスティック演算子を採用しており、表形式のデータに対してより実用的でスケーラブルである。
実世界のデータセットとシミュレーションデータセットに関する広範な実験を通して、Tab-PEは高次相関を示すデータセットの事前ベースラインを大幅に上回ることを示した。
AIMと比較して、Tab-PEは28倍高速に動作しながら、分類精度を最大10%向上させる。
関連論文リスト
- Improving TabPFN's Synthetic Data Generation by Integrating Causal Structure [1.3357838668308473]
合成データ生成はデータの不足とプライバシ制約に対処する。
生成プロセスに因果構造を組み込む方法を示す。
制御されたベンチマークと6つのCSuiteデータセットに対して,これらのアプローチを評価する。
論文 参考訳(メタデータ) (2026-03-10T22:16:44Z) - Tab-PET: Graph-Based Positional Encodings for Tabular Transformers [10.312868216225118]
本稿では,位置エンコーディングを埋め込みに推定し,解析するためのグラフベースのフレームワークを提案する。
グラフトポロジからPEを導出するアプローチにインスパイアされた我々は、グラフ推定のパラダイムとして、アソシエーションベースと因果関係ベースという2つを探求する。
グラフ由来のPEは,50の分類データセットと3Tの回帰データセットにまたがる性能を著しく向上させることを実証的に実証した。
論文 参考訳(メタデータ) (2025-11-17T13:08:34Z) - Mitra: Mixed Synthetic Priors for Enhancing Tabular Foundation Models [85.64873567417396]
実世界のデータに対して,その多様性,特異性,および性能のために選択された合成前駆体の硬化した混合物をトレーニングしたTFMであるMitraを紹介する。
Mitraは、TabPFNv2やTabICLのような最先端のTFMを、分類と回帰のベンチマークで一貫して上回っている。
論文 参考訳(メタデータ) (2025-10-24T07:15:06Z) - LLM-TabLogic: Preserving Inter-Column Logical Relationships in Synthetic Tabular Data via Prompt-Guided Latent Diffusion [49.898152180805454]
合成データセットはドメイン固有の論理的一貫性を維持する必要がある。
既存の生成モデルは、しばしばこれらのカラム間の関係を見落としている。
本研究では,ドメイン知識を必要とせずに列間関係を効果的に維持する手法を提案する。
論文 参考訳(メタデータ) (2025-03-04T00:47:52Z) - Structural Entropy Guided Probabilistic Coding [52.01765333755793]
構造エントロピー誘導型確率的符号化モデルSEPCを提案する。
我々は、構造エントロピー正規化損失を提案することにより、潜在変数間の関係を最適化に組み込む。
分類タスクと回帰タスクの両方を含む12の自然言語理解タスクに対する実験結果は、SEPCの優れた性能を示す。
論文 参考訳(メタデータ) (2024-12-12T00:37:53Z) - TabDiff: a Mixed-type Diffusion Model for Tabular Data Generation [91.50296404732902]
グラフデータの混合型分布を1つのモデルでモデル化する共同拡散フレームワークであるTabDiffを紹介する。
我々の重要な革新は、数値データと分類データのための連立連続時間拡散プロセスの開発である。
TabDiffは、既存の競合ベースラインよりも優れた平均性能を実現し、ペアワイドカラム相関推定における最先端モデルよりも最大で22.5%改善されている。
論文 参考訳(メタデータ) (2024-10-27T22:58:47Z) - TAEGAN: Generating Synthetic Tabular Data For Data Augmentation [13.612237747184363]
Tabular Auto-Encoder Generative Adversarial Network (TAEGAN)は、高品質な表データを生成するための改良されたGANベースのフレームワークである。
TAEGANは、マスク付きオートエンコーダをジェネレータとして採用し、自己監督型事前学習のパワーを初めて導入した。
論文 参考訳(メタデータ) (2024-10-02T18:33:06Z) - Differentially Private Tabular Data Synthesis using Large Language Models [6.6376578496141585]
本稿ではDP-LLMTGenについて紹介する。
DP-LLMTGenは、2段階の微調整手順を用いて、センシティブなデータセットをモデル化する。
微調整LDMをサンプリングすることで合成データを生成する。
論文 参考訳(メタデータ) (2024-06-03T15:43:57Z) - Rethinking Pre-Training in Tabular Data: A Neighborhood Embedding Perspective [71.45945607871715]
メタ表現(TabPTM)を用いたタブラルデータ事前学習を提案する。
中心となる考え方は、データインスタンスを共有機能空間に埋め込むことで、各インスタンスは、近隣の固定数とそのラベルまでの距離で表現される。
101データセットの大規模な実験は、微調整の有無にかかわらず、分類タスクと回帰タスクの両方においてTabPTMの有効性を確認した。
論文 参考訳(メタデータ) (2023-10-31T18:03:54Z) - Generating tabular datasets under differential privacy [0.0]
ディープニューラルネットワークのトレーニングプロセスに差分プライバシー(DP)を導入する。
これにより、結果データの品質とプライバシの間にトレードオフが生じます。
我々は、注意機構を活用する新しいエンドツーエンドモデルを実装している。
論文 参考訳(メタデータ) (2023-08-28T16:35:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。