論文の概要: TDGT: A Tabular Data Generation Toolkit supporting adaptive GPU-accelerated Bayesian mixture models, diffusion-based models, and latent-space generative modeling
- arxiv url: http://arxiv.org/abs/2606.31268v1
- Date: Tue, 30 Jun 2026 07:42:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.127865
- Title: TDGT: A Tabular Data Generation Toolkit supporting adaptive GPU-accelerated Bayesian mixture models, diffusion-based models, and latent-space generative modeling
- Title(参考訳): TDGT: 適応GPU加速ベイズ混合モデル、拡散モデル、潜在空間生成モデルをサポートするタブラルデータ生成ツールキット
- Abstract要約: TDGTは、合成データ生成と忠実度評価のためのWebベースのツールキットである。
Adaptive Bayesian Mixture Synthesizer (ABMS)は、最適な混合成分数を自律的に決定する新しいアルゴリズムである。
TDGTは、医療、社会経済モデリング、サイバーセキュリティドメインからのデータセットで評価される。
- 参考スコア(独自算出の注目度): 1.5441436657738097
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The growing demand for privacy-preserving data sharing has positioned synthetic data generation as a critical component of responsible AI workflows. Despite notable advances in generative modeling, existing solutions often lack integration of adaptive generation strategies, multi-metric evaluation, and accessible end-to-end generators within a unified web-based toolkit. In this work, we introduce TDGT (Tabular Data Generation Toolkit), a web-based toolkit for synthetic tabular data generation and fidelity assessment. TDGT introduces the Adaptive Bayesian Mixture Synthesizer (ABMS), a novel algorithm that autonomously determines the optimal number of mixture components through iterative cluster quality optimization, eliminating the need for manual hyperparameter configuration. Building upon ABMS, we further propose VAE-ABMS, a hybrid architecture that couples Variational Autoencoder-based latent space learning with adaptive Bayesian mixture synthesis, enabling high-fidelity generation of complex, nonlinear tabular distributions. For large-scale scenarios, TDGT provides a GPU-accelerated variant of ABMS leveraging CUDA-based k-means clustering and Gaussian mixture fitting. Synthetic data fidelity is assessed through eleven statistical fidelity metrics spanning distributional divergence, structural correlation, and sample-level similarity, complemented by privacy risk indicators including k-anonymity scoring and disclosure rate estimation. The web-based toolkit supports a real-time streaming interface with interactive Plotly-based visualizations. TDGT is assessed across datasets from healthcare, socioeconomic modeling, and cybersecurity domains, demonstrating consistent generation fidelity and statistical coherence across heterogeneous feature types and data scales.
- Abstract(参考訳): プライバシ保護データ共有の需要が高まっている中で、合成データ生成は、責任あるAIワークフローの重要なコンポーネントとして位置づけられている。
生成モデリングの顕著な進歩にもかかわらず、既存のソリューションは、適応生成戦略、マルチメトリック評価、および統一されたWebベースのツールキット内でアクセス可能なエンドツーエンドジェネレータの統合を欠いていることが多い。
本研究では,TDGT (Tabular Data Generation Toolkit) について紹介する。
TDGTは、適応ベイズ混合合成器 (ABMS) を導入し、これは、反復的なクラスタ品質の最適化を通じて最適な混合成分数を自律的に決定し、手動のハイパーパラメータ設定を不要にする新しいアルゴリズムである。
ABMSを基盤として,変分オートエンコーダに基づく潜在空間学習と適応ベイズ混合合成を併用したハイブリッドアーキテクチャであるVAE-ABMSを提案する。
大規模なシナリオでは、TDGTはCUDAベースのk平均クラスタリングとガウス混合フィッティングを活用したGPUアクセラレーション型のABMSを提供する。
合成データの忠実度は、分布のばらつき、構造的相関、サンプルレベルの類似度にまたがる11の統計的忠実度で評価され、k匿名性スコアや開示率推定を含むプライバシーリスク指標が補完される。
Webベースのツールキットは、インタラクティブなPlotlyベースの視覚化を備えたリアルタイムストリーミングインターフェースをサポートする。
TDGTは、医療、社会経済モデリング、サイバーセキュリティドメインのデータセットにまたがって評価され、不均一な特徴タイプとデータスケールで一貫した生成の忠実さと統計的コヒーレンスを示す。
関連論文リスト
- Multimodal Distribution Matching for Vision-Language Dataset Distillation [50.411341509805936]
マルチモーダル分散マッチング(Multimodal Distribution Matching)は、効率的かつ一般化可能なマルチモーダル蒸留のための幾何学的枠組みである。
MDMはデータ、モデル、損失レベルで補完的なコンポーネントを統合する。
マルチモーダルなセマンティクスを保存し、蒸留コストを大幅に削減し、建築全体にわたって頑丈な、コンパクトな合成セットを生成する。
論文 参考訳(メタデータ) (2026-05-22T10:41:58Z) - Reinforcement-Guided Synthetic Data Generation for Privacy-Sensitive Identity Recognition [60.52810518437911]
高忠実度生成モデルは、プライバシーに敏感なシナリオでますます必要とされている。
限られたデータによって生成モデルは貧弱になり、データ不足を軽減できない。
汎用ドメイン生成の先行を識別タスクに適応させる,強化誘導型合成データ生成フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-09T06:52:03Z) - Stable and Privacy-Preserving Synthetic Educational Data with Empirical Marginals: A Copula-Based Approach [1.5449641546929325]
Non-Parametric Gaussian Copula (NPGC) は、深層学習とパラメトリック最適化を経験的統計的アンカーに置き換えるプラグアンドプレイ合成法である。
NPGCは、差分プライバシー(DP)を限界レベルと相関レベルの両方で統合し、異種変数タイプをサポートし、欠落したデータを明示的な状態として扱い、情報的不在パターンを維持する。
論文 参考訳(メタデータ) (2026-04-05T17:34:21Z) - GO-GenZip: Goal-Oriented Generative Sampling and Hybrid Compression [50.76941829813458]
現在のネットワークデータテレメトリパイプラインは、複数の分散ソースから中央アグリゲータへの、きめ細かいキーパフォーマンス指標(KPI)の巨大なストリームで構成されている。
本研究は、目標指向の観点からネットワークテレメトリを再設計する、ジェネレーティブAI(GenAI)駆動サンプリングとハイブリッド圧縮フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-20T16:33:15Z) - scMRDR: A scalable and flexible framework for unpaired single-cell multi-omics data integration [53.683726781791385]
単一セルマルチオミクス(ScMRDR)と呼ばれるスケーラブルでフレキシブルな生成フレームワークを導入する。
本手法は, バッチ補正, モダリティアライメント, 生体信号保存の観点から, ベンチマークデータセット上での優れた性能を実現する。
論文 参考訳(メタデータ) (2025-10-28T21:28:39Z) - Dynamic Clustering for Personalized Federated Learning on Heterogeneous Edge Devices [10.51330114955586]
フェデレートラーニング(FL)は、エッジデバイスがグローバルモデルを協調的に学習することを可能にする。
パーソナライズド・フェデレーション・ラーニング・システム(DC-PFL)のための動的クラスタリングアルゴリズムを提案する。
また,DC-PFLはトレーニング時間を大幅に短縮し,ベースラインに比べてモデルの精度が向上することを示した。
論文 参考訳(メタデータ) (2025-08-03T04:19:22Z) - Efficient Federated Learning with Heterogeneous Data and Adaptive Dropout [62.73150122809138]
Federated Learning(FL)は、複数のエッジデバイスを使用したグローバルモデルの協調トレーニングを可能にする、有望な分散機械学習アプローチである。
動的不均一モデルアグリゲーション(FedDH)と適応ドロップアウト(FedAD)の2つの新しい手法を備えたFedDHAD FLフレームワークを提案する。
これら2つの手法を組み合わせることで、FedDHADは精度(最大6.7%)、効率(最大2.02倍高速)、コスト(最大15.0%小型)で最先端のソリューションを大幅に上回っている。
論文 参考訳(メタデータ) (2025-07-14T16:19:00Z) - Adaptive Clustering for Efficient Phenotype Segmentation of UAV Hyperspectral Data [1.6135226672466307]
無人航空機 (UAV) とハイパースペクトルイメージング (HSI) が組み合わさって、環境および農業用途の可能性を秘めている。
本稿では,リアルタイムツリー表現型セグメンテーションのためのオンラインハイパースペクトル簡易線形反復クラスタリングアルゴリズム(OHSLIC)を提案する。
論文 参考訳(メタデータ) (2025-01-17T13:48:04Z) - Generative AI-Powered Plugin for Robust Federated Learning in Heterogeneous IoT Networks [3.536605202672355]
フェデレーション学習により、エッジデバイスは、データのローカライズを維持しながら、データのプライバシを維持しながら、グローバルモデルを協調的にトレーニングすることが可能になる。
我々は,AI強化データ拡張と均衡サンプリング戦略により,IIDからIDDへの非IIDデータ分布を近似する,フェデレーション最適化技術のための新しいプラグインを提案する。
論文 参考訳(メタデータ) (2024-10-31T11:13:47Z) - An improved tabular data generator with VAE-GMM integration [9.4491536689161]
本稿では,現在のアプローチの限界に対処する新しい変分オートエンコーダ(VAE)モデルを提案する。
本手法は,TVAEモデルにインスパイアされたベイジアン・ガウス混合モデル(BGM)をVAEアーキテクチャに組み込む。
我々は,2つの医療関連データセットを含む混合データ型を持つ実世界の3つのデータセットに対して,我々のモデルを徹底的に検証する。
論文 参考訳(メタデータ) (2024-04-12T12:31:06Z) - Deep Autoencoding Topic Model with Scalable Hybrid Bayesian Inference [55.35176938713946]
我々は、ガンマ分布の階層構造を用いて、その多確率層生成ネットワークを構築するディープ・オートエンコーディング・トピック・モデル(DATM)を開発した。
Weibull上向き変分エンコーダを提案する。このエンコーダは深層ニューラルネットワークを介して情報を上向きに伝播し,次いで下向き生成モデルを提案する。
大規模コーパス上での教師なしおよび教師なしの学習タスクにおいて,モデルの有効性とスケーラビリティを実証した。
論文 参考訳(メタデータ) (2020-06-15T22:22:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。