論文の概要: TabKDE: Simple and Scalable Tabular Data Generation with Kernel Density Estimates
- arxiv url: http://arxiv.org/abs/2605.17642v1
- Date: Sun, 17 May 2026 20:21:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:48.295244
- Title: TabKDE: Simple and Scalable Tabular Data Generation with Kernel Density Estimates
- Title(参考訳): TabKDE:カーネル密度推定による単純でスケーラブルな語彙データ生成
- Authors: Meysam Alishahi, Yan Zheng, Junpeng Wang, Chin-Chia Michael Yeh, Jeff M. Phillips,
- Abstract要約: タブラルデータ生成は、複数の列を持つ大きなテーブルを考える。
目標は、元のデータから行の分布を複製するテーブル用の新しい行を作成することである。
- 参考スコア(独自算出の注目度): 22.485759824387696
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tabular data generation considers a large table with multiple columns -- each column comprised of numerical, categorical, or sometimes ordinal values. The goal is to produce new rows for the table that replicate the distribution of rows from the original data -- without just copying those initial rows. The last 4 years have seen enormous progress on this problem, mostly using computational expensive methods that employ one-hot encoding, VAEs, and diffusion. This paper describes a new approach to the problem of tabular data generation. By employing copula transformations and modeling the distribution as a kernel density estimate we can nearly match the accuracy and leakage-avoidance achievements of the previous methods, but with almost no training time. Our method is very scalable, and can be run on data sets orders of magnitude larger than prior state-of-the-art on a simple laptop. Moreover, because we employ kernel density estimates, we can store the model as a coreset of the original data -- we believe the first for generative modeling -- and as a result, require significantly less space as well. Our code is available here: \url{https://github.com/tabkde/tabkde-main}
- Abstract(参考訳): タブラルデータ生成は、複数の列を持つ大きなテーブル — 数値、カテゴリ、あるいは時折順序値で構成されている — を考慮している。目標は、最初の行をコピーすることなく、元のデータから行の分布を複製するテーブル用の新しい行を生成することだ。
過去4年間、この問題は膨大な進歩を遂げており、主に1ホットエンコーディング、VAE、拡散を利用した計算コストの高い手法を用いている。
本稿では,表型データ生成問題に対する新しいアプローチについて述べる。
コプラ変換を採用し、カーネル密度推定として分布をモデル化することにより、以前の手法の精度とリーク回避の達成とほぼ一致できるが、ほとんど訓練時間なしで実現できる。
我々の手法は非常にスケーラブルで、単純なラップトップで以前の最先端よりも桁違いに大きいデータセットで実行することができる。
さらに、カーネル密度の推定を採用すれば、モデルを元のデータのコアセットとして保存することができます。
私たちのコードはここで利用可能です。
関連論文リスト
- A Sobering Look at Tabular Data Generation via Probabilistic Circuits [20.66441498486505]
タブラルデータはテキストや画像よりも生成が難しい。
拡散ベースのモデルは現在の最先端(SotA)モデルクラスである。
ディープ確率回路(PC)は、コストのごく一部でSotAモデルに競争力または優れた性能を提供する。
論文 参考訳(メタデータ) (2026-03-24T10:01:28Z) - Efficient Masked AutoEncoder for Video Object Counting and A Large-Scale Benchmark [52.339936954958034]
前景の動的不均衡は、ビデオオブジェクトのカウントにおいて大きな課題である。
本稿では,密度埋め込み型効率的なマスドオートエンコーダカウント(E-MAC)フレームワークを提案する。
さらに,渡り鳥保護のための自然シナリオにおいて,まず,大規模なビデオバードカウントデータセットであるDroneBirdを提案する。
論文 参考訳(メタデータ) (2024-11-20T06:08:21Z) - Teddy: Efficient Large-Scale Dataset Distillation via Taylor-Approximated Matching [74.75248610868685]
Teddyは、大規模なデータセットを扱うように設計されたTaylor近似データセット蒸留フレームワークである。
TeddyはTiny-ImageNetとオリジナルサイズのImageNet-1Kデータセット上で、最先端の効率性とパフォーマンスを実現する。
論文 参考訳(メタデータ) (2024-10-10T03:28:46Z) - LaTable: Towards Large Tabular Models [63.995130144110156]
タブラル生成基盤モデルは、異なるデータセットの不均一な特徴空間のために構築が困難である。
LaTableは、これらの課題に対処し、異なるデータセットでトレーニング可能な、新しい拡散モデルである。
LaTableは、分散生成のベースラインよりも優れており、微調整されたLaTableは、より少ないサンプルで分散データセットをより良く生成できる。
論文 参考訳(メタデータ) (2024-06-25T16:03:50Z) - Generating and Imputing Tabular Data via Diffusion and Flow-based
Gradient-Boosted Trees [11.732842929815401]
タブラルデータは取得が困難で、値が失われる。
本稿では,混合型(連続型および分類型)データの生成と計算のための新しいアプローチを提案する。
スコア関数やベクトル場をニューラルネットワークで学習する従来の手法とは対照的に,我々はXGBoostを採用する。
論文 参考訳(メタデータ) (2023-09-18T17:49:09Z) - Generative Forests [23.554594285885273]
私たちは、表データという最も一般的な形式のデータのうちの1つを表わすデータのための生成AIに焦点を合わせています。
本稿では,このような課題に適合する森林モデルの新しい強力なクラスと,強力な収束保証を備えた簡単なトレーニングアルゴリズムを提案する。
これらのタスクに関する追加実験により、我々のモデルは、多種多様な技術手法に対する優れた競争相手になり得ることが判明した。
論文 参考訳(メタデータ) (2023-08-07T14:58:53Z) - Improved Distribution Matching for Dataset Condensation [91.55972945798531]
本稿では,分布マッチングに基づく新しいデータセット凝縮法を提案する。
提案手法は,計算資源の少ない従来の最適化指向手法よりも優れている。
論文 参考訳(メタデータ) (2023-07-19T04:07:33Z) - Coresets for Relational Data and The Applications [8.573878018370547]
coresetは、元の入力データセットの構造を保存できる小さなセットである。
我々は、クラスタリング、ロジスティック回帰、SVMといった機械学習タスクにコアセットアプローチを適用することができることを示す。
論文 参考訳(メタデータ) (2022-10-09T12:46:27Z) - Scaling Structured Inference with Randomization [64.18063627155128]
本稿では、構造化されたモデルを数万の潜在状態に拡張するためにランダム化された動的プログラミング(RDP)のファミリを提案する。
我々の手法は古典的DPベースの推論に広く適用できる。
また、自動微分とも互換性があり、ニューラルネットワークとシームレスに統合できる。
論文 参考訳(メタデータ) (2021-12-07T11:26:41Z) - Partially-Aligned Data-to-Text Generation with Distant Supervision [69.15410325679635]
我々はPADTG(Partially-Aligned Data-to-Text Generation)と呼ばれる新しい生成タスクを提案する。
自動的にアノテートされたデータをトレーニングに利用し、アプリケーションドメインを大幅に拡張するため、より実用的です。
我々のフレームワークは、全てのベースラインモデルより優れており、部分整合データの利用の可能性を検証する。
論文 参考訳(メタデータ) (2020-10-03T03:18:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。