論文の概要: From Data to Program: Fast & Direct Generative Program Inference from Empirical Data
- arxiv url: http://arxiv.org/abs/2609.35348v1
- Date: Mon, 28 Sep 2026 15:01:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 06:17:07.800943
- Title: From Data to Program: Fast & Direct Generative Program Inference from Empirical Data
- Title(参考訳): データからプログラムへ:経験的データから高速かつ直接生成的プログラム推論
- Abstract要約: PRODiGIは、1つのフォワードパスで明示的で実行可能な生成プログラムを推論するデータ・ツー・プログラムモデルである。
既存の事前訓練モデルよりも平均密度を低くし、MAEをスコアし、マルチフォールド・スピードアップを提供する。
- 参考スコア(独自算出の注目度): 22.249214905912847
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Estimating probability densities from a finite set of samples typically requires dataset-specific model fitting. We introduce PRODiGI, a pretrained data-to-program model that infers an explicit, executable generative program in a single forward pass. Pretrained on synthetic datasets paired with their ground-truth programs, PRODiGI accommodates diverse generative families and data dimensionalities through template prediction and non-autoregressive program parameter decoding. Its inferred programs support direct sampling, density and score evaluation, and inspection independently of the pretrained model. We further introduce program-space fine-tuning, which refines differentiable program parameters by matching generated and empirical samples while keeping model parameters intact. Experiments show that PRODiGI achieves lower average density and score MAE than existing pretrained models, while offering multi-fold speedups over its closest competitors. Program-space fine-tuning further reduces generation MMD by 84%. By turning empirical data into explicit, reusable programs, PRODiGI introduces a new direction for fast, interpretable tabular generative modeling.
- Abstract(参考訳): 有限個のサンプルから確率密度を推定するには、通常、データセット固有のモデルフィッティングが必要である。
ProDiGIは,1つのフォワードパスで明示的で実行可能な生成プログラムを推論する事前訓練されたデータ・ツー・プログラムモデルである。
PRODiGIは, アルゴリズム予測と非自己回帰的プログラムパラメータ復号により, 多様な生成系とデータ次元を許容する。
その推定プログラムは、事前訓練されたモデルとは独立して、直接サンプリング、密度、スコア評価、検査をサポートする。
さらに、モデルパラメータをそのまま保ちながら、生成されたサンプルと経験的なサンプルをマッチングすることで、プログラムパラメータを改良するプログラム空間微調整を導入する。
実験の結果, ProDiGIは既存の事前訓練モデルよりも平均密度を低くし, MAEをスコアし, 最寄りの競合モデルよりも複数倍のスピードアップを提供することがわかった。
プログラム空間の微調整により、ジェネレーションMDDはさらに84%削減される。
PRODiGIは経験的データを明示的で再利用可能なプログラムにすることで、高速で解釈可能な表生成モデリングのための新しい方向を導入する。
関連論文リスト
- Gradient-Informed Temporal Sampling Improves Rollout Accuracy in PDE Surrogate Training [5.24655241578805]
ニューラルシミュレータGITS(Gradient-Informed Temporal Smpling)に適したデータサンプリング手法を提案する。
GITSは、パイロットモデル局所勾配とセットレベルの時間被覆を協調的に最適化し、モデル特異性と動的情報のバランスをとる。
複数のサンプリングベースラインと比較して、GITSが選択したデータは、複数のPDEシステム、モデルバックボーン、サンプル比率で低いロールアウト誤差を達成する。
論文 参考訳(メタデータ) (2026-03-18T19:45:44Z) - Flow Matching Neural Processes [2.3020018305241337]
本稿では,様々なデータモダリティに対して強い性能を示す生成的モデリングパラダイムであるフローマッチングに基づく新しいNPモデルを提案する。
従来のNPモデルと比較して,本モデルは実装が簡単で,ODEソルバを用いた条件分布のサンプリングに使用できる。
本モデルは,合成1次元ガウス過程データ,2次元画像,実世界の気象データなど,様々なベンチマークにおいて,従来の最先端のニューラルプロセス手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-12-29T20:37:29Z) - Prequential posteriors [2.831395148295604]
逐次的(逐次的)損失関数に基づく前置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置後置
軽度条件下では、事前損失最小化器と、最適予測性能を持つパラメータまわりの逐次後部集中器の両方が有効であることを示す。
本手法は,合成多次元時系列と実世界の気象データセットの両方で検証する。
論文 参考訳(メタデータ) (2025-11-21T19:18:19Z) - Steering Masked Discrete Diffusion Models via Discrete Denoising Posterior Prediction [88.65168366064061]
本稿では,確率論的推論の課題として,事前学習したMDMを操る作業を行う新しいフレームワークであるDDPPを紹介する。
私たちのフレームワークは、3つの新しい目標のファミリーにつながります。
Wet-lab Validation(ウェット・ラブ・バリデーション)を用いて,報酬最適化タンパク質配列の過渡的発現を観察する。
論文 参考訳(メタデータ) (2024-10-10T17:18:30Z) - Diffusion posterior sampling for simulation-based inference in tall data settings [53.17563688225137]
シミュレーションベース推論(SBI)は、入力パラメータを所定の観測に関連付ける後部分布を近似することができる。
本研究では、モデルのパラメータをより正確に推測するために、複数の観測値が利用できる、背の高いデータ拡張について考察する。
提案手法を,最近提案した各種数値実験の競合手法と比較し,数値安定性と計算コストの観点から,その優位性を実証した。
論文 参考訳(メタデータ) (2024-04-11T09:23:36Z) - Towards Theoretical Understandings of Self-Consuming Generative Models [56.84592466204185]
本稿では,自己消費ループ内で生成モデルを訓練する新たな課題に取り組む。
我々は,このトレーニングが将来のモデルで学習したデータ分布に与える影響を厳格に評価するための理論的枠組みを構築した。
カーネル密度推定の結果は,混合データトレーニングがエラー伝播に与える影響など,微妙な洞察を与える。
論文 参考訳(メタデータ) (2024-02-19T02:08:09Z) - Private Synthetic Data Meets Ensemble Learning [15.425653946755025]
機械学習モデルが合成データに基づいてトレーニングされ、実際のデータにデプロイされると、しばしばパフォーマンス低下が発生する。
実データを用いた場合のパフォーマンス向上を目標として,下流モデルのトレーニングのための新たなアンサンブル戦略を導入する。
論文 参考訳(メタデータ) (2023-10-15T04:24:42Z) - On Calibrating Diffusion Probabilistic Models [78.75538484265292]
拡散確率モデル(DPM)は様々な生成タスクにおいて有望な結果を得た。
そこで本研究では,任意の事前学習DPMを校正する簡単な方法を提案する。
キャリブレーション法は1回だけ行い, 得られたモデルをサンプリングに繰り返し使用することができる。
論文 参考訳(メタデータ) (2023-02-21T14:14:40Z) - Sequential Bayesian Experimental Design for Implicit Models via Mutual
Information [12.68659360172393]
自然科学と医学科学に特に興味を持つモデルのクラスは暗黙のモデルである。
モデルパラメータとシミュレーションデータ間の相互情報(MI)を実用関数として用いたパラメータ推定のための新しい逐次設計フレームワークを考案する。
我々のフレームワークは、テストされた様々な暗黙のモデルに対して効率的であることが分かり、数回の反復で正確なパラメータ推定が得られます。
論文 参考訳(メタデータ) (2020-03-20T16:52:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。