論文の概要: Conditioning Tree-Based Diffusions and Flows for Probabilistic Tabular Regression
- arxiv url: http://arxiv.org/abs/2607.28864v1
- Date: Thu, 30 Jul 2026 22:08:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.493721
- Title: Conditioning Tree-Based Diffusions and Flows for Probabilistic Tabular Regression
- Title(参考訳): 確率的タブラリ回帰のための条件付き木系拡散と流れ
- Abstract要約: 木に基づく拡散モデルは、神経密度推定器を使わずに回帰の柔軟な条件付き予測分布に適合する。
これらのデフォルトはバインディングの制約であることを示す: 勾配のブーストされたアンサンブルが実際に解決するのは、教師付き回帰問題である。
DiffGBM を2つの軸に沿って明示する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tree-based diffusion models fit flexible conditional predictive distributions for tabular regression without a neural density estimator, but they inherit their design defaults---noising path, parameterization, training distribution, features, sampler---from the neural setting. We show these defaults are the binding constraint: what a gradient-boosted ensemble actually solves is a supervised regression problem whose conditioning they determine. We present DiffGBM, which makes them explicit along two axes. First, a Gaussian-path flow-matching trainer for $p(y \mid x)$ that learns a velocity field directly and recovers the score algebraically, admitting few-step deterministic ODE sampling. Second, we expose the score-side recipe---residualization, EDM-style preconditioning, log-sigma time sampling, noise-level features, loss weighting, and histogram resolution---as jointly tunable axes over a shared LightGBM surface rather than one frozen bundle. This \emph{score-flex} space represents the published recipe as a special case; across eleven tabular benchmarks under fold-0 tuning, folds-1--5 evaluation, and a matched 40-trial budget and sampler, the selected configurations beat that baseline on \emph{every} dataset (paired Wilcoxon $11/0$, $p<10^{-3}$), with the best aggregate CRPS skill (0.725 vs.\ 0.699) of any row. The two rows are complementary: score-flex buys accuracy with a stochastic sampler and is the slowest row, while flow matching is the cheapest sampler ($5.2\times$ faster than the published baseline) and the best-calibrated DiffGBM row. Tuned non-diffusion baselines still win individual datasets, and stochastic ($\varepsilon>0$) flow samplers do not Pareto-dominate the deterministic corner.
- Abstract(参考訳): ツリーベースの拡散モデルは、ニューラルネットワークの密度推定器を使わずに、柔軟な条件付き回帰の予測分布に適合するが、彼らは設計のデフォルトを継承する。
これらのデフォルトは束縛制約であることを示す: 勾配ブーストされたアンサンブルが実際に解くのは、条件が決定される教師付き回帰問題である。
DiffGBM を2つの軸に沿って明示する。
まず、速度場を直接学習し、スコアを代数的に回復する$p(y \mid x)$のガウスパスフローマッチングトレーナー。
第2に,残効化,EDM型プレコンディショニング,ログシグマ時間サンプリング,ノイズレベル特徴,損失重み付け,ヒストグラム分解能を,凍結束ではなく共有光GBM表面上の共振可能な軸として公開する。
この 'emph{score-flex} 空間は、公表されたレシピを特別なケースとして表現している: fold-0 チューニング、folds-1--5 評価、マッチした 40-trial budget と sampler の下での11の表計算ベンチマークにおいて、選択された構成は、そのベースラインを 'emph{every} データセット (ペア化された Wilcoxon $11/0$, $p<10^{-3}$) で破る。
行の0.699。
スコアフレックスは確率的なサンプリング器で正確さを買い取り、最も遅い行であるのに対して、フローマッチングは最も安いサンプリング器(5.2\times$)と最高の校正されたDiffGBM行である。
調整された非拡散ベースラインは依然として個々のデータセットに勝利し、確率的な(\varepsilon>0$)フローサンプリングはパレートが決定論的コーナーを支配しない。
関連論文リスト
- Drift Variation Autoencoder: Unifying Generation and Representation Learning through Conditional Posterior Flow Matching [0.0]
この研究は、条件生成の共通統計対象として対応する後続の$P(Xmid C)$を取る。
ドリフト変動オートエンコーダは、マスク付きエンコーダ$Z=E(C)$と、1つのきれいな予測フローマッチング損失を持つ条件付きフローデコーダを訓練する。
論文 参考訳(メタデータ) (2026-08-25T20:38:50Z) - Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training [51.18425726646089]
我々は、画像とビデオの拡散モデルのための統合潜在空間フレームワークであるtextscSUREを提案する。
報酬分布を学習し、信頼性を直接利用して、密集したポストトレーニングをガイドする。
textscSURE-REFLは評価手法の中で最も高いVBench品質、セマンティック、総得点を達成する。
論文 参考訳(メタデータ) (2026-08-06T14:55:42Z) - Round-Trip Consistency: Bidirectional Diffusion Models Can Predict Their Own Rollout Errors [51.56484100374058]
自動回帰モデルは、長時間のロールアウトでエラーを蓄積しますが、デプロイ時には、それを測定するための基本的な真実はありません。
我々は、方向フラグを介して動的システムを前方または後方にステップする単一の条件付き潜在拡散モデルを訓練する。
この双方向性は測定不要なテスト時間誤差信号を提供することを示す。
論文 参考訳(メタデータ) (2026-08-01T13:49:46Z) - Velocity Scheduled Flow Matching [0.0]
フローマッチングはニューラルネットワークを訓練し、ノイズとデータの間の線形補間子に沿って条件速度を後退させる。
条件付きターゲットに取って代わるVelocity Scheduled Flow Matchingを導入する。
VSFMは、一様でないプロファイルにODEを統合することで、任意の許容プロファイルの下でサンプル化することができる。
論文 参考訳(メタデータ) (2026-07-13T11:50:06Z) - Asymptotic-Preserving A Posteriori Analysis of Diffusion and Flow-Matching Samplers [0.6768558752130311]
拡散及びフローマッチングサンプリングは、学習した確率フローODEを、大きなノイズスケールから小さな終端フロア($_min$)まで統合し、スコアが硬く、フローが境界層を発達させる。
特異摂動パラメータとして$_min$を扱い、どの固定ステップサンプリングが解けるかを決定する。
論文 参考訳(メタデータ) (2026-07-05T04:48:33Z) - Inverse Design for Conditional Distribution Matching [0.0]
条件分布マッチング(CDM)は、生成モデルにおける新しい逆設計問題クラスである。
MLGD-F (Matching-Loss Guided Diffusion with a Fast inner sampler) は,事前学習したスコアベース拡散モデルと事前学習した高速条件付きサンプルモデルを組み合わせたプラグアンドプレイ推論時アルゴリズムである。
MLGD-Fは1ステップの条件付きサンプリングを利用することで、引き込み可能な勾配計算を可能にし、$mathcalP(Y mid X)$$をメモリ効率と計算量の両方に軽量にする。
論文 参考訳(メタデータ) (2026-05-10T09:27:55Z) - Constrained and Composite Sampling via Proximal Sampler [2.087898608419977]
本研究では,制約サンプリングと複合サンプリングの2つの対数凹型サンプリング問題について検討する。
主な課題は、ミキシングを劣化させることなくフィージビリティを強制することである。
複合サンプリングでは、ターゲットは$exp(-f(x)-h(x))$に比例する。
論文 参考訳(メタデータ) (2026-02-16T05:36:36Z) - Posterior Sampling by Combining Diffusion Models with Annealed Langevin Dynamics [6.987640034932562]
後方サンプリングは、塗装、脱臭、MRI再構成などのタスクのための正確で公正なフレームワークを提供する。
我々は、拡散モデルとランゲヴィン力学の変種を組み合わせることで、スコア誤差の$L4$バウンドだけで条件付きサンプリングを実現することを証明した。
論文 参考訳(メタデータ) (2025-10-30T10:17:27Z) - DISCO: Diversifying Sample Condensation for Efficient Model Evaluation [59.01400190971061]
コスト評価は傾向を低下させ、イノベーションのサイクルを遅くし、環境への影響を悪化させる。
モデル応答の多様性を最大化するサンプルを選択することが重要となる。
我々のメソッドである$textbfDiversifying Sample Condensation (DISCO)$は、最も大きなモデル不一致を持つトップkサンプルを選択します。
論文 参考訳(メタデータ) (2025-10-09T08:53:59Z) - Turnstile $\ell_p$ leverage score sampling with applications [56.403488578703865]
我々は,行列$AinmathbbRntimes d$の行をサンプリングする新しいアルゴリズムを開発した。
我々のアルゴリズムはサンプル行インデックスのセットを返すだけでなく、わずかに乱れた行を $tildea_i approx a_i$ で返却し、サンプリング確率を $varepsilon$ の相対誤差に近似する。
ロジスティック回帰のために、我々のフレームワークは$を達成した最初のアルゴリズムを得る。
論文 参考訳(メタデータ) (2024-06-01T07:33:41Z) - Stochastic Approximation Approaches to Group Distributionally Robust Optimization and Beyond [89.72693227960274]
本稿では,グループ分散ロバスト最適化 (GDRO) を,$m$以上の異なる分布をうまく処理するモデルを学習する目的で検討する。
各ラウンドのサンプル数を$m$から1に抑えるため、GDROを2人でプレイするゲームとして、一方のプレイヤーが実行し、他方のプレイヤーが非公開のマルチアームバンディットのオンラインアルゴリズムを実行する。
第2のシナリオでは、最大リスクではなく、平均的最上位k$リスクを最適化し、分散の影響を軽減することを提案する。
論文 参考訳(メタデータ) (2023-02-18T09:24:15Z) - Optimal Robust Linear Regression in Nearly Linear Time [97.11565882347772]
学習者が生成モデル$Y = langle X,w* rangle + epsilon$から$n$のサンプルにアクセスできるような高次元頑健な線形回帰問題について検討する。
i) $X$ is L4-L2 hypercontractive, $mathbbE [XXtop]$ has bounded condition number and $epsilon$ has bounded variance, (ii) $X$ is sub-Gaussian with identity second moment and $epsilon$ is
論文 参考訳(メタデータ) (2020-07-16T06:44:44Z) - Sample Complexity of Asynchronous Q-Learning: Sharper Analysis and
Variance Reduction [63.41789556777387]
非同期Q-ラーニングはマルコフ決定過程(MDP)の最適行動値関数(またはQ-関数)を学習することを目的としている。
Q-関数の入出力$varepsilon$-正確な推定に必要なサンプルの数は、少なくとも$frac1mu_min (1-gamma)5varepsilon2+ fract_mixmu_min (1-gamma)$の順である。
論文 参考訳(メタデータ) (2020-06-04T17:51:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。