論文の概要: Scalable Learning of Multivariate Distributions via Coresets
- arxiv url: http://arxiv.org/abs/2603.19792v1
- Date: Fri, 20 Mar 2026 09:28:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:39.084509
- Title: Scalable Learning of Multivariate Distributions via Coresets
- Title(参考訳): コアセットによる多変量分布のスケーラブル学習
- Authors: Zeyu Ding, Katja Ickstadt, Nadja Klein, Alexander Munteanu, Simon Omlor,
- Abstract要約: 我々は,多変量条件変換モデル(MCTM)のための新しいコアセットの構築を行い,そのスケーラビリティと訓練効率を向上させる。
提案手法は,重要サンプリングによる大幅なデータ削減を実現する。
これまでコアセットが組み込まれてきた従来のフルパラメトリックモデルと比較して,我々の半パラメトリックアプローチは適応性の向上を示す。
- 参考スコア(独自算出の注目度): 48.02318786960811
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Efficient and scalable non-parametric or semi-parametric regression analysis and density estimation are of crucial importance to the fields of statistics and machine learning. However, available methods are limited in their ability to handle large-scale data. We address this issue by developing a novel coreset construction for multivariate conditional transformation models (MCTMs) to enhance their scalability and training efficiency. To the best of our knowledge, these are the first coresets for semi-parametric distributional models. Our approach yields substantial data reduction via importance sampling. It ensures with high probability that the log-likelihood remains within multiplicative error bounds of $(1\pm\varepsilon)$ and thereby maintains statistical model accuracy. Compared to conventional full-parametric models, where coresets have been incorporated before, our semi-parametric approach exhibits enhanced adaptability, particularly in scenarios where complex distributions and non-linear relationships are present, but not fully understood. To address numerical problems associated with normalizing logarithmic terms, we follow a geometric approximation based on the convex hull of input data. This ensures feasible, stable, and accurate inference in scenarios involving large amounts of data. Numerical experiments demonstrate substantially improved computational efficiency when handling large and complex datasets, thus laying the foundation for a broad range of applications within the statistics and machine learning communities.
- Abstract(参考訳): 効率的でスケーラブルな非パラメトリック回帰分析と半パラメトリック回帰分析と密度推定は、統計学と機械学習の分野において重要である。
しかし、利用可能な方法は大規模データを扱う能力に限られている。
本稿では,多変量条件変換モデル(MCTM)のコアセットを新たに構築し,そのスケーラビリティと訓練効率を向上させることで,この問題に対処する。
我々の知る限りでは、これらは半パラメトリック分布モデルのための最初のコアセットである。
提案手法は,重要サンプリングによる大幅なデータ削減を実現する。
対数類似度が$(1\pm\varepsilon)$の乗法誤差境界内にあることを高い確率で保証し、したがって統計モデルの精度を維持する。
これまでコアセットが組み込まれてきた従来のフルパラメトリックモデルと比較して、我々の半パラメトリックアプローチは、特に複雑な分布や非線形関係が存在するが完全には理解されていないシナリオにおいて、適応性の向上を示す。
対数項の正規化に伴う数値的な問題に対処するために,入力データの凸包に基づく幾何近似に従う。
これにより、大量のデータを含むシナリオにおいて、実現可能、安定、そして正確な推論が保証される。
数値実験により、大規模で複雑なデータセットを扱う際の計算効率が大幅に向上し、統計学や機械学習コミュニティにおける幅広い応用の基礎を築いた。
関連論文リスト
- Contributions to Robust and Efficient Methods for Analysis of High Dimensional Data [3.8590360275860767]
この論文は、高次元データを解析するための頑健で計算学的に効率的な手法を開発する。
Tsallisパワースパースルーエントロピーに基づく混合効果モデルの開発により,高次元相関観測のロバストなモデリングに寄与する。
数値安定性を維持しつつ非線形収束を加速する新しい共役アルゴリズムを開発した。
論文 参考訳(メタデータ) (2025-09-09T21:30:01Z) - A Unified MDL-based Binning and Tensor Factorization Framework for PDF Estimation [19.747102062281545]
多変量確率密度関数推定のための新しい非パラメトリックアプローチを提案する(PDF)。
提案手法は, 共役確率テンソルの正準多進分解(CPD)を利用するテンソル分解法に基づく。
我々は,本手法が合成データおよび実生豆分類データセットに与える影響を実証した。
論文 参考訳(メタデータ) (2025-04-25T20:27:04Z) - Computation-Aware Gaussian Processes: Model Selection And Linear-Time Inference [55.150117654242706]
我々は、1.8万のデータポイントでトレーニングされた計算対応GPのモデル選択が、1つのGPU上で数時間以内に可能であることを示す。
この研究の結果、ガウス過程は、不確実性を定量化する能力を著しく妥協することなく、大規模なデータセットで訓練することができる。
論文 参考訳(メタデータ) (2024-11-01T21:11:48Z) - Inference for Large Scale Regression Models with Dependent Errors [3.3160726548489015]
この研究は、外因性変数を持つ一般化ウェーブレットモーメント法(GMWMX)の統計的性質を定義し、証明する。
これは、遅延依存構造や欠落データのようなデータ複雑度が存在するプロセスを用いて、線形モデルに対する推論を推定し、提供するための、高度にスケーラブルで安定で統計的に有効な方法である。
論文 参考訳(メタデータ) (2024-09-08T17:01:05Z) - Diffusion posterior sampling for simulation-based inference in tall data settings [53.17563688225137]
シミュレーションベース推論(SBI)は、入力パラメータを所定の観測に関連付ける後部分布を近似することができる。
本研究では、モデルのパラメータをより正確に推測するために、複数の観測値が利用できる、背の高いデータ拡張について考察する。
提案手法を,最近提案した各種数値実験の競合手法と比較し,数値安定性と計算コストの観点から,その優位性を実証した。
論文 参考訳(メタデータ) (2024-04-11T09:23:36Z) - Partially factorized variational inference for high-dimensional mixed models [0.0]
変分推論は、特にベイズ的文脈において、そのような計算を行う一般的な方法である。
標準平均場変動推論は,高次元の後方不確かさを劇的に過小評価することを示した。
次に、平均場仮定を適切に緩和すると、不確実な定量化が高次元で悪化しない手法が導かれることを示す。
論文 参考訳(メタデータ) (2023-12-20T16:12:37Z) - TACTiS: Transformer-Attentional Copulas for Time Series [76.71406465526454]
時間変化量の推定は、医療や金融などの分野における意思決定の基本的な構成要素である。
本稿では,アテンションベースデコーダを用いて関節分布を推定する多元的手法を提案する。
本研究では,本モデルが実世界の複数のデータセットに対して最先端の予測を生成することを示す。
論文 参考訳(メタデータ) (2022-02-07T21:37:29Z) - Distributed Learning of Finite Gaussian Mixtures [21.652015112462]
有限ガウス混合系の分散学習における分割・対数アプローチについて検討する。
新しい推定器は整合性を示し、いくつかの一般的な条件下ではルート-nの整合性を保持する。
シミュレーションおよび実世界のデータに基づく実験により、提案手法はグローバル推定器と同等の統計的性能を有することが示された。
論文 参考訳(メタデータ) (2020-10-20T16:17:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。