論文の概要: An Analysis of Posterior Collapse, Parameterization and Initialization in Variational Deep Gaussian Processes
- arxiv url: http://arxiv.org/abs/2606.25882v1
- Date: Wed, 24 Jun 2026 14:25:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.359162
- Title: An Analysis of Posterior Collapse, Parameterization and Initialization in Variational Deep Gaussian Processes
- Title(参考訳): 変分深いガウス過程における後部崩壊・パラメータ化・初期化の解析
- Authors: Francisco Javier Sáez-Maldonado, Juan Maroñas, Daniel Hernández-Lobato,
- Abstract要約: DGPは確率的モデルであり、いくつかの層にまたがるGPを達成する顕著な予測性能を持つ。
DGPの厳密な推論は難解であり、変分推論はクルバック・リーブラの発散を最小限にして調整されたパラメトリック分布と後部を近似するためにしばしば用いられる。
本研究は、DGPの後方崩壊について研究し、DSVIアルゴリズムと広く使われている線形先行平均関数との関係を同定する。
- 参考スコア(独自算出の注目度): 9.176056742068814
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: DGPs are probabilistic models with remarkable prediction performance that concatenate GPs across several layers. Exact inference in DGPs is intractable, and variational inference is often used to approximate the posterior with a parametric distribution tuned by minimizing the Kullback-Leibler divergence. Moreover, finding a good VI approximation is challenging. In particular, a problem of VI is posterior collapse, where VI converges to a variational posterior that matches the prior. In variational DGPs, this implies explaining the data as noise. This work studies posterior collapse in DGPs and identifies its connection to the DSVI algorithm and the widely used linear prior mean function employed in all but the last layer. We show that the benefit of the linear prior mean does not arise from avoiding the non-injective pathology in very deep DGPs, as previously believed, but from improving the conditioning of the optimization problem at initialization. Thus, we propose an alternative initialization of a zero prior mean DGP that mimics a DGP with a linear prior mean at initialization. This enables successful training of DGPs without imposing optimization-driven constraints on the prior, allowing to choose the prior based on modeling assumptions rather than optimization convenience. Our analysis considers three common parameterizations of DGPs and shows that not all of them benefit from a linear prior mean. We also explain why a whitened parameterization of the \DGP provides more stable convergence, something often assumed from experience, but lacking a rigorous analysis. Furthermore, we show that this stability is also beneficial to avoid the posterior collapse problem. Extensive experiments validate our findings: the proposed initialization prevents posterior collapse, improves stability, and achieves performance comparable to (and sometimes better than) DGPs with a linear prior mean.
- Abstract(参考訳): DGPは、複数の層にまたがるGPを結合する顕著な予測性能を持つ確率モデルである。
DGPの厳密な推論は難解であり、変分推論はクルバック・リーブラの発散を最小限にして調整されたパラメトリック分布と後部を近似するためにしばしば用いられる。
さらに、良いVI近似を見つけることは困難である。
特に、VI の問題は後部崩壊であり、VI は前部と一致する変分後部に収束する。
変分DGPでは、これはデータがノイズとして説明されることを意味する。
本研究は, DGPの後方崩壊について検討し, DSVIアルゴリズムと, 最後の層を除いて広く用いられている線形平均関数との関係を明らかにする。
線形先行平均の利点は、先述したように、非常に深いDGPの非射影病理を回避することではなく、初期化時の最適化問題の条件付けを改善することにある。
そこで本研究では,DGP を初期化時に線形先行平均で模倣するゼロ先行平均 DGP の代替初期化を提案する。
これにより、事前の最適化駆動制約を課さずにDGPのトレーニングを成功させることができ、最適化の利便性よりもモデリングの前提に基づいて事前を選択することができる。
本分析はDGPの3つの共通パラメータ化を考察し,これらすべてが線形先行平均から恩恵を受けるわけではないことを示す。
また、DGPの白化パラメタライゼーションがより安定な収束をもたらす理由も説明し、経験からしばしば仮定されるが厳密な解析は欠如している。
さらに, この安定性は, 後部崩壊問題を回避する上でも有用であることを示す。
提案した初期化は後方崩壊を防止し、安定性を向上し、線形先行平均のDGPに匹敵する性能を達成する。
関連論文リスト
- Amortized Variational Inference for Deep Gaussian Processes [0.0]
ディープガウス過程(DGP)はガウス過程(GP)の多層一般化である
本稿では,DGPに対して,各観測を変動パラメータにマッピングする推論関数を学習するアモータライズされた変分推論を導入する。
本手法は, 計算コストの低い従来の手法よりも, 同様に, あるいはより優れた性能を示す。
論文 参考訳(メタデータ) (2024-09-18T20:23:27Z) - Domain Invariant Learning for Gaussian Processes and Bayesian
Exploration [39.83530605880014]
そこで本研究では,確率を最小限に最適化したガウス過程(DIL-GP)の領域不変学習アルゴリズムを提案する。
数値実験により、複数の合成および実世界のデータセットの予測におけるDIL-GPの優位性を示す。
論文 参考訳(メタデータ) (2023-12-18T16:13:34Z) - Stable Nonconvex-Nonconcave Training via Linear Interpolation [51.668052890249726]
本稿では,ニューラルネットワークトレーニングを安定化(大規模)するための原理的手法として,線形アヘッドの理論解析を提案する。
最適化過程の不安定性は、しばしば損失ランドスケープの非単調性によって引き起こされるものであり、非拡張作用素の理論を活用することによって線型性がいかに役立つかを示す。
論文 参考訳(メタデータ) (2023-10-20T12:45:12Z) - Efficient Private SCO for Heavy-Tailed Data via Averaged Clipping [40.69950711262191]
我々は、差分プライベート(DP)を保証する重み付きデータに対する差分プライベート凸最適化について検討する。
我々は,制約付きおよび制約なし凸問題に対するAClipped-dpSGDというアルゴリズムに対して,新たな収束結果を確立し,複雑性境界を改善した。
論文 参考訳(メタデータ) (2022-06-27T01:39:15Z) - Shallow and Deep Nonparametric Convolutions for Gaussian Processes [0.0]
GPの非パラメトリックプロセス畳み込み定式化を導入し,機能サンプリング手法を用いて弱点を緩和する。
古典的ディープGPモデルの代替となるこれらの非パラメトリック畳み込みの合成を提案する。
論文 参考訳(メタデータ) (2022-06-17T19:03:04Z) - Incremental Ensemble Gaussian Processes [53.3291389385672]
本稿では,EGPメタラーナーがGP学習者のインクリメンタルアンサンブル(IE-) GPフレームワークを提案し,それぞれが所定のカーネル辞書に属するユニークなカーネルを持つ。
各GP専門家は、ランダムな特徴ベースの近似を利用してオンライン予測とモデル更新を行い、そのスケーラビリティを生かし、EGPメタラーナーはデータ適応重みを生かし、熟練者ごとの予測を合成する。
新たなIE-GPは、EGPメタラーナーおよび各GP学習者内における構造化力学をモデル化することにより、時間変化関数に対応するように一般化される。
論文 参考訳(メタデータ) (2021-10-13T15:11:25Z) - Benign Overfitting of Constant-Stepsize SGD for Linear Regression [122.70478935214128]
帰納バイアスは 経験的に過剰フィットを防げる中心的存在です
この研究は、この問題を最も基本的な設定として考慮している: 線形回帰に対する定数ステップサイズ SGD。
我々は、(正規化されていない)SGDで得られるアルゴリズム正則化と、通常の最小二乗よりも多くの顕著な違いを反映する。
論文 参考訳(メタデータ) (2021-03-23T17:15:53Z) - Reducing the Amortization Gap in Variational Autoencoders: A Bayesian
Random Function Approach [38.45568741734893]
GPモデルの推論は、セミアモタイズ法よりもはるかに高速な1つのフィードフォワードパスによって行われる。
提案手法は,複数のベンチマークデータセットの最先端データよりも高い確率でテストデータが得られることを示す。
論文 参考訳(メタデータ) (2021-02-05T13:01:12Z) - On the Convergence Rate of Projected Gradient Descent for a
Back-Projection based Objective [58.33065918353532]
我々は、最小二乗(LS)の代替として、バックプロジェクションに基づく忠実度項を考える。
LS項ではなくBP項を用いることで最適化アルゴリズムの繰り返しを少なくすることを示す。
論文 参考訳(メタデータ) (2020-05-03T00:58:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。