論文の概要: Stable Global Weighting of Flow Mixtures using Simplex Exponential Moving Average
- arxiv url: http://arxiv.org/abs/2607.03809v1
- Date: Sat, 04 Jul 2026 10:31:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.72788
- Title: Stable Global Weighting of Flow Mixtures using Simplex Exponential Moving Average
- Title(参考訳): 簡易指数移動平均値を用いたフローミックスの安定な大域的重み付け
- Authors: Benjamin Wiriyapong, Oktay Karakus, Can Eyupoglu, Kirill Sidorov,
- Abstract要約: emphAMFmbox-VImbox-sEMAは、Emphstableのグローバルな重み付け機構を備えた2段階のフレームワークである。
従来のemphAMFmbox-VIよりも一貫したNLLの改善を実現し、単一フローベースラインの破滅的な輸送障害を回避する。
- 参考スコア(独自算出の注目度): 0.8224695424591678
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Normalising flows provide a powerful variational family for approximate inference, yet individual architectures often fail to generalise across heterogeneous posterior geometries. We revisit mixture-based flow formulations and introduce \emph{AMF\mbox{-}VI\mbox{-}sEMA}, a two-stage framework featuring a \emph{stable global weighting} mechanism based on a \emph{Simplex Exponential Moving Average} (sEMA) update. In Stage~1, a heterogeneous set of experts (\textsc{RealNVP}, \textsc{MAF}, \textsc{RBIG}) are trained independently to specialise in distinct structural regimes. In Stage~2, expert parameters are frozen and global mixture weights are learned through a temperature-controlled softmax of average log-likelihoods, followed by a smooth EMA update on the probability simplex. This design produces a tractable, data-agnostic gating mechanism (without per-sample gating or gradient backpropagation through weights) that adaptively reallocates capacity while avoiding component collapse. We evaluate the framework on ten posterior benchmarks: six canonical 2D synthetic families (Banana, X-Shaped, Bimodal, Multimodal, Two-moons, Rings) and four real/low-dimensional Bayesian targets (BLR, BPR, Weibull, Real-GMM2), with stronger baselines (\textsc{NICE}, \textsc{ResFlow}, and EM-Mixing). Comprehensive evaluation covers NLL, KL divergence, Wasserstein-2 distance, and MMD, together with diagnostics of mixture dynamics, hyperparameter sensitivity, and cross-seed robustness. Empirically, \emph{AMF\mbox{-}VI\mbox{-}sEMA} achieves consistent NLL improvements over its predecessor \emph{AMF\mbox{-}VI} and avoids the catastrophic transport failures of single-flow baselines, while maintaining stable weight trajectories ($N_{\mathrm{eff}}{>}1.4$ on all datasets) with minimal computational overhead.
- Abstract(参考訳): 正規化フローは近似推論のための強力な変分族を提供するが、個々のアーキテクチャは不均一な後続測地をまたぐ一般化に失敗することが多い。
我々は混合フローの定式化を再考し,emph{AMF\mbox{-}VI\mbox{-}sEMA} という2段階のフレームワークを紹介した。
ステージ~1では、異質な専門家の集合(\textsc{RealNVP}, \textsc{MAF}, \textsc{RBIG})が独立に訓練され、異なる構造体系を専門とする。
ステージ~2では、専門家パラメータが凍結し、平均対数類似度の温度制御ソフトマックスによってグローバルな混合重みが学習され、続いて確率単純度に関する円滑なEMA更新が行われる。
この設計は、コンポーネントの崩壊を回避しながらキャパシティを適応的に再配置する(サンプルごとのゲーティングやウェイトによる勾配のバックプロパゲーションを使わずに)、トラクタブルでデータに依存しないゲーティング機構を生成する。
6つの標準2D合成系(バナナ、X字型、ビモダル、マルチモーダル、ツームーン、リング)と4つの実・低次元ベイズ目標(BLR、BPR、ワイブル、リアル-GMM2)と、より強力なベースライン(\textsc{NICE}、 \textsc{ResFlow}、EM-Mixing)について評価を行った。
総合的な評価は、NLL、KL発散、ワッサースタイン-2距離、MDD、混合力学、ハイパーパラメータ感度、種間ロバストネスの診断を網羅する。
経験的に、 \emph{AMF\mbox{-}VI\mbox{-}sEMA} は前回の \emph{AMF\mbox{-}VI} よりも一貫した NLL の改善を実現し、単一のフローベースラインの破滅的な輸送障害を回避すると同時に、安定したウェイトトラジェクトリ (N_{\mathrm{eff}}{>}1.4$) を最小の計算オーバーヘッドで維持する。
関連論文リスト
- LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - Extra-Merge: Tracing the Rank-1 Subspace of Model Merging in Language Model Pre-Training [56.323119575322146]
Extra-Mergeは、GPT-2およびLLaMAファミリーにわたる実験において、標準のマージベースラインを一貫して上回っている。
Pythia-12B下流のタスクに対して一貫したゼロショット精度のゲインを与え、Muon citepjordan2024muonに効果的に一般化する。
論文 参考訳(メタデータ) (2026-05-26T02:48:34Z) - GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding [3.0708725114491293]
ペア化された$ell$-normalized dual-encoder VLM の結合分布を学習するポストホックアダプタとして textbfGeoFlowVLM を提案する。
整合性の結果, 人口制限下では, トレーニングされたネットワークは, 接合流と両モード条件流を露呈することがわかった。
この単一モデルから2つの量を得る:Fano型境界による決定論的解釈でアレター的曖昧さを定量化する条件付き検索エントロピーと、関節NLLの正確な連鎖ルール分解によって正当化される限界特異性スコアである。
論文 参考訳(メタデータ) (2026-05-13T11:12:18Z) - ConsistentRFT: Reducing Visual Hallucinations in Flow-based Reinforcement Fine-Tuning [85.20505958752928]
フローベースモデル上での強化ファインチューニング(RFT)は、優先順位調整に不可欠である。
RFTは、過度に最適化された詳細や意味的なミスアライメントのような視覚幻覚をしばしば導入する。
この研究は、なぜ視覚幻覚が生じるのか、どのようにそれらを減らすのかを予備的に探求する。
論文 参考訳(メタデータ) (2026-02-03T11:49:46Z) - A Fast and Flat Federated Learning Method via Weighted Momentum and Sharpness-Aware Minimization [16.674348270108993]
本稿では,クライアントのSAM方向をグローバル降下幾何学と整合させるため,サーバ集約モーメントからのモーメント誘導大域摂動を提案する。
摂動によって引き起こされる分散$_2=2+(L)2$と理論側の$(S, K, R, N)$への依存を経験的にモデル化する非IID収束境界を提供する。
論文 参考訳(メタデータ) (2025-11-27T04:02:09Z) - Sparse by Rule: Probability-Based N:M Pruning for Spiking Neural Networks [66.61171793101872]
スパイキングニューラルネットワーク(SNN)は、イベント駆動のスパース計算を通じてエネルギー効率の高いインテリジェンスを約束するが、より深いアーキテクチャはパラメータと計算コストを増大させ、エッジデプロイメントを妨げている。
SNNプルーニングの最近の進歩は、この負担を軽減するのに役立っているが、既存の取り組みは、スパシティが高いが一般的なハードウェアでは加速が難しいインハン構造化プルーニング(emphunstructured pruning)と、デプロイが容易だが柔軟性に欠けるエンハン構造化プルーニング(emphstructured pruning)の2つのファミリーに限られる。
最初のSNNであるbfSpikeNMを紹介する。
論文 参考訳(メタデータ) (2025-11-15T08:23:20Z) - MTmixAtt: Integrating Mixture-of-Experts with Multi-Mix Attention for Large-Scale Recommendation [8.34766340139746]
我々は,Multi-Mix Attention を用いたMixture-of-Experts (MoE) アーキテクチャである textbfMTmixAtt を提案する。
textbfAutoTokenモジュールは、異種機能をセマンティックコヒーレントトークンに自動的にクラスタリングし、ヒューマン定義の機能グループの必要性を取り除く。
Meituanの産業TRecデータセットに関する大規模な実験は、MTmixAttが一貫して最先端のベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2025-10-17T03:50:09Z) - Global Convergence of Gradient EM for Over-Parameterized Gaussian Mixtures [53.51230405648361]
勾配EMの力学を考察し, テンソル分解を用いて幾何的景観を特徴付ける。
これは、m=2$という特別な場合を超えるEMや勾配EMに対する最初の大域収束と回復の結果である。
論文 参考訳(メタデータ) (2025-06-06T23:32:38Z) - DFedADMM: Dual Constraints Controlled Model Inconsistency for
Decentralized Federated Learning [52.83811558753284]
分散学習(DFL)は、中央サーバーを捨て、分散通信ネットワークを確立する。
既存のDFL手法は依然として、局所的な矛盾と局所的な過度なオーバーフィッティングという2つの大きな課題に悩まされている。
論文 参考訳(メタデータ) (2023-08-16T11:22:36Z) - Gravitational-wave parameter estimation with autoregressive neural
network flows [0.0]
深部ニューラルネットワークを用いた重力波データから二元ブラックホール系のパラメータを高速に推定するための自己回帰正規化フローを導入する。
正規化フロー(英: normalizing flow)は、単純な確率分布からより複雑なものへの変換を誘導するために用いられるサンプル空間上の可逆写像である。
可変オートエンコーダフレームワークに自己回帰フローを組み込むことにより,より強力な潜在変数モデルを構築する。
論文 参考訳(メタデータ) (2020-02-18T15:44:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。