論文の概要: COSMOS: Soft Mechanism Mixtures with Verifiable Routing for Long-Horizon PDE Forecasting
- arxiv url: http://arxiv.org/abs/2610.04427v1
- Date: Sat, 03 Oct 2026 10:37:39 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:31:54.137388
- Title: COSMOS: Soft Mechanism Mixtures with Verifiable Routing for Long-Horizon PDE Forecasting
- Title(参考訳): COSMOS:長期PDE予測のための検証可能なルーティングによるソフトメカニズムの混合
- Abstract要約: ソフトメカニズム混合ニューラル演算子COSMOSを提案する。
プロセスバイアスのある4人のスペシャリストは、すべてのステップで活動し続け、学習ゲートによって継続的に混合されます。
専門家は粗い遅延格子を共有し、ゼロdの完全解像度の残留詳細はボトルネックを通して失われた残留詳細を復元する。
ラベル付きベンチマークでは、高密度なソフトルーティングは、同じ融合時のハードトップ1ルーティングよりも2.2タイム=低いエラーをもたらす。
ジェネレータの重みを$wstar$で推論することで、ロールアウトエラーをさらに0.034$に下げ、学習ゲートの制限を診断する。
- 参考スコア(独自算出の注目度): 1.9153836153207706
- License:
- Abstract: Neural operators offer an efficient alternative to classical PDE solvers, but most learn a monolithic map per equation family and discretization. Real systems are compositional: transport, diffusion, wave, and reaction processes can act simultaneously. Existing mixture-of-experts operators typically use sparse top-$K$ routing, although concurrent physics is naturally a blend rather than a discrete choice. We propose COSMOS (Cooperative Operator Specialists with Mechanism-level Operator Soft-routing), a soft mechanism-mixture neural operator. Four process-biased specialists remain active at every step and are continuously mixed by a learned gate, with their features fused by a small network. Specialists share a coarse latent grid, while a zero-initialized full-resolution residual restores detail lost through the bottleneck. We also introduce an operator-splitting compositional benchmark with known mixture weights $w^\star$ per trajectory. Against family-tuned FNO under 20-step rollouts, an initial 3-seed evaluation suggested gains on diffusion--reaction, parity on Navier--Stokes, and weaker shallow-water performance. An 11-seed audit showed that the diffusion--reaction gain was unstable, motivating caution in small-seed rollout comparisons and precluding a reliable accuracy-win claim on these families. Ablations show that uniform routing or removing the specialist mixture substantially degrades stable-regime rollouts. On the labeled benchmark, dense soft routing yields $2.2\times$ lower error than hard top-1 routing at identical fusion; using generator weights $w^\star$ at inference further lowers rollout error to $0.034$, diagnosing limitations of the learned gate. However, routing labels do not align with the specialists' intended mechanisms: COSMOS supports compositional accuracy, not mechanism identity.
- Abstract(参考訳): ニューラル作用素は古典的PDE解法に代わる効率的な代替手段を提供するが、ほとんどの場合方程式群毎のモノリシック写像と離散化を学習する。
輸送、拡散、波動、反応のプロセスは同時に作用する。
既存のミックス・オブ・エグゼクティブ作用素は、通常スパーストップ$K$ルーティングを使用するが、並列物理学は離散的な選択というよりは自然にブレンドである。
ソフトミキチャーニューラルオペレータであるCOSMOS (Cooperative Operator Specialists with Mechanism-level Operator Soft-routing)を提案する。
プロセスバイアスのある4人のスペシャリストは、各ステップで活動し続け、学習ゲートによって継続的に混合され、その特徴は小さなネットワークによって融合される。
専門家は粗い遅延格子を共有し、ゼロ初期化された完全解像度の復元はボトルネックによって詳細が失われる。
また,軌道当たりの混合重量が$w^\star$である演算子分割合成ベンチマークも導入した。
20段階のロールアウトによる家族調整FNOに対して,最初の3シード評価では拡散反応,Navier-Stokesのパリティ,浅水性能の低下が示唆された。
11系統の監査の結果,拡散反応の上昇は不安定であり,ロールアウト比較において注意を喚起し,これらの家族に対する信頼性の高い主張を除外した。
アブレーションは、均一なルーティングや、スペシャリスト混合物の除去が安定レジムロールアウトを著しく劣化させることを示している。
ラベル付きベンチマークでは、密度の高いソフトルーティングは、同じ融合でハードトップ1ルーティングよりも2.2\times$低いエラーをもたらし、推論時にジェネレータ重量$w^\star$を使用すると、ロールアウトエラーはさらに0.034$に減少し、学習ゲートの限界を診断する。
しかし、ルーティングラベルは、専門家の意図したメカニズムと一致しない: COSMOSは、メカニズムのアイデンティティではなく、構成の正確性をサポートしている。
関連論文リスト
- When Load-Balancing Goes Too Far: Expert Pruning in Over-Dispersed Mixture-of-Experts Models [14.959514582161956]
エキスパートプルーニングは、Mixture-of-Experts(MoE)モデルのメモリとサービスコストを削減します。
この仮定は、トークンがほぼ一様に専門家に分散される過分散ルーティングの下で分解されるのを観察する。
筆者らは,現在最も影響の低いドメインに対して,重要度を反復的に向上させるドメイン認識手法であるMinimax Expert Score Allocation (MESA)を提案する。
論文 参考訳(メタデータ) (2026-09-03T20:21:20Z) - When Model Merging Breaks Routing: Training-Free Calibration for MoE [67.27839627141972]
Hessian-Aware Router (HARC) は、二階曲率情報を利用してマージされたルータを認識できるトレーニングフリーのフレームワークである。
数学的推論とコード生成タスクの実験は、HARCが様々なMoEマージベースライン間のルーティングの分解を効果的に軽減していることを示している。
論文 参考訳(メタデータ) (2026-06-02T09:33:33Z) - Martingale Neural Operators: Learning Stochastic Marginals via Doob-Meyer Factorization [0.0]
ドゥーブ=マイヤーの定理は、任意の半マーチンゲールが基本的に予測可能なドリフトと予測不可能なゼロ平均マーチンゲールに分解されることを証明している。
本稿では,初期条件を端末法則の条件平均と共分散に直接マッピングするMartingale Neural Operator(MNO)を紹介する。
MNOはワッサースタイン距離を4ドルフィールド理論で最大120ドル、バーガーズで680ドルまで削減し、壁面のトレーニング予算で一致した条件付き拡散ベースラインよりも早くsim 3timesを評価した。
論文 参考訳(メタデータ) (2026-05-15T10:00:21Z) - $φ$-Balancing for Mixture-of-Experts Training [20.061328126956028]
Mixture-of-Experts (MoE)モデルは、そのスケーラビリティを完全に実現するために、バランスのとれた専門家の利用に依存します。
我々は,厳密な凸性,対称性,および予測されるルーティング分布の微分ポテンシャルを最小化することにより,集団レベルの専門家バランスを直接ターゲットとする原則的フレームワークである$-balancingを提案する。
論文 参考訳(メタデータ) (2026-05-14T20:39:28Z) - A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs [64.8510381475827]
SMOE(Sparse Mixture-of-Experts)アーキテクチャは、大規模言語モデルを効率的にスケールするためにますます使われている。
SMoEモデルは専門家間で厳しい負荷不均衡に悩まされることが多く、専門家のごく一部がほとんどのトークンを受け取り、他のモデルは未利用である。
推定中のエキスパートルーティングの体系的解析を行い, (i) 負荷不均衡が持続し, バッチサイズが大きくなる, (ii) 選択頻度が, 専門家の重要度を確実に反映しない, (iii) 専門家の全体負荷と重要性を, キャリブレーションセットを用いて推定できる,という3つの知見を同定する。
論文 参考訳(メタデータ) (2026-02-23T15:11:16Z) - Grassmannian Mixture-of-Experts: Concentration-Controlled Routing on Subspace Manifolds [6.908972852063454]
Mixture-of-Expertsモデルは、エキスパートにトークンを割り当てるために学習ルータに依存しているが、標準的なソフトマックスゲーティングは、スパーシリティと利用のトレードオフを制御するための原則的なメカニズムを提供していない。
部分空間のグラスマン多様体上で動くルーティングフレームワークGrassmannian MoEを提案する。
論文 参考訳(メタデータ) (2026-02-19T20:03:23Z) - Generalizing GNNs with Tokenized Mixture of Experts [75.8310720413187]
安定性の向上には,変化に敏感な特徴への依存を低減し,既約最悪の一般化フロアを残す必要があることを示す。
本研究では,STEM-GNNを提案する。STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN,STEM-GNN。
9つのノード、リンク、グラフのベンチマークで、STEM-GNNはより強力な3方向バランスを実現し、クリアグラフ上での競争力を維持しながら、次数/ホモフィリーシフトや特徴/エッジの破損に対する堅牢性を改善している。
論文 参考訳(メタデータ) (2026-02-09T22:48:30Z) - Least-Loaded Expert Parallelism: Load Balancing An Imbalanced Mixture-of-Experts [74.40169987564724]
エキスパート並列性(EP)は、複数のデバイスに専門家を分散させることで、MoEモデルをスケールするように設計されている。
極端な不均衡の下で、EPは少数の専門家に不均等な数のトークンを渡し、計算とメモリバウンドの障害を引き起こす。
本稿では,過剰なトークンと関連する専門家パラメータを過負荷デバイスから未利用デバイスへ動的に再帰する新しいEPアルゴリズムであるLast-Loaded Expert Parallelism (LLEP)を提案する。
論文 参考訳(メタデータ) (2026-01-23T18:19:15Z) - Patch-level Routing in Mixture-of-Experts is Provably Sample-efficient
for Convolutional Neural Networks [74.68583356645276]
ディープラーニングでは、Mixix-of-experts(MoE)が、サンプル単位またはトーケン単位で専門家(サブネットワーク)を活性化する。
我々は,pMoEが適切な一般化を実現するために,必要なトレーニングサンプル数を確実に削減できることを初めて示す。
論文 参考訳(メタデータ) (2023-06-07T00:16:10Z) - Permutation Compressors for Provably Faster Distributed Nonconvex
Optimization [68.8204255655161]
本稿では,Gorbunov et al (2021) の MARINA 法が,理論的な通信複雑性の観点から最先端の手法とみなすことができることを示す。
MARINAの理論は、古典的な独立圧縮機設定を超えて、潜在的にエミュレートされた圧縮機の理論を支持するものである。
論文 参考訳(メタデータ) (2021-10-07T09:38:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。