論文の概要: Towards a Statistical Understanding of Mixture-of-Experts
- arxiv url: http://arxiv.org/abs/2609.03501v1
- Date: Thu, 03 Sep 2026 08:03:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.977167
- Title: Towards a Statistical Understanding of Mixture-of-Experts
- Title(参考訳): 混成実験の統計的理解に向けて
- Abstract要約: Mixture-of-experts (MoE)アーキテクチャは、入力依存のルーティングを通じて専門家予測器のコレクションを組み合わせることで、モデル容量を増加させる。
我々は、MoEを局所化集約の一形態とみなし、この局所化が近似-推定-計算のトレードオフをどう見直すかを示す。
我々はまた、入力空間の幾何学を通してゲーティングを解釈し、局所的な専門家の利点のある領域にルーティング性能を関連付けるとともに、DeepSeekMoEのようなアーキテクチャで採用されている共有専門家が、どのように共通の予測構造を抽出できるかを示す。
- 参考スコア(独自算出の注目度): 9.70213785111328
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture-of-experts (MoE) architectures increase model capacity by combining a collection of expert predictors through input-dependent routing, while often activating only a small subset of experts for each input. Despite their growing importance in modern large-scale models, the statistical roles of their design choices, especially routing, sparse activation, and shared experts, remain only partially understood, as existing theory has largely focused on parametric or correctly specified MoE models. In this paper, we view MoE as a form of localized aggregation and show how this localization reshapes the approximation-estimation-computation tradeoff. We derive oracle risk bounds for learning dense and sparse routing with evolving experts, separating approximation, expert-learning, and router-estimation errors, and characterize how sparse Top-K routing can retain the benefits of localized aggregation while controlling per-input computation. We also interpret gating through the geometry of input space, relating routing performance to regions of local expert advantage, and show how shared experts, as adopted in architectures such as DeepSeekMoE, can extract common predictive structure so that routed experts focus on residual local variation. Together, these results provide a unified statistical framework for understanding MoE through input-dependent expert aggregation, in which expert specialization and computational tradeoffs are governed by local predictive structure.
- Abstract(参考訳): Mixture-of-experts (MoE)アーキテクチャは、入力依存のルーティングを通じて専門家予測器のコレクションを組み合わせることで、モデルのキャパシティを向上する。
現代の大規模モデルにおいてその重要性は増しているが、それらの設計選択の統計的役割、特にルーティング、スパースアクティベーション、および共有専門家は、既存の理論がパラメトリックまたは正しく特定されたMoEモデルに主に焦点を当てているため、部分的にしか理解されていない。
本稿では,MoEを局所化アグリゲーションの一形態とみなし,この局所化が近似-推定-計算のトレードオフにどう影響するかを示す。
我々は、進化する専門家と密で疎いルーティングを学習し、近似、エキスパートラーニング、ルータ推定誤差を分離し、Sparse Top-Kルーティングが、インプット毎の計算を制御しながら、局所的な集約の利点を如何に維持できるかを特徴付けるために、オラクルのリスク境界を導出する。
我々はまた、入力空間の幾何学を通してゲーティングを解釈し、局所的な専門家の利点のある領域にルーティング性能を関連付けるとともに、DeepSeekMoEのようなアーキテクチャで採用されている共有専門家が、共通予測構造を抽出して、ルーティングされた専門家が残留する局所的変動に焦点を合わせる方法を示す。
これらの結果は、専門家の専門化と計算トレードオフが局所的な予測構造によって管理される、入力依存のエキスパートアグリゲーションを通じてMoEを理解するための統一的な統計フレームワークを提供する。
関連論文リスト
- Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation [49.8459545291965]
Mixture-of-experts (MoE)モデルは、最近、一定数の完全なエキスパートをルーティングする以上の動きをしている。
我々は、この依存度を、わずかにリサイクルされたフィードフォワードの専門家をキーバリューチャネルに分解することで研究する。
トークン適応型MoE計算のための統一フレームワークであるUniF-MoEでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-11T02:40:58Z) - Multi-Domain Learning with Global Expert Mapping [102.62297074508147]
Mixture-of-Experts (MoE)モデルは、入力を専門分野(専門家)にルーティングすることでスケーラブルなソリューションを提供する。
本稿では,学習ルータをグローバルスケジューラに置き換えるプランナー・コンパイラフレームワークであるGEMを提案する。
我々のプランナーは線形プログラミングの緩和に基づいて、データセットを専門家に分数的に割り当てる一方、コンパイラはこのソフトプランを決定論的でキャパシティを意識したマッピングに変換するために階層的なラウンドリングを適用する。
実験の結果、GEM-DINOはUODBベンチマークで最先端のパフォーマンスを達成し、表現不足のデータセットに顕著な利益をもたらし、タスク干渉をわずかに解決していることがわかった。
論文 参考訳(メタデータ) (2026-04-20T21:09:34Z) - MoE Lens -- An Expert Is All You Need [0.09444932939944471]
エキスパートの混合(MoE)モデルは、スパース専門家のアクティベーションを通じてパラメータ効率のスケーリングを可能にする。
本稿では,2つの相補的アプローチを用いて,MoEsの専門家専門化の体系的分析を行う。
論文 参考訳(メタデータ) (2026-03-06T01:35:28Z) - The Illusion of Specialization: Unveiling the Domain-Invariant "Standing Committee" in Mixture-of-Experts Models [18.428606280260187]
エキスパートモデルの混合は、スパースルーティングによってドメインの特殊化を実現すると広く仮定されている。
我々は,個別の専門家ではなく,専門家グループレベルでのルーティング行動を分析するフレームワークであるCOMMITTEEAUDITを紹介する。
私たちは、スタンドング委員会が、ドメイン、レイヤ、およびルーティング予算をまたいだルーティングマスの大部分を一貫して捉えていることに気付きました。
論文 参考訳(メタデータ) (2026-01-06T21:29:45Z) - Enhancing CTR Prediction with De-correlated Expert Networks [45.50697497028273]
本稿では,専門的相関を最小化するクロスエキスパートデコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレーショナル・デコレー
我々はD-MoEがMulti-Embedding MoEベースラインと比較して1.19%のGross Merchandise Volume (GMV)リフトを達成することを示す。
論文 参考訳(メタデータ) (2025-05-23T14:04:38Z) - Domain-Specific Pruning of Large Mixture-of-Experts Models with Few-shot Demonstrations [48.890534958441016]
本研究では,大規模MoEモデルにおける領域の特殊化と専門的冗長性について検討する。
本稿では,最も関係のある専門家のみを識別・保持するための簡易で効果的な刈取フレームワークであるEASY-EPを提案する。
DeepSeek-R1とDeepSeek-V3-0324の実験は、我々の手法が同じメモリ予算の下で同等の性能と2.99タイムのスループットを達成できることを示した。
論文 参考訳(メタデータ) (2025-04-09T11:34:06Z) - Generalization Error Analysis for Sparse Mixture-of-Experts: A Preliminary Study [65.11303133775857]
Mixture-of-Experts (MoE)計算アマルガメート予測
Sparse MoEは、限られた数、あるいは1つの専門家だけを選択的に扱うことで、経験的に保存され、時にはパフォーマンスが向上する一方で、オーバーヘッドを大幅に削減する。
論文 参考訳(メタデータ) (2024-03-26T05:48:02Z) - MoEC: Mixture of Expert Clusters [93.63738535295866]
Sparsely Mixture of Experts (MoE)は、安価な計算オーバーヘッドを持つ有望なスケーリング能力のため、大きな関心を集めている。
MoEは密度の高い層をスパースの専門家に変換し、ゲートルーティングネットワークを使用して専門家を条件付きで活性化させる。
しかし、専門家の数が増加するにつれて、乱雑なパラメータを持つMoEはデータアロケーションの過度な調整とスパースに悩まされる。
論文 参考訳(メタデータ) (2022-07-19T06:09:55Z) - On the Representation Collapse of Sparse Mixture of Experts [102.83396489230375]
専門家のまばらな混合は、一定の計算オーバーヘッドを必要としながら、より大きなモデルキャパシティを提供する。
入力トークンを隠された表現に従ってベストマッチした専門家に分散するためにルーティング機構を使用する。
しかし、そのようなルーティングメカニズムを学ぶことで、専門家のセントロイドを中心にトークンのクラスタリングが促進され、表現の崩壊の傾向が示唆される。
論文 参考訳(メタデータ) (2022-04-20T01:40:19Z) - Gaussian Experts Selection using Graphical Models [7.530615321587948]
ローカル近似は、元のデータセットをサブセットに分割し、各サブセットでローカル専門家を訓練することで、時間の複雑さを低減する。
我々は、専門家間の条件依存を符号化するスパース精度行列を用いて、非方向性のグラフィカルモデルに関する文献からのテクニックを活用し、最も重要な専門家を選択する。
論文 参考訳(メタデータ) (2021-02-02T14:12:11Z) - Aggregating Dependent Gaussian Experts in Local Approximation [8.4159776055506]
我々は,条件付き独立の強い違反を検出することによって,ガウスの専門家を集結させる新しいアプローチを提案する。
専門家間の依存関係は、精度行列を生成するガウス図形モデルを用いて決定される。
我々の新しい手法は、SOTAアプローチよりもはるかに時間効率が高く、他の最先端(SOTA)DGP手法よりも優れている。
論文 参考訳(メタデータ) (2020-10-17T21:49:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。