論文の概要: Expert Routing for Communication-Efficient MoE via Finite Expert Banks
- arxiv url: http://arxiv.org/abs/2605.05278v1
- Date: Wed, 06 May 2026 16:00:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.336839
- Title: Expert Routing for Communication-Efficient MoE via Finite Expert Banks
- Title(参考訳): 有限エキスパートバンクによるコミュニケーション効率の良いMoEのためのエキスパートルーティング
- Authors: Mohammad Reza Deylam Salehi, Ali Khalesi,
- Abstract要約: リソース効率のよい機械学習では、スパース・ミックス・オブ・エクササイズ(MoE)アーキテクチャの利用が増えている。
ゲートをチャネルとして扱い、選択した専門家が利用可能なルーティング情報を定量化するために$I(X;T)$を使用します。
提案するフレームワークは,リソースを意識したMoE推論システムを解析するための実用的なツールを提供する。
- 参考スコア(独自算出の注目度): 3.8673630752805437
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Resource-efficient machine learning increasingly uses sparse Mixture-of-Experts (MoE) architectures, where the gate acts as both a learning component and a routing interface controlling computation, communication, and accuracy. Motivated by finite-rate interpretations of MoE gating, we treat the gate as a stochastic channel and use $I(X;T)$ to quantify the routing information available to the selected expert. To make the associated information quantities tractable beyond synthetic examples, we develop a finite-bank MNIST construction using pretrained CNN experts and a discrete, data-dependent selection rule. Since the selected model belongs to a finite candidate set, the algorithmic mutual information $I(S;W)$ admits a closed-form discrete-entropy estimator from the empirical posterior $q(W|S)$. Sweeping a data-dependence parameter $α$, we observe that $\widehat I(S;W)$ monotonically tracks the generalization gap, while the Xu-Raginsky bound exhibits the expected looseness. We also compare with a uniform union-bound baseline and introduce an empirical estimator of $I(X;T)$ together with a Blahut-Arimoto procedure for tracing an accuracy-rate curve over the expert bank. The proposed framework provides a practical tool for analyzing resource-aware MoE inference systems and for interpreting $I(X;T)$ and $D(R_g)$ as design proxies for efficient expert routing.
- Abstract(参考訳): リソース効率のよい機械学習はスパース・ミックス・オブ・エクササイズ(MoE)アーキテクチャを使い、ゲートは学習コンポーネントと、計算、通信、正確性を制御するルーティングインターフェースの両方として機能する。
MoEゲーティングの有限レート解釈により、ゲートを確率的チャネルとして扱い、選択した専門家が利用できるルーティング情報の定量化に$I(X;T)$を使用する。
そこで本研究では,CNNの専門家による有限バンク型MNISTの構築と,データに依存した離散的選択規則を提案する。
選択されたモデルは有限候補集合に属するので、アルゴリズム的相互情報 $I(S;W)$ は経験的後部$q(W|S)$ から閉形式離散エントロピー推定器を許容する。
データ依存パラメータを$α$とすると、$\widehat I(S;W)$は一般化ギャップを単調に追跡し、Xu-Raginsky境界は期待されるゆるさを示す。
また、統一されたユニオンバウンドベースラインと比較し、専門家バンク上の精度曲線をトレースするブラフト・アリモト法と共に、$I(X;T)$の経験的推定器を導入する。
提案フレームワークは,リソースを意識したMoE推論システムを解析し,より効率的な専門家ルーティングのための設計プロキシとして$I(X;T)$と$D(R_g)$を解釈するための実用的なツールを提供する。
関連論文リスト
- Mixture-of-Experts under Finite-Rate Gating: Communication--Generalization Trade-offs [3.8673630752805437]
Mixture-of-Experts (MoE)アーキテクチャは、予測タスクをゲーティング機構によって選択された専門的なサブネットワークに分解する。
我々は、相互情報境界を専門とし、有限レートゲーティングの速度歪み特性$D(R_g)$を開発する。
この分析により,通信制約付きMoEシステムのキャパシティ・アウェア・リミットが得られ,合成マルチエキスパートモデルの数値シミュレーションにより,ゲーティング速度,表現率,一般化の予測トレードオフが実証的に確認される。
論文 参考訳(メタデータ) (2026-02-16T17:26:12Z) - Improving MoE Compute Efficiency by Composing Weight and Data Sparsity [50.654297246411545]
Mixture-of-Experts 層は重量空間によって計算効率を向上する。
各専門家がトークンのサブセットだけを処理するようなデータスパシティは、補完的な軸を提供する。
論文 参考訳(メタデータ) (2026-01-21T18:53:58Z) - Routing by Analogy: kNN-Augmented Expert Assignment for Mixture-of-Experts [32.65737144630759]
Mixture-of-Experts (MoE)アーキテクチャは、パラメトリックな"router"を使用して、トークンを専門家のまばらなサブセットにディスパッチすることで、大きな言語モデルを効率的にスケールする。
我々は、類似したケースのメモリから最適な専門家の割り当てを再利用する検索強化ルーティングフレームワークであるkNN-MoEを紹介する。
実験の結果、kNN-MoEはゼロショットベースラインよりも優れており、計算コストのかかる微調整に匹敵することがわかった。
論文 参考訳(メタデータ) (2026-01-05T14:16:11Z) - On the sample complexity of semi-supervised multi-objective learning [17.947890912560162]
多目的学習では、競合する可能性のある予測タスクを1つのモデルで共同で解決する必要がある。
Bregman の損失で定義された目的に対して、$mathcalG$ の複雑さはラベルのないデータでのみ有効であることが証明される。
これらのレートは擬似ラベルによる単純な半教師付きアルゴリズムによって達成される。
論文 参考訳(メタデータ) (2025-08-23T22:15:36Z) - Inverse Entropic Optimal Transport Solves Semi-supervised Learning via Data Likelihood Maximization [72.69498649272347]
条件分布は機械学習の中心的な問題です
ペアデータとペアデータの両方を統合する新しいパラダイムを提案する。
提案手法は任意の誤差で理論上真の条件分布を復元可能であることを示す。
論文 参考訳(メタデータ) (2024-10-03T16:12:59Z) - Estimating Treatment Effects under Recommender Interference: A Structured Neural Networks Approach [32.55211271796683]
一般に採用されている差分推定器は、推奨者干渉による推定に大きく偏りがあることが示される。
干渉経路を明示的に表現した「推薦者選択モデル」を提案する。
Weixin短ビデオプラットフォーム上での大規模フィールド実験により本手法の有効性を検証した。
論文 参考訳(メタデータ) (2024-06-20T14:53:26Z) - Patch-level Routing in Mixture-of-Experts is Provably Sample-efficient
for Convolutional Neural Networks [74.68583356645276]
ディープラーニングでは、Mixix-of-experts(MoE)が、サンプル単位またはトーケン単位で専門家(サブネットワーク)を活性化する。
我々は,pMoEが適切な一般化を実現するために,必要なトレーニングサンプル数を確実に削減できることを初めて示す。
論文 参考訳(メタデータ) (2023-06-07T00:16:10Z) - FeDXL: Provable Federated Learning for Deep X-Risk Optimization [105.17383135458897]
我々は、既存のアルゴリズムが適用できないXリスクのファミリーを最適化するために、新しい連邦学習(FL)問題に取り組む。
Xリスクに対するFLアルゴリズムを設計する際の課題は、複数のマシンに対する目的の非可逆性と、異なるマシン間の相互依存にある。
論文 参考訳(メタデータ) (2022-10-26T00:23:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。