論文の概要: ProbMoE: Differentiable Probabilistic Routing for Mixture-of-Experts
- arxiv url: http://arxiv.org/abs/2606.01509v1
- Date: Mon, 01 Jun 2026 00:16:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:29.755359
- Title: ProbMoE: Differentiable Probabilistic Routing for Mixture-of-Experts
- Title(参考訳): ProbMoE:Mixture-of-Expertsのための微分確率的ルーティング
- Authors: Heng Zhao, Zilei Shao, Guy Van den Broeck, Zhe Zeng,
- Abstract要約: Mixture-of-Experts (MoE)モデルはトークンごとに少数の専門家を活性化することでスケールする。
本稿では,確率的ルーティングフレームワークProbMoEを紹介する。
- 参考スコア(独自算出の注目度): 32.864092506780004
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Experts (MoE) models scale by activating only a small subset of experts per token. However, training such models remains challenging because top-$k$ routing is discrete and non-differentiable, requiring gradient estimators for expert selection whose design remains a central open problem. We introduce ProbMoE, a probabilistic routing framework that models expert selection as a distribution over cardinality-constrained expert subsets and formulates routing as probabilistic inference in this discrete subset space. We first propose ProbMoE Exact-$k$ routing, which samples $k$-expert subsets in the forward pass, and the backward pass uses gradients through each expert's exact marginal probability as a tractable surrogate for the true gradient. ProbMoE naturally generalizes to a dynamic-$k$ routing setting, where both training and inference constrain the routing cardinality to the same predefined range, allowing adaptive expert allocation per token. Across benchmarks and model backbones, ProbMoE Exact-$k$ achieves strong performance compared to competitive baselines, with improved expert utilization and routing diversity; ProbMoE Dynamic-$k$ achieves comparable performance with fewer activated experts.
- Abstract(参考訳): Mixture-of-Experts (MoE)モデルはトークンごとに少数の専門家を活性化することでスケールする。
しかし、そのようなモデルのトレーニングは、トップ$のルーティングが離散的で微分不可能であるため、設計が中心的なオープンな問題である専門家の選択に勾配推定器を必要とするため、依然として困難である。
本稿では、確率的ルーティングフレームワークProbMoEを紹介する。これは、専門家選択を基数制約付きエキスパートサブセット上の分布としてモデル化し、この離散部分集合空間における確率的推論としてルーティングを定式化する。
まず最初にProbMoE Exact-$k$ルーティングを提案し、このルーティングは前方パスの$k$-expertサブセットをサンプリングし、後方パスは真勾配の抽出可能なサロゲートとして各専門家の正確な限界確率の勾配を使用する。
ProbMoEは自然に動的$k$ルーティング設定に一般化され、トレーニングと推論の両方がルーティングの濃度を同じ定義範囲に制限し、トークンごとに適応的な専門家割り当てを可能にする。
ベンチマークとモデルバックボーン全体にわたって、ProbMoE Exact-$k$は、専門家の利用率とルーティングの多様性を改善した競合ベースラインと比較して、強力なパフォーマンスを実現している。
関連論文リスト
- Expert Routing for Communication-Efficient MoE via Finite Expert Banks [3.8673630752805437]
リソース効率のよい機械学習では、スパース・ミックス・オブ・エクササイズ(MoE)アーキテクチャの利用が増えている。
ゲートをチャネルとして扱い、選択した専門家が利用可能なルーティング情報を定量化するために$I(X;T)$を使用します。
提案するフレームワークは,リソースを意識したMoE推論システムを解析するための実用的なツールを提供する。
論文 参考訳(メタデータ) (2026-05-06T16:00:46Z) - Path-Constrained Mixture-of-Experts [23.80197713200086]
MoEルーティングは各レイヤの専門家を独立して選択する。
本稿では,連続層にまたがるルータパラメータを共有するパスモエを提案する。
0.9Bおよび16Bパラメータモデルの実験では、独立ルーティングよりも複雑なタスクと下流タスクが一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-03-18T21:35:53Z) - Token-Level LLM Collaboration via FusionRoute [60.72307345997823]
FusionRouteはトークンレベルのマルチLLMコラボレーションフレームワークである。
各デコーディングステップで最も適した専門家を選択し、選択した専門家の次のTokenディストリビューションを洗練または修正する補完ロジットをコントリビュートする。
シーケンスレベルのコラボレーションとトークンレベルのコラボレーション、モデルマージ、ダイレクト微調整の両方に優れています。
論文 参考訳(メタデータ) (2026-01-08T16:53:16Z) - Sparsity-Controllable Dynamic Top-p MoE for Large Foundation Model Pre-training [30.589225478300023]
DTop-pは空間制御可能な動的Top-pルーティング機構である。
DTop-pはTop-kベースラインとTop-pベースラインの両方を一貫して上回ることを示す。
DTop-pは、専門家の粒度、専門家のキャパシティ、モデルサイズ、データセットサイズに関して、強力なスケーリング特性を示す。
論文 参考訳(メタデータ) (2025-12-16T01:28:57Z) - RouteMark: A Fingerprint for Intellectual Property Attribution in Routing-based Model Merging [69.2230254959204]
我々は,統合されたMoEモデルにおけるIP保護のためのフレームワークであるRouteMarkを提案する。
我々の重要な洞察は、タスク固有の専門家は、探索入力の下で安定かつ独特なルーティング行動を示すことである。
属性と改ざん検出のために,類似性に基づくマッチングアルゴリズムを導入する。
論文 参考訳(メタデータ) (2025-08-03T14:51:58Z) - Token-Level Prompt Mixture with Parameter-Free Routing for Federated Domain Generalization [51.562474873972086]
Federated Domain Generalization (FedDG)は、異種データを持つ分散クライアントからグローバルに一般化可能なモデルを学ぶことを目的としている。
近年の研究では、単一のグローバルなプロンプトを学習することで、FedDGの視覚言語モデル(VLM)を適応させる素早い学習が導入されている。
本稿では,FedDGのためのパラメータフリールーティングフレームワークであるTRIPを提案する。
論文 参考訳(メタデータ) (2025-04-29T11:06:03Z) - Mixture of Efficient Diffusion Experts Through Automatic Interval and Sub-Network Selection [63.96018203905272]
本稿では, 事前学習した拡散モデルを用いて, 効率の良い専門家の混入を図り, サンプリングコストを削減することを提案する。
提案手法であるDiffPruningの有効性を,複数のデータセットで示す。
論文 参考訳(メタデータ) (2024-09-23T21:27:26Z) - Patch-level Routing in Mixture-of-Experts is Provably Sample-efficient
for Convolutional Neural Networks [74.68583356645276]
ディープラーニングでは、Mixix-of-experts(MoE)が、サンプル単位またはトーケン単位で専門家(サブネットワーク)を活性化する。
我々は,pMoEが適切な一般化を実現するために,必要なトレーニングサンプル数を確実に削減できることを初めて示す。
論文 参考訳(メタデータ) (2023-06-07T00:16:10Z) - Soft Merging of Experts with Adaptive Routing [38.962451264172856]
適応ルーティングによるエキスパートのソフトマージ(SMEAR)について紹介する
SMEARは、専門家のパラメータの重み付け平均を通して構築された単一の「マージされた」専門家を使用することで、離散的なルーティングを避ける。
我々は,メタデータに基づいた経路モデルや,勾配推定によるスパースルーティングを学習するSMEARモデルを用いたモデルの有効性を実証的に検証した。
論文 参考訳(メタデータ) (2023-06-06T15:04:31Z) - On the Representation Collapse of Sparse Mixture of Experts [102.83396489230375]
専門家のまばらな混合は、一定の計算オーバーヘッドを必要としながら、より大きなモデルキャパシティを提供する。
入力トークンを隠された表現に従ってベストマッチした専門家に分散するためにルーティング機構を使用する。
しかし、そのようなルーティングメカニズムを学ぶことで、専門家のセントロイドを中心にトークンのクラスタリングが促進され、表現の崩壊の傾向が示唆される。
論文 参考訳(メタデータ) (2022-04-20T01:40:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。