論文の概要: Slicing and Dicing: Configuring Optimal Mixtures of Experts
- arxiv url: http://arxiv.org/abs/2605.11689v1
- Date: Tue, 12 May 2026 07:47:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.676207
- Title: Slicing and Dicing: Configuring Optimal Mixtures of Experts
- Title(参考訳): スライシングとディシング: エキスパートの最適な混合構成
- Authors: Margaret Li, Sneha Kudugunta, Danielle Rothermel, Luke Zettlemoyer,
- Abstract要約: 本研究は,最大6.6Bのパラメータにまたがる2000以上の事前学習走行に関する最初の系統的研究である。
私たちは、全体専門家、専門家の次元、単一層内の異種の専門家サイズ、共有専門家サイズ、ロードバランシングメカニズムを徹底的に変化させています。
専門家の数え方と粒度に焦点を合わせ、その他の選択肢は最終品質に最小限の影響を与える。
- 参考スコア(独自算出の注目度): 49.5613403644084
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Experts (MoE) architectures have become standard in large language models, yet many of their core design choices - expert count, granularity, shared experts, load balancing, token dropping - have only been studied one or two at a time over narrow configuration ranges. It remains an open question whether these choices can be optimized independently, without considering interactions. We present the first systematic study of over 2,000 pretraining runs spanning models up to 6.6B total parameters, in which we exhaustively vary total experts, expert dimension, heterogeneous expert sizing within a single layer, shared expert size and load-balancing mechanisms. We find that at every active-parameter scale that we study, performance consistently improves with total MoE parameters even at extreme active expert parameter ratios like 128.Further, the optimal expert size is nearly invariant to total parameter count and depends only on active parameter count. Third, we see that other choices like shared experts, heterogeneous experts and load-balancing settings have small effects relative to expert count and granularity, although dropless routing yields a consistent gain. Overall, our results suggest a simpler recipe: focus on expert count and granularity, other choices have minimal effect on final quality.
- Abstract(参考訳): 大きな言語モデルではMixture-of-Experts(MoE)アーキテクチャが標準になっているが、その中核となる設計選択 – 専門家数、粒度、共有専門家、ロードバランシング、トークンのドロップ – の多くは、狭い設定範囲で一度に1つか2つしか研究されていない。
相互作用を考慮せずに、これらの選択が独立して最適化できるかどうか、まだ明らかな疑問である。
我々は,最大6.6Bまでのモデルにまたがる2000以上の事前学習ランニングに関する最初の体系的研究を行い,全専門家,専門家次元,単一層内における異質な専門家サイズ,共有専門家サイズ,負荷分散機構を網羅的に変化させた。
調査対象とする各アクティブパラメータスケールにおいて, 最適パラメータサイズは総パラメータ数にほぼ不変であり, アクティブパラメータ数にのみ依存する。
第3に、共有専門家や異種専門家、ロードバランシング設定といった他の選択肢は、専門家の数や粒度に対して小さな影響しか与えないが、ドロップレスルーティングは一貫した利益をもたらす。
専門家の数え方と粒度に焦点を合わせ、その他の選択肢は最終品質に最小限の影響を与える。
関連論文リスト
- MoE Lens -- An Expert Is All You Need [0.09444932939944471]
エキスパートの混合(MoE)モデルは、スパース専門家のアクティベーションを通じてパラメータ効率のスケーリングを可能にする。
本稿では,2つの相補的アプローチを用いて,MoEsの専門家専門化の体系的分析を行う。
論文 参考訳(メタデータ) (2026-03-06T01:35:28Z) - $\infty$-MoE: Generalizing Mixture of Experts to Infinite Experts [43.075289015406355]
Mixture of Experts (MoE)はトークンごとにいくつかのフィードフォワードネットワーク(FFN)を選択し、計算コストとパフォーマンスの効果的なトレードオフを実現する。
トークン毎にサンプリングされた連続値に基づいて,大きなFFNのパラメータの一部を選択可能な$infty$-MoEを提案する。
GPT-2 Small-based $infty$-MoE model, with 19M active and 186M total parameters, is a comparable performance to a dense GPT-2 Medium with 350M parameters。
論文 参考訳(メタデータ) (2026-01-25T03:55:51Z) - Domain-Specific Pruning of Large Mixture-of-Experts Models with Few-shot Demonstrations [48.890534958441016]
本研究では,大規模MoEモデルにおける領域の特殊化と専門的冗長性について検討する。
本稿では,最も関係のある専門家のみを識別・保持するための簡易で効果的な刈取フレームワークであるEASY-EPを提案する。
DeepSeek-R1とDeepSeek-V3-0324の実験は、我々の手法が同じメモリ予算の下で同等の性能と2.99タイムのスループットを達成できることを示した。
論文 参考訳(メタデータ) (2025-04-09T11:34:06Z) - Convergence Rates for Softmax Gating Mixture of Experts [78.3687645289918]
機械学習モデルの効率性とスケーラビリティを向上するための効果的なフレームワークとして、Mixture of Expert (MoE)が登場した。
MoEの成功の中心は、適応的なソフトマックスゲーティングメカニズムであり、各専門家の入力に対する関連性を決定する責任を負い、それぞれの重みを動的に専門家に割り当てる。
標準ソフトマックスゲーティングまたはその変種を備えたMoEの下で,パラメータ推定と専門家推定の収束解析を行い,密度とスパースゲーティングと階層ソフトマックスゲーティングを含む。
論文 参考訳(メタデータ) (2025-03-05T06:11:24Z) - Mixture of Efficient Diffusion Experts Through Automatic Interval and Sub-Network Selection [63.96018203905272]
本稿では, 事前学習した拡散モデルを用いて, 効率の良い専門家の混入を図り, サンプリングコストを削減することを提案する。
提案手法であるDiffPruningの有効性を,複数のデータセットで示す。
論文 参考訳(メタデータ) (2024-09-23T21:27:26Z) - Generalization Error Analysis for Sparse Mixture-of-Experts: A Preliminary Study [65.11303133775857]
Mixture-of-Experts (MoE)計算アマルガメート予測
Sparse MoEは、限られた数、あるいは1つの専門家だけを選択的に扱うことで、経験的に保存され、時にはパフォーマンスが向上する一方で、オーバーヘッドを大幅に削減する。
論文 参考訳(メタデータ) (2024-03-26T05:48:02Z) - Pushing Mixture of Experts to the Limit: Extremely Parameter Efficient
MoE for Instruction Tuning [7.094820944028638]
我々は,MoEアーキテクチャと軽量専門家を組み合わせることで,極めてパラメータ効率の良いMoEを提案する。
本手法は,従来のタスク知識に依存しないため,目に見えないタスクに一般化する。
本研究は,厳密なパラメータ制約の下でも堅牢な性能を実現する能力を示す。
論文 参考訳(メタデータ) (2023-09-11T13:31:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。