論文の概要: Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution
- arxiv url: http://arxiv.org/abs/2605.08575v1
- Date: Sat, 09 May 2026 00:34:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.751019
- Title: Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution
- Title(参考訳): エクササイズ・オブ・エクササイズモデルの実行効率向上のためのエキスパート内アクティベーション空間の探索
- Abstract要約: 我々は,MoEモデルにおいて,経験的アクティベーション空間を相補的かつ未探索の空間空間次元として探求し,活用する。
驚くべきことに、既存のトレーニング済みのMoEモデルでは、相当な試験内間隔が容易に利用できる。
我々は、不活性ニューロンの計算をスキップすることで、エキスパート内アクティベーション間隔を活用するために、vLLMのMoE実行パイプラインを拡張した。
- 参考スコア(独自算出の注目度): 34.06023804017819
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture of Experts (MoE) architecture has become the standard for state-of-the-art large language models, owing to its computational efficiency through sparse expert activation. However, sparsity through finer expert granularity is becoming increasingly difficult to achieve due to fundamental training challenges such as expert collapse and load imbalance. In this work, we explore and leverage intra-expert activation sparsity as a complementary and underexplored dimension of sparsity in MoE models. Surprisingly, substantial intra-expert sparsity is readily available in existing pre-trained MoE models, without any modification to the activation function or model parameters, providing up to 90% sparsity within each expert without significant accuracy loss. We explore intra-expert activation sparsity across eight off-the-shelf MoE models ranging from 1B to 400B parameters, and extend the MoE execution pipeline of vLLM to leverage intra-expert activation sparsity by skipping the computations of inactive neurons, on top of its existing optimizations, achieving up to 2.5 times speedup in MoE layer execution and 1.2 times end-to-end speedup compared to the original dense vLLM baseline.
- Abstract(参考訳): エキスパートの混在(Mixture of Experts)アーキテクチャは、専門家の活性化による計算効率の低下により、最先端の大規模言語モデルの標準となっている。
しかし、専門家の崩壊や負荷不均衡といった基本的な訓練課題のために、より詳細な専門家の粒度による疎結合がますます難しくなってきている。
本研究では,MoEモデルにおいて,経験的アクティベーション空間を相補的かつ未探索な空間空間として活用する。
驚くべきことに、既存のトレーニング済みのMoEモデルでは、アクティベーション関数やモデルパラメータを変更することなく、実質的な専門家内間隔が容易に利用できる。
我々は, 1B から 400B のパラメータを含む 8 個のオフザシェルフ MoE モデルのエクササイズを探索し,vLLM の MoE 実行パイプラインを拡張して,既存の最適化に加えて,不活性ニューロンの計算をスキップすることで,既存の vLLM ベースラインに比べて最大2.5 倍の高速化と 1.2 倍のエンド・ツー・エンド・スピードアップを実現した。
関連論文リスト
- BEAM: Binary Expert Activation Masking for Dynamic Routing in MoE [18.898045833395095]
Mixture-of-Experts (MoE)アーキテクチャはトークンごとに専門家のサブセットだけを活性化する。
既存のアクセラレーション手法では、アーキテクチャの変更でコストがかかるか、あるいは高頻度で厳しいパフォーマンス低下に苦しむ必要がある。
訓練可能なバイナリマスクを用いてトークン適応型エキスパート選択を学習する新しい手法BEAMを提案する。
論文 参考訳(メタデータ) (2026-05-14T06:33:41Z) - ExpertWeaver: Unlocking the Inherent MoE in Dense LLMs with GLU Activation Patterns [68.61814799047956]
Mixture-of-Experts (MoE)は、スパース専門家のアクティベーションを通じて計算効率を保ちながら、モデル容量を効果的にスケールする。
ExpertWeaverは、ニューロンをアクティベーションパターンに従ってパーティショニングする、トレーニング不要のフレームワークで、共有専門家と特殊なルーティング専門家をレイヤ適応構成で構成する。
論文 参考訳(メタデータ) (2026-02-17T11:50:58Z) - Expertise need not monopolize: Action-Specialized Mixture of Experts for Vision-Language-Action Learning [56.129822832095726]
AdaMoEはMixture-of-Experts (MoE)アーキテクチャであり、密度の高いVLAモデルから事前訓練された重量を継承する。
実世界の実験で21.5%の大幅な改善が、ロボット操作タスクの実用的効果を実証している。
論文 参考訳(メタデータ) (2025-10-16T04:52:57Z) - Training Matryoshka Mixture-of-Experts for Elastic Inference-Time Expert Utilization [60.309915093470416]
Matryoshka MoE(M-MoE)は、エキスパートアンサンブルに直接粗い構造を注入するトレーニングフレームワークである。
私たちの作業は、大規模MOEモデルのより実用的で適応可能なデプロイメントの道を開くものです。
論文 参考訳(メタデータ) (2025-09-30T16:56:44Z) - DualSparse-MoE: Coordinating Tensor/Neuron-Level Sparsity with Expert Partition and Reconstruction [15.261077484922616]
Mixture of Experts (MoE) はLarge Language Models (LLM) の主流アーキテクチャとなった。
トレーニング済みMoEモジュールにおけるテンソルとニューロンの二重間隔を精度と効率の両立の鍵因子として同定した。
本稿では,動的テンソルレベル低下と静的ニューロンレベル再構成を統合する推論システムであるDualSparse-MoEを提案する。
論文 参考訳(メタデータ) (2025-08-25T18:08:32Z) - Towards Greater Leverage: Scaling Laws for Efficient Mixture-of-Experts Language Models [25.608085561102566]
本稿では,高密度等価量上でのMoEモデルの計算優位性を定量化する指標として,レバレッジ効率(EL)を紹介する。
ELは、予測可能な電力法に従って、専門家のアクティベーション比と総計算予算によって駆動される。
我々はこれらの発見を統合スケーリング法則に統合し、その構成に基づいてMoEアーキテクチャのELを正確に予測する。
論文 参考訳(メタデータ) (2025-07-23T17:10:23Z) - Latent Prototype Routing: Achieving Near-Perfect Load Balancing in Mixture-of-Experts [0.0]
Latent Prototype Routing (LPR)は、下流のパフォーマンスを損なうことなく、専門家のバランスのとれた利用を促進する新しいルーティングフレームワークである。
LPRは、専門家負荷のジーニ係数を平均0.70から0.035に減らし、専門家負荷比を1e-6から0.070に改善し、ほぼ完全な負荷分散を実現する。
論文 参考訳(メタデータ) (2025-06-26T14:41:18Z) - DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs [86.76714527437383]
本稿では,事前学習したFFN層を計算ブロックに分割することで,分散化を実現するDSMoEを提案する。
我々は,Sigmoid アクティベーションとストレートスルー推定器を用いた適応型エキスパートルーティングを実装し,トークンがモデル知識の様々な側面に柔軟にアクセスできるようにする。
LLaMAモデルを用いた実験により、DSMoEは既存のプルーニング法やMoE法に比べて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-02-18T02:37:26Z) - GRIN: GRadient-INformed MoE [132.87651078514122]
Mixture-of-Experts (MoE)モデルは、エキスパートルーティングによるスパース計算により、密度の高いモデルよりも効果的にスケールする。
エキスパートルーティングのためのスパース勾配推定を組み込んだGRIN(GRadient-Informed MoE Training)を導入する。
我々のモデルは6.6Bの活性化パラメータしか持たないが、7Bの密度モデルより優れており、同じデータで訓練された14Bの密度モデルの性能と一致している。
論文 参考訳(メタデータ) (2024-09-18T17:00:20Z) - SEER-MoE: Sparse Expert Efficiency through Regularization for Mixture-of-Experts [49.01990048827639]
本稿では,事前学習したMoEモデルのメモリフットプリントと計算要求の両方を削減するためのフレームワークSEER-MoEを紹介する。
第1段階では、ヘビーヒッターズカウントガイダンスを使用して専門家の総数を計算し、第2段階では、正則化に基づく微調整戦略を使用して精度の低下を回復する。
実験により,提案手法の有効性を実証し,精度のトレードオフを最小限に抑えた推論効率に最適化したMoEsモデルを試作した。
論文 参考訳(メタデータ) (2024-04-07T22:13:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。