論文の概要: MobileMoE: Scaling On-Device Mixture of Experts
- arxiv url: http://arxiv.org/abs/2605.27358v1
- Date: Tue, 26 May 2026 17:58:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:42.586635
- Title: MobileMoE: Scaling On-Device Mixture of Experts
- Title(参考訳): MobileMoE: エキスパートのデバイス上での混在を拡大
- Authors: Yanbei Chen, Hanxian Huang, Ernie Chang, Jacob Szwejbka, Digant Desai, Zechun Liu, Vikas Chandra, Raghuraman Krishnamoorthi,
- Abstract要約: サブビリオンアクティブパラメータを持つデバイス上でのMoE言語モデルであるMobileMoEを提案する。
まず、モバイルメモリと計算制約下でのMoEアーキテクチャを協調的に最適化するデバイス上のMoEスケーリング法を定式化する。
我々は、事前学習、中級訓練、教示微調整、量子化対応トレーニングを含む4段階のレシピでMobileMoEを訓練する。
- 参考スコア(独自算出の注目度): 32.364288082407406
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Experts (MoE) has become the de facto architecture for hundred-billion-parameter language models, yet its advantages at sub-billion scales for on-device deployment remain largely unexplored. To close this gap, we present MobileMoE, a family of on-device MoE language models with sub-billion active parameters (0.3-0.9B active and 1.3-5.3B total) that establish a new Pareto frontier for on-device LLMs. We first formulate an on-device MoE scaling law that jointly optimizes MoE architecture under mobile memory and compute constraints, identifying an on-device sweet spot - moderate sparsity with fine-grained and shared experts - that is simultaneously memory and compute-optimal. Building on the derived architectures, we train MobileMoE with a four-stage recipe covering pre-training, mid-training, instruction fine-tuning, and quantization-aware training, all on open-source datasets. Across 14 benchmarks, MobileMoE matches or exceeds leading on-device dense LLMs with 2-4$\times$ fewer inference FLOPs, and matches or surpasses the state-of-the-art MoE OLMoE-1B-7B with up to 60% fewer parameters. To bridge the last mile to mobile deployment, we provide the first efficient MoE inference on commodity smartphones with comprehensive on-device profiling. At comparable INT4 weight memory, MobileMoE-S delivers $1.8$-$3.8\times$ faster prefill and $2.2$-$3.4\times$ faster decode than the dense baseline MobileLLM-Pro.
- Abstract(参考訳): Mixture-of-Experts (MoE) は、100億パラメトリック言語モデルのデファクトアーキテクチャとなっているが、デバイス上でのデプロイメントにおいて、サブビリオンスケールでの利点は、まだ明らかにされていない。
このギャップを埋めるために、サブビリオンアクティブパラメータ(0.3-0.9B、合計1.3-5.3B)を持つデバイス上でのMoE言語モデルのファミリーであるMobileMoEを紹介し、デバイス上でのLCMのための新しいParetoフロンティアを確立する。
まず、モバイルメモリと計算制約下でのMoEアーキテクチャを協調的に最適化する、デバイス上のMoEスケーリング法を定式化し、デバイス上のスイートスポットを特定します。
派生したアーキテクチャに基づいて、MobileMoEを4段階のレシピでトレーニングし、事前トレーニング、中級トレーニング、命令の微調整、量子化対応トレーニングを全てオープンソースデータセットでカバーしています。
14のベンチマークで、MobileMoEはデバイス上の高密度LCMと2-4$\times$より少ない推論FLOPで一致し、最先端のMoE OLMoE-1B-7Bと最大60%のパラメータで一致または超える。
最後のマイルをモバイル展開に橋渡しするために、我々は、デバイス上の包括的なプロファイリングを備えた、最初の効率的なMoE推論をコモディティスマートフォンに提供します。
INT4と比較して、MobileMoE-Sは1.8$-$3.8\times$高速プリフィルと2.2$-$3.4\times$高速デコードを提供する。
関連論文リスト
- Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device [90.46496321553843]
我々は,モバイル端末に統一されたマルチモーダルインテリジェンスを実現する,コンパクトな視覚言語拡散モデルであるMobile-Oを提案する。
そのコアモジュールであるモバイルコンディショニング・プロジェクタ(MCP)は、奥行き分離可能な畳み込みと階層的アライメントを用いた拡散生成器で視覚言語の特徴を融合させる。
iPhone上では512x512イメージあたり3秒でしか動作しないMobile-Oは、エッジデバイス上でリアルタイムに統一されたマルチモーダル理解と生成を行うための最初の実践的なフレームワークを確立している。
論文 参考訳(メタデータ) (2026-02-23T18:59:58Z) - FlashMoE: Reducing SSD I/O Bottlenecks via ML-Based Cache Replacement for Mixture-of-Experts Inference on Edge Devices [0.0]
Mixture-of-Experts (MoE)モデルは、大規模言語モデルを効率的にスケールするために注目を集めている。
MoEモデルは極めて大きく、そのスパースアクティベーションは、一度にモデルのごく一部にアクセスすることで推論を行うことができる。
SSDに非アクティブな専門家をオフロードするシステムであるFlashMoEを提案する。
論文 参考訳(メタデータ) (2026-01-22T17:07:33Z) - SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations [54.303301888915406]
混合エキスパートモデル(MoE)は、計算コストを大幅に増加させることなく、言語モデルをスケールアップするためのデファクトアーキテクチャとして登場した。
最小のアクティベーションキャッシングでMoEの前後パスを計算するメモリ効率のアルゴリズムを提案する。
また,グループ化されたGEMMカーネルのパディングによる無駄計算を最小限に抑える新しい「トークンラウンドリング」手法を提案する。
論文 参考訳(メタデータ) (2025-12-16T04:39:10Z) - SlimMoE: Structured Compression of Large MoE Models via Expert Slimming and Distillation [82.53411922988039]
SlimMoEは、大規模なMoEモデルをより小さく効率的な変種に変換するための多段階圧縮フレームワークである。
このフレームワークを用いて、Phi 3.5-MoE (41.9Bトータル/6.6Bアクティベートパラメータ)を圧縮し、Phi-mini-MoE (7.6Bトータル/2.4Bアクティベートパラメータ)とPhi-tiny-MoE (3.8Bトータル/1.1Bアクティベートパラメータ)を生成する。
実験により、圧縮されたモデルが他のモデルと同等の大きさのモデルよりも優れ、より大きなモデルと競合し続けていることが示された。
論文 参考訳(メタデータ) (2025-06-23T07:15:59Z) - Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models [62.4691912312317]
Mixture-of-Experts (MoE)言語モデルは、性能を犠牲にすることなく、高密度モデルと比較して計算コストを2~4ドル削減することができる。
本稿では,強力な計算とパラメータ効率を実現するMOEモデル(DS-MoE)のためのハイブリッド密集型トレーニングおよびスパース推論フレームワークを提案する。
論文 参考訳(メタデータ) (2024-04-08T14:39:49Z) - Mobile V-MoEs: Scaling Down Vision Transformers via Sparse
Mixture-of-Experts [55.282613372420805]
我々は、資源制約された視覚アプリケーションにとってより魅力的な視覚変換器(ViT)をスケールダウンするために、スパースMOE(sparse MoEs)の使用について検討する。
我々は,個々のパッチではなく画像全体を専門家にルーティングする,シンプルでモバイルフレンドリーなMoE設計を提案する。
V-MoEs(V-MoEs)は高密度VTよりも性能と効率のトレードオフが優れていることを実証的に示す。
論文 参考訳(メタデータ) (2023-09-08T14:24:10Z) - MoESys: A Distributed and Efficient Mixture-of-Experts Training and Inference System for Internet Services [32.278096820269816]
大規模トレーニングと推論の両方において効率を高める新しいMoESysを提案する。
具体的には、トレーニング手順において、提案されたMoESysは、階層ストレージ上の2Dプリフェッチとフュージョン通信を備えたElastic MoEトレーニング戦略を採用する。
単一ノードでのスケーラブルな推論のために、MoESysはCPU-GPUメモリを、モデルをロードするセクションのリングに共同で構築し、効率的な推論のためにラウンドロビン方式でメモリセクション全体で計算タスクを実行する。
論文 参考訳(メタデータ) (2022-05-20T09:09:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。