論文の概要: SpecPrefetch: Parameter-Efficient Expert Prefetching for Sparse MoE Foundation Models
- arxiv url: http://arxiv.org/abs/2607.24787v2
- Date: Thu, 30 Jul 2026 11:13:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.065645
- Title: SpecPrefetch: Parameter-Efficient Expert Prefetching for Sparse MoE Foundation Models
- Title(参考訳): SpecPrefetch: スパースMoE基礎モデルのためのパラメータ効率の良いエキスパートプレフェッチ
- Abstract要約: SpecPrefetchは、オフロードされたMoE推論のためのパラメータ効率の良いプリフェッチフレームワークである。
トレーニング済みのルーティングセマンティクスを変更することなく、専門家がロードするレイテンシを低減する。
Snapdragon 8 Eliteデバイスでは、SpecPrefetchはさらに、計算最適化されたオフロードランタイム上でのデコードスループットを最大(20%)向上する。
- 参考スコア(独自算出の注目度): 7.204022394734952
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse Mixture-of-Experts (MoE) models expand foundation model capacity through conditional expert activation, but their full expert pools remain difficult to deploy under limited accelerator memory. Although expert offloading alleviates memory pressure by moving inactive experts to host memory or storage, it introduces a routing-dependent transfer bottleneck: required experts are known only after native top-\(K\) routing, which serializes routing, expert loading, and expert execution during inference. To address this bottleneck, we propose SpecPrefetch, a parameter-efficient prefetching framework for offloaded MoE inference. SpecPrefetch uses a shared lightweight adapter to predict next-layer expert candidates only for asynchronous transfer, while the frozen native router still determines the final executed experts. By separating transfer prediction from execution routing, SpecPrefetch reduces exposed expert-loading latency without changing pretrained routing semantics, so prediction errors affect transfer efficiency rather than model outputs. In addition, a window-aware scheduler prioritizes feasible transfers under cache and bandwidth constraints. Across Qwen3-VL-30B-A3B and DeepSeek-VL2-Tiny, SpecPrefetch achieves the best average expert recall in 9 out of 10 model-benchmark settings with substantially fewer trainable parameters than learned predictor baselines. On a Snapdragon 8 Elite device, SpecPrefetch further improves decoding throughput by up to \(20\%\) over a compute-optimized offloading runtime, demonstrating practical benefits for storage-constrained MoE deployment. The code and model weights are available at https://github.com/wei390/SpecPrefetch.
- Abstract(参考訳): Sparse Mixture-of-Experts (MoE)モデルは条件付きエキスパートアクティベーションを通じて基礎モデルの容量を拡大するが、フルエキスパートプールは限られたアクセラレータメモリ下での展開が困難である。
専門家の負荷はメモリやストレージのホストに非アクティブな専門家を移動させることでメモリ圧力を軽減しますが、ルーティング依存の転送ボトルネックが発生します。
このボトルネックに対処するために、オフロードされたMoE推論のためのパラメータ効率の良いプリフェッチフレームワークであるSpecPrefetchを提案する。
SpecPrefetchは共有軽量アダプタを使用して、非同期転送のみに、次世代の専門家候補を予測する。
SpecPrefetchは、転送予測と実行ルーティングを分離することにより、事前訓練されたルーティングセマンティクスを変更することなく、公開専門家負荷レイテンシを低減する。
さらに、ウィンドウ対応スケジューラは、キャッシュと帯域幅の制約の下で実現可能な転送を優先する。
Qwen3-VL-30B-A3BとDeepSeek-VL2-Tinyで、SpecPrefetchは10のモデルベンチマーク設定のうち9つで、学習した予測基準よりもトレーニング可能なパラメータが大幅に少ない、最高の専門家リコールを達成している。
Snapdragon 8 Eliteデバイス上では、SpecPrefetchはさらに、計算最適化されたオフロードランタイム上で最大$(20\%\)のデコードスループットを改善し、ストレージ制限されたMoEデプロイメントの実用的なメリットを示している。
コードとモデルの重み付けはhttps://github.com/wei390/SpecPrefetchで確認できる。
関連論文リスト
- SeqMoE: Toward Full-Load Performance via Predictive and Graph-Compatible MoE Offloading [21.33671694736238]
Mixture-of-Experts (MoE)は、オフロードに構造的な利点をもたらす。
45%のエキスパートが居住しており、セクモエの平均的ヒット率は96.97%、フルロード性能は80.22%である。
論文 参考訳(メタデータ) (2026-09-11T15:43:52Z) - Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts [49.09151538536423]
Mixture-of-experts (MoE)モデルはトークンごとに専門家のサブセットだけを活性化することでスケーラブルなトランスフォーマーアーキテクチャを実現する。
最近の証拠は、より粒度の細かい専門家、すなわち、少数の大きな専門家ではなく、多くの小さな専門家によって、パフォーマンスが向上することを示している。
ベクトル量子化(VQ)に基づく逆インデックス型ルーティングアーキテクチャである MoE (AIR-MoE) の適応型逆インデックスルーティングを導入する。
論文 参考訳(メタデータ) (2026-05-06T14:15:10Z) - ZeRO-Prefill: Zero Redundancy Overheads in MoE Prefill Serving [18.574823955774207]
本稿では,ZeRO-Prefillを提案する。ZeRO-Prefillはプリフィルのみのサービスシステムで,バックエンドはアクティベーションによってルーティングするのではなく,専門家を重みに集める。
Qwen3-235B-A22Bでは、4つのハードウェア/精度構成でZeRO-Prefillは1.35-1.37倍のスループットを提供する。
論文 参考訳(メタデータ) (2026-05-03T03:10:24Z) - Speculating Experts Accelerates Inference for Mixture-of-Experts [44.31811859704714]
Mixture-of-Experts (MoE)モデルは、大規模言語モデル(LLM)のキャパシティを拡大する手段として人気を集めている。
本稿では、現在計算されている内部モデル表現を活用して、将来の専門家を推測するエキスパートプレフェッチ方式を提案する。
提案手法は,CPUメモリからのエキスパートのオンデマンドロードよりも,出力トークン当たりの最大14%の時間短縮を実現する。
論文 参考訳(メタデータ) (2026-03-09T06:59:47Z) - Least-Loaded Expert Parallelism: Load Balancing An Imbalanced Mixture-of-Experts [74.40169987564724]
エキスパート並列性(EP)は、複数のデバイスに専門家を分散させることで、MoEモデルをスケールするように設計されている。
極端な不均衡の下で、EPは少数の専門家に不均等な数のトークンを渡し、計算とメモリバウンドの障害を引き起こす。
本稿では,過剰なトークンと関連する専門家パラメータを過負荷デバイスから未利用デバイスへ動的に再帰する新しいEPアルゴリズムであるLast-Loaded Expert Parallelism (LLEP)を提案する。
論文 参考訳(メタデータ) (2026-01-23T18:19:15Z) - BuddyMoE: Exploiting Expert Redundancy to Accelerate Memory-Constrained Mixture-of-Experts Inference [11.5035097836611]
現代のMoEモデルのサイズが大きくなると、完全なパラメータセットがGPUメモリ容量を超える。
Prefetchingsは、どの専門家が必要なのかを予測することによって、このレイテンシを隠すことを目的としている。
重要な課題は、プレフェッチ失敗時に高い推論速度とモデルの精度を維持することである。
論文 参考訳(メタデータ) (2025-11-13T07:56:50Z) - ExpertFlow: Adaptive Expert Scheduling and Memory Coordination for Efficient MoE Inference [8.296993547783808]
ExpertFlowは、適応型エキスパートプリフェッチとキャッシュ対応ルーティングを組み合わせた、MoE推論のためのランタイムシステムである。
我々の評価では、ExpertFlowはモデルストール時間をベースラインの0.1%未満に短縮する。
論文 参考訳(メタデータ) (2025-10-30T17:29:27Z) - From Score Distributions to Balance: Plug-and-Play Mixture-of-Experts Routing [52.01745035243826]
Mixture-of-Experts (MoE)モデルは、各トークンを専門家のサブセットにルーティングすることで、パラメータキャパシティをスケールすることができる。
条件付きルーティングは、推論メモリの負荷をシフトし、デバイスごとに専門家の数を制限する。
本稿では,精度を保ちながら負荷のバランスをとるプラグイン・アンド・プレイ型推論時ルーティングアルゴリズムLASERを提案する。
論文 参考訳(メタデータ) (2025-09-29T16:29:17Z) - Mixture of Lookup Experts [63.787712153454464]
Mixture-of-Experts (MoE)は、推論中に専門家のサブセットだけを起動する。
MoLEは通信とVRAMの両方で効率的な新しいMoEアーキテクチャである。
論文 参考訳(メタデータ) (2025-03-20T02:31:57Z) - HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference [54.40808356999408]
フレキシブルで効率的なMoE推論を実現するための混合精度専門家オフロードシステムHOBBITを提案する。
キーとなる洞察は、重要でないキャッシュミスの専門家を低い精度で動的に置き換えることで、専門家のロード遅延を大幅に削減できるということです。
HOBBITは、最先端のMoEオフロードシステムと比較して、デコードで最大9.93倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2024-11-03T04:25:46Z) - ExpertFlow: Optimized Expert Activation and Token Allocation for Efficient Mixture-of-Experts Inference [41.41316718220569]
ExpertFlowは、柔軟なルーティングを調整し、CPUとGPU間の効率的な専門家スケジューリングを可能にすることで、推論効率を向上させるように設計されている。
実験により、ExpertFlowは最大93.72%のGPUメモリを節約し、ベースライン法に比べて推論速度を2~10倍に向上することを示した。
論文 参考訳(メタデータ) (2024-10-23T15:24:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。