論文の概要: S2-MoE: Enabling Efficient Self-Speculative Decoding for Mixture-of-Experts on Edge Devices
- arxiv url: http://arxiv.org/abs/2608.15018v2
- Date: Wed, 19 Aug 2026 09:26:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 13:35:39.136206
- Title: S2-MoE: Enabling Efficient Self-Speculative Decoding for Mixture-of-Experts on Edge Devices
- Title(参考訳): S2-MoE:エッジデバイス上でのMixture-of-Expertの効率的な自己投機的デコーディングを実現する
- Authors: Haochen Huang, Shengxuan Qiu, Meng Li,
- Abstract要約: S2-MoEはエッジデバイス上でのMoE推論のための効率的な自己投機的デコーディングフレームワークである。
S2-MoEは、ルーティング投機拡張による冗長な検証を減らす。
- 参考スコア(独自算出の注目度): 3.652791347806378
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deploying large language models (LLMs) for inference on edge devices is challenging due to severe memory and bandwidth constraints. While speculative decoding and Mixture-of-Experts (MoE) have been proposed to improve inference efficiency, naively combining them often incurs excessive verification overhead and poor expert reuse, limiting their effectiveness in memory-bound edge settings. In this work, we propose S2-MoE, an efficient self-speculative decoding framework for MoE inference on edge devices. S2-MoE reduces redundant verification through routing-aware adaptive speculative expansion, improves verification efficiency with reuse-aware expert gating, and aligns draft and target execution via shared context. Implemented in llama$.$cpp, S2-MoE achieves up to $5.3\times$ speedup (about $2.0\times$ on average) over standard autoregressive decoding across diverse MoE models and datasets on edge devices. Code is available at https://github.com/angerybob/S2-MoE.
- Abstract(参考訳): エッジデバイス上での推論のための大規模言語モデル(LLM)のデプロイは、メモリと帯域幅の厳しい制約のため、難しい。
投機的復号化とMixture-of-Experts (MoE) は推論効率を改善するために提案されているが、過度な検証オーバーヘッドと専門家の再利用が不足し、メモリバウンドエッジ設定の有効性が制限されることが多い。
本研究では、エッジデバイス上でのMoE推論のための効率的な自己投機的デコーディングフレームワークであるS2-MoEを提案する。
S2-MoEは、ルーティング対応適応型投機拡張による冗長な検証を削減し、再利用対応の専門家ゲーティングによる検証効率を改善し、共有コンテキストを介してドラフトとターゲットの実行を調整する。
llama$で実装。
$cpp, S2-MoEは、さまざまなMoEモデルとエッジデバイス上のデータセットにまたがる標準的な自己回帰デコーディングよりも、最大5.3\times$スピードアップ(平均で約2.0\times$)を実現している。
コードはhttps://github.com/angerybob/S2-MoE.comで入手できる。
関連論文リスト
- Dense2MoE: Pushing the Pareto Frontier of On-Device LLMs via Unified Pruning and Upcycling [10.009897539610646]
Mixture of Experts MoEアーキテクチャは、デバイスデプロイメントに制約のあるリソースに対して非常に有望だが、これらのモデルをスクラッチからトレーニングすることは禁忌なコストである。
現在の手法では、密度の高いモデルをMoEにアップサイクルすることでこれを緩和しようとするが、しばしばパラメータの冗長性を導入し、推論効率を低下させる。
論文 参考訳(メタデータ) (2026-05-26T03:19:04Z) - ZipMoE: Efficient On-Device MoE Serving via Lossless Compression and Cache-Affinity Scheduling [56.88966608455977]
ZipMoEはエッジデバイスのハードウェア特性とMoEパラメータ固有の統計的冗長性との相乗効果を利用する。
ZipMoEは72.77%の推論遅延低減と6.76タイムのスループットを実現している。
論文 参考訳(メタデータ) (2026-01-29T02:51:59Z) - Dual-Stage Reweighted MoE for Long-Tailed Egocentric Mistake Detection [85.0189917888094]
本稿では,微妙で頻繁なミスによって生じる課題に対処するため,Dual-Stage Reweighted Mixture-of-Experts (DR-MoE) フレームワークを提案する。
提案手法は,特に稀かつ曖昧な誤りの特定において,高い性能を達成する。
論文 参考訳(メタデータ) (2025-09-16T12:00:42Z) - SLED: A Speculative LLM Decoding Framework for Efficient Edge Serving [7.69991252191073]
acronymは、軽量エッジデバイスが様々なドラフトモデルを使用して、複数の候補トークンをローカルにドラフトできるフレームワークである。
単一の共有エッジサーバは、より正確なターゲットモデルを用いてトークンを検証する。
Jetson Orin Nano、Raspberry Pi 4B/5、Nvidia A100 GPUを搭載したエッジサーバを使った最初の実験は、大きなメリットを示している。
論文 参考訳(メタデータ) (2025-06-11T04:55:54Z) - HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference [54.40808356999408]
フレキシブルで効率的なMoE推論を実現するための混合精度専門家オフロードシステムHOBBITを提案する。
キーとなる洞察は、重要でないキャッシュミスの専門家を低い精度で動的に置き換えることで、専門家のロード遅延を大幅に削減できるということです。
HOBBITは、最先端のMoEオフロードシステムと比較して、デコードで最大9.93倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2024-11-03T04:25:46Z) - EdgeMoE: Empowering Sparse Large Language Models on Mobile Devices [3.3947808667959536]
EdgeMoEは、Mix-of-expert (MoE) LLM用のオンデバイス推論エンジンである。
非専門家の重みはデバイスメモリに保持されるが、専門家の重みは外部ストレージに保持され、アクティベート時にのみメモリにフェッチされる。
論文 参考訳(メタデータ) (2023-08-28T06:56:08Z) - Consistent Training and Decoding For End-to-end Speech Recognition Using
Lattice-free MMI [67.13999010060057]
本稿では,LF-MMI基準をE2E ASRフレームワークに統合する新たな手法を提案する。
LF-MMI基準の導入は、一貫して大きなパフォーマンス改善をもたらすことが実験的に示唆されている。
論文 参考訳(メタデータ) (2021-12-05T07:30:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。