論文の概要: DraftExpert: Expansion-Aware Self-Speculative Decoding for End-Device MoE Inference
- arxiv url: http://arxiv.org/abs/2607.24434v1
- Date: Mon, 27 Jul 2026 13:44:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.445004
- Title: DraftExpert: Expansion-Aware Self-Speculative Decoding for End-Device MoE Inference
- Title(参考訳): DraftExpert: エンドデバイスMoE推論のための拡張対応自己スペクティブデコーディング
- Abstract要約: DraftExpertは、専門家オフロードされたMoE推論のための拡張対応の自己投機的デコーディングフレームワークである。
DeepSeek-V2-LiteとMoonlight-16B-A3BのCPU-GPUおよびFlash-NPUオフロードでは、DraftExpertはデコードスループットを平均1.45倍改善する。
- 参考スコア(独自算出の注目度): 0.4944564023471818
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Mixture-of-Experts (MoE) language models are attractive for end-device deployment because only a small subset of experts is active per token, but their routed expert weights often exceed accelerator memory. We target latency-critical single-user settings where routed experts are staged on demand from CPU memory to a GPU or from Flash to a mobile NPU. In this setting, self-speculative decoding faces a new bottleneck: increasing the draft expert set improves accuracy but triggers extra expert loading, while cheap small-footprint drafts have low acceptance; moreover, verifying a multi-token block activates the union of target experts and is no longer close to one target step. We propose DraftExpert, an expansion-aware self-speculative decoding framework for expert-offloaded MoE inference. DraftExpert trains one lightweight accelerator-resident draft expert per layer by self-distilling residual, logit/token, and router-agreement signals from the frozen target MoE. At inference time, it uses a fixed-footprint shared+top-1+draft-expert drafter together with confidence--expansion truncation and target-expert prefetching, while final tokens are still exactly verified by the target model. On DeepSeek-V2-Lite and Moonlight-16B-A3B across CPU-GPU and Flash-NPU offload, DraftExpert improves decode throughput by 1.45x on average, raises draft acceptance to 84~87%, and achieves 86~88% prefetch hit rates.
- Abstract(参考訳): 大規模なMixture-of-Experts(MoE)言語モデルは、トークン当たりのエキスパートのごく一部しかアクティブではないが、そのルーティングされたエキスパートの重みがアクセラレータメモリを超えているため、エンドデバイスデプロイメントにとって魅力的なものだ。
我々は、CPUメモリからGPU、あるいはFlashからモバイルNPUへの要求に応じて、ルーティングされた専門家がステージングされるレイテンシクリティカルなシングルユーザ設定をターゲットにしています。
この設定では、自己投機的復号化は、新たなボトルネックに直面している: ドラフトエキスパートセットの増大は、正確性を改善するが、追加のエキスパートローディングをトリガーする一方、安価な小さなフットプリントドラフトは、受け入れが低く、さらに、マルチトークンブロックの検証は、ターゲットエキスパートの連合を活性化し、もはや1つの目標ステップに近づかない。
本稿では,専門家オフロード型MoE推論のための拡張型自己投機的デコーディングフレームワークであるDraftExpertを提案する。
DraftExpertは、凍結ターゲットMoEからの残量、ロジット/トケン、ルータの蓄積信号を自己蒸留することにより、レイヤ毎に軽量なアクセラレーター登録ドラフトエキスパートを訓練する。
推論時には、固定フットプリントの共有+top-1+draft-expertドラフトと、信頼性向上のトランケーションとターゲット-Expertプリフェッチが使用され、最終的なトークンは依然としてターゲットモデルによって正確に検証されている。
DeepSeek-V2-LiteとMoonlight-16B-A3BのCPU-GPUおよびFlash-NPUオフロードでは、DraftExpertはデコードスループットを平均1.45倍改善し、ドラフト受け入れを84~87%に引き上げ、86~88%のプレフェッチヒット率を達成した。
関連論文リスト
- ExFold: Unified Expert Folding for Training-Free MoE Prefill-Decode Acceleration [28.21219412744595]
Mixture-of-Experts (MoE)モデルは、専門家のアクティベーションを通じて、トーケン毎の計算を維持しながら、強力な品質のためにキャパシティをスケールする。
我々は,MoEプリフィルデコードとバッチレベルのエキスパートプールフォールディングを共同で高速化するExFoldを提案する。
論文 参考訳(メタデータ) (2026-08-24T08:53:58Z) - AcceptMoE: Commitment-Weighted Self-Sizing Verifier Expert Sets for Efficient MoE Speculative Decoding [21.76650680783374]
投機的復号化は、1つのターゲットモデルフォワードパスにおけるドラフトトークンのツリーを検証する。
ミックス・オブ・エキスパート(MoE)ターゲットの場合、並列検証はすべてのツリーノードから選択された専門家の団結を活性化することができる。
本稿では,検証側の専門家セレクタであるAcceptMoEを紹介する。
論文 参考訳(メタデータ) (2026-08-04T01:01:12Z) - Less Experts, Faster Decoding: Cost-Aware Speculative Decoding for Mixture-of-Experts [34.20364644493512]
本稿では,予測限界エキスパートアクティベーションコストをドラフト選択に組み込む,コストアウェアな投機的復号化フレームワークを提案する。
我々は、DeepSeek-V3.1 (671B)、Qwen3-235B-A22B、GPT-OSS-120Bを含む3つの大規模MoEモデル上でtextscEcoSpecを評価する。
論文 参考訳(メタデータ) (2026-07-14T12:22:55Z) - dMoE: dLLMs with Learnable Block Experts [71.572316901001]
単純なブロックレベルのMoEフレームワークであるdMoEを提案する。
また,dMoEは,推論中に一意に活性化される専門家の数を著しく減少させることを示した。
また、メモリ使用量を76.64%から79.84%に減らし、1.14$times$から1.66$times$エンドツーエンドのレイテンシ高速化を実現している。
論文 参考訳(メタデータ) (2026-05-29T06:03:50Z) - Speculating Experts Accelerates Inference for Mixture-of-Experts [44.31811859704714]
Mixture-of-Experts (MoE)モデルは、大規模言語モデル(LLM)のキャパシティを拡大する手段として人気を集めている。
本稿では、現在計算されている内部モデル表現を活用して、将来の専門家を推測するエキスパートプレフェッチ方式を提案する。
提案手法は,CPUメモリからのエキスパートのオンデマンドロードよりも,出力トークン当たりの最大14%の時間短縮を実現する。
論文 参考訳(メタデータ) (2026-03-09T06:59:47Z) - MoE-Spec: Expert Budgeting for Efficient Speculative Decoding [4.064682810747041]
本稿では,メモリコストから投機深度を分離する訓練不要な専門家予算化手法を提案する。
複数のモデルスケールとデータセットにわたる実験により、この手法は最先端の投機的デコードベースラインよりも10-30%高いスループットが得られることが示された。
論文 参考訳(メタデータ) (2026-02-17T22:02:36Z) - BuddyMoE: Exploiting Expert Redundancy to Accelerate Memory-Constrained Mixture-of-Experts Inference [11.5035097836611]
現代のMoEモデルのサイズが大きくなると、完全なパラメータセットがGPUメモリ容量を超える。
Prefetchingsは、どの専門家が必要なのかを予測することによって、このレイテンシを隠すことを目的としている。
重要な課題は、プレフェッチ失敗時に高い推論速度とモデルの精度を維持することである。
論文 参考訳(メタデータ) (2025-11-13T07:56:50Z) - MoBiLE: Efficient Mixture-of-Experts Inference on Consumer GPU with Mixture of Big Little Experts [17.518573710849513]
MoBiLEは、プラグイン・アンド・プレイのオフロードベースのMoE推論フレームワークで、大手専門家のテキストミキサーを備えている。
MoBiLEは、コンシューマGPUシステムのベースラインと比較して1.60倍から1.72倍のスピードアップを実現し、精度の劣化は無視できる。
論文 参考訳(メタデータ) (2025-10-14T10:22:44Z) - MC#: Mixture Compressor for Mixture-of-Experts Large Models [86.64315380917827]
Mixture-of-Experts (MoE)は、大きな言語モデル(LLM)と視覚言語モデル(VLM)をスパースアクティベーションによって拡張することで効果的にスケールする。
静的量子化と動的エキスパートプルーニングを組み合わせたフレームワークであるMC#(Mixture-Compressor-sharp)を提案する。
論文 参考訳(メタデータ) (2025-10-13T03:12:46Z) - Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding [73.67253077506672]
大規模言語モデル(LLM)は、優れた生成品質を提供するが、非常に高い推論コストをもたらす。
早期排他的自己投機的復号法(EESD)がこのコストを軽減するために登場した。
ドラフトと検証作業を完全にパイプライン化するパイプライン・パラレル自己スペクティブ・デコーディング(PPSD)を提案する。
論文 参考訳(メタデータ) (2025-09-19T04:51:41Z) - ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts [79.62448915248926]
16ビットモデル推論の精度を犠牲にすることなくLSM推論を高速化する手法として、投機復号法(SD)が登場した。
MXFP4Weight-Only-Quantization (WOQ)は、単にBF16ターゲットモデルの重みをMXFP4に直接キャストするだけなので、MXFP4モデルをプラグアンドプレイ方式でドラフトとして使用することを提案する。
私たちのプラグアンドプレイソリューションでは,BF16ベースラインの最大2倍のスピードアップを実現しています。
論文 参考訳(メタデータ) (2025-03-17T08:38:45Z) - Bootstrapped Masked Autoencoders for Vision BERT Pretraining [142.5285802605117]
BootMAEは、オリジナルのマスク付きオートエンコーダ(MAE)を2つのコア設計で改善した。
1) BERT予測対象としてオンライン機能を提供するモーメントエンコーダ,2) BERT事前学習における目標固有情報を記憶するためのエンコーダの圧力を減らそうとする目標認識デコーダ。
論文 参考訳(メタデータ) (2022-07-14T17:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。