論文の概要: Efficient Mixture-of-Experts with Speculative Decoding via Expert Coactivation
- arxiv url: http://arxiv.org/abs/2609.22471v1
- Date: Fri, 18 Sep 2026 18:30:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.40738
- Title: Efficient Mixture-of-Experts with Speculative Decoding via Expert Coactivation
- Title(参考訳): エキスパート・コアクティベーションによる投機的復号化手法の効率化
- Abstract要約: Mixture-of-Experts (MoE)モデルは、推論を加速するために、Prulative Decoding (SD)と共にデプロイされることが多い。
トレーニング中のMoEルータ設計がSDを用いたMoEの速度に及ぼす影響について検討する。
専門家のコアクティベーションの度合いが高いルータが実行速度をはるかに速くすることがわかった。
- 参考スコア(独自算出の注目度): 23.260475018284385
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Mixture-of-Experts (MoE) models are increasingly deployed alongside Speculative Decoding (SD) to accelerate inference, but combining the two is challenging. SD improves the inference speed of dense models by verifying groups of tokens in parallel. However, the inference speedup for SD with MoEs depends heavily on the number of tokens being verified. Using more verification tokens results in more experts being transferred from DRAM to the Neural Processing Unit (NPU), which increases the memory transfer cost. This negatively impacts model runtime, as memory transfer is typically the bottleneck in inference. In this work, we investigate the impact of MoE router design during training on the speed of MoEs with SD. We find that routers with high degrees of expert coactivation result in much faster runtimes, mitigating the impact of using more verification tokens. Motivated by this observation, we assess the impact of various router design choices on expert coactivation and runtime using billion-parameter transformer models. We find that combining a global load-balancing loss, shared experts, a consistency loss, and an autoregressive expert selection mechanism during training results in significantly stronger expert coactivation. This increased coactivation translates into higher overall runtime throughput: our exploration yields a model that improves throughput by 21% over MoE baselines, while maintaining on-par accuracy with the baseline MoE.
- Abstract(参考訳): Mixture-of-Experts (MoE)モデルは、推測を加速するために、SD(Speculative Decoding)と共にデプロイされることが多いが、この2つを組み合わせることは難しい。
SDは、トークンのグループを並列に検証することで、高密度モデルの推論速度を改善する。
しかし、MoEsによるSDの推論スピードアップは、検証されているトークンの数に大きく依存する。
より多くの認証トークンを使用することで、より多くの専門家がDRAMからNeural Processing Unit(NPU)に転送され、メモリ転送コストが増加する。
メモリ転送が典型的には推論のボトルネックであるため、これはモデルランタイムに悪影響を及ぼす。
本研究では,トレーニング中のMoEルータ設計がSDを用いたMoEの速度に与える影響について検討する。
専門家のコアクティベーションの度合いが高いルータは、より高速な実行を実現し、より多くの認証トークンを使用することによる影響を軽減する。
この観測により,10億パラメータトランスモデルを用いて,各種ルータの設計選択が専門家のコアクティベーションと実行に与える影響を評価する。
トレーニング中に、グローバルな負荷分散損失、共有専門家、一貫性損失、自己回帰専門家選択機構を組み合わせることで、専門家のコアクティベーションが大幅に向上することがわかった。
私たちの探索では、ベースラインのMoEと同等の精度を維持しながら、MoEベースラインよりもスループットを21%向上させるモデルを作成しています。
関連論文リスト
- TEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model Acceleration [3.510563137261977]
拡散大言語モデル(dLLMs)は、並列デコードに固有のサポートがあるため、最近注目されている。
MoEアーキテクチャと拡散型デコーディングの基本的なミスマッチを同定する。
TEAMはMoE dLLMを高速化するプラグイン・アンド・プレイフレームワークである。
論文 参考訳(メタデータ) (2026-02-09T09:05:46Z) - MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE [14.345207231093722]
投機的復号法(SD: Speculative decoding)は、LSM推論を精度の低下なしに高速化する手法として広く用いられている。
中程度のバッチサイズでは、MoEは高密度モデルよりもSDの恩恵を受けます。
これらの効果を特徴付ける新しい指標「目標効率」を導入する。
論文 参考訳(メタデータ) (2025-05-26T08:01:45Z) - Unchosen Experts Can Contribute Too: Unleashing MoE Models' Power by Self-Contrast [58.98411447739218]
Mixture-of-Experts (MoE) は、計算効率を保ちながら、モデルサイズをスケールするための顕著なアーキテクチャとして登場した。
本研究では,無声専門家を推論中に自己コントラスト的に活用する学習自由戦略である自己コントラスト混合(SCMoE)を提案する。
我々の手法は概念的には単純で計算量も軽量であり、グリージー復号法に比べて最小限の遅延を発生させる。
論文 参考訳(メタデータ) (2024-05-23T12:45:29Z) - SMILE: Scaling Mixture-of-Experts with Efficient Bi-level Routing [47.11171833082974]
我々は、異種ネットワーク帯域を利用するSMILEを導入し、シングルステップのルーティングをバイレベルルーティングに分割する。
提案手法は, コンバージェンス速度を損なうことなく, コロッサルクリーンクローリングコーパスのプリトレーニングスループットにおいて, スイッチ変換器の2.5倍の高速化が得られることを示す。
論文 参考訳(メタデータ) (2022-12-10T03:44:16Z) - Gating Dropout: Communication-efficient Regularization for Sparsely
Activated Transformers [78.77361169167149]
本稿では,トークンがゲーティングネットワークを無視してローカルマシンに留まることを可能にするEmphGating Dropoutを提案する。
従来のドロップアウトと同様に、Gating Dropoutはトレーニング中に正規化効果があり、その結果、一般化性能が向上することを示す。
論文 参考訳(メタデータ) (2022-05-28T05:12:43Z) - Taming Sparsely Activated Transformer with Stochastic Experts [76.0711573018493]
わずかに活性化されたモデル(SAM)は、計算コストを大幅に増加させることなく、非常に大量のパラメータを持つように容易にスケールすることができる。
本稿では,新しいエキスパートベースモデルTHOR(Transformer witH StOchastic ExpeRts)を提案する。
Switch Transformerのような古典的なエキスパートベースのモデルとは異なり、THORの専門家はトレーニングと推論の間、各入力に対してランダムにアクティベートされる。
論文 参考訳(メタデータ) (2021-10-08T17:15:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。