論文の概要: PCoMoE: Shifting MoE Inference from Monolithic Expert Selection to Fine-Grained Path Composition
- arxiv url: http://arxiv.org/abs/2609.01024v1
- Date: Tue, 01 Sep 2026 10:21:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.551445
- Title: PCoMoE: Shifting MoE Inference from Monolithic Expert Selection to Fine-Grained Path Composition
- Title(参考訳): PCoMoE: モノリシックエキスパート選択から微粒化パス合成へ移行したMoE推論
- Authors: Ziyan Gan, Fangxin Liu, Chenyang Guan, Junjie Wang, Ning Yang, Haomin Li, Xiang Li, Siran Yang, Jiamang Wang, Lin Qu, Zongwu Wang, Li Jiang, Haibing Guan,
- Abstract要約: 提案するPCoMoEは,MoE推論を粗粒度の専門家選択から細粒度パス合成へ変換するパス構成実行フレームワークである。
PCoMoEは、モデル精度を10%向上させながら、最大1.31倍のエンドツーエンド推論スピードアップを達成する。
- 参考スコア(独自算出の注目度): 20.806124668699393
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture-of-Experts (MoE) architectures scale Large Language Model (LLM) capacity efficiently by activating a sparse subset of experts per token. However, modern MoE inference remains heavily constrained by the rigid, whole-expert abstraction. Existing frameworks manage, schedule, or prune experts as atomic execution units, which fixes the optimization boundary too early and leaves fine-grained intra-expert computational redundancy underexplored. In this work, we present PCoMoE, a path-compositional execution framework that shifts MoE inference from coarse-grained expert selection to fine-grained path composition. PCoMoE incorporates a path-level formulation of expert computation, a compatibility-aware layer-wise pruning strategy to suppress low-value path combinations, and a hardware-friendly execution engine to exploit reusable sub-expert structures under strictly bounded overheads. Experimental results demonstrate that PCoMoE achieves up to a 1.31x end-to-end inference speedup while enhancing model accuracy by 10%. The code is available at https://github.com/gzyyy0/PCoMoE
- Abstract(参考訳): Mixture-of-Experts (MoE)アーキテクチャは、トークンごとに専門家のまばらなサブセットを活性化することにより、LLM(Large Language Model)のキャパシティを効率的に拡張する。
しかし、現代のMoE推論は厳密で全専門的な抽象化によって厳しく制約されている。
既存のフレームワークは、最適化バウンダリを早めに修正し、厳密な精巧な計算冗長性を過小評価するアトミック実行ユニットとして、専門家を管理する、スケジュールする、あるいはプルーンする。
そこで本研究では,PCoMoEを提案する。PCoMoEは,MoE推論を粗粒度の専門家選択から細粒度パス合成へ変換するパス構成実行フレームワークである。
PCoMoEには、専門家計算のパスレベルの定式化、低値パスの組み合わせを抑えるための互換性を意識したレイヤワイズプルーニング戦略、厳密な制約付きオーバーヘッドの下で再利用可能なサブエキスパート構造を利用するハードウェアフレンドリーな実行エンジンが組み込まれている。
実験の結果、PCoMoEはモデル精度を10%向上させながら、最大1.31倍のエンドツーエンドの推論スピードアップを達成することが示された。
コードはhttps://github.com/gzyyy0/PCoMoEで入手できる。
関連論文リスト
- Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models [50.34585122347149]
これは連続的なトランスフォーマー層にまたがるエキスパートパラメータを共有するアーキテクチャ修正である。
我々は、OLMoE、Qwen3、DeepSeekスタイルのMoEなど、一般的な最先端アーキテクチャにおけるこのアプローチを評価した。
論文 参考訳(メタデータ) (2026-06-15T15:08:09Z) - DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts [56.175408382091796]
本研究では, 標準重み付け集約を構造集約に置き換えることにより, 専門家やルータを変更することなく, 専門家合成空間を拡大することを示す。
DAG-MoEは軽量モジュールを用いて,選択した専門家の最適な集約構造を自動的に学習するスパースMoEフレームワークである。
論文 参考訳(メタデータ) (2026-05-31T07:08:16Z) - Accelerating MoE Model Inference with Expert Sharding [1.4733737463429546]
専門家の混合モデル(MoE)は、言語モデリングにおいて最先端の結果を得るが、不均衡なトークンルーティングと通信オーバーヘッドにより、非効率なハードウェア利用に悩まされる。
我々は,MoEエキスパートのテンソルシャーディングを通じて,完全な負荷分散を実現する推論システムであるMoEShardを紹介する。
論文 参考訳(メタデータ) (2025-03-11T14:15:01Z) - OMoE: Diversifying Mixture of Low-Rank Adaptation by Orthogonal Finetuning [3.8813502422318127]
低ランク適応(LoRA)のためのMixix-of-experts(MoE)アーキテクチャは、パラメータ効率の微調整(PEFT)における潜在的方向として出現している。
まず,バニラMoEの類似表現に専門家が崩壊し,モジュール設計の能力と計算効率が制限されることを示す定性解析を行った。
これらの知見に触発されて、直交混合(OMoE)を提案する。
提案手法は,バニラMOEモデルと比較して最小限の専門家を惹起するため,メモリボトルネックを緩和する。
論文 参考訳(メタデータ) (2025-01-17T09:27:08Z) - MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts [63.67734699877724]
MoE++は、Feed-Forward Network(FFN)とゼロ計算の専門家を統合した、汎用的で異種なMoEフレームワークである。
MoE++は、1.1-2.1xのエキスパートの前方スループットを同じサイズのバニラのMoEモデルと比較すると、パフォーマンスが向上する。
論文 参考訳(メタデータ) (2024-10-09T18:01:27Z) - A Provably Effective Method for Pruning Experts in Fine-tuned Sparse Mixture-of-Experts [49.394145046409044]
本論文は,MoEモデルにおけるエキスパートの刈り取りに有効な手法として,初めて提案するものである。
理論的には、事前訓練されたモデルからルータl2ノルムを小さく変更することで、専門家のプルーニングを優先順位付けすることで、テスト精度の維持が保証される。
我々の理論解析は、単純化されたMoEアーキテクチャ上でのバイナリ分類タスクに重点を置いているが、我々の専門的なプルーニング手法は、大きな視覚的MoEモデルに基づいて検証されている。
論文 参考訳(メタデータ) (2024-05-26T17:52:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。