論文の概要: SHAPE: Coalition-Aware Expert Pruning for Sparse Mixture-of-Experts LLMs
- arxiv url: http://arxiv.org/abs/2606.09886v1
- Date: Wed, 03 Jun 2026 08:41:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-10 15:40:58.007133
- Title: SHAPE: Coalition-Aware Expert Pruning for Sparse Mixture-of-Experts LLMs
- Title(参考訳): SHAPE:Sparse Mixture-of-Experts LLMのためのCoalition-Aware Expert Pruning
- Authors: Yuhao Zhang,
- Abstract要約: Sparse Mixture-of-Experts (MoE)モデルは、トーケンの少ない計算で強力な品質を達成するが、そのデプロイメントはメモリウォールによって制限されることが多い。
課題駆動型プルーニングフレームワークのtextbfSHAPE を提案する。
- 参考スコア(独自算出の注目度): 4.035485260002141
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse Mixture-of-Experts (MoE) large language models achieve strong quality with low per-token compute, yet their deployment is often limited by the memory wall: the full expert pool must remain resident to support token-dependent routing. Expert pruning is a direct remedy, but prior criteria typically score experts independently and overlook that MoE inference is inherently \emph{coalitional}, where outputs arise from routed top-$k$ expert combinations. We propose \textbf{SHAPE}, a task-driven pruning framework that explicitly models \emph{intra-layer} expert cooperation. SHAPE formulates routing traces on a small calibration set as an empirical cooperative game and assigns interaction-aware expert values via a Shapley-style attribution over observed top-$k$ coalitions, enabling the identification of experts that are essential for high-utility collaborations rather than merely frequent. To preserve MoE topology under a global pruning budget, SHAPE further introduces a \emph{quality-coverage} selection rule that retains, in each layer, the minimal expert subset covering an $α$ fraction of non-negative Shapley mass, while using bisection to match a target keep rate. Experiments on three modern MoE backbones (Qwen3-30B-A3B, GPT-OSS-20B, and DeepSeek-V2-Lite) across diverse benchmarks show that SHAPE consistently improves robustness over global and layer-wise pruning variants, maintaining competitive accuracy under 20\% and 40\% expert pruning without additional training and delivering clear reductions in peak GPU memory footprint. The open-source code is available at https://github.com/Alizen-1009/Shapley-Moe.
- Abstract(参考訳): Sparse Mixture-of-Experts (MoE) 大規模な言語モデルは、トークン単位の計算量が少なく、強力な品質を実現するが、そのデプロイメントはメモリウォールによって制限されることが多い。
専門家のプルーニングは直接的な治療法であるが、事前の基準では専門家を独立に評価し、MoE推論は本質的には「emph{coalitional}」であり、そこでは上位の$k$のエキスパートの組み合わせからアウトプットが生じる。
本稿では,タスク駆動型プルーニングフレームワークである \textbf{SHAPE} を提案する。
SHAPEは、経験的な協調ゲームとして小さなキャリブレーションセット上のルーティングトレースを定式化し、観察されたトップ$kのアトリビューションに対してShapleyスタイルのアトリビューションを通じてインタラクションアウェアの専門家値を割り当て、単に頻繁に行われるのではなく、高ユーティリティなコラボレーションに不可欠な専門家の識別を可能にする。
グローバルプルーニング予算の下で MoE 位相を保存するために、SHAPE はさらに \emph{quality-coverage} 選択規則を導入し、これは各層において、標的の保留率に合うようにバイセクションを使用しながら、非負のシャプリー質量の$α$分をカバーする最小のエキスパート部分集合を保持する。
さまざまなベンチマークによる3つのモダンなMoEバックボーン(Qwen3-30B-A3B、GPT-OSS-20B、DeepSeek-V2-Lite)の実験は、SHAPEがグローバルおよびレイヤワイドなプルーニングの亜種よりも堅牢性を一貫して改善し、新たなトレーニングなしで20\%と40\%のエキスパートプルーニングの競合精度を維持し、ピークGPUメモリフットプリントの明確な削減を実現していることを示している。
オープンソースコードはhttps://github.com/Alizen-1009/Shapley-Moe.comで公開されている。
関連論文リスト
- ConMoE: Expert-Pool Consolidation via Prototype Reassignment for MoE Compression [4.740789393042061]
Mixture-of-Experts (MoE)言語モデルでは、トーケン毎の計算が削減されるが、それでもすべての専門家の保存とサービスを必要としている。
訓練後のMoE圧縮をエキスパートプール統合として定式化する。
電車のないプロトタイプリマッピングフレームワークであるConMoEを提案する。
論文 参考訳(メタデータ) (2026-05-28T04:44:22Z) - Context Pruning for Coding Agents via Multi-Rubric Latent Reasoning [14.508049757681862]
LLMベースのコーディングエージェントは、トークンの予算の大部分をリポジトリファイルを読むのに費やしている。
この定式化がモデリングのボトルネックを生み出すことを示す。
コード関連性を2つの解釈可能な品質次元に分解する構造化プルーニングフレームワークであるLaMRを提案する。
論文 参考訳(メタデータ) (2026-05-14T18:30:10Z) - EvoESAP: Non-Uniform Expert Pruning for Sparse MoE [42.738877185877634]
textbfExpected textbfAcceptance textbfProxy (textbfESAP) は,プルーンドモデルがフルモデルとどの程度よく一致しているかを測定する投機的復号化型教師力メトリクスである。
固定されたグローバル予算の下で一様でない層単位の空間配置を最適化する進化的探索フレームワークであるEvoESAPを提案する。
論文 参考訳(メタデータ) (2026-03-06T08:02:58Z) - Dynamic Expert Sharing: Decoupling Memory from Parallelism in Mixture-of-Experts Diffusion LLMs [22.399470395813577]
Dynamic Expert Sharing (DES) は、MoE最適化をトークン中心のプルーニングからシーケンシャルレベルのコアセット選択に移行する新しいテクニックである。
DESは、独自の専門家アクティベーションを55%以上削減し、レイテンシを最大38%削減し、バニラ精度の99%を維持している。
論文 参考訳(メタデータ) (2026-01-31T20:01:47Z) - MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping [52.02659589971978]
我々は,MoE MLLM推論を効果的かつ正確なものにするために,専門家を適応的にスキップする最初のトレーニングフリーフレームワークであるMoDESを提案する。
MoDESは推論速度を大幅に向上させ、プリフィルタイムを2.16$times$、デコードタイムを1.26$times$に改善する。
論文 参考訳(メタデータ) (2025-11-19T18:48:27Z) - Unified Sparse Mixture of Experts [14.774596844618396]
SMOE(Sparse Mixture of Experts)モデルは、一定の計算オーバーヘッドを維持しながら、モデルのキャパシティをスケールする。
本稿では,これらの制約に対処する統一スパース・ミックス・オブ・エキスパート(USMoE)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-29T07:15:12Z) - MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts [63.67734699877724]
MoE++は、Feed-Forward Network(FFN)とゼロ計算の専門家を統合した、汎用的で異種なMoEフレームワークである。
MoE++は、1.1-2.1xのエキスパートの前方スループットを同じサイズのバニラのMoEモデルと比較すると、パフォーマンスが向上する。
論文 参考訳(メタデータ) (2024-10-09T18:01:27Z) - Multilinear Mixture of Experts: Scalable Expert Specialization through Factorization [51.98792406392873]
Mixture of Experts (MoE)は、高密度層をより小さくモジュール化された計算に分解する強力な方法を提供する。
大きな課題は、きめ細かい特殊化を達成するのに十分高い専門家の数をスケーリングする計算コストである。
視覚モデルに焦点をあて、この問題に対処するため、Multilinear Mixture of Experts(mu$MoE)層を提案する。
論文 参考訳(メタデータ) (2024-02-19T21:20:22Z) - Merge, Then Compress: Demystify Efficient SMoE with Hints from Its Routing Policy [84.11508381847929]
わずかに活性化されたMixture-of-Experts(SMoE)は、ニューラルネットワークの学習能力のスケールアップを約束している。
ルーティング統計を利用したM-SMoEを提案する。
我々のMC-SMoEは最大80%のメモリと20%のFLOPを削減でき、性能は実質的に損なわれない。
論文 参考訳(メタデータ) (2023-10-02T16:51:32Z) - MLPruning: A Multilevel Structured Pruning Framework for
Transformer-based Models [78.45898846056303]
プルーニングは、大きな自然言語処理モデルに関連するメモリフットプリントと計算コストを削減する効果的な方法である。
我々は,頭部刈り込み,行刈り,ブロックワイズ刈りという3つの異なるレベルの構造化刈り込みを利用する,新しいマルチレベル構造化刈り込みフレームワークを開発した。
論文 参考訳(メタデータ) (2021-05-30T22:00:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。