論文の概要: Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models
- arxiv url: http://arxiv.org/abs/2609.04575v1
- Date: Fri, 04 Sep 2026 00:11:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.866042
- Title: Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models
- Title(参考訳): ファイングラインド・ミックス・オブ・エクスプロイト・モデルにおけるアクティベートエキスパートの育成・育成
- Authors: Xing Chen, Hengshuai Yao,
- Abstract要約: 再正規化は暗黙的に専門家のアウトプットゲインをトレーニングのトップ$k$に校正することを示す。
再正常化を完全に除去することは破滅的であり、適切な基準質量を維持することが重要であることを示す。
- 参考スコア(独自算出の注目度): 3.749501286035187
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern fine-grained Mixture-of-Experts (MoE) models route each token to a small number of experts and renormalize their router probabilities. We show that this renormalization implicitly calibrates expert output gain to the training top-$k$: reducing $k$ at inference changes not only which experts are used but also the strength of the expert branch. We separate these effects by activating the top $k_1$ experts while normalizing by the probability mass of the top $k_2$ experts, introducing one integer with no parameters, training, or measurable compute overhead. On Qwen3.6-35B-A3B, reducing from 8 to 4 experts causes a 4.65-point MMLU drop under standard renormalization but only 0.35 points with $k_2=16$, while halving routed-expert compute. The result replicates on the $11\times$ larger Qwen3.5-397B-A17B, where reducing from 10 to 5 experts loses only 0.55 points with an appropriate reference set. Removing renormalization entirely is catastrophic, showing that preserving a suitable reference mass is crucial. We further find that perplexity and downstream accuracy favor different $k_2$, cautioning against selecting MoE compression settings using unlabeled text alone. Analyses also show that expert identity matters substantially more than expert weighting, while balanced and domain-specialized routing leaves limited room for expert pruning.
- Abstract(参考訳): 現代のMixture-of-Experts(MoE)モデルは、トークンを少数の専門家にルートし、ルータの確率を正規化する。
この再正規化は、エキスパートの出力ゲインをトレーニングのトップ$k$に暗黙的に校正することを示します。
これらの効果は、上位の$k_1$専門家を活性化し、上位の$k_2$エキスパートの確率質量を正規化し、パラメータやトレーニング、測定可能な計算オーバーヘッドのない整数を1つ導入することで分離します。
Qwen3.6-35B-A3Bでは、専門家を8名から4名に減らし、4.65ポイントのMMLUが標準正規化されるが、$k_2=16$の0.35ポイントしかなかった。
Qwen3.5-397B-A17Bは10から5人の専門家が適切な基準セットで0.55ポイントしか失わない。
再正常化を完全に除去することは破滅的であり、適切な基準質量を維持することが重要であることを示している。
さらに、ラベルなしテキストだけでMoE圧縮設定を選択することに注意して、パープレキシティとダウンストリーム精度が異なる$k_2$を好んでいることもわかりました。
分析によれば、専門家のアイデンティティは専門家の重み付けよりも重要である一方で、バランスの取れたドメイン特化ルーティングは専門家のプルーニングの余地を限定している。
関連論文リスト
- Generic Expert Coverage for Pruning SparseMixture-of-Experts Language Models [16.871402640095745]
キャリブレーションにジェネリックテキストコーパスのみを用いるカバレッジ・アウェア・エキスパート・プルーニング手法を提案する。
我々の改善は、固定された刈り込み予算と下流キャリブレーションデータに支えられている。
論文 参考訳(メタデータ) (2026-07-02T05:02:18Z) - Attribution-Guided and Coverage-Maximized Pruning for Structural MoE Compression [74.00650541246374]
そこで本研究では,MoEモデルに適した構造解析フレームワークを提案する。
我々のアプローチはメモリフットプリントを5.27$times削減し、最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-16T06:53:27Z) - $\infty$-MoE: Generalizing Mixture of Experts to Infinite Experts [43.075289015406355]
Mixture of Experts (MoE)はトークンごとにいくつかのフィードフォワードネットワーク(FFN)を選択し、計算コストとパフォーマンスの効果的なトレードオフを実現する。
トークン毎にサンプリングされた連続値に基づいて,大きなFFNのパラメータの一部を選択可能な$infty$-MoEを提案する。
GPT-2 Small-based $infty$-MoE model, with 19M active and 186M total parameters, is a comparable performance to a dense GPT-2 Medium with 350M parameters。
論文 参考訳(メタデータ) (2026-01-25T03:55:51Z) - Dropping Experts, Recombining Neurons: Retraining-Free Pruning for Sparse Mixture-of-Experts LLMs [54.95810313530111]
DERNは、専門家のプルーニングと再構築のためのタスク非依存でトレーニングなしのフレームワークである。
コモンセンス推論やMMLUベンチマークでは、50%のエキスパートスパシティでパフォーマンスを5%以上向上させる。
論文 参考訳(メタデータ) (2025-09-12T16:09:39Z) - Unified Sparse Mixture of Experts [14.774596844618396]
SMOE(Sparse Mixture of Experts)モデルは、一定の計算オーバーヘッドを維持しながら、モデルのキャパシティをスケールする。
本稿では,これらの制約に対処する統一スパース・ミックス・オブ・エキスパート(USMoE)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-29T07:15:12Z) - Multilinear Mixture of Experts: Scalable Expert Specialization through Factorization [51.98792406392873]
Mixture of Experts (MoE)は、高密度層をより小さくモジュール化された計算に分解する強力な方法を提供する。
大きな課題は、きめ細かい特殊化を達成するのに十分高い専門家の数をスケーリングする計算コストである。
視覚モデルに焦点をあて、この問題に対処するため、Multilinear Mixture of Experts(mu$MoE)層を提案する。
論文 参考訳(メタデータ) (2024-02-19T21:20:22Z) - Merge, Then Compress: Demystify Efficient SMoE with Hints from Its Routing Policy [84.11508381847929]
わずかに活性化されたMixture-of-Experts(SMoE)は、ニューラルネットワークの学習能力のスケールアップを約束している。
ルーティング統計を利用したM-SMoEを提案する。
我々のMC-SMoEは最大80%のメモリと20%のFLOPを削減でき、性能は実質的に損なわれない。
論文 参考訳(メタデータ) (2023-10-02T16:51:32Z) - Mixture-of-Experts with Expert Choice Routing [44.777850078713634]
以前の作業では、トップk関数を使用して各トークンに一定数の専門家を割り当てていた。
本稿では,専門家選択手法を用いた異種混合実験を提案する。
本手法は, トレーニング収束時間を2倍以上改善する。
論文 参考訳(メタデータ) (2022-02-18T17:46:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。