論文の概要: Generic Expert Coverage for Pruning SparseMixture-of-Experts Language Models
- arxiv url: http://arxiv.org/abs/2607.01710v1
- Date: Thu, 02 Jul 2026 05:02:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.67849
- Title: Generic Expert Coverage for Pruning SparseMixture-of-Experts Language Models
- Title(参考訳): SparseMixture-of-Experts言語モデル作成のためのジェネリックエキスパートカバレッジ
- Authors: Yongqin Zeng, Sicheng Pan, Jiale Wang, Hai-tao Zheng, Hong-Gee Kim, Chunxia Ma, XiuTeng Zhou,
- Abstract要約: キャリブレーションにジェネリックテキストコーパスのみを用いるカバレッジ・アウェア・エキスパート・プルーニング手法を提案する。
我々の改善は、固定された刈り込み予算と下流キャリブレーションデータに支えられている。
- 参考スコア(独自算出の注目度): 16.871402640095745
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sparsely activated Mixture-of-Experts (MoE) language models contain substantial structured redundancy among routed experts, but pruning them without downstream calibration data remains challenging. Existing expert-pruning methods typically rely on a single aggregated importance score, which can bias the retained set toward experts favored by dominant calibration patterns. We propose \textbf{Generic TB-Coverage}, a coverage-aware expert pruning method that uses only generic text corpora (WikiText2 and C4) for calibration. Instead of collapsing expert utility into one score, our method profiles per-expert utility separately on each corpus and enforces a fixed-budget coverage rule that preserves high-utility experts from each corpus before constructing the final pruning mask. Across Qwen1.5-MoE-A2.7B and DeepSeek-MoE-16B-Base at 25\%, 50\%, and 75\% retention budgets, our method improves average accuracy on six common zero-shot benchmarks over random pruning, REAP, and ExpertSparsity, while also reducing perplexity degradation on WikiText2 and C4. The gains are largest under aggressive pruning (25\% and 50\% retain), suggesting that preserving cross-corpus expert coverage is an effective generic-data prior for MoE pruning. Our improvements hold with fixed pruning budgets and no downstream calibration data.
- Abstract(参考訳): わずかに活性化されたMixture-of-Experts(MoE)言語モデルは、ルーティングされた専門家の間でかなり構造化された冗長性を含んでいるが、下流キャリブレーションデータなしでそれらを刈り取ることは依然として困難である。
既存のエキスパート・プルーニングの手法は、通常は単一の集約された重要度スコアに依存しており、支配的なキャリブレーションパターンによって好まれる専門家に対して保持されたセットを偏らせる可能性がある。
本稿では,一般的なテキストコーパス (WikiText2 と C4) のみを校正に用いるカバレッジ・アウェア・エキスパート・プルーニング手法である \textbf{Generic TB-Coverage} を提案する。
専門家の効用を1つのスコアに分解する代わりに、我々の手法プロファイルは各コーパスに個別に個別に設定し、最終プルーニングマスクを構築する前に、各コーパスから高ユーティリティの専門家を保護するための固定予算カバレッジルールを実行します。
Qwen1.5-MoE-A2.7B と DeepSeek-MoE-16B-Base を 25\%, 50\%, 75\% の保持予算で適用することにより,ランダムプルーニング,REAP,ExpertSparsity の6つの共通ゼロショットベンチマークの平均精度を向上させるとともに,WikiText2 と C4 の難易度劣化を低減する。
このゲインはアグレッシブプルーニング(25\%と50\%の保持)で最大であり、クロスコーパスの専門家のカバレッジを維持することは、MoEプルーニングに先立って有効な汎用データであることを示している。
我々の改善は、固定された刈り込み予算と下流キャリブレーションデータに支えられている。
関連論文リスト
- Attribution-Guided and Coverage-Maximized Pruning for Structural MoE Compression [74.00650541246374]
そこで本研究では,MoEモデルに適した構造解析フレームワークを提案する。
我々のアプローチはメモリフットプリントを5.27$times削減し、最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-16T06:53:27Z) - Slicing and Dicing: Configuring Optimal Mixtures of Experts [49.5613403644084]
本研究は,最大6.6Bのパラメータにまたがる2000以上の事前学習走行に関する最初の系統的研究である。
私たちは、全体専門家、専門家の次元、単一層内の異種の専門家サイズ、共有専門家サイズ、ロードバランシングメカニズムを徹底的に変化させています。
専門家の数え方と粒度に焦点を合わせ、その他の選択肢は最終品質に最小限の影響を与える。
論文 参考訳(メタデータ) (2026-05-12T07:47:22Z) - Does a Global Perspective Help Prune Sparse MoEs Elegantly? [21.594202826999958]
既存のプルーニング手法は、通常、平らなMoEで生じる不均一な冗長性を見渡して、層全体に均一に予算を割り当てる。
GRAPE(Global Redundancy-Aware Pruning of Experts)は,多層冗長性に基づいて動的にプルーニング予算を割り当てるグローバルプルーニング戦略である。
Mixtral-8x7B、Mixtral-8x22B、DeepSeek-MoE、Qwen-MoE、およびGPT-OSSの実験では、同じプルーニング予算の下では、GRAPEは一貫して最高の平均性能を達成している。
論文 参考訳(メタデータ) (2026-04-08T00:41:11Z) - AIMER: Calibration-Free Task-Agnostic MoE Pruning [12.732331870876182]
簡単なキャリブレーションフリーの基準であるAIMERを導入する。
7Bから30B MoE言語モデル全体の25%と50%のプルーニング比率を16ベンチマークで比較すると、AIMERは一貫して、競争力のある、あるいはより強い全体的なパフォーマンスを提供する。
論文 参考訳(メタデータ) (2026-03-19T04:54:37Z) - EvoESAP: Non-Uniform Expert Pruning for Sparse MoE [42.738877185877634]
textbfExpected textbfAcceptance textbfProxy (textbfESAP) は,プルーンドモデルがフルモデルとどの程度よく一致しているかを測定する投機的復号化型教師力メトリクスである。
固定されたグローバル予算の下で一様でない層単位の空間配置を最適化する進化的探索フレームワークであるEvoESAPを提案する。
論文 参考訳(メタデータ) (2026-03-06T08:02:58Z) - REAP the Experts: Why Pruning Prevails for One-Shot MoE compression [5.517309667435783]
専門家の刈り取りは、生成タスクにおいて優れた戦略であることを示す。
ルータ重み付きエキスパートアクティベーション・プルーニング(REAP)を提案する。
提案手法は,Qwen3-Coder-480B と Kimi-K2 を用いて,コード生成およびツール呼び出しタスクの無作為な圧縮を実現する。
論文 参考訳(メタデータ) (2025-10-15T18:29:28Z) - Dropping Experts, Recombining Neurons: Retraining-Free Pruning for Sparse Mixture-of-Experts LLMs [54.95810313530111]
DERNは、専門家のプルーニングと再構築のためのタスク非依存でトレーニングなしのフレームワークである。
コモンセンス推論やMMLUベンチマークでは、50%のエキスパートスパシティでパフォーマンスを5%以上向上させる。
論文 参考訳(メタデータ) (2025-09-12T16:09:39Z) - How to Prune Your Language Model: Recovering Accuracy on the "Sparsity
May Cry'' Benchmark [60.72725673114168]
下流データセットの微調整中における正確なBERTプルーニングの問題を再考する。
そこで我々は,SMCベンチマークの挑戦においても,プルーニングを成功させるための一般的なガイドラインを提案する。
論文 参考訳(メタデータ) (2023-12-21T03:11:30Z) - Certified Error Control of Candidate Set Pruning for Two-Stage Relevance
Ranking [57.42241521034744]
本稿では、妥当性ランキングのための候補セットプルーニングの認証エラー制御の概念を提案する。
提案手法は,第1段階から抽出した候補集合を抽出し,第2段階の復位速度を向上する。
論文 参考訳(メタデータ) (2022-05-19T16:00:13Z) - MLPruning: A Multilevel Structured Pruning Framework for
Transformer-based Models [78.45898846056303]
プルーニングは、大きな自然言語処理モデルに関連するメモリフットプリントと計算コストを削減する効果的な方法である。
我々は,頭部刈り込み,行刈り,ブロックワイズ刈りという3つの異なるレベルの構造化刈り込みを利用する,新しいマルチレベル構造化刈り込みフレームワークを開発した。
論文 参考訳(メタデータ) (2021-05-30T22:00:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。