論文の概要: It Takes a MAESTRO To Prune Bad Experts
- arxiv url: http://arxiv.org/abs/2607.08601v1
- Date: Thu, 09 Jul 2026 15:32:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.581367
- Title: It Takes a MAESTRO To Prune Bad Experts
- Title(参考訳): 悪名高い専門家を雇うには、MAESTROが要る
- Abstract要約: スパースアクティベートされたMixture-of-Experts (MoE) 言語モデルはトークン当たりのパラメータをわずかに活性化することで、顕著な推論効率を達成する。
既存の構造化プルーニング法は、主に高密度変圧器用に設計されており、MoEルーティングの相互依存性に欠ける局所的導出を用いて、専門家の重要度を評価する。
自動回帰エキスパートアクティベーショントラジェクトリをモデル化するMOEアーキテクチャ用に設計された構造化プルーニングフレームワークであるMAESTROを紹介する。
- 参考スコア(独自算出の注目度): 23.29849824707685
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sparsely-activated Mixture-of-Experts (MoE) language models achieve remarkable inference efficiency by activating only a small fraction of parameters per token, yet their full expert banks reside in memory at all times, creating a prohibitive deployment bottleneck. Existing structured pruning methods, largely designed for dense transformers, assess expert importance using locally derived heuristics that are blind to the interdependent nature of MoE routing. We introduce MAESTRO (Markov-chain Approximated Expert Sparsification via Transition-based ROuting), a structured pruning framework designed for MoE architectures that models autoregressive expert activation trajectories as Ergodic Markov chains whose stationary distributions encode cross-layer dependencies, yielding a globally aware importance heuristic. Evaluated across five diverse domains including Safety, Bias, and Ethics, MAESTRO outperforms state-of-the-art baselines by up to 10.61% in average performance retention under a strict 50% compression regime, while exhibiting substantially lower cross-task variance, indicating that global, routing-congruent pruning produces models that generalize more consistently across heterogeneous tasks.
- Abstract(参考訳): わずかにアクティベートされたMixture-of-Experts(MoE)言語モデルはトークン当たりのパラメータをわずかに活性化することで、驚くべき推論効率を達成する。
既存の構造化プルーニング法は、主に高密度変圧器用に設計されており、MoEルーティングの相互依存性に欠ける局所的に派生したヒューリスティックを用いて、専門家の重要さを評価する。
我々は,MESTRO (Markov-chain Approximated Expert Sparsification via transition-based ROuting)を紹介した。これはMoEアーキテクチャ用に設計された構造化プルーニングフレームワークで,静的分布が層間依存関係をコードするエルゴディックマルコフ連鎖として自己回帰的専門家活性化軌道をモデル化し,世界的に重要なヒューリスティックをもたらす。
安全、バイアス、倫理を含む5つの異なる領域で評価され、MAESTROは、厳密な50%の圧縮条件の下で平均パフォーマンス保持率を最大10.61%向上させ、また、クロスタスクのばらつきが著しく低く、グローバルでルーティングに一貫性のあるプルーニングが、異種タスクをより一貫して一般化するモデルを生み出していることを示している。
関連論文リスト
- CoRDE: Concept-Prior Routed Diffusion Experts for Structural Generalization in Robot Manipulation [13.845777652673767]
CoRDE(Concept-prior Routed Diffusion Experts)は、構造誘導型変量蒸留フレームワークである。
CoRDEは凍結概念エンコーダから意味分布を抽出し、変動後責任を導出する。
優れたアクション品質と漸進的な学習効率を実現しつつ、堅牢でセマンティックに整合した専門家アロケーションを形成します。
論文 参考訳(メタデータ) (2026-06-20T08:07:59Z) - Attribution-Guided and Coverage-Maximized Pruning for Structural MoE Compression [74.00650541246374]
そこで本研究では,MoEモデルに適した構造解析フレームワークを提案する。
我々のアプローチはメモリフットプリントを5.27$times削減し、最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-16T06:53:27Z) - Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models [50.34585122347149]
これは連続的なトランスフォーマー層にまたがるエキスパートパラメータを共有するアーキテクチャ修正である。
我々は、OLMoE、Qwen3、DeepSeekスタイルのMoEなど、一般的な最先端アーキテクチャにおけるこのアプローチを評価した。
論文 参考訳(メタデータ) (2026-06-15T15:08:09Z) - AnchorMoE: Interpretable Time Series Classification via Anchor-Routed MoE [51.994752158953084]
AnchorMoEは、解釈可能な構成別分類フレームワークである。
ローカルパッチのマルチビュー表現をエンコードし、専門の専門家にルーティングする。
実世界のベンチマークと合成ベンチマークの実験は、AnchorMoEが非常に競争力のある分類性能を達成することを示した。
論文 参考訳(メタデータ) (2026-06-02T13:30:54Z) - D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning [49.16227597771663]
D2Prunerは、デバイアスされた重要性と構造的なプルーニングメカニズムを組み合わせたフレームワークである。
FLOPを74.2%削減し、元の性能の99.2%を維持した。
既存の手法に比べて63.53%も改善されている。
論文 参考訳(メタデータ) (2025-12-22T14:42:31Z) - MoE Pathfinder: Trajectory-driven Expert Pruning [19.790092938955336]
本稿では, 各層にまたがるアクティベート専門家の軌道に基づくプルーニング手法を提案する。
提案手法は,既存のほとんどの手法と比較して,ほぼすべてのタスクにおいて優れたプルーニング性能を実現する。
論文 参考訳(メタデータ) (2025-12-20T17:05:08Z) - Mixture of Ranks with Degradation-Aware Routing for One-Step Real-World Image Super-Resolution [76.66229730098759]
実世界の画像超解像(Real-ISR)では、既存のアプローチは主に微調整された事前学習拡散モデルに依存している。
単一ステップ画像超解像のためのMixture-of-Ranks (MoR)アーキテクチャを提案する。
LoRAの各ランクを独立した専門家として扱う、きめ細かい専門家分割戦略を導入する。
論文 参考訳(メタデータ) (2025-11-20T04:11:44Z) - From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models [27.774067682004745]
GISP-Global Iterative Structured Pruningは、ブロックワイド正規化により、構造レベルで集約された1次、損失ベースの重要な重み付けを用いて、注目ヘッドとチャネルを除去する。
反復的なスケジュールは、ワンショットプルーニングではなく、高い間隔で精度を安定させ、中間微調整を必要とせず、パープレキシティの崩壊を緩和する。
重要度はモデルレベルの損失によって定義されるため、GISPはタスク固有の目的を自然にサポートしている。
論文 参考訳(メタデータ) (2025-10-20T19:04:09Z) - ERIS: An Energy-Guided Feature Disentanglement Framework for Out-of-Distribution Time Series Classification [51.07970070817353]
理想的な時系列分類(TSC)は不変表現をキャプチャできるべきである。
現在の手法は、真に普遍的な特徴を分離するために必要な意味的な方向性を欠いている。
本稿では,シフト・ロバストネス・フレームワークのためのエンドツーエンドのエネルギー規則化情報を提案する。
論文 参考訳(メタデータ) (2025-08-19T12:13:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。