論文の概要: Meta-Learning Where to Allocate Experts: Task-Conditioned Layer-Wise Compression for MoEs
- arxiv url: http://arxiv.org/abs/2608.26650v1
- Date: Thu, 27 Aug 2026 06:01:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.254021
- Title: Meta-Learning Where to Allocate Experts: Task-Conditioned Layer-Wise Compression for MoEs
- Title(参考訳): エキスパートをアロケートするメタラーニング:MOEのためのタスク記述型レイヤワイズ圧縮
- Abstract要約: Mixture-of-Experts (MoE)モデルは、各トークンを専門家ネットワークのサブセットにルーティングし、トークンごとのスパースを維持しながらキャパシティを増大させる。
本稿では,各レイヤに対して,専門家保持閾値と有界ルーティングバイアスを予測可能なサポートセットコントローラであるMetaNetを提案する。
- 参考スコア(独自算出の注目度): 8.622261628194893
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Experts (MoE) models route each token to a subset of expert networks, increasing capacity while keeping per-token computation sparse. In many deployed MoEs, the number of active experts is fixed across layers and tasks, although layer roles and expert redundancy vary with depth and demand varies with difficulty. Existing approaches address only part of this setting: layer-wise allocations are usually determined offline and reused for all tasks, while token-level methods vary expert activation using local routing signals without task-level context. We propose MetaNet, a support-set controller that predicts, for each layer, an expert-retention threshold and a bounded routing bias. The backbone, experts, and router remain frozen. On DeepSeek-MoE-16B-Chat, MetaNet provides a tunable accuracy-expert-activation trade-off. Relative to fixed k=6, a conservative setting activates 3.61 experts on average (40% fewer) and achieves comparable MMLU accuracy (0.489 vs. 0.474), whereas an aggressive setting activates 2.28 experts on average (62% fewer) with accuracy approximately 3.7 percentage points lower. The MMLU-trained controller also transfers to C-Eval without retraining, activating 2.90 experts on average (52% fewer than fixed k=6) at 0.386 accuracy.
- Abstract(参考訳): Mixture-of-Experts (MoE)モデルは、各トークンを専門家ネットワークのサブセットにルーティングし、トーケン毎の計算スパースを維持しながらキャパシティを増大させる。
多くのデプロイされたMoEでは、レイヤやタスクにまたがってアクティブな専門家の数が固定されますが、レイヤの役割と専門家の冗長性は深さによって異なり、需要は困難によって異なります。
レイヤワイドアロケーションは通常、すべてのタスクに対してオフラインで再利用され、トークンレベルのメソッドはタスクレベルのコンテキストなしで、ローカルなルーティング信号を使用して専門家のアクティベーションを変更する。
本稿では,各レイヤに対して,専門家保持閾値と有界ルーティングバイアスを予測可能なサポートセットコントローラであるMetaNetを提案する。
バックボーン、エキスパート、ルーターは凍結されている。
DeepSeek-MoE-16B-Chatでは、MetaNetは調整可能な精度-専門家-アクティベーショントレードオフを提供する。
固定k=6に対して、保守的な設定は平均3.61人の専門家(40%以下)を活性化し、MMLUの精度(0.489対0.474)を達成し、攻撃的な設定は平均2.28人の専門家(62%以下)を活性化し、精度は約3.7ポイント低下させる。
MMLUで訓練されたコントローラーは再訓練せずにC-Evalに移行し、0.386の精度で平均2.90人の専門家(固定k=6より52%少ない)を活性化する。
関連論文リスト
- ACE: Adaptive Calibration-Free Expert Skipping for MoE-based LLMs [15.24786135265898]
Mixture-of-Experts (MoE)アーキテクチャは、大規模言語モデル(LLM)のスケーリングに効率的なパラダイムを提供する。
本稿では,トークン適応型エキスパートスキップのためのトレーニングフリー,キャリブレーションフリー,チェックポイント保存フレームワークであるACEを提案する。
論文 参考訳(メタデータ) (2026-09-04T14:56:00Z) - Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation [49.8459545291965]
Mixture-of-experts (MoE)モデルは、最近、一定数の完全なエキスパートをルーティングする以上の動きをしている。
我々は、この依存度を、わずかにリサイクルされたフィードフォワードの専門家をキーバリューチャネルに分解することで研究する。
トークン適応型MoE計算のための統一フレームワークであるUniF-MoEでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-11T02:40:58Z) - Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models [3.747647072414422]
Mixture-of-Experts(MoE)モデルは、トーケン毎の計算から合計パラメータを分離するが、それでもデプロイにはすべての専門家を保存する必要がある。
最近の理論では、微調整中に最小のルータノルム変化を持つプルーニングの専門家は精度を維持することができるが、完全な微調整を前提としている。
軽量適応がこの信号を回復できるかどうかを検証する。
論文 参考訳(メタデータ) (2026-08-08T03:36:41Z) - AcceptMoE: Commitment-Weighted Self-Sizing Verifier Expert Sets for Efficient MoE Speculative Decoding [21.76650680783374]
投機的復号化は、1つのターゲットモデルフォワードパスにおけるドラフトトークンのツリーを検証する。
ミックス・オブ・エキスパート(MoE)ターゲットの場合、並列検証はすべてのツリーノードから選択された専門家の団結を活性化することができる。
本稿では,検証側の専門家セレクタであるAcceptMoEを紹介する。
論文 参考訳(メタデータ) (2026-08-04T01:01:12Z) - Sticky Routing: Training MoE Models for Memory-Efficient Inference [0.0]
StickyMoEは、隣接するトークン間の急激な専門家スイッチをペナライズする。
ポストホックメソッドとは異なり、StickyMoEはエキスパート表現とルーティング決定を、最初のトレーニングステップから共適応させる。
論文 参考訳(メタデータ) (2026-06-12T23:47:19Z) - Hierarchical Mixture-of-Experts with Two-Stage Optimization [84.70724165894501]
ルーティング制御を2つの結合レベルに分解するグループ化されたMoEフレームワークであるHi-MoEを提案する。
我々は,最近のスパースルーティングやグループ化されたMoEベースラインに対する一貫した改善をNLPおよびビジョンベンチマークで観察する。
58Bトークンの大規模事前トレーニングでは、Hi-MoE-7Bは5.6%のパープレキシティ低減と、OLMoE-7Bよりも40%のエキスパートバランスの改善を実現している。
論文 参考訳(メタデータ) (2026-05-08T09:21:46Z) - Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns [10.028141800987548]
スケールでのMoE推論は、専門家の負荷不均衡と非効率なトークンルーティングによってボトルネックとなる。
Llama 4 Maverick, DeepSeek V3-671B, Qwen3-230B-A22B など, SOTA のオープンソース MoE モデルについて検討した。
これらの知見から,ワークロード対応のマイクロバッチグループ化と専門家配置戦略を提案する。
論文 参考訳(メタデータ) (2026-04-25T05:33:03Z) - MoE-Sieve: Routing-Guided LoRA for Efficient MoE Fine-Tuning [0.5076419064097734]
MoE-SieveはLoRAファインチューニングのためのシンプルなルーティング誘導フレームワークである。
上位25%のルーティングされた専門家のみをチューニングすることは、完全なLoRAと競合し続けています。
また、専門家数と種間差異の非単調な関係も観察した。
論文 参考訳(メタデータ) (2026-03-25T07:53:09Z) - SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning [83.66308307152808]
マルチモーダル・インストラクション・チューニング(MCIT)のためのStAbilized Mixture-of-Experts(SAME)を提案する。
プロプライエタリは、サブスペースへのルーティングダイナミクスを分解し、タスク関連方向のみを更新することで、専門家の選択を安定化する。
また、トレーニング中に選択した専門家を凍結するためにアダプティブな専門家アクティベーションを導入し、冗長でクロスタスクな干渉を減らす。
論文 参考訳(メタデータ) (2026-02-02T11:47:06Z) - MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping [52.02659589971978]
我々は,MoE MLLM推論を効果的かつ正確なものにするために,専門家を適応的にスキップする最初のトレーニングフリーフレームワークであるMoDESを提案する。
MoDESは推論速度を大幅に向上させ、プリフィルタイムを2.16$times$、デコードタイムを1.26$times$に改善する。
論文 参考訳(メタデータ) (2025-11-19T18:48:27Z) - Mixtral of Experts [57.411379935325435]
Mixtral 8x7Bはスパース・ミックス・オブ・エキスパートズ(SMOE)言語モデルである。
Mixtralは数学、コード生成、多言語ベンチマークでLlama 270Bをはるかに上回っている。
また、GPT-3.5 Turbo、Claude-2.1、Gemini Pro、Llama 2 70Bを超越したMixtral 8x7B - Instructという命令に従うように微調整されたモデルも提供する。
論文 参考訳(メタデータ) (2024-01-08T18:47:34Z) - MoEC: Mixture of Expert Clusters [93.63738535295866]
Sparsely Mixture of Experts (MoE)は、安価な計算オーバーヘッドを持つ有望なスケーリング能力のため、大きな関心を集めている。
MoEは密度の高い層をスパースの専門家に変換し、ゲートルーティングネットワークを使用して専門家を条件付きで活性化させる。
しかし、専門家の数が増加するにつれて、乱雑なパラメータを持つMoEはデータアロケーションの過度な調整とスパースに悩まされる。
論文 参考訳(メタデータ) (2022-07-19T06:09:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。