論文の概要: MASKerade: Token-Routed Mask Experts for Dense-to-MoE Upcycling
- arxiv url: http://arxiv.org/abs/2610.07809v1
- Date: Tue, 06 Oct 2026 06:04:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.836496
- Title: MASKerade: Token-Routed Mask Experts for Dense-to-MoE Upcycling
- Title(参考訳): MASKerade:Token-Routed Mask Experts for Dense-to-MoE Upcycling
- Abstract要約: わずかに活性化されたMixture-of-Experts (MoE)モデルは、トーケン当たりの計算量が比例的に増加することなくモデル容量を増加させる。
Dense-to-MoEは、訓練済みの高密度モデルを再利用して、一般にフィードフォワードネットワーク(FFN)を独立に訓練された専門家にコピーすることで、そのようなシステムを構築する。
MASKeradeは,凍結事前訓練されたFFNのスパースワークとして専門家を学習する,高密度から高密度のトレーニング手法である。
- 参考スコア(独自算出の注目度): 41.1609960626654
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sparsely activated Mixture-of-Experts (MoE) models increase model capacity without a proportional increase in per-token computation. Dense-to-MoE upcycling reuses pretrained dense models to construct such systems, commonly by copying feed-forward networks (FFNs) into independently trained experts. We introduce MASKerade, a dense-to-MoE training method that instead learns experts as sparse subnetworks of a frozen pretrained FFN. Each expert is defined by a learned binary mask, and a token-level router selects which masked FFNs to execute and combine. The router and mask scores are optimized jointly, while the underlying FFN weight values remain unchanged. This formulation supports neuron-structured, semi-structured, and unstructured experts within the same routing architecture. Our main configuration uses four 2:4 experts with top-2 routing, where two half-dense expert passes have the nominal FFN arithmetic of one dense pass, without requiring independent expert weight matrices. On five vision-language benchmarks with Qwen and Gemma backbones, this configuration achieves the highest performance among the compared baselines. Comparisons across mask granularities, routing interventions, and compute-matched controls distinguish the effects of learned connectivity from expert activation count. These results establish mask learning over frozen weights as a practical alternative for constructing token-routed MoE experts.
- Abstract(参考訳): わずかに活性化されたMixture-of-Experts (MoE)モデルは、トーケン当たりの計算量が比例的に増加することなくモデル容量を増加させる。
Dense-to-MoEは、訓練済みの高密度モデルを再利用して、一般にフィードフォワードネットワーク(FFN)を独立に訓練された専門家にコピーすることで、そのようなシステムを構築する。
MASKeradeは,凍結事前訓練されたFFNのスパースサブネットワークとして専門家を学習する,高密度から高密度のトレーニング手法である。
各エキスパートは学習されたバイナリマスクで定義され、トークンレベルのルータがFFNをマスクして実行するかを選択します。
ルータとマスクのスコアは共同で最適化されるが、基礎となるFFNの重量値は変わらない。
この定式化は、同じルーティングアーキテクチャ内で、ニューロン構造、半構造、非構造の専門家をサポートする。
主な構成では、トップ2ルーティングを持つ4つの2:4の専門家を使用します。
QwenとGemmaのバックボーンを使った5つのビジョン言語ベンチマークでは、この構成は比較したベースラインの中で最高のパフォーマンスを達成する。
マスクの粒度、ルーティング介入、コンピュータマッチング制御の比較により、学習された接続性の影響を専門家のアクティベーションカウントと区別する。
これらの結果から, 凍結重量によるマスク学習が, トークンを除去したMoE専門家の実践的な代替手段として確立された。
関連論文リスト
- MaskCoFT: Masked Co-Adaptive Fine-Tuning for Memory-Efficient MoE Inference [17.718564947470906]
MaskCoFTは、クロスエントロピー損失だけでルーターとエキスパートを訓練する。
トークン単位のエキスパートフェッチを23.7%、ベースモデルに対して10.1%削減する。
9つのベンチマークの平均精度は、ベースモデルよりも0.92と0.53ポイント高い。
論文 参考訳(メタデータ) (2026-09-28T01:12:30Z) - Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation [49.8459545291965]
Mixture-of-experts (MoE)モデルは、最近、一定数の完全なエキスパートをルーティングする以上の動きをしている。
我々は、この依存度を、わずかにリサイクルされたフィードフォワードの専門家をキーバリューチャネルに分解することで研究する。
トークン適応型MoE計算のための統一フレームワークであるUniF-MoEでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-11T02:40:58Z) - MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts [63.67734699877724]
MoE++は、Feed-Forward Network(FFN)とゼロ計算の専門家を統合した、汎用的で異種なMoEフレームワークである。
MoE++は、1.1-2.1xのエキスパートの前方スループットを同じサイズのバニラのMoEモデルと比較すると、パフォーマンスが向上する。
論文 参考訳(メタデータ) (2024-10-09T18:01:27Z) - BAM! Just Like That: Simple and Efficient Parameter Upcycling for Mixture of Experts [41.83123857437985]
大規模な体制でゼロからMoEを訓練することは違法に高価である。
本稿では,BAM(Branch-Attend-Mix)を提案する。
5億9000万から20億のパラメータのシードモデルに関する実験では、BAMがパープレキシティとダウンストリームのタスクパフォーマンスの両方でベースラインを超えていることが示されている。
論文 参考訳(メタデータ) (2024-08-15T17:19:12Z) - MoMa: Efficient Early-Fusion Pre-training with Mixture of Modality-Aware Experts [95.26323548734692]
MoMaは、モダリティを意識したミックス・オブ・エキスパートアーキテクチャで、混合モーダル、アーリーフュージョン言語モデルを事前訓練する。
MoMa 1.4Bモデルには4人のテキスト専門家と4人の画像専門家が参加し、FLOPの大幅な節約を実現している。
論文 参考訳(メタデータ) (2024-07-31T17:46:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。