論文の概要: How to Loop MoE: Flatten the Experts, Untie the Attention
- arxiv url: http://arxiv.org/abs/2609.35751v1
- Date: Mon, 28 Sep 2026 17:58:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 19:08:49.127517
- Title: How to Loop MoE: Flatten the Experts, Untie the Attention
- Title(参考訳): MoEをループする方法: 専門家をフラットにし、注意を解き放つ
- Abstract要約: 本稿では、Foilを用いて、スパースミックスオブエキスパート(MoE)モデルをループする方法を示す。
実験では、フォイルは未膨らんだループベースラインよりも明らかに優れていた。
この結果をループ型MoEの設計指針に変換する。
- 参考スコア(独自算出の注目度): 18.853580407628407
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Looped Transformers reuse one block of layers several times: by spending extra computation they push a model of fixed size further, and so use its parameters more fully; while sparse mixture-of-experts (MoE) models activate only a few of many experts for each token. Looped MoE bridges these two design philosophies and gives MoE models new potential for better expert usage, but it raises a question: how to loop a MoE? We answer it with Foil. With the expert parameters and the expert compute per token held fixed, Foil (1) flattens the experts, halving the expert layers, doubling the experts per layer and doubling the passes, so that every routing decision chooses from a larger pool, and (2) unties the attention, giving each pass its own attention parameters while the experts and routers stay shared. Experiments show that Foil clearly outperforms the unflattened looped baseline: at 20B tokens every Foil model has lower pretraining loss than the baseline; at 100B tokens the loss improves monotonically with the degree of flattening, the most flattened Foil ending 0.012 nat below the baseline at equal parameters and compute, with downstream accuracy on par or better; untying the attention also yields more balanced and more confident routing at equal shape. Our ablations analyse why Foil works and turn the findings into design guidance for looped MoE: the returns of looping and of widening the expert layers amplify each other, routing confidence tracks healthy expert use better than load balance, and a sparse looped MoE should therefore use more experts per layer and more passes. Code and configurations are available at https://github.com/SR-A-W/how-to-loop-moe.
- Abstract(参考訳): ループトランスフォーマーは、余分な計算をすることで、固定サイズのモデルをさらに推し進め、パラメータをより完全に活用する。
Looped MoEはこれらの2つの設計哲学を橋渡しし、MoEモデルに専門家の使い勝手を高める新たな可能性を与えるが、それは疑問を投げかける:どのようにMoEをループするか?
Foilで答える。
専門家パラメータとトークン単位のエキスパート計算が固定され、(1)エキスパート層をフラットにし、専門家層を半分にし、レイヤ単位のエキスパートを倍にし、パスを倍にする。
20Bトークンでは全てのフォイルモデルがベースラインよりも事前学習損失が低く、100Bトークンでは損失はフラット化の度合いで単調に改善され、最も平坦化されたフォイルは、同じパラメータと計算でベースラインより0.012ナット下にあり、下流の精度は同等かそれ以上である。
ループの返却と専門家層の拡大は相互に増幅し、ルーティングの信頼性は正常な専門家がロードバランシングよりもうまく利用し、疎いループ化されたMoEは各レイヤ当たりのエキスパートの数を増やし、パス数を増やすべきです。
コードと設定はhttps://github.com/SR-A-W/how-to-loop-moe.comで公開されている。
関連論文リスト
- MaskCoFT: Masked Co-Adaptive Fine-Tuning for Memory-Efficient MoE Inference [17.718564947470906]
MaskCoFTは、クロスエントロピー損失だけでルーターとエキスパートを訓練する。
トークン単位のエキスパートフェッチを23.7%、ベースモデルに対して10.1%削減する。
9つのベンチマークの平均精度は、ベースモデルよりも0.92と0.53ポイント高い。
論文 参考訳(メタデータ) (2026-09-28T01:12:30Z) - From Score Distributions to Balance: Plug-and-Play Mixture-of-Experts Routing [52.01745035243826]
Mixture-of-Experts (MoE)モデルは、各トークンを専門家のサブセットにルーティングすることで、パラメータキャパシティをスケールすることができる。
条件付きルーティングは、推論メモリの負荷をシフトし、デバイスごとに専門家の数を制限する。
本稿では,精度を保ちながら負荷のバランスをとるプラグイン・アンド・プレイ型推論時ルーティングアルゴリズムLASERを提案する。
論文 参考訳(メタデータ) (2025-09-29T16:29:17Z) - Accelerating MoE Model Inference with Expert Sharding [1.4733737463429546]
専門家の混合モデル(MoE)は、言語モデリングにおいて最先端の結果を得るが、不均衡なトークンルーティングと通信オーバーヘッドにより、非効率なハードウェア利用に悩まされる。
我々は,MoEエキスパートのテンソルシャーディングを通じて,完全な負荷分散を実現する推論システムであるMoEShardを紹介する。
論文 参考訳(メタデータ) (2025-03-11T14:15:01Z) - MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts [63.67734699877724]
MoE++は、Feed-Forward Network(FFN)とゼロ計算の専門家を統合した、汎用的で異種なMoEフレームワークである。
MoE++は、1.1-2.1xのエキスパートの前方スループットを同じサイズのバニラのMoEモデルと比較すると、パフォーマンスが向上する。
論文 参考訳(メタデータ) (2024-10-09T18:01:27Z) - BAM! Just Like That: Simple and Efficient Parameter Upcycling for Mixture of Experts [41.83123857437985]
大規模な体制でゼロからMoEを訓練することは違法に高価である。
本稿では,BAM(Branch-Attend-Mix)を提案する。
5億9000万から20億のパラメータのシードモデルに関する実験では、BAMがパープレキシティとダウンストリームのタスクパフォーマンスの両方でベースラインを超えていることが示されている。
論文 参考訳(メタデータ) (2024-08-15T17:19:12Z) - Multilinear Mixture of Experts: Scalable Expert Specialization through Factorization [51.98792406392873]
Mixture of Experts (MoE)は、高密度層をより小さくモジュール化された計算に分解する強力な方法を提供する。
大きな課題は、きめ細かい特殊化を達成するのに十分高い専門家の数をスケーリングする計算コストである。
視覚モデルに焦点をあて、この問題に対処するため、Multilinear Mixture of Experts(mu$MoE)層を提案する。
論文 参考訳(メタデータ) (2024-02-19T21:20:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。