論文の概要: ExpertMuon-Compass: Alignment-Guided Step Sizes for Mixture-of-Experts Training
- arxiv url: http://arxiv.org/abs/2610.04140v1
- Date: Fri, 02 Oct 2026 23:27:50 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:39:53.262586
- Title: ExpertMuon-Compass: Alignment-Guided Step Sizes for Mixture-of-Experts Training
- Title(参考訳): ExpertMuon-Compass:Mixture-of-Expertsトレーニングのためのアライメントガイド付きステップサイズ
- Abstract要約: Mixture-of-Experts(MoE)言語モデルは、トークンを数人の専門家に送信する。
学習率の共有により、Muonは、ほぼ同じサイズの更新を、同じ形状のエキスパート行列に適用する。
本稿では,各専門家のミューオンステップを2つの要因で乗算するExpertMuonアライメントを提案する。
- 参考スコア(独自算出の注目度): 41.68108356445426
- License:
- Abstract: Mixture-of-experts (MoE) language models send each token to a few experts, so each expert is trained on a different part of the data, and this part changes during training. With a shared learning rate, Muon applies updates of roughly the same size to expert matrices of the same shape, even when an expert's update is poorly aligned with its current gradient. We here propose ExpertMuon-Compass (Compass), which multiplies the Muon step of each expert by two factors. A family factor compares the cosine between the expert's orthogonalized update and its gradient with the same cosine for the other experts in its layer. A scalar radius aggregates the alignment between corresponding rows of the update and gradient into one step-length multiplier. Compass keeps the update direction and the momentum buffer of Muon. In pretraining on FineWeb-Edu, Compass with Nesterov momentum on all matrices performs as well as or better than Muon, NorMuon, and other optimizers, with weight decay matched to NorMuon in the longer runs. Adding its factors to NorMuon gives the same or a lower loss than NorMuon. Compass is the most effective when the data seen by each expert varies during training, for example, as when the languages of a multilingual corpus arrive in separate blocks. With Compass, the expert load stays balanced, and the router assigns tokens to experts more decisively. We also prove a perturbation bound for the two factors.
- Abstract(参考訳): Mixture-of-Experts(MoE)言語モデルは、トークンを数人の専門家に送信するので、各専門家はデータの異なる部分でトレーニングされ、トレーニング中にこの部分が変わる。
共有学習率では、専門家の更新が現在の勾配に不整合である場合でも、Muonは、ほぼ同じ大きさの更新を同じ形状のエキスパート行列に適用する。
本稿では、各専門家のミューオンステップを2つの要因で乗算するExpertMuon-Compass(Compass)を提案する。
ファミリーファクターは、専門家の直交した更新と勾配のコサインを、その階層内の他の専門家と同じコサインと比較する。
スカラー半径は、更新の対応する行と勾配のアライメントを1ステップの乗算器に集約する。
Compass は Muon の更新方向と運動量バッファを保持する。
FineWeb-Eduでの事前トレーニングでは、Nesterovの運動量を持つCompassは、Muon、NorMuon、その他のオプティマイザと同等以上のパフォーマンスを示し、より長い走行ではNorMuonと重みが一致している。
NorMuonにその要素を追加することは、NorMuonと同じまたは低い損失を与える。
コンパスは、例えば多言語コーパスの言語が別々のブロックに到達した時のように、トレーニング中に各専門家が見るデータが異なる場合に最も効果的である。
Compassでは、専門家の負荷はバランスが保たれ、ルータは専門家にトークンをより決定的に割り当てる。
また、この2つの要因に束縛された摂動も証明する。
関連論文リスト
- The Row Normalization Puzzle in Muon [12.977441534320041]
本稿では,行ごとの計算再正規化がMuonに与える影響について検討する。
NorMuonの最悪のケース保証と実際のパフォーマンスのギャップに焦点を当てている。
論文 参考訳(メタデータ) (2026-09-30T06:51:18Z) - Equivariance Breaks the Learning Rate [24.409404298953234]
等変ネットワークは一般的にアダムで訓練される。
等変線形層内のこの違いの1つの源を同定する。
ブロックワイドなステップ制御と運動量蓄積が、ムオンの利点の大部分を占めることを示す。
論文 参考訳(メタデータ) (2026-09-08T07:52:03Z) - Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation [49.8459545291965]
Mixture-of-experts (MoE)モデルは、最近、一定数の完全なエキスパートをルーティングする以上の動きをしている。
我々は、この依存度を、わずかにリサイクルされたフィードフォワードの専門家をキーバリューチャネルに分解することで研究する。
トークン適応型MoE計算のための統一フレームワークであるUniF-MoEでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-11T02:40:58Z) - From Score Distributions to Balance: Plug-and-Play Mixture-of-Experts Routing [52.01745035243826]
Mixture-of-Experts (MoE)モデルは、各トークンを専門家のサブセットにルーティングすることで、パラメータキャパシティをスケールすることができる。
条件付きルーティングは、推論メモリの負荷をシフトし、デバイスごとに専門家の数を制限する。
本稿では,精度を保ちながら負荷のバランスをとるプラグイン・アンド・プレイ型推論時ルーティングアルゴリズムLASERを提案する。
論文 参考訳(メタデータ) (2025-09-29T16:29:17Z) - EOE: Evolutionary Optimization of Experts for Training Language Models [0.0]
本稿では,大規模言語モデル(LLM)の学習のための進化的枠組みを提案する。
実験では、最高の専門家がフルモデルとほぼ同じ精度で達成できることが示されている。
各ステップでトレーニングされる専門家は1人なので、トレーニングはメモリをはるかに少なくし、スループットもはるかに高くなります。
論文 参考訳(メタデータ) (2025-09-29T08:18:26Z) - SYMI: Efficient Mixture-of-Experts Training via Model and Optimizer State Decoupling [1.2777855412373709]
Mixture-of-Experts (MoE)モデルは、計算の線形増加を伴わずに、モデルサイズを拡大し続けるために広く採用されているソリューションとなっている。
現在のシステムでは、人気のある専門家に割り当てられたトークンをドロップするか、収束を低下させるか、あるいは人気に基づいて各専門家に割り当てられたリソースを頻繁に再バランスさせなければならない。
適応型MOEトレーニングシステムであるSYMIを紹介する。
論文 参考訳(メタデータ) (2025-04-28T15:58:55Z) - Mixtral of Experts [57.411379935325435]
Mixtral 8x7Bはスパース・ミックス・オブ・エキスパートズ(SMOE)言語モデルである。
Mixtralは数学、コード生成、多言語ベンチマークでLlama 270Bをはるかに上回っている。
また、GPT-3.5 Turbo、Claude-2.1、Gemini Pro、Llama 2 70Bを超越したMixtral 8x7B - Instructという命令に従うように微調整されたモデルも提供する。
論文 参考訳(メタデータ) (2024-01-08T18:47:34Z) - Rebalanced Siamese Contrastive Mining for Long-Tailed Recognition [120.80038161330623]
教師付きコントラスト学習は、元のバッチレベルとシームズバッチレベルの両方において、二重クラス不均衡の問題に悩まされていることを示す。
コントラスト計算のための情報的ペアを抽出し,表現学習を改善するために,教師付き強正・負のペアマイニングを提案する。
論文 参考訳(メタデータ) (2022-03-22T07:30:38Z) - Mixture-of-Experts with Expert Choice Routing [44.777850078713634]
以前の作業では、トップk関数を使用して各トークンに一定数の専門家を割り当てていた。
本稿では,専門家選択手法を用いた異種混合実験を提案する。
本手法は, トレーニング収束時間を2倍以上改善する。
論文 参考訳(メタデータ) (2022-02-18T17:46:11Z) - A Mixture of $h-1$ Heads is Better than $h$ Heads [63.12336930345417]
我々は注意的専門家モデル(MAE)の混合を提案する。
機械翻訳と言語モデリングの実験により、MAEは両方のタスクにおいて強いベースラインを上回ります。
分析の結果、我々のモデルは、異なる専門家を異なる入力に専門化することを学びました。
論文 参考訳(メタデータ) (2020-05-13T19:05:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。