論文の概要: Muown: Row-Norm Control for Muon Optimization
- arxiv url: http://arxiv.org/abs/2605.10797v1
- Date: Mon, 11 May 2026 16:26:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 02:24:05.582009
- Title: Muown: Row-Norm Control for Muon Optimization
- Title(参考訳): Muown: Muon最適化のためのRow-Normコントロール
- Authors: Kai Lion, Florian Hübler, Bingcong Li, Antonio Orvieto, Niao He,
- Abstract要約: Muonは、言語モデルの事前トレーニングにおいてAdamWと強く競合する。
Muownは、Muon、SOAP、AdamW、Lionの複雑さを改善します。
- 参考スコア(独自算出の注目度): 41.541871767555484
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Muon has emerged as a strong competitor to AdamW for language model pre-training, yet its behavior at scale is sensitive to weight decay. Recent work has observed that, for Muon without decoupled weight decay, the spectral norm of weight matrices drifts upward over training. Through a decomposition of the spectral norm into a row-magnitude factor and a row-coherence factor, we identify the former as the empirical driver of this drift under Muon, while the latter remains well-behaved along the trajectory. Motivated by this diagnosis, we introduce Muown, a drop-in replacement for Muon that treats the row-magnitude vector as an explicit optimizer variable, updating it under the $\ell_\infty$ geometry induced by the decomposition, while applying Muon unchanged to the remaining direction component. We prove that Muown attains the optimal non-convex rates in both deterministic and stochastic regimes under a dual norm aligned with the underlying geometries and with a stochastic noise coefficient that empirically remains below that of Muon throughout training. Across GPT-style pre-training on FineWeb-Edu with model sizes from 124M up to 2.7B parameters, Muown improves perplexity over Muon, SOAP, AdamW, and Lion. It also widens the plateau of near-optimal learning rates across model scales, reduces sensitivity to weight decay, and avoids the spectral norm drift at negligible step-time overhead when appropriately sharded.
- Abstract(参考訳): Muonは、言語モデルの事前トレーニングにおいてAdamWの強力な競合相手として登場したが、そのスケールでの振る舞いは体重減少に敏感である。
近年の研究では、無結合の重量崩壊のないミューオンでは、重量行列のスペクトルノルムがトレーニングよりも上向きに漂うことが観察されている。
スペクトルノルムを行磁度係数と行コヒーレンス係数に分解することにより、前者は無音下におけるこのドリフトの実証的ドライバであると同定し、後者は軌道に沿ってうまく保たれている。
この診断に触発されたMuownは、行磁度ベクトルを明示的なオプティマイザ変数として扱い、分解によって誘導される$\ell_\infty$幾何の下で更新するMuonのドロップイン置換である。
基礎となる測地線に整合した双対ノルムの下で,Muown が決定的および確率的両体制の最適非凸速度を達成し,Mumon の学習を通して経験的に劣る確率的雑音係数を達成できることを証明した。
モデルサイズが124Mから2.7Bまで、FineWeb-Edu上でのGPTスタイルの事前トレーニング全体にわたって、Muownは、Muon、SOAP、AdamW、Lionの複雑さを改善している。
また、モデルスケールにまたがる準最適学習率の台地を広げ、重量減少に対する感度を低下させ、適切にシャードすると無視できるステップタイムオーバーヘッドでのスペクトルノルムのドリフトを回避する。
関連論文リスト
- Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory [77.27772368491698]
Muonのようなスペクトルは、最近、大規模な言語モデルトレーニングにおいて、強い経験的パフォーマンスを示している。
我々はこの問題を線形連想記憶問題を通して研究する。
また,Muonの貯蔵能力はSGDよりも有意に高いことがわかった。
論文 参考訳(メタデータ) (2026-03-27T16:13:18Z) - Mousse: Rectifying the Geometry of Muon with Curvature-Aware Preconditioning [72.62839712454196]
スペクトル最適化の最近の進歩、特にムーンは、スティーフェル多様体への更新ステップの制限が、トレーニングと改善を著しく加速することを示した。
我々は、この「利他的」制約は、曲率スペクトルが非常に重く、不調であることが知られているディープニューラルネットワークに最適であると主張している。
textbfShampoo の textbfStruct を利用した textbfMousse (textbfMuon textbfOptimization textbfUtilizing textbfShampoo's textbfStruct を提案する。
論文 参考訳(メタデータ) (2026-03-10T14:03:49Z) - NuMuon: Nuclear-Norm-Constrained Muon for Compressible LLM Training [50.27276603708547]
フルランク更新を行うにもかかわらず,無音訓練モデルでは重み行列の低ランク構造が顕著に示され,標準パイプラインで容易に圧縮可能であることを示す。
更新方向の核ノルム制約でミューオンを増強し,低ランク構造への学習重み付けをさらに制限するNuMuonを提案する。
論文 参考訳(メタデータ) (2026-03-04T00:10:14Z) - Muon in Associative Memory Learning: Training Dynamics and Scaling Laws [23.350512542598803]
We study Muon in a linear associative memory model with softmax search and ahierarchical frequency spectrum over query-apwer pairs。
我々は、Muonがこの不均衡を緩和し、より速く、より均一な進歩をもたらすことを示す。
論文 参考訳(メタデータ) (2026-02-05T14:49:40Z) - ECO: Quantized Training without Full-Precision Master Weights [58.97082407934466]
Error-Compensating (ECO)は、量子化されたパラメータに直接更新を適用することで、マスターウェイトを除去する。
ECO は最適値の定数半径近傍に収束するが、素早いマスターウェイト除去は学習率に逆比例する誤差を生じさせる。
論文 参考訳(メタデータ) (2026-01-29T18:35:01Z) - Variance-Adaptive Muon: Accelerating LLM Pretraining with NSR-Modulated and Variance-Scaled Momentum [19.385264518362472]
大規模言語モデル(LLM)は、多種多様な自然言語処理(NLP)タスク間の競合性能を達成する。
モーメントに分散適応正規化を適用するMuon-NSRとMuon-VSの2つの変種を提案する。
GPT-2 と LLaMA プレトレーニング実験により,提案手法は収束を加速し,AdamW と Muon の両ベースラインの競合よりも連続的に検証損失を減少させることを示した。
論文 参考訳(メタデータ) (2026-01-21T02:41:56Z) - Cautious Weight Decay [23.198565281737896]
Cautious Weight Decay (CWD) は、1行の非依存的な修正であり、符号が更新に一致したパラメータのみに重み減衰を適用する。
CWDはAdamW、Lion、Muonなどの座標のドロップイン変更である。
言語モデルの事前トレーニングとImageNet分類では、CWDは最終的な損失と精度を一貫して改善する。
論文 参考訳(メタデータ) (2025-10-14T11:32:55Z) - Low-rank Orthogonalization for Large-scale Matrix Optimization with Applications to Foundation Model Training [3.1922198632169327]
近年、Muon citejordanmuonは、基礎モデルトレーニングにおける強力なパフォーマンスに対して大きな注目を集めている。
我々は,低ランク行列符号の勾配降下と低ランクのムオン変種を提案する。
論文 参考訳(メタデータ) (2025-09-15T14:28:53Z) - Convergence Bound and Critical Batch Size of Muon Optimizer [1.2289361708127877]
4つの実践的な設定にまたがって、Muon の収束証明を提供する。
重み付け崩壊の付加は、より厳密な理論的境界をもたらすことを示す。
トレーニングの計算コストを最小限に抑えた,Muonのクリティカルバッチサイズを導出する。
論文 参考訳(メタデータ) (2025-07-02T11:03:13Z) - Muon is Scalable for LLM Training [50.68746986439438]
MoE(Mixture-of-Expert)モデルであるMoonlightを紹介する。
我々のモデルは現在のフロンティアを改善し、以前のモデルに比べてトレーニングのFLOPをはるかに少なくして、より良いパフォーマンスを実現しています。
メモリ最適化と通信効率のよい分散 Muon 実装をオープンソースとして公開しています。
論文 参考訳(メタデータ) (2025-02-24T09:12:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。