論文の概要: Musec: MomentUm SpEctral Clipping for Stable Muon-type Training
- arxiv url: http://arxiv.org/abs/2609.11655v2
- Date: Fri, 11 Sep 2026 06:18:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.476705
- Title: Musec: MomentUm SpEctral Clipping for Stable Muon-type Training
- Title(参考訳): Musec: 安定したミューオン型トレーニングのためのMomentUm Spectral Clipping
- Abstract要約: ミューオンは、損失のスパイクと重量の変動が原因で、スペクトル成長のために不安定性を訓練する傾向にある。
モーメントUmMusecは運動量行列の特異値を約1に切断し、基礎となるスペクトル構造を保存する。
経験的に、Soft Musecは、幅広い学習率とモデルサイズにわたる既存のMuon変種に対するトレーニングを一貫して改善している。
- 参考スコア(独自算出の注目度): 24.72819846755016
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Muon has emerged as a highly effective optimizer for large language model training, often achieving superior convergence and performance compared with the widely adopted Adam and AdamW optimizers. Nevertheless, Muon is prone to training instability due to its spectral flattening, manifested by loss spikes and unbounded growth of model weights. Existing approaches primarily rely on weight or attention-logit clipping, which require architecture-specific modifications and do not directly address instability across all model components. We propose MomentUm SpEctral Clipping (Musec), which replaces Muon's spectral flattening with spectral clipping: rather than setting all singular values of the momentum matrix to approximately one, Musec clips singular values that exceed a threshold while preserving the underlying spectral structure of the momentum. Our strategy provides an optimizer-level, architecture-agnostic mechanism for stabilizing Muon training. Theoretically, we establish convergence guarantees for Musec in nonconvex nonsmooth stochastic optimization. Practically, we develop Soft Musec, an efficient implementation that uses a smooth spectral saturation function approximated by coupled Newton-Schulz iterations. Empirically, Soft Musec consistently improves training stability over existing Muon variants across a wide range of learning rates and model sizes, remaining stable in settings where existing Muon variants diverge while matching their performance under well-tuned configurations.
- Abstract(参考訳): Muonは大規模な言語モデルのトレーニングに非常に効果的なオプティマイザとして登場し、広く採用されているAdamやAdamWのオプティマイザと比較して、コンバージェンスとパフォーマンスが優れている。
それでもムオンは、損失スパイクとモデル重量の非有界成長によって現れるスペクトル平坦化のために不安定性を訓練する傾向にある。
既存のアプローチは主に重み付けやアテンション・ロジット・クリッピングに依存しており、アーキテクチャ固有の変更が必要であり、すべてのモデルコンポーネントの不安定性に直接対処しない。
モーメントUm SpEctral Clipping (Musec) を提案し, モーメントUm SpEctral Clipping (Musec) のスペクトル平坦化をスペクトルクリッピングに置き換える。
私たちの戦略は、Muonトレーニングを安定化するための最適化レベル、アーキテクチャに依存しないメカニズムを提供します。
理論的には、非凸非滑らか確率最適化におけるMusecの収束保証を確立する。
そこで本研究では,Newton-Schulz の反復によるスムーズなスペクトル飽和関数を用いた効率的な実装であるSoft Musecを開発した。
経験的に、Soft Musecは、幅広い学習率とモデルサイズにわたる既存のMuon変種に対するトレーニング安定性を一貫して改善する。
関連論文リスト
- Spectral Allocation: Why Muon Outperforms Adam, and How to Improve Muon [12.170977868230622]
Muon のような直交オプティマイザは、Adam と比較して大きな言語モデルの事前訓練を大幅に加速させることができる。
本研究では,トランスフォーマーの損失景観のスペクトル探索解析を通じてこれを考察する。
完全なSAMuonは低ランクランダム化SVDを用いて測定されたプロファイルに従い、単純化されたSAMuon-liteはランク1の電力反復による2レベル近似を使用する。
論文 参考訳(メタデータ) (2026-08-26T16:41:12Z) - Reassessing Muon for Matrix Factorization [9.691906492780353]
Muonは、大規模なディープラーニングにおいて強力な競争相手として現れている。
簡単な、よく理解され、スペクトル的に構造化された問題(低ランク行列分解)について、Muonについて研究する。
この設定では、MuonはAdamWを一貫して上回るわけではない。
論文 参考訳(メタデータ) (2026-07-14T20:21:38Z) - DMuon: Efficient Distributed Muon Training with Near-Adam Overhead [13.192517400076746]
DMuonはオープンソースの分散Muon実装で、既存のトレーニングパイプラインをドロップインモジュールとして統合します。
DMuonは、エンドツーエンドのステップタイムで1.48x-3.01xのスピードアップ、ステップタイムで6.85x-163.00xのスピードアップを達成する。
論文 参考訳(メタデータ) (2026-06-25T15:23:03Z) - Muon is Not That Special: Random or Inverted Spectra Work Just as Well [50.969177887027115]
正確な幾何構造が性能に影響を及ぼす重要な要因ではないことを実証する。
ここでは、Schatten (quasi-size)normsに基づく幾何学のファミリであるFreonを紹介する。
また、特異値をランダムノイズで置き換える不条理なKaonを導入する。
論文 参考訳(メタデータ) (2026-05-11T19:42:48Z) - Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning [18.570226339282296]
Muonは、大規模な基礎モデル事前トレーニングのための有望な計算として登場した。
メモリオーバーヘッドが無視できるMuon$2$のゲインをほとんど保存するメモリ効率の係数化変種であるMuon$2$を提案する。
論文 参考訳(メタデータ) (2026-04-11T00:27:40Z) - Mousse: Rectifying the Geometry of Muon with Curvature-Aware Preconditioning [72.62839712454196]
スペクトル最適化の最近の進歩、特にムーンは、スティーフェル多様体への更新ステップの制限が、トレーニングと改善を著しく加速することを示した。
我々は、この「利他的」制約は、曲率スペクトルが非常に重く、不調であることが知られているディープニューラルネットワークに最適であると主張している。
textbfShampoo の textbfStruct を利用した textbfMousse (textbfMuon textbfOptimization textbfUtilizing textbfShampoo's textbfStruct を提案する。
論文 参考訳(メタデータ) (2026-03-10T14:03:49Z) - NuMuon: Nuclear-Norm-Constrained Muon for Compressible LLM Training [50.27276603708547]
フルランク更新を行うにもかかわらず,無音訓練モデルでは重み行列の低ランク構造が顕著に示され,標準パイプラインで容易に圧縮可能であることを示す。
更新方向の核ノルム制約でミューオンを増強し,低ランク構造への学習重み付けをさらに制限するNuMuonを提案する。
論文 参考訳(メタデータ) (2026-03-04T00:10:14Z) - Controlled LLM Training on Spectral Sphere [76.60985966206746]
重み付けと更新の両方に厳密なモジュール単位のスペクトル制約を課す textbfSpectral Sphere アルゴリズム (SSO) を導入する。
我々は,MoEルータロードバランシングの改善,外乱抑制,厳密な制限付きアクティベーションなど,重要な実用的安定性の利点を観察した。
論文 参考訳(メタデータ) (2026-01-13T09:59:47Z) - Muon is Provably Faster with Momentum Variance Reduction [55.388203260208485]
近年の実証研究により、線形線形オラクル(LMO)に基づく深層学習が特に選択された非ユーデアンよりも優れていることが示された。
アダム型学習法は,大規模言語モデルの最小化よりも優れている。
論文 参考訳(メタデータ) (2025-12-18T14:38:39Z) - NorMuon: Making Muon more efficient and scalable [71.49702449498085]
我々はアダムの後継としてノームーンを提案する。
我々は、NorMuonがAdamとMuonの両方を一貫して上回り、Adamより21.74%、Muonより11.31%改善していることを示す。
論文 参考訳(メタデータ) (2025-10-07T01:13:41Z) - AdaMuon: Adaptive Muon Optimizer [11.281916426508216]
AdaMuonは、要素の適応性と、大規模なニューラルネットワークトレーニングのための直交更新を組み合わせる。
AdaMuonは安定性を維持しているが、大規模シナリオではAdamを40%以上のトレーニング効率で上回ることができる。
論文 参考訳(メタデータ) (2025-07-15T05:49:37Z) - Muon is Scalable for LLM Training [50.68746986439438]
MoE(Mixture-of-Expert)モデルであるMoonlightを紹介する。
我々のモデルは現在のフロンティアを改善し、以前のモデルに比べてトレーニングのFLOPをはるかに少なくして、より良いパフォーマンスを実現しています。
メモリ最適化と通信効率のよい分散 Muon 実装をオープンソースとして公開しています。
論文 参考訳(メタデータ) (2025-02-24T09:12:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。