論文の概要: Muon Meets Mamba: Spectral Optimization for State Space Models
- arxiv url: http://arxiv.org/abs/2608.03941v1
- Date: Tue, 04 Aug 2026 17:10:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.297456
- Title: Muon Meets Mamba: Spectral Optimization for State Space Models
- Title(参考訳): Muon 氏と Mamba: 状態空間モデルのスペクトル最適化
- Authors: Arslan Battalov, Karim Kramin, Alexander Markotenko, Sofia Sinitsina,
- Abstract要約: 我々はMuonとMamba-2130MのAdamWを比較する。
出力プロジェクション上のミューオンは、入力プロジェクションまたはその両方でミューオンに打ち勝つ。
条件付けは利得を説明しない。Muonは、それが訓練される射影の条件数を下げるが、より良い条件付き入力射影は助けとなるものではない。
- 参考スコア(独自算出の注目度): 39.146761527401424
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Muon is a recent optimizer that orthogonalizes the update to each weight matrix with a Newton-Schulz iteration, which performs steepest descent under the spectral norm. Almost all the evidence for it comes from Transformer models, and its behavior on state-space models is largely unreported. We compare Muon with AdamW on Mamba-2 130M under a controlled protocol that varies only which weight groups are trained with Muon. The benefit is localized. Muon on the output projection alone beats Muon on the input projection or on both. The advantage is mainly one of token efficiency. It holds on two corpora and two token budgets, and persists when training continues well past the compute-optimal point. Conditioning does not explain the gain. Muon lowers the condition number of whichever projection it trains, but the better-conditioned input projection is not the one that helps.
- Abstract(参考訳): Muonは、各重み行列の更新をNewton-Schulz反復で直交する最近のオプティマイザであり、スペクトルノルムの下で最も急降下する。
ほぼすべての証拠はTransformerモデルによるもので、状態空間モデルに対する振る舞いはほとんど報告されていない。
我々はMuonとMamba-2130MのAdamWを比較する。
利点はローカライズされる。
出力プロジェクション上のミューオンは、入力プロジェクションまたはその両方でミューオンに打ち勝つ。
利点は主にトークン効率の1つです。
2つのコーパスと2つのトークン予算を持ち、トレーニングが計算最適点をはるかに越えて継続する。
条件付けは利得を説明しない。
Muonは、訓練対象のプロジェクションの条件数を下げるが、より良い条件付きインプットプロジェクションは助けにならない。
関連論文リスト
- Why Muon Outperforms Adam: A Curvature Perspective [49.85900116602357]
Muonは、大規模な言語モデルトレーニングにおいて、Adamよりもトレーニング効率を約2倍改善する。
私たちの研究は、Adamに対するMuonの優位性を曲率の観点から軽視する第一歩を踏み出します。
論文 参考訳(メタデータ) (2026-06-03T09:40:30Z) - LionMuon: Alternating Spectral and Sign Descent for Efficient Training [48.69598464267559]
平均コストを大幅に削減しつつ,Muonのステップの有効性を維持するLionMuonを提案する。
固定周期 P におけるライオンとムオンの更新を交互に行い、その間に1つのデュアルEMA運動量バッファを共有する。
シングルEMAのSignMuonは、それ自体が純粋なMuonを上回っている。
論文 参考訳(メタデータ) (2026-05-19T13:07:59Z) - Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning [18.570226339282296]
Muonは、大規模な基礎モデル事前トレーニングのための有望な計算として登場した。
メモリオーバーヘッドが無視できるMuon$2$のゲインをほとんど保存するメモリ効率の係数化変種であるMuon$2$を提案する。
論文 参考訳(メタデータ) (2026-04-11T00:27:40Z) - NuMuon: Nuclear-Norm-Constrained Muon for Compressible LLM Training [50.27276603708547]
フルランク更新を行うにもかかわらず,無音訓練モデルでは重み行列の低ランク構造が顕著に示され,標準パイプラインで容易に圧縮可能であることを示す。
更新方向の核ノルム制約でミューオンを増強し,低ランク構造への学習重み付けをさらに制限するNuMuonを提案する。
論文 参考訳(メタデータ) (2026-03-04T00:10:14Z) - Muon+: Towards Better Muon via One Additional Normalization Step [18.816463168231618]
我々は,ミュオンの簡易かつ効果的な拡張,すなわちミュオン+を提案する。
モデルスケールとアーキテクチャの広範な事前学習実験を通じて,Muon+の有効性を実証する。
論文 参考訳(メタデータ) (2026-02-25T04:04:00Z) - NorMuon: Making Muon more efficient and scalable [71.49702449498085]
我々はアダムの後継としてノームーンを提案する。
我々は、NorMuonがAdamとMuonの両方を一貫して上回り、Adamより21.74%、Muonより11.31%改善していることを示す。
論文 参考訳(メタデータ) (2025-10-07T01:13:41Z) - Muon is Scalable for LLM Training [50.68746986439438]
MoE(Mixture-of-Expert)モデルであるMoonlightを紹介する。
我々のモデルは現在のフロンティアを改善し、以前のモデルに比べてトレーニングのFLOPをはるかに少なくして、より良いパフォーマンスを実現しています。
メモリ最適化と通信効率のよい分散 Muon 実装をオープンソースとして公開しています。
論文 参考訳(メタデータ) (2025-02-24T09:12:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。