論文の概要: The Active Ingredient in Muon's Grokking
- arxiv url: http://arxiv.org/abs/2607.20512v1
- Date: Mon, 06 Jul 2026 22:35:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.926141
- Title: The Active Ingredient in Muon's Grokking
- Title(参考訳): Muon's Grokkingにおけるアクティブイングレディエント
- Authors: Yufeng Wang,
- Abstract要約: 我々は,Muon-fasterがAdamWよりも早くモジュラー算術のグラッキングしきい値に達することを示す。
Mounの振る舞いをよりよく理解するために、私たちはマルチシードおよびマルチラーニングレートのスイープを実行して、その効果を分解し、ストレステストします。
- 参考スコア(独自算出の注目度): 2.921159958223653
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The Muon optimizer reaches the grokking threshold on modular arithmetic faster than AdamW. Prior work attributes this to "spectral-norm constraints plus orthogonalized momentum" but does not isolate which mechanism matters. To better understand Moun's behavior, we run multi-seed and multi-learning-rate sweeps to decompose and stress-test the effect. First, an ablation shows the speedup comes from orthogonalization (the Newton-Schulz iteration): orthogonalize-only matches full Muon, whereas spectral-only is no faster than AdamW and is unreliable, and this verdict holds across learning rates. Second, a mechanistic analysis finds that orthogonalizing optimizers reach generalization at roughly 3x lower spectral norm and, controlling for how much the embedding actually moves, settle into a lower-norm solution rather than simply perturbing the embedding less. Third, reducing the Newton-Schulz iteration count from five to one accelerates reaching the threshold but makes the grokked solution fragile, prone to transient collapse, with fragility that grows with learning rate; a single iteration is fast and stable only at small learning rate, while the canonical five iterations are the learning-rate-robust choice. We also show spectral scaling can be dropped at no measured cost. A methodological thread runs throughout: under a stability-aware metric, "faster" claims about grokking optimizers can invert, so we report both first-crossing and sustained-grok times. To support reproducibility, we release our full training and analysis code at https://github.com/louiswang524/muon-grokking-frontier
- Abstract(参考訳): Muonオプティマイザは、AdamWよりも早くモジュラー演算のグラッキングしきい値に達する。
先行研究は、これを「スペクトルノルム制約と直交運動量」とみなすが、どのメカニズムが重要なのかを分離しない。
Mounの振る舞いをよりよく理解するために、私たちはマルチシードおよびマルチラーニングレートのスイープを実行して、その効果を分解し、ストレステストします。
まず、アブレーションは直交化(ニュートン・シュルツの反復)によるスピードアップを示す: 直交化のみはフルミューオンと一致するが、スペクトルのみはAdamWより高速で信頼できない。
第2に、直交最適化器は、約3倍のスペクトルノルムで一般化され、埋め込みが実際にどれだけ動くかを制御することで、単に埋め込みの摂動を減らすのではなく、低ノルムの解に落ち着く。
第三に、ニュートン・シュルツのイテレーション数を5から1に減らすことは、しきい値に達するまで加速するが、グラククされたソリューションは壊れやすく、過渡的な崩壊を起こす傾向があり、学習速度で成長する脆弱性がある。
また、スペクトルスケーリングを計測コストなしで落とせることを示した。
安定性を意識した測定基準の下では、グルーキングオプティマイザに関する"より高速"な主張が逆転し得るので、最初のクロスと持続的なクロックタイムの両方を報告します。
再現性をサポートするため、私たちはhttps://github.com/louiswang524/muon-grokking-frontierで完全なトレーニングと分析コードをリリースしました。
関連論文リスト
- REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Spectral Flattening Is All Muon Needs: How Orthogonalization Controls Learning Rate and Convergence [15.754779716816174]
ムオンの最大安定ステップサイズは、最大ではなく、勾配の平均特異値でスケールすることを示す。
我々はMuonを事前条件付き勾配法として再評価し、Kronecker-factored curvatureモデルの下で有効収束係数を改善することを示す。
論文 参考訳(メタデータ) (2026-05-13T06:54:01Z) - MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization [7.243820893114047]
指向性最適化の原理に基づく低ビットMuonトレーニングフレームワークを提案する。
4ビット精度のMuonQは、トレーニング損失と下流タスク精度の両方において、フル精度のMuonと密接に一致している。
私たちのコードはhttps://github.com/YupSueng/MuonQ.comで公開されています。
論文 参考訳(メタデータ) (2026-05-12T01:31:32Z) - Accelerating Zeroth-Order Spectral Optimization with Partial Orthogonalization from Power Iteration [6.574641780732972]
我々は,MuonのようなスペクトルがAdamWより優れている隠蔽層トレーニング問題に焦点を当てた。
そのため、Muonの象徴的なNewton-Schulz手順を、より高速でより集中的なパワーイテレーション手法で置き換える。
本手法はZO-Muonの収束速度を1.5倍から4倍にすることができる。
論文 参考訳(メタデータ) (2026-05-09T16:16:45Z) - Muon is Provably Faster with Momentum Variance Reduction [55.388203260208485]
近年の実証研究により、線形線形オラクル(LMO)に基づく深層学習が特に選択された非ユーデアンよりも優れていることが示された。
アダム型学習法は,大規模言語モデルの最小化よりも優れている。
論文 参考訳(メタデータ) (2025-12-18T14:38:39Z) - MuonBP: Faster Muon via Block-Periodic Orthogonalization [24.232069944820513]
ベースラインからMuonBPへの学習率の調整方法を示し、このアルゴリズムの保証を与える。
8方向テンソルテンソルとZeROによる8Bモデルのトレーニングでは、ムオンBPは8%のムオンを達成でき、性能は劣化しない。
論文 参考訳(メタデータ) (2025-10-19T19:56:05Z) - SKI to go Faster: Accelerating Toeplitz Neural Networks via Asymmetric
Kernels [69.47358238222586]
Toeplitz Neural Networks (TNN) は、印象的な結果を持つ最近のシーケンスモデルである。
我々は, O(n) 計算複雑性と O(n) 相対位置エンコーダ (RPE) 多層パーセプトロン (MLP) と減衰バイアスコールの低減を目指す。
双方向モデルの場合、これはスパースと低ランクのToeplitz行列分解を動機付ける。
論文 参考訳(メタデータ) (2023-05-15T21:25:35Z) - Lassoed Tree Boosting [53.56229983630983]
有界断面変動のカドラー関数の大きな非パラメトリック空間において,早期に停止するn-1/4$ L2の収束速度を持つ勾配向上木アルゴリズムを証明した。
我々の収束証明は、ネストしたドンスカー類の経験的損失最小化子による早期停止に関する新しい一般定理に基づいている。
論文 参考訳(メタデータ) (2022-05-22T00:34:41Z) - AdamP: Slowing Down the Slowdown for Momentum Optimizers on
Scale-invariant Weights [53.8489656709356]
正規化技術は現代の深層学習の恩恵である。
しかし、運動量を導入することで、スケール不変の重みに対する効果的なステップサイズが急速に小さくなることがしばしば見過ごされる。
本稿では,この2つの材料の組み合わせが,有効ステップサイズと準最適モデル性能の早期劣化につながることを検証した。
論文 参考訳(メタデータ) (2020-06-15T08:35:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。