論文の概要: MALT: Lightweight Curvature-Aware Muon via Diagonal Preconditioning
- arxiv url: http://arxiv.org/abs/2608.05088v1
- Date: Wed, 05 Aug 2026 17:26:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.056713
- Title: MALT: Lightweight Curvature-Aware Muon via Diagonal Preconditioning
- Title(参考訳): MALT:斜めプレコンディショニングによる軽量曲率対応ミューオン
- Authors: Tongle Wu, Huanyu Dong, Ying Sun, Ziye Ma,
- Abstract要約: 損失景観の曲率幾何学に対するMuonの感度を低減するためにMALTを提案する。
MALTは、ロスランドスケープの曲率幾何学を捉えるために、メモリとオーバーヘッドの少ない両側対角前処理器を使用する。
- 参考スコア(独自算出の注目度): 14.373662883104808
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Muon has recently emerged as a promising alternative to AdamW for language model pretraining by orthogonalizing momentum matrices using Newton-Schulz iterations. Although Muon mitigates gradient anisotropy, it does not explicitly account for the curvature geometry of the loss landscape and may therefore remain sensitive to curvature anisotropy. We bridge this gap by proposing MALT (Muon Augmented by Lightweight Two-sided Preconditioning), which uses lightweight diagonal preconditioners to reduce the sensitivity of Muon to curvature anisotropy. Specifically, MALT uses two-sided diagonal preconditioners with low memory and computational overhead to approximately capture the curvature geometry of the loss landscape. It orthogonalizes the preconditioned momentum using Newton-Schulz iterations and maps the result back to define the update direction, while norm grafting controls the update magnitude. To improve the robustness of MALT to stochastic gradient noise, we further propose MALTER (MALT with Adaptive stEpsize Rescaling). Convergence guarantees are provided for MALT in the stochastic non-convex setting. Experiments on GPT-2 Small, Medium, and Large pretraining show that the proposed methods outperform Muon while maintaining nearly the same memory footprint and wall-clock time.
- Abstract(参考訳): Muon は最近,Newton-Schulz の反復による運動量行列の直交化による言語モデルの事前学習に,AdamW に代わる有望な代替手段として登場した。
ムーンは勾配異方性(英語版)を緩和するが、損失ランドスケープの曲率幾何学を明示的に考慮せず、従って曲率異方性(英語版)に敏感である。
このギャップを、軽量な対角型プレコンディショナーを用いたMALT(Muon Augmented by Lightweight Two-sided Preconditioning)を用いて、変形異方性に対するMuonの感度を低減し、橋渡しする。
特に、MALTは、メモリと計算オーバーヘッドの少ない両側対角前処理器を使用して、ロスランドスケープの曲率幾何学を概ね捉えている。
ニュートン=シュルツ反復を用いて事前条件運動量を直交し、その結果を更新方向の定義にマップし、ノルムグラフトは更新大きさを制御する。
確率勾配雑音に対するMALTのロバスト性を改善するため,MALT(Adaptive stEpsize Rescaling)を提案する。
確率的非凸設定におけるMALTの収束保証を提供する。
GPT-2 Small, Medium, and Large Pretraining 実験の結果,提案手法はメモリフットプリントと壁面時間をほぼ同じに保ちながら Muon よりも優れていることがわかった。
関連論文リスト
- Why Muon Outperforms Adam: A Curvature Perspective [49.85900116602357]
Muonは、大規模な言語モデルトレーニングにおいて、Adamよりもトレーニング効率を約2倍改善する。
私たちの研究は、Adamに対するMuonの優位性を曲率の観点から軽視する第一歩を踏み出します。
論文 参考訳(メタデータ) (2026-06-03T09:40:30Z) - Extra-Merge: Tracing the Rank-1 Subspace of Model Merging in Language Model Pre-Training [56.323119575322146]
Extra-Mergeは、GPT-2およびLLaMAファミリーにわたる実験において、標準のマージベースラインを一貫して上回っている。
Pythia-12B下流のタスクに対して一貫したゼロショット精度のゲインを与え、Muon citepjordan2024muonに効果的に一般化する。
論文 参考訳(メタデータ) (2026-05-26T02:48:34Z) - AMUSE: Anytime Muon with Stable Gradient Evaluation [25.647698512832648]
本研究は,平らで低曲率なバルク部分空間に沿って,ムーンを河川-谷の損失景観から調査するものである。
本研究では,Muonの急激なバルク進行とSchedule-Free平均化の安定化効果を統合した安定勾配評価(AMUSE)を用いたAnytime MUonを提案する。
論文 参考訳(メタデータ) (2026-05-21T12:55:52Z) - Distance-Aware Muon: Adaptive Step Scaling for Normalized Optimization [47.817303172845506]
ミューオンと関連する正規化は、ステップスケールの選択から更新方向の選択を分離する。
我々は,Muonチューニングのための3つの補完アルゴリズムを開発し,正規化適応スケーリングパラメータを開発した。
論文 参考訳(メタデータ) (2026-05-18T18:19:26Z) - Spectral Flattening Is All Muon Needs: How Orthogonalization Controls Learning Rate and Convergence [15.754779716816174]
ムオンの最大安定ステップサイズは、最大ではなく、勾配の平均特異値でスケールすることを示す。
我々はMuonを事前条件付き勾配法として再評価し、Kronecker-factored curvatureモデルの下で有効収束係数を改善することを示す。
論文 参考訳(メタデータ) (2026-05-13T06:54:01Z) - Muon is Not That Special: Random or Inverted Spectra Work Just as Well [50.969177887027115]
正確な幾何構造が性能に影響を及ぼす重要な要因ではないことを実証する。
ここでは、Schatten (quasi-size)normsに基づく幾何学のファミリであるFreonを紹介する。
また、特異値をランダムノイズで置き換える不条理なKaonを導入する。
論文 参考訳(メタデータ) (2026-05-11T19:42:48Z) - Muown: Row-Norm Control for Muon Optimization [41.541871767555484]
Muonは、言語モデルの事前トレーニングにおいてAdamWと強く競合する。
Muownは、Muon、SOAP、AdamW、Lionの複雑さを改善します。
論文 参考訳(メタデータ) (2026-05-11T16:26:06Z) - Mousse: Rectifying the Geometry of Muon with Curvature-Aware Preconditioning [72.62839712454196]
スペクトル最適化の最近の進歩、特にムーンは、スティーフェル多様体への更新ステップの制限が、トレーニングと改善を著しく加速することを示した。
我々は、この「利他的」制約は、曲率スペクトルが非常に重く、不調であることが知られているディープニューラルネットワークに最適であると主張している。
textbfShampoo の textbfStruct を利用した textbfMousse (textbfMuon textbfOptimization textbfUtilizing textbfShampoo's textbfStruct を提案する。
論文 参考訳(メタデータ) (2026-03-10T14:03:49Z) - AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates [5.049533819651459]
我々は、標準ベースの更新とaGradタイプのステップを組み合わせた新しい適応型更新AdaGOを提案する。
AdaGOは更新の直交性を保持しており、これはスペクトル降下と解釈できる。
論文 参考訳(メタデータ) (2025-09-03T03:42:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。