論文の概要: Muse: Representation Geometry of Muon Beyond Normalized Momentum
- arxiv url: http://arxiv.org/abs/2607.14536v1
- Date: Thu, 16 Jul 2026 03:42:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.976418
- Title: Muse: Representation Geometry of Muon Beyond Normalized Momentum
- Title(参考訳): Muse: Muon の正規化モメンタムを超越した表現幾何学
- Abstract要約: ミューオン型は行列運動量に対して極写像を適用するが、その更新は曲率化前の各パラメータブロックの表現にも依存する。
我々は、同じ運動量規則とニュートンの運動量規則を共有するムオンスタイルの族であるメソッドを導入する。
バランスのとれた非ネイティブ表現はネイティブ表現と一致するが、より短い次元の縮小はスケーリングと特異チャネルのサポートを弱め、正規化運動量の増加につながる。
- 参考スコア(独自算出の注目度): 26.90642116529718
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Muon-style optimizers apply a polar map to matrix momentum, but their updates also depend on the representation of each parameter block before orthogonalization. We study this representation choice as a form of optimizer geometry and introduce {\method}, a family of Muon-style optimizers that shares the same momentum rule and Newton--Schulz backend across native, nearest-square, skinny, and vector representations. Each Frobenius-isometric representation induces a distinct polar steepest-descent geometry, in which the shorter matrix dimension determines the number of supported singular channels, the pullback scaling, and the constants in stochastic nonconvex convergence bounds. In a teacher--student model, curvature collapse and an isotropic Marchenko--Pastur spectral profile connect early-stage dissipation to the represented nuclear-to-squared-Frobenius norm ratio. Pretraining experiments on LLaMA2-130M and LLaMA2-600M, together with fixed-momentum diagnostics, show that balanced non-native representations can match the performance of the native representation, whereas reducing the shorter dimension weakens the scaling and singular-channel support, leading to behavior that increasingly resembles normalized momentum.
- Abstract(参考訳): ミューオン式最適化器は行列運動量に極写像を適用するが、その更新は直交前の各パラメータブロックの表現にも依存する。
我々は、この表現選択をオプティマイザ幾何の一形態として研究し、同じ運動量規則とニュートン-シュルツバックエンドを共有するミューオンスタイルオプティマイザの族である {\method} を導入する。
フロベニウスの等距離表現は、より短い行列次元が支持される特異チャネルの数、引き戻しスケーリング、確率的非凸収束境界における定数を決定する、明確な極急勾配幾何学を誘導する。
教師-学生モデルでは、曲率崩壊と等方性マルテンコ-パストゥルスペクトルプロファイルが、代表される核対二乗標準比に初期散逸を結びつける。
LLaMA2-130M と LLaMA2-600M の事前学習実験により、バランスの取れた非ネイティブ表現がネイティブ表現のパフォーマンスにマッチすることを示した。
関連論文リスト
- Nonsmooth Optimization via Orthogonalized Momentum [11.546795991978613]
すべての固定運動量因子 $in[0,1)$ に対して、ムオンは凸リプシッツの目的として大域最適解に近づくことができないことを示す。
本稿では,運動量と勾配を結合したMAGDを提案する。
論文 参考訳(メタデータ) (2026-09-12T03:08:36Z) - On Higher-Order Geometric Refinements of Classical Covariance Asymptotics: An Approach via Intrinsic and Extrinsic Information Geometry [0.0]
混合、曲線指数族、潜在変数モデル、多様体-ルートパラメータ空間を含む曲線モデルでは、有限サンプルの振る舞いは予測から体系的に逸脱することができる。
我々は、正規パラメトリック族をフィッシャー制約ラオ計量の((,g))として見ることにより、座標不変な曲率対応の洗練を開発する。
本稿では,学習速度と後進平均二乗誤差における実対数正準しきい値の役割,および正規理論を特殊ケースとして回復する解空間上の曲率に基づく共分散展開について述べる。
論文 参考訳(メタデータ) (2026-04-14T13:40:13Z) - Muon Dynamics as a Spectral Wasserstein Flow [21.689846521201588]
正半定値行列に関するワッサーシュタインノルムの族を導入する。
静的ベナモ・ブレニエ式と動的ベナモ・ブレニエ式との同値性を証明する。
流れモデルに付随する厳密な勾配を同定する。
論文 参考訳(メタデータ) (2026-04-06T17:41:12Z) - Mousse: Rectifying the Geometry of Muon with Curvature-Aware Preconditioning [72.62839712454196]
スペクトル最適化の最近の進歩、特にムーンは、スティーフェル多様体への更新ステップの制限が、トレーニングと改善を著しく加速することを示した。
我々は、この「利他的」制約は、曲率スペクトルが非常に重く、不調であることが知られているディープニューラルネットワークに最適であると主張している。
textbfShampoo の textbfStruct を利用した textbfMousse (textbfMuon textbfOptimization textbfUtilizing textbfShampoo's textbfStruct を提案する。
論文 参考訳(メタデータ) (2026-03-10T14:03:49Z) - Rethinking Diffusion Models with Symmetries through Canonicalization with Applications to Molecular Graph Generation [56.361076943802594]
CanonFlowは、挑戦的なGEOM-DRUGデータセット上で最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-16T18:58:55Z) - Preconditioning Benefits of Spectral Orthogonalization in Muon [50.62925024212989]
線形変圧器の行列分解と文脈内学習の2つのケーススタディにおいて,ミュオンの簡易版の有効性について検討した。
解析の結果,Muonのダイナミクスはスペクトル領域内の独立したスカラー配列の集合に分解され,それぞれが同様の収束挙動を示すことが明らかとなった。
論文 参考訳(メタデータ) (2026-01-20T00:08:31Z) - Isotropic Curvature Model for Understanding Deep Learning Optimization: Is Gradient Orthogonalization Optimal? [2.5336146096572745]
本稿では,重みの行列構造を利用して,一反復でディープラーニングの最適化を解析するモデルを提案する。
最適更新行列は、元の勾配行列のスペクトルをより均一にすることで得られることを示す。
深層学習と言語モデルの学習のための新しい最適化手法の設計に等方的曲率モデルを活用する方法について,今後の研究について論じる。
論文 参考訳(メタデータ) (2025-11-01T19:37:29Z) - Euclidean Distance Matrix Completion via Asymmetric Projected Gradient Descent [25.846262685970164]
本稿では,Burer-Monteiro因子化に基づく勾配型アルゴリズムの提案と解析を行う。
部分ユークリッド距離測定から点集合構成を再構成する。
論文 参考訳(メタデータ) (2025-04-28T07:13:23Z) - Bayesian Circular Regression with von Mises Quasi-Processes [57.88921637944379]
本研究では、円値ランダム関数上の表現的および解釈可能な分布の族を探索する。
後部推論のために,高速ギブズサンプリングに寄与するストラトノビッチ様拡張法を導入する。
本研究では,このモデルを用いて風向予測と走行歩行周期のパーセンテージを関節角度の関数として適用する実験を行った。
論文 参考訳(メタデータ) (2024-06-19T01:57:21Z) - Geometric Neural Diffusion Processes [55.891428654434634]
拡散モデルの枠組みを拡張して、無限次元モデリングに一連の幾何学的先行を組み込む。
これらの条件で、生成関数モデルが同じ対称性を持つことを示す。
論文 参考訳(メタデータ) (2023-07-11T16:51:38Z) - Graph Polynomial Convolution Models for Node Classification of
Non-Homophilous Graphs [52.52570805621925]
本研究では,高階グラフ畳み込みからの効率的な学習と,ノード分類のための隣接行列から直接学習する。
得られたモデルが新しいグラフと残留スケーリングパラメータをもたらすことを示す。
提案手法は,非親和性パラメータのノード分類における精度の向上を実証する。
論文 参考訳(メタデータ) (2022-09-12T04:46:55Z) - Understanding Implicit Regularization in Over-Parameterized Single Index
Model [55.41685740015095]
我々は高次元単一インデックスモデルのための正規化自由アルゴリズムを設計する。
暗黙正則化現象の理論的保証を提供する。
論文 参考訳(メタデータ) (2020-07-16T13:27:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。