論文の概要: Muon as a Residual Connection
- arxiv url: http://arxiv.org/abs/2607.01124v1
- Date: Wed, 01 Jul 2026 16:12:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.981577
- Title: Muon as a Residual Connection
- Title(参考訳): 残留接続としてのミューオン
- Abstract要約: Muonは、大規模なニューラルネットワークをトレーニングするための最も効果的な保存の1つとして登場した。
我々は,ミュオンをトレーニング中に暗黙的な残差接続と解釈できる機構的解釈を提案する。
- 参考スコア(独自算出の注目度): 4.242184336943779
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Muon has recently emerged as one of the most effective optimizers for training large neural networks, yet its empirical success has been explained from several different perspectives. In this paper, we propose a simple mechanistic interpretation: Muon can be understood as an implicit residual connection during training. Specifically, orthogonalizing the update can sacrifice some immediate gradient fidelity while improving representation preservation for downstream layers. We study this trade-off in controlled linear optimization settings, where Muon can learn representations that are slower to fit a local target but easier for downstream layers to exploit. Our results suggest a conceptual explanation for Muon and a design perspective for optimizers that balance local descent with downstream usability.
- Abstract(参考訳): Muonは最近、大規模なニューラルネットワークをトレーニングするための最も効果的なオプティマイザの1つとして登場したが、その経験的な成功は、いくつかの異なる観点から説明されている。
本稿では,ミュオンをトレーニング中に暗黙的な残差接続として解釈する,簡単な機械的解釈を提案する。
具体的には、アップデートの直交化は、下流層の表現保存を改善しながら、直近の勾配の忠実さを犠牲にする可能性がある。
制御された線形最適化設定において、このトレードオフについて検討し、Muonはローカルターゲットに適合するのが遅い表現を学習できるが、下流層が利用しやすいようにすることができる。
この結果から,Muonの概念的説明と,局所的な降下と下流のユーザビリティのバランスをとる最適化設計の視点が示唆された。
関連論文リスト
- Towards Understanding the Power and Limits of the Muon Optimizer: A River-Valley Perspective [12.959531584997462]
近年、ムオンはアダムのようなニュアンスに代えて魅力的な存在として注目されている。
本稿では,センサオペレータを信号,スパイク,バルク成分に分解した混合スパイク行列センシングモデルを提案する。
本研究は,学習の初期段階において,ムオンが情報量の多い川方向に沿ってより速く移動することを示す。
論文 参考訳(メタデータ) (2026-06-19T15:10:20Z) - Muon Learns More Robust and Transferable Features than Adam [24.749527924478148]
Muon が学んだ機能は,Adam と SGD が学んだ機能よりも一貫して堅牢であることを示す。
また,Muonで学習した特徴がAdamやSGDが学んだ特徴よりも効果的に伝達できることを実証した。
論文 参考訳(メタデータ) (2026-06-08T15:42:54Z) - NuMuon: Nuclear-Norm-Constrained Muon for Compressible LLM Training [50.27276603708547]
フルランク更新を行うにもかかわらず,無音訓練モデルでは重み行列の低ランク構造が顕著に示され,標準パイプラインで容易に圧縮可能であることを示す。
更新方向の核ノルム制約でミューオンを増強し,低ランク構造への学習重み付けをさらに制限するNuMuonを提案する。
論文 参考訳(メタデータ) (2026-03-04T00:10:14Z) - To Use or not to Use Muon: How Simplicity Bias in Optimizers Matters [16.624341041698013]
Muonはおそらく、トレーニング速度が優れているため、最も人気がある。
本稿では、このスピードアップを駆動するメカニズムから生じる潜在的な欠点について検討する。
Muonはタスク間の共通基盤構造を明らかにするのに苦労しており、刺激的な特徴に適合する傾向にある。
論文 参考訳(メタデータ) (2026-02-28T17:37:15Z) - Muon in Associative Memory Learning: Training Dynamics and Scaling Laws [23.350512542598803]
We study Muon in a linear associative memory model with softmax search and ahierarchical frequency spectrum over query-apwer pairs。
我々は、Muonがこの不均衡を緩和し、より速く、より均一な進歩をもたらすことを示す。
論文 参考訳(メタデータ) (2026-02-05T14:49:40Z) - NorMuon: Making Muon more efficient and scalable [71.49702449498085]
我々はアダムの後継としてノームーンを提案する。
我々は、NorMuonがAdamとMuonの両方を一貫して上回り、Adamより21.74%、Muonより11.31%改善していることを示す。
論文 参考訳(メタデータ) (2025-10-07T01:13:41Z) - FedMuon: Federated Learning with Bias-corrected LMO-based Optimization [36.00641661700195]
我々は,ミュオンがフェデレートラーニングにどのように活用できるかを考察した。
我々はFedMuonが最先端のフェデレーション学習手法より優れていることを示す。
論文 参考訳(メタデータ) (2025-09-30T14:45:12Z) - Muon Outperforms Adam in Tail-End Associative Memory Learning [118.98991042050532]
機能埋め込みにかかわらず,Muonはクラス間のバランスの取れた学習を一貫して達成している。
我々の経験的観察と理論的分析により、ムオンの核となる利点が明らかとなり、その更新規則は線形連想記憶の外積構造と一致している。
論文 参考訳(メタデータ) (2025-09-30T10:04:08Z) - Muon is Scalable for LLM Training [50.68746986439438]
MoE(Mixture-of-Expert)モデルであるMoonlightを紹介する。
我々のモデルは現在のフロンティアを改善し、以前のモデルに比べてトレーニングのFLOPをはるかに少なくして、より良いパフォーマンスを実現しています。
メモリ最適化と通信効率のよい分散 Muon 実装をオープンソースとして公開しています。
論文 参考訳(メタデータ) (2025-02-24T09:12:29Z) - Improving Network Interpretability via Explanation Consistency Evaluation [56.14036428778861]
本稿では、より説明可能なアクティベーションヒートマップを取得し、同時にモデル性能を向上させるフレームワークを提案する。
具体的には、モデル学習において、トレーニングサンプルを適応的に重み付けするために、新しいメトリクス、すなわち説明整合性を導入する。
そこで,本フレームワークは,これらのトレーニングサンプルに深い注意を払ってモデル学習を促進する。
論文 参考訳(メタデータ) (2024-08-08T17:20:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。