論文の概要: DMuon: Efficient Distributed Muon Training with Near-Adam Overhead
- arxiv url: http://arxiv.org/abs/2606.27153v1
- Date: Thu, 25 Jun 2026 15:23:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.332591
- Title: DMuon: Efficient Distributed Muon Training with Near-Adam Overhead
- Title(参考訳): DMuon: ニアアダムオーバーヘッドによる効率的な分散ムーントレーニング
- Authors: Vincent Chen, Starrick Liu, Regis Cheng, Dance Yang, Shalfun Li, Ryan Yu, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang,
- Abstract要約: DMuonはオープンソースの分散Muon実装で、既存のトレーニングパイプラインをドロップインモジュールとして統合します。
DMuonは、エンドツーエンドのステップタイムで1.48x-3.01xのスピードアップ、ステップタイムで6.85x-163.00xのスピードアップを達成する。
- 参考スコア(独自算出の注目度): 13.192517400076746
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Matrix-orthogonalization-based optimizers, exemplified by Muon, have demonstrated strong convergence behavior across a wide range of modern deep learning workloads. The matrix-aware updates offer a compelling alternative to conventional element-wise optimization, particularly as model architectures continue to grow in scale and heterogeneity. Yet contemporary distributed training infrastructure built around the assumption of element-wise optimizers is poorly matched to matrix-level optimizers such as Muon, whose updates couple entire weight matrices and require costly Newton-Schulz iterations. Vanilla Muon implementations incur more than 2x the cost of forward and backward passes. To close this gap, we present DMuon, an open-source distributed Muon implementation that integrates into existing training pipelines as a drop-in module, with no framework-level modifications. Across both embodied foundation model and large language model (LLM) training workloads, DMuon achieves a 1.48x-3.01x speedup in end-to-end step time and a 6.85x-163.00x speedup in optimizer-step time, bringing per-step latency to near-AdamW levels and enabling efficient scaling in our model training.
- Abstract(参考訳): Muon氏が例示したマトリックス直交化に基づく最適化は、さまざまな現代的なディープラーニングワークロードに強い収束挙動を示す。
マトリックスを意識した更新は、特にモデルアーキテクチャがスケールと不均一性で成長し続けるにつれて、従来の要素の最適化に代わる魅力的な代替手段を提供する。
しかし、要素ワイドオプティマイザの仮定に基づいて構築された現代の分散トレーニング基盤は、Muonのようなマトリックスレベルのオプティマイザとはあまり一致しない。
Vanilla Muonの実装は、前方と後方のパスの2倍以上のコストを発生させる。
このギャップを埋めるために、DMuonはオープンソースの分散Muon実装で、フレームワークレベルの変更なしに既存のトレーニングパイプラインをドロップインモジュールとして統合する。
具体的基礎モデルと大規模言語モデル(LLM)トレーニングワークロードの両方で、DMuonはエンドツーエンドのステップタイムで1.48x-3.01xのスピードアップを達成し、オプティマイザステップタイムで6.85x-163.00xのスピードアップを実現し、ステップ単位のレイテンシをほぼAdamWレベルにし、モデルのトレーニングで効率的なスケーリングを可能にします。
関連論文リスト
- MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training [32.15839901598669]
我々は、Muonの直交化フレームワークを曲率認識加速度でブリッジする加速度項MONAを提案する。
我々はMONAの収束解析を行い、加速項が鋭い最小値からの脱出を可能にすることを示す。
汎用性、数学的推論、コード生成ベンチマークで評価し、MONAがSOTA性能を達成する。
論文 参考訳(メタデータ) (2026-05-26T10:56:20Z) - Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning [18.570226339282296]
Muonは、大規模な基礎モデル事前トレーニングのための有望な計算として登場した。
メモリオーバーヘッドが無視できるMuon$2$のゲインをほとんど保存するメモリ効率の係数化変種であるMuon$2$を提案する。
論文 参考訳(メタデータ) (2026-04-11T00:27:40Z) - NuMuon: Nuclear-Norm-Constrained Muon for Compressible LLM Training [50.27276603708547]
フルランク更新を行うにもかかわらず,無音訓練モデルでは重み行列の低ランク構造が顕著に示され,標準パイプラインで容易に圧縮可能であることを示す。
更新方向の核ノルム制約でミューオンを増強し,低ランク構造への学習重み付けをさらに制限するNuMuonを提案する。
論文 参考訳(メタデータ) (2026-03-04T00:10:14Z) - MuonRec: Shifting the Optimizer Paradigm Beyond Adam in Scalable Generative Recommendation [60.1890607252082]
MuonRecは、提案されたMuonイテレーションをRecSysトレーニングに導入する最初のフレームワークである。
我々は、レコメンデーションモデルのためのオープンソースのトレーニングレシピを開発し、従来のシーケンシャルなレコメンデーションモデルと近代的なジェネレーティブなレコメンデーションモデルの両方で評価する。
論文 参考訳(メタデータ) (2026-02-28T02:32:44Z) - DiRL: An Efficient Post-Training Framework for Diffusion Language Models [54.405206032785706]
Diffusion Language Models (dLLMs) はAuto-Regressive(AR)モデルに代わる有望な代替品として登場した。
既存の手法は、訓練と推論の間の計算の非効率性と客観的なミスマッチに悩まされている。
我々は,FlexAttention-accelerated blockwise trainingとLMDeploy-timized inferenceを密接に統合した,効率的なポストトレーニングフレームワークであるDiRLを紹介した。
論文 参考訳(メタデータ) (2025-12-23T08:33:19Z) - MuonBP: Faster Muon via Block-Periodic Orthogonalization [24.232069944820513]
ベースラインからMuonBPへの学習率の調整方法を示し、このアルゴリズムの保証を与える。
8方向テンソルテンソルとZeROによる8Bモデルのトレーニングでは、ムオンBPは8%のムオンを達成でき、性能は劣化しない。
論文 参考訳(メタデータ) (2025-10-19T19:56:05Z) - NorMuon: Making Muon more efficient and scalable [71.49702449498085]
我々はアダムの後継としてノームーンを提案する。
我々は、NorMuonがAdamとMuonの両方を一貫して上回り、Adamより21.74%、Muonより11.31%改善していることを示す。
論文 参考訳(メタデータ) (2025-10-07T01:13:41Z) - Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models [49.911784762244814]
TraceRLは拡散言語モデル(DLM)のための軌道対応強化学習フレームワークである
我々は最先端の拡散言語モデル、すなわち TraDo を導出する。
TraDo-8B-InstructはQwen2.5-7B-Instructで6.1%、Llama3.1-8B-Instructで51.3%の精度向上を実現している。
論文 参考訳(メタデータ) (2025-09-08T17:58:06Z) - AdaMuon: Adaptive Muon Optimizer [11.281916426508216]
AdaMuonは、要素の適応性と、大規模なニューラルネットワークトレーニングのための直交更新を組み合わせる。
AdaMuonは安定性を維持しているが、大規模シナリオではAdamを40%以上のトレーニング効率で上回ることができる。
論文 参考訳(メタデータ) (2025-07-15T05:49:37Z) - Muon is Scalable for LLM Training [50.68746986439438]
MoE(Mixture-of-Expert)モデルであるMoonlightを紹介する。
我々のモデルは現在のフロンティアを改善し、以前のモデルに比べてトレーニングのFLOPをはるかに少なくして、より良いパフォーマンスを実現しています。
メモリ最適化と通信効率のよい分散 Muon 実装をオープンソースとして公開しています。
論文 参考訳(メタデータ) (2025-02-24T09:12:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。