論文の概要: Scaling Muon for Diffusion Transformers
- arxiv url: http://arxiv.org/abs/2608.20818v2
- Date: Mon, 24 Aug 2026 18:34:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:33.866311
- Title: Scaling Muon for Diffusion Transformers
- Title(参考訳): 拡散変圧器のスケーリングミューオン
- Abstract要約: 行列対応のMuonは、一方向にわたる更新のバランスをとることで、大規模なモデルトレーニングを改善するが、そのスケーリング動作と、大規模なトランスフォーマー(DiT)のエンドツーエンド効率は、まだ不明である。
まず、1.3B から 15B のパラメータから DiT 上の Muon のスケーリング挙動を定式化し、AdamW に対する最適化と生成的品質上の利点がモデルスケールにわたって持続していることを示した。
各ステップ(K)毎にNS5スペクトルをフルに更新し、残りのステップにおける現在の運動量に基づく低計算・通信コストの行制限更新を適用する周期的Row-wise Muonを導入する。
- 参考スコア(独自算出の注目度): 32.20758643343064
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The matrix-aware optimizer Muon improves large model training by balancing updates across singular directions, yet its scaling behavior and end-to-end efficiency on large Diffusion Transformers (DiTs) remain unclear. We first establish Muon's scaling behavior on DiTs from 1.3B to 15B parameters, showing that its optimization and generative quality advantages over AdamW persist across model scales. However, at scale, the 5-step Newton--Schulz iteration (NS5) performed at every optimization step, together with full-momentum materialization, introduces substantial computation and communication overhead that can offset Muon's step-efficiency advantage. We introduce \emph{Periodic Row-wise Muon}, which performs a full NS5 spectral update once every \(K\) steps and applies a low compute and communication cost row-wise constrained update based on the current momentum at the remaining steps. We further co-design a distributed implementation that operates directly on sharded momentum during non-refresh steps and accelerates spectral refreshes through bucketed all-gather and communication--computation overlap. Across all scales, Muon improves the best observed generative quality over AdamW by 12.9--19.1\%. Compared with vanilla Muon, Periodic Row-wise Muon remains within 0.5\% in best generative quality on the 1.3B--4B models and improves it by 4.5\% at 9B. It reduces optimizer time by 46.9--54.3\%, end-to-end step time by 15.7--24.3\%, and logical communication volume by 66.7\%, while reaching its respective best generative quality with 33.7--64.8\% less active training time. These results show that Periodic Row-wise Muon preserves Muon's generative quality advantage while translating it into end-to-end training efficiency for large DiTs.
- Abstract(参考訳): 行列対応オプティマイザであるMuonは、一方向の更新のバランスをとることで、大規模なモデルトレーニングを改善するが、大規模拡散変換器(DiT)のスケーリング動作とエンドツーエンド効率は、まだ不明である。
まず、1.3B から 15B のパラメータから DiT 上の Muon のスケーリング挙動を定式化し、AdamW に対する最適化と生成的品質上の利点がモデルスケールにわたって持続していることを示した。
しかし、大規模では、すべての最適化ステップで5ステップのNewton-Schulzイテレーション(NS5)が実行され、フルモーメントの物質化とともに、ムーンのステップ効率の利点を相殺できる相当な計算と通信オーバーヘッドが導入された。
ここでは,各ステップ毎にNS5スペクトルをフルに更新し,残りのステップにおける現在の運動量に基づく低計算・通信コストの行制限更新を適用する。
さらに,非リフレッシュステップにおいて,シャード運動量を直接操作し,バケット付きオールガザーと通信-計算オーバーラップによるスペクトルリフレッシュを加速する分散実装を共同設計する。
バニラ・ムーンと比較すると、周期的なロウワイド・ムーンは1.3B--4Bモデルで最高の生成品質を0.5倍に抑え、9Bで4.5倍改善し、最適化時間を46.9-54.3倍に、エンドツーエンドのステップタイムを15.7-24.3倍に、論理通信量を66.7倍に減らし、それぞれ最高の生成品質を33.7-64.8倍に減らした。
これらの結果から, ムオンはムオンの生成的品質の優位性を保ちつつ, 大規模DiTのエンドツーエンドトレーニング効率に変換できることが示唆された。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales [48.03325171473355]
Muon や SOAP のような高次の LLM は、AdamW よりも高速な収束を提供するが、計算コストと数値安定性の課題は、大規模に採用されることが限られている。
我々は,大規模LLM事前訓練体制の実践的課題を克服するために,事前条件付き手法を適応し,強化する。
論文 参考訳(メタデータ) (2026-07-13T21:47:08Z) - DMuon: Efficient Distributed Muon Training with Near-Adam Overhead [13.192517400076746]
DMuonはオープンソースの分散Muon実装で、既存のトレーニングパイプラインをドロップインモジュールとして統合します。
DMuonは、エンドツーエンドのステップタイムで1.48x-3.01xのスピードアップ、ステップタイムで6.85x-163.00xのスピードアップを達成する。
論文 参考訳(メタデータ) (2026-06-25T15:23:03Z) - Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning [262.0414794728708]
ネモトロン3スーパーの事前学習、後学習、量子化について述べる。
Nemotron 3 Superは1200億(アクティブ120億)のパラメータハイブリッドMamba-Attention Mixture-of-Expertsモデルである。
論文 参考訳(メタデータ) (2026-04-14T07:02:32Z) - MuonRec: Shifting the Optimizer Paradigm Beyond Adam in Scalable Generative Recommendation [60.1890607252082]
MuonRecは、提案されたMuonイテレーションをRecSysトレーニングに導入する最初のフレームワークである。
我々は、レコメンデーションモデルのためのオープンソースのトレーニングレシピを開発し、従来のシーケンシャルなレコメンデーションモデルと近代的なジェネレーティブなレコメンデーションモデルの両方で評価する。
論文 参考訳(メタデータ) (2026-02-28T02:32:44Z) - MuonBP: Faster Muon via Block-Periodic Orthogonalization [24.232069944820513]
ベースラインからMuonBPへの学習率の調整方法を示し、このアルゴリズムの保証を与える。
8方向テンソルテンソルとZeROによる8Bモデルのトレーニングでは、ムオンBPは8%のムオンを達成でき、性能は劣化しない。
論文 参考訳(メタデータ) (2025-10-19T19:56:05Z) - NorMuon: Making Muon more efficient and scalable [71.49702449498085]
我々はアダムの後継としてノームーンを提案する。
我々は、NorMuonがAdamとMuonの両方を一貫して上回り、Adamより21.74%、Muonより11.31%改善していることを示す。
論文 参考訳(メタデータ) (2025-10-07T01:13:41Z) - Muon: Training and Trade-offs with Latent Attention and MoE [4.500362688166346]
小型・中型デコーダ(30M-200Mパラメータ)のみで変圧器を訓練するためのMuonの総合的理論的・実証的研究について述べる。
厳密な理論解析として, (i) 標準仮定による収束率のショーイング, (ii) 勾配の爆発を防止するスペクトル正則化特性, (iii) スティーフェル多様体上の自然勾配降下への接続, (iv) スペクトルノルムによる最も急勾配降下への同値性などを挙げる。
論文 参考訳(メタデータ) (2025-09-29T07:51:06Z) - Muon is Scalable for LLM Training [50.68746986439438]
MoE(Mixture-of-Expert)モデルであるMoonlightを紹介する。
我々のモデルは現在のフロンティアを改善し、以前のモデルに比べてトレーニングのFLOPをはるかに少なくして、より良いパフォーマンスを実現しています。
メモリ最適化と通信効率のよい分散 Muon 実装をオープンソースとして公開しています。
論文 参考訳(メタデータ) (2025-02-24T09:12:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。