論文の概要: LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2608.03457v1
- Date: Tue, 04 Aug 2026 10:53:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.146777
- Title: LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
- Title(参考訳): LLaDA MoE v2:Scaling Mixture-of-Experts Diffusion Language Models
- Authors: Fengqi Zhu, Shaoxuan Xu, Jingyang Ou, Zebin You, Yipeng Xing, Huabin Liu, Xiaolu Zhang, Jun Zhou, Zhenzhong Lan, Yankai Lin, Wayne Xin Zhao, Jianguo Li, Chongxuan Li, Ji-Rong Wen,
- Abstract要約: 拡散言語モデル(dLLM)は自己回帰(AR)言語モデリングの代替を提供する。
我々は, MoE dLLM に対するハイパーパラメータ, 計算割り当て, アーキテクチャスケールの最適化を特徴付ける。
23.5Tトークンで30B-A3B dLLMのLLaDA MoE v2をスクラッチからトレーニングします。
- 参考スコア(独自算出の注目度): 129.64558694024126
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion language models (dLLMs) offer an alternative to autoregressive (AR) language modeling, yet the scaling behavior of Mixture-of-Experts (MoE) dLLMs remains poorly understood. We systematically characterize how optimization hyperparameters, compute allocation, and architecture scale for MoE dLLMs, identifying quantitative differences from scaling trends previously reported for AR models. Specifically, for optimization, the optimal nominal batch size grows faster, while the optimal learning rate decays more rapidly with compute. For model--data allocation, IsoFLOP analysis reveals a slight data-side tilt: the optimal token budget grows faster than activated model-side computation. For MoE architecture, larger scales increasingly favor larger expert pools at fixed activated capacity, while moderate expert granularity remains consistently effective and the preferred fraction of activated capacity assigned to shared experts remains stable across scales. Guided by these findings, we train LLaDA MoE v2, a 30B-A3B dLLM, from scratch on 23.5T tokens. With approximately 65\% as many pretraining tokens as Qwen3, LLaDA MoE v2 approaches Qwen3 on several knowledge, reasoning, and coding benchmarks. After supervised fine-tuning alone, it outperforms SDAR Chat on seven of eight reasoning and coding benchmarks and remains close to Qwen3 on several tasks. These results establish practical scaling laws and design principles for MoE dLLMs.
- Abstract(参考訳): 拡散言語モデル (dLLMs) は自己回帰(AR)言語モデリングに代わるものを提供するが、Mixture-of-Experts (MoE) dLLMsのスケーリング挙動はよく分かっていない。
我々は,MoE dLLMの最適化ハイパーパラメータ,計算アロケーション,アーキテクチャスケールを体系的に特徴付け,これまでにARモデルで報告されたスケーリングトレンドと量的差異を識別する。
具体的には、最適化のために最適な名目バッチサイズがより速く成長し、最適な学習速度は計算によってより速く減衰する。
モデル-データアロケーションの場合、IsoFLOP分析はデータ側傾きをわずかに示し、最適なトークン予算は活性化されたモデル-サイド計算よりも速く成長する。
MoEアーキテクチャでは、より大きなスケールでは、固定されたアクティベート能力でより大きなエキスパートプールが好まれる一方で、適度な専門家の粒度は一貫して有効であり、共有された専門家に割り当てられるアクティベーション容量の比率は、スケールにわたって安定している。
23.5Tトークンで30B-A3B dLLMのLLaDA MoE v2をスクラッチからトレーニングした。
Qwen3の約65\%の事前トレーニングトークンを持つLLaDA MoE v2は、いくつかの知識、推論、コーディングベンチマークに基づいてQwen3にアプローチする。
8つの推論とコーディングベンチマークのうち7つでSDAR Chatを上回り、いくつかのタスクでQwen3に近づき続けている。
これらの結果から,MoE dLLMの実用的スケーリング法則と設計原則が確立された。
関連論文リスト
- MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping [52.02659589971978]
我々は,MoE MLLM推論を効果的かつ正確なものにするために,専門家を適応的にスキップする最初のトレーニングフリーフレームワークであるMoDESを提案する。
MoDESは推論速度を大幅に向上させ、プリフィルタイムを2.16$times$、デコードタイムを1.26$times$に改善する。
論文 参考訳(メタデータ) (2025-11-19T18:48:27Z) - Towards Greater Leverage: Scaling Laws for Efficient Mixture-of-Experts Language Models [25.608085561102566]
本稿では,高密度等価量上でのMoEモデルの計算優位性を定量化する指標として,レバレッジ効率(EL)を紹介する。
ELは、予測可能な電力法に従って、専門家のアクティベーション比と総計算予算によって駆動される。
我々はこれらの発見を統合スケーリング法則に統合し、その構成に基づいてMoEアーキテクチャのELを正確に予測する。
論文 参考訳(メタデータ) (2025-07-23T17:10:23Z) - Predictor-Corrector Enhanced Transformers with Exponential Moving Average Coefficient Learning [73.73967342609603]
トラクションエラーを最小限に抑えるための予測-相関学習フレームワークを提案する。
また、高次予測器を強化するために、指数関数的移動平均ベース係数学習法を提案する。
我々のモデルは3.8BのDeepNetを平均2.9のSacreBLEUで上回り、1/3のパラメータしか使用していない。
論文 参考訳(メタデータ) (2024-11-05T12:26:25Z) - Enabling High-Sparsity Foundational Llama Models with Efficient Pretraining and Deployment [56.44025052765861]
大規模言語モデル(LLM)は自然言語処理(NLP)に革命をもたらしたが、そのサイズは計算のボトルネックを生み出している。
そこで本研究では,高性能LLMの高精度かつ疎結合な基本バージョンを作成するための新しいアプローチを提案する。
スパース量子化LLaMAの最大8.6倍のCPU上での総高速化を示す。
論文 参考訳(メタデータ) (2024-05-06T16:03:32Z) - Confident Adaptive Language Modeling [95.45272377648773]
CALMは、入力と生成時間ごとに異なる量の計算を動的に割り当てるフレームワークである。
ハイパフォーマンスを確実に維持しつつ、計算能力、潜在的スピードアップを最大3ドルまで削減する上で、我々のフレームワークの有効性を実証する。
論文 参考訳(メタデータ) (2022-07-14T17:00:19Z) - Sparse MoEs meet Efficient Ensembles [49.313497379189315]
このようなモデルの2つの一般的なクラス、すなわちニューラルネットワークのアンサンブルと専門家のスパースミックス(スパースMoE)の相互作用について研究する。
Efficient Ensemble of Experts (E$3$)は、両モデルのクラスを最大限に活用するスケーラブルでシンプルなMoEのアンサンブルであり、深いアンサンブルよりも最大45%少ないFLOPを使用する。
論文 参考訳(メタデータ) (2021-10-07T11:58:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。