論文の概要: Mixture-of-Kittens: MoE Megakernel for NVL72s
- arxiv url: http://arxiv.org/abs/2609.36070v1
- Date: Mon, 28 Sep 2026 18:22:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.93563
- Title: Mixture-of-Kittens: MoE Megakernel for NVL72s
- Title(参考訳): キツネの混合:NVL72用MoEメガカーネル
- Abstract要約: Nvidia NVL72向けに設計されたMoEトレーニングシステムであるMixture-of-Kittens(MoK)を紹介する。
MoKは、スケールアップドメインのパフォーマンスを解放する3つの洞察の上に構築されている。
MoKは4つの広く使われているオープンウェイトモデルのMoE層にまたがって、最強の一般公開ベースラインのスループットを最大2.37タイムで提供する。
- 参考スコア(独自算出の注目度): 31.93380275641404
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI accelerator systems are rapidly consolidating into scale-up architectures, where tens to thousands of GPUs communicate over high-bandwidth, single-hop fabrics. We find that existing Mixture-of-Experts (MoE) training systems, optimized for conventional scale-out networks, transfer poorly to this setting, often running slower than a naive baseline built with PyTorch and NCCL. With industry roadmaps pointing toward even larger scale-up domains, understanding the performance tradeoffs of this hardware regime is increasingly important. We present Mixture-of-Kittens (MoK), an MoE training system designed for Nvidia NVL72. MoK builds on three insights that unlock performance on scale-up domains: (1) choosing push- or pull-based communication per operator, (2) restructuring the computation-communication overlap, and (3) fully eliminating CPU-GPU synchronization. MoK distills these insights into a single deterministic training megakernel that fuses token dispatch, shared and routed expert FFNs, and token combine. Across MoE layer shapes from four widely used open-weight models, MoK delivers up to $2.37\times$ the throughput of the strongest publicly available baseline. In a production run on 512 GPUs spanning multiple GB300 NVL72 racks, MoK improves end-to-end training throughput by $1.41\times$.
- Abstract(参考訳): AIアクセラレータシステムは、数万から数千のGPUが高帯域幅のシングルホップファブリック上で通信する、スケールアップアーキテクチャに急速に統合されている。
既存のMixture-of-Experts(MoE)トレーニングシステムは、従来のスケールアウトネットワークに最適化されており、この設定への転送が不十分で、しばしばPyTorchとNCCLで構築された単純なベースラインよりも遅い。
業界ロードマップがさらに大きなスケールアップドメインを指しているため、このハードウェア体制のパフォーマンス上のトレードオフを理解することがますます重要である。
Nvidia NVL72向けに設計されたMoEトレーニングシステムであるMixture-of-Kittens(MoK)を紹介する。
MoKは、(1)演算子ごとにプッシュまたはプルベースの通信を選択すること、(2)計算通信のオーバーラップを再構築すること、(3)CPU-GPU同期を完全に排除すること、の3つの洞察に基づいて、スケールアップドメインのパフォーマンスをアンロックする。
MoKはこれらの洞察を、トークンディスパッチ、共有およびルーティングされた専門家FFN、トークンコンバインを融合する単一の決定論的トレーニングメガカーネルに蒸留する。
MoKは、広く使われている4つのオープンウェイトモデルからMoE層にまたがって、最強の一般公開ベースラインのスループットを最大2.37\timesで提供する。
複数のGB300 NVL72ラックにまたがる512GPU上での本番環境では、MoKはエンドツーエンドのトレーニングスループットを1.41\times$で改善している。
関連論文リスト
- Mixture-of-Parallelisms: Towards Memory-Efficient Training Stack for Mixture-of-Experts Models [67.17268530365189]
本稿では,Mixture-of-Experts(MoE)モデルのためのメモリ効率のトレーニングスタックを紹介する。
さまざまなレイヤやMoEモデルのトレーニングパイプラインのステージにおいて、さまざまな既存および新しい並列処理テクニックを組み合わせて、特殊化する。
論文 参考訳(メタデータ) (2026-07-02T08:06:57Z) - Scalable Training of Mixture-of-Experts Models with Megatron Core [26.9162079065285]
MOE(Scaling Mixture-of-Experts)トレーニングでは、密集したモデルに欠けているシステムの課題が導入されている。
各トークンは専門家のサブセットのみを活性化するため、このスパーシリティにより、トータルパラメータはトーケン計算よりもはるかに高速に成長できる。
メモリ(微細な再計算,オフロード,通信,計算)の統合最適化により,MoEトレーニングにおけるこれらの課題に対処する。
論文 参考訳(メタデータ) (2026-03-08T15:42:43Z) - MiMo-V2-Flash Technical Report [101.08860732385551]
我々は309Bの総パラメータと15Bのアクティブパラメータを持つMixture-of-Experts(MoE)モデルであるMiMo-V2-Flashを提案する。
MiMo-V2-Flashは、スライディングウインドウ・アテンション(SWA)をインターリーブするハイブリッドアテンションアーキテクチャを採用している。
このモデルは、Multi-Token Prediction (MTP)で27兆トークンで事前トレーニングされ、ネイティブ32kコンテキスト長を使用し、256kまで拡張された。
論文 参考訳(メタデータ) (2026-01-06T07:31:47Z) - SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations [54.303301888915406]
混合エキスパートモデル(MoE)は、計算コストを大幅に増加させることなく、言語モデルをスケールアップするためのデファクトアーキテクチャとして登場した。
最小のアクティベーションキャッシングでMoEの前後パスを計算するメモリ効率のアルゴリズムを提案する。
また,グループ化されたGEMMカーネルのパディングによる無駄計算を最小限に抑える新しい「トークンラウンドリング」手法を提案する。
論文 参考訳(メタデータ) (2025-12-16T04:39:10Z) - X-MoE: Enabling Scalable Training for Emerging Mixture-of-Experts Architectures on HPC Platforms [15.572112199097132]
我々は,次世代MoEアーキテクチャのスケーラブルなトレーニング性能を実現するために設計された,新しいMoEトレーニングシステムであるX-MoEを紹介する。
X-MoEは、クロスプラットフォームカーネルによる効率的なパディングフリーなMoEトレーニング、冗長性バイパスディスパッチ、シーケンスシャーディングされたMoEブロックによるハイブリッド並列化など、いくつかの新しい手法によってこれを達成している。
論文 参考訳(メタデータ) (2025-08-18T19:49:28Z) - HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap [17.1806530983927]
大規模言語モデル(LLM)のトレーニングを2つのトポロジ対応技術で高速化するためにHierMoEを導入する。
プロトタイプのHierMoEは、1.55times$から3.32times$高速通信を実現し、1.18times$から1.27times$高速エンドツーエンドトレーニングを実現しています。
論文 参考訳(メタデータ) (2025-08-13T08:16:31Z) - MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs [55.95879347182669]
MoEアーキテクチャは、推論コストの比例的な増加なしにモデルキャパシティを向上できることで有名である。
MoE-LightningはCPU-GPU-I/OパイプラインスケジュールであるCGOPipeを導入し、ページ重み付けにより高いリソース利用を実現する。
MoE-Lightningは、単一のT4 GPU(16GB)上でMixtral 8x7Bの最先端オフロード可能なLLM推論システムよりも最大10.3倍高いスループットを実現することができる
論文 参考訳(メタデータ) (2024-11-18T01:06:12Z) - FusionLLM: A Decentralized LLM Training System on Geo-distributed GPUs with Adaptive Compression [55.992528247880685]
分散トレーニングは、システム設計と効率に関する重要な課題に直面します。
大規模深層ニューラルネットワーク(DNN)のトレーニング用に設計・実装された分散トレーニングシステムFusionLLMを提案する。
本システムと手法は,収束性を確保しつつ,ベースライン法と比較して1.45~9.39倍の高速化を実現可能であることを示す。
論文 参考訳(メタデータ) (2024-10-16T16:13:19Z) - FastMoE: A Fast Mixture-of-Expert Training System [20.74001755688784]
Mixture-of-Expert (MoE) は言語モデルのサイズを数兆のパラメータに拡大する強力な可能性を示す。
FastMoEはPyTorchをベースとした分散MoEトレーニングシステムである。
論文 参考訳(メタデータ) (2021-03-24T15:27:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。