論文の概要: UBEP: Re-architecting Expert Parallelism Communication Library for Production Superpods
- arxiv url: http://arxiv.org/abs/2607.06202v2
- Date: Wed, 08 Jul 2026 01:17:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 12:30:34.865232
- Title: UBEP: Re-architecting Expert Parallelism Communication Library for Production Superpods
- Title(参考訳): UBEP: スーパーポッド生産のためのエキスパート並列通信ライブラリの再設計
- Abstract要約: UBEP(Unified-Bus Expert Parallelism)は,現代スーパーポッドアーキテクチャにおけるMoEのオール・ツー・オールプリミティブを再考する,プロダクション対応通信ライブラリである。
UBEPは全レイテンシを最大52.4%削減し、MoE推論タイム・パー・アウトプット・トークン(TPOT)を最大11.1%削減した。
- 参考スコア(独自算出の注目度): 26.604739614895077
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The deployment of Mixture-of-Experts (MoE) models on production high-bandwidth superpods, such as NVIDIA's NVL72/576 and Huawei's CloudMatrix384, introduces critical challenges beyond raw interconnect bandwidth. While these systems provide unified global address spaces and high-bandwidth fabrics, their full potential for sparse MoE communication is hindered by three fundamental bottlenecks: (1) Strict execution serialization imposed by coarse-grained Bulk Synchronous Parallel (BSP) orchestration of interdependent communication phases; (2) Prohibitive synchronization overhead that fails to scale alongside high interconnect bandwidth; and (3) Severe load imbalance resulting from distance-agnostic scheduling of irregular token traffic. To eliminate these bottlenecks, we introduce UBEP (Unified-Bus Expert Parallelism), a production-ready communication library that rethinks MoE's All-to-All primitives for modern superpod architectures. Through large scale experiments, UBEP reduces All-to-All latency by up to 52.4% and MoE inference Time Per Output Token (TPOT) by up to 11.1%.
- Abstract(参考訳): NVIDIAのNVL72/576やHuaweiのCloudMatrix384のような高帯域幅スーパーポッドにMixture-of-Experts(MoE)モデルが配備されたことにより、生の配線帯域を越える重要な課題がもたらされた。
これらのシステムはグローバルアドレス空間と高帯域幅のファブリックを提供する一方で,(1)粗粒バルク同期並列(BSP)による厳密な実行シリアライゼーション,(2)高帯域幅のスケールに失敗する抑制的同期オーバーヘッド,(3)不規則なトークントラフィックの遠隔スケジューリングによる負荷不均衡の3つの基本的なボトルネックによって,疎結合の可能性が妨げられている。
このようなボトルネックを回避するため, UBEP (Unified-Bus Expert Parallelism) は MoE の All-to-All プリミティブを現代スーパーポッドアーキテクチャに再考した,生産対応の通信ライブラリである。
大規模な実験を通じて、UBEPは最大52.4%のレイテンシと、最大11.1%のタイム・パー・アウトプット・トークン(TPOT)を推論する。
関連論文リスト
- An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation [63.50393485685279]
音声の理解と生成を統一する vLLM ベースの推論パイプラインを提案する。
共有直観自由誘導(CFG)のスループットを克服する。
連続バッチ内でペア条件と非条件要求を共スケジューリングすることにより、CFGの実装は、非CFGスループットの80%を維持できます。
論文 参考訳(メタデータ) (2026-07-02T12:55:11Z) - FoMoE: Breaking the Full-Replica Barrier with a Federation of MoEs [16.652851143065213]
FoMoEは、労働者間で専門家層を分割し、地元の訓練中に非居住者の専門家をスキップすることで、フルレプリカパラダイムを破るシステムである。
本稿では,FoMoEが分散データ並列性(DDP)の通信コストを最大1.42倍に削減し,分散データ並列性(DDP)を最大45.44倍に抑えることを示す。
論文 参考訳(メタデータ) (2026-06-17T12:50:07Z) - Relay Buffer Independent Communication over Pooled HBM for Efficient MoE Inference on Ascend [14.495939227785074]
Mixture-of-Experts (MoE)推論はデバイス間で大規模なトークン交換を必要とする。
本稿では,Ascendシステム上でのMoE推論高速化のためのリレーバッファフリー通信設計を提案する。
論文 参考訳(メタデータ) (2026-05-07T11:41:18Z) - Wireless Federated Multi-Task LLM Fine-Tuning via Sparse-and-Orthogonal LoRA [61.12136997430116]
低ランク適応(LoRA)に基づく分散連合学習(DFL)により、マルチタスクデータセットを持つモバイルデバイスは、ローカルに更新されたパラメータを、無線接続を介して近隣デバイスのサブセットと交換することで、大きな言語モデル(LLM)を協調的に微調整することができる。
不均一データセットに微調整されたパラメータを直接集約すると、DFLライフサイクルの3つの主要な問題が発生する: (i) 微調整プロセス中に忘れる破滅的な知識、(ii) データの異種性に起因する更新方向の矛盾に起因する。
論文 参考訳(メタデータ) (2026-02-24T02:45:32Z) - Parallel Track Transformers: Enabling Fast GPU Inference with Reduced Synchronization [19.97521786735984]
Parallel Track (PT) Transformerは、デバイス間の依存関係を最小限にするために再構成される新しいアーキテクチャパラダイムである。
その結果,最大15~30%の時間短縮,2~12%の時間短縮,最大31.90%のスループット向上が報告された。
論文 参考訳(メタデータ) (2026-02-07T01:42:20Z) - AsyncMesh: Fully Asynchronous Optimization for Data and Pipeline Parallelism [54.8494905524997]
両方の並列処理軸をまたいだ非同期更新を導入し、コロケーション要求を緩和します。
スパース平均化と非同期更新の両方に対して収束保証を提供します。
大規模言語モデルを用いた実験により,本手法が完全同期ベースラインの性能と一致することを示した。
論文 参考訳(メタデータ) (2026-01-30T01:24:47Z) - TawPipe: Topology-Aware Weight Pipeline Parallelism for Accelerating Long-Context Large Models Training [9.859893936091813]
大規模言語モデル(LLM)のトレーニングは、デバイスメモリの制限とデバイス間通信のコストによって、基本的に制限されている。
分散クラスタにおける階層的帯域幅を利用して通信効率を向上させるTawPipeを提案する。
論文 参考訳(メタデータ) (2025-11-12T21:06:37Z) - Eliminating Multi-GPU Performance Taxes: A Systems Approach to Efficient Distributed LLMs [61.953548065938385]
分析フレームワークとして'3つの税'(バルク同期、カーネル間データローカリティ、カーネルローンチオーバーヘッド)を紹介した。
我々は、分散GPU実行におけるキー非効率に対処するために、厳密なBSPモデルを超えて移動することを提案する。
BSPベースのアプローチによるエンドツーエンドのレイテンシの10-20%の高速化を観察する。
論文 参考訳(メタデータ) (2025-11-04T01:15:44Z) - Pipeline MoE: A Flexible MoE Implementation with Pipeline Parallelism [91.9372563527801]
既存のMoEモデルは、膨大な内部ノードとノード間通信オーバーヘッドに悩まされる。
本稿では,新しいMoEアーキテクチャであるPipeline MoE(PPMoE)を提案する。
PPMoEは、テンソル並列を組み込んだ専門家の並列処理を構築し、通信集約型の全対一のディスパッチとコレクションを置き換える。
論文 参考訳(メタデータ) (2023-04-22T14:09:14Z) - Low-Latency Federated Learning over Wireless Channels with Differential
Privacy [142.5983499872664]
フェデレートラーニング(FL)では、モデルトレーニングはクライアントに分散し、ローカルモデルは中央サーバによって集約される。
本稿では,各クライアントの差分プライバシ(DP)要件だけでなく,全体としてのトレーニング性能に制約された無線チャネル上でのFLトレーニング遅延を最小限に抑えることを目的とする。
論文 参考訳(メタデータ) (2021-06-20T13:51:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。