論文の概要: Rethinking Network Topologies for Cost-Effective Mixture-of-Experts LLM Serving
- arxiv url: http://arxiv.org/abs/2605.00254v1
- Date: Thu, 30 Apr 2026 21:35:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 17:43:28.768859
- Title: Rethinking Network Topologies for Cost-Effective Mixture-of-Experts LLM Serving
- Title(参考訳): コスト・エフェクティブ・ミックス・オブ・サービングにおけるネットワークトポロジーの再考
- Authors: Junsun Choi, Sam Son, Sunjin Choi, Hansung Kim, Yakun Sophia Shao, Scott Shenker, Sylvia Ratnasamy, Borivoje Nikolic,
- Abstract要約: 本報告では,MoE LLMサービスにおけるネットワークコスト効率の体系的クロスレイヤ解析について述べる。
低コストのスイッチレストポロジはスケールアップトポロジよりも費用対効果が高いことがわかった。
今後のGPU世代を前向きに分析すると、スイッチレスネットワークのコストパフォーマンス上の優位性が持続する可能性が示唆されている。
- 参考スコア(独自算出の注目度): 5.396584448366384
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-experts (MoE) architectures have turned LLM serving into a cluster-scale workload in which communication consumes a considerable portion of LLM serving runtime. This has prompted industry to invest heavily in expensive high-bandwidth scale-up networks. We question whether such costly infrastructure is strictly necessary. We present the first systematic cross-layer analysis of network cost-effectiveness for MoE LLM serving, comparing four representative XPU (e.g., GPU/TPU) topologies (scale-up, scale-out, 3D torus, and 3D full-mesh). We find that lower-cost switchless topologies are more cost-effective than the scale-up topology across all serving scenarios explored, improving cost-effectiveness by 20.6-56.2%. In particular, the 3D full-mesh topology is Pareto-optimal in terms of the performance-cost tradeoff. We also find that current scale-up link bandwidths are over-provisioned: reducing the link bandwidth improves throughput per cost by up to 27%. A forward-looking analysis of upcoming GPU generations indicates that the cost-performance advantage of switchless networks will likely persist.
- Abstract(参考訳): Mixture-of-experts (MoE) アーキテクチャは LLM をクラスタスケールのワークロードに変換し、通信は LLM のサービスランタイムの大部分を消費する。
これにより、業界は高価な高帯域のスケールアップネットワークに多大な投資をするようになった。
このようなコストのかかるインフラが厳密に必要かどうかを問う。
本報告では, MoE LLM サービスにおけるネットワークコスト効率を, 4つの代表的 XPU (例えば GPU/TPU) トポロジ (スケールアップ, スケールアウト, 3次元トーラス, 3次元フルメッシュ) と比較する。
低コストのスイッチレストポロジは、探索されたすべてのサービスシナリオのスケールアップトポロジよりもコスト効率が高く、コスト効率が20.6~56.2%向上することがわかった。
特に、3Dのフルメッシュトポロジは、パフォーマンスコストのトレードオフの観点から、パレート最適化である。
リンク帯域幅の削減は、コストあたりのスループットを最大27%向上させる。
今後のGPU世代を前向きに分析すると、スイッチレスネットワークのコストパフォーマンス上の優位性が持続する可能性が示唆されている。
関連論文リスト
- How to Train Your LLM Web Agent: A Statistical Diagnosis [96.86317871461834]
LLMウェブエージェントのポストトレーニングにおける計算割当に関する統計学的基礎研究について述べる。
提案手法では,Llama 3.1 8Bの学生を対象に,教師付き微調整(SFT)とオンライン強化学習を用いて,Llama 3.3 70Bの教師を模倣する2段階のパイプラインを用いた。
以上の結果から,SFTとオンラインRLの組み合わせは,WorkArenaとMiniWob++のいずれにおいても,単独でのアプローチよりも一貫して優れていた。
論文 参考訳(メタデータ) (2025-07-05T17:12:33Z) - Rail-only: A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters [7.293402047354488]
本稿では,大規模言語モデル(LLM)をハイパースケールでトレーニングするための,低コストなネットワークアーキテクチャを提案する。
この設計をRailオンリーネットワークと名付け,ネットワークコストを38%から77%削減しながら,同じトレーニング性能を実現することを示す。
私たちのアーキテクチャは、全トラフィックに対して8.2%から11.2%の完了時間オーバーヘッドしか持たない、全対全通信を備えたMixture-of-Expert(MoE)モデルもサポートしています。
論文 参考訳(メタデータ) (2023-07-22T21:18:41Z) - Lightweight and Progressively-Scalable Networks for Semantic
Segmentation [100.63114424262234]
マルチスケール学習フレームワークは,セマンティックセグメンテーションを向上する有効なモデルのクラスと見なされてきた。
本稿では,畳み込みブロックの設計と,複数スケールにわたる相互作用の仕方について,徹底的に解析する。
我々は,軽量で拡張性の高いネットワーク(LPS-Net)を考案した。
論文 参考訳(メタデータ) (2022-07-27T16:00:28Z) - SRH-Net: Stacked Recurrent Hourglass Network for Stereo Matching [33.66537830990198]
本研究では,3次元畳み込みフィルタで用いる4次元立方体体積を相違点方向の逐次コストマップに分解する。
新たなリカレントモジュールであるスタックド・リカレント・ホアーグラス(SRH)が,各コストマップの処理のために提案されている。
提案アーキテクチャはエンドツーエンドのパイプラインで実装され、パブリックデータセットで評価される。
論文 参考訳(メタデータ) (2021-05-25T00:10:56Z) - AANet: Adaptive Aggregation Network for Efficient Stereo Matching [33.39794232337985]
現在の最先端ステレオモデルは、ほとんどが高価な3D畳み込みに基づいている。
エッジフェットング問題を緩和するために,スパースポイントに基づくスケール内コストアグリゲーション手法を提案する。
また、従来のクロススケールなコスト集約アルゴリズムをニューラルネットワーク層に近似して、大きなテクスチャレス領域を処理する。
論文 参考訳(メタデータ) (2020-04-20T18:07:55Z) - ReActNet: Towards Precise Binary Neural Network with Generalized
Activation Functions [76.05981545084738]
本稿では,新たな計算コストを伴わずに,実数値ネットワークからの精度ギャップを埋めるため,バイナリネットワークを強化するためのいくつかのアイデアを提案する。
まず,パラメータフリーのショートカットを用いて,コンパクトな実数値ネットワークを修正・バイナライズすることで,ベースラインネットワークを構築する。
提案したReActNetはすべての最先端技術よりも大きなマージンで優れていることを示す。
論文 参考訳(メタデータ) (2020-03-07T02:12:02Z) - Toward fast and accurate human pose estimation via soft-gated skip
connections [97.06882200076096]
本稿では,高精度かつ高効率な人間のポーズ推定について述べる。
我々は、最先端技術よりも精度と効率を両立させる文脈において、この設計選択を再分析する。
本モデルでは,MPII と LSP のデータセットから最先端の結果が得られる。
論文 参考訳(メタデータ) (2020-02-25T18:51:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。