論文の概要: TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes
- arxiv url: http://arxiv.org/abs/2608.13057v2
- Date: Fri, 14 Aug 2026 07:00:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 13:59:16.225521
- Title: TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes
- Title(参考訳): TEMPO: メモリと計算バウンドのレジームをまたいで、専門家と並列のロードバランシングを実現する
- Authors: Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song,
- Abstract要約: TEMPOは、クリティカルパスからミリ秒でバッチ毎のディスパッチを解決するメースパン対応ディスパッチである。
SG統合はプロセスアウトで実行され、ディスパッチを1つのイングラフカーネルにフューズする。
Testbed Bのエンドツーエンドでは、Qwen3-235Bが4-6%のスループットを獲得し、p99のレイテンシを15.6%のコストで削減している。
- 参考スコア(独自算出の注目度): 6.460910545652521
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In expert-parallel (EP) MoE serving, every layer synchronizes at the slowest GPU. Dispatchers balance token counts (EPLB, LPLB, UltraEP) or activated-expert counts (METRO), assuming expert time is linear in one. Measurements on two datacenter GPU generations show it is neither: below $n^* \approx 156$--$168$ tokens, HBM weight streaming dominates---cost attaches to $activated replicas$, not tokens; above it, grouped GEMM rounds tokens to 128-tile $M$-tiles, so $splitting$ an expert adds padded compute. A max-affine profile $t=\max(a+bG,\,c+βN)$ captures both regimes. Realistic decode batches hold hot experts in the linear regime and cold in the flat $simultaneously$; recorded batches show proxy dispatches differ by $1.4$--$1.6\times$ in modeled block time (p95 up to $1.7\times$), and $which$ proxy wins flips with the regime. We formalize per-batch dispatch as a fixed-charge makespan problem---NP-hard on two fully replicated GPUs, polynomial in degenerate limits---and present TEMPO, a makespan-aware dispatcher solving it in milliseconds off the critical path; its SGLang integration runs out-of-process and fuses dispatch with count collection into one in-graph kernel. Anchored by an 8-GPU Testbed A microbenchmark, TEMPO stays within $1\%$ of the best fixed baseline everywhere and wins by up to $15.5\%$ where regimes mix. End-to-end on Testbed B, Qwen3-235B (inside the win region) gains $4$--$6\%$ throughput and cuts p99 latency by $\sim 15.6\%$; DeepSeek-V3 (outside, communication-dominated) shows only mechanism cost. A phase diagram, not a universal win, is the claim: it predicts both outcomes before deployment.
- Abstract(参考訳): エキスパート並列(EP) MoEサービスでは、すべてのレイヤが最も遅いGPUで同期する。
Dispatchers balance token counts (EPLB, LPLB, UltraEP) またはactivated-expert counts (METRO) は、専門家時間が1つに線形であると仮定する。
下記の$n^* \approx 156$-$168$トークン、HBMのウェイトストリーミングが支配する---$activated replicasへのコストのアタッチ トークンではなく、トークンではない。
最大アフィンプロファイル $t=\max(a+bG,\,c+βN)$ は両方のレシームをキャプチャする。
記録されたバッチは、プロキシディスパッチがモデル化されたブロック時間(p95から1.7まで)で1.4$--$1.6\times$が異なることを示している。
我々は、バッチごとのディスパッチを固定電荷のメースパン問題として定式化する。-NP-hard on two fully replicated GPU, polynomial in degenerate limit--- 現在、TEMPOはクリティカルパスからミリ秒でそれを解き、SGLangはアウト・オブ・プロセスを実行し、カウントコレクションでディスパッチを1つのイングラフカーネルに融合する。
8GPUテストベッド マイクロベンチマークにより、TEMPOは至る所で最高の固定ベースラインの$1\%以内に留まり、レギュラーが混在するところで最大$15.5\%で勝利する。
Testbed B のエンドツーエンドでは Qwen3-235B が 4$--$6\% のスループットを獲得し、p99 のレイテンシを $\sim 15.6\% で削減している。
フェーズダイアグラムは、普遍的な勝利ではなく、クレームであり、デプロイ前に両方の結果を予測する。
関連論文リスト
- \chisao{}: A GPU-Native Parallel Optimizer for Multimodal Black-Box Functions via Convergence-Anticonvergence Oscillation [0.0]
Chisaoはサンプルバッチ全体を同時に実行し、意図的な収束対収束サイクルを活用する。
Chisaoは textbf100% モードのリカバリを実現しており、CPUベースラインはすべて$d geq 8$で崩壊する。
このアルゴリズムは、PyPI上のスタンドアロンのPythonパッケージとして利用できる。
論文 参考訳(メタデータ) (2026-06-24T06:33:29Z) - Scaling Neural Network Verification with Tensor Parallelism and Fully Sharded Data Parallelism [0.0]
形式的ニューラルネットワーク検証は、実際にはGPUメモリによって境界付けられている。
大規模なモデルトレーニングのために開発された2つのテクニックをauto_LiRPA / $,$-CROWN 検証フレームワークに適用する。
フルシャードデータ並列(FSDP)シャードは、層ごとのAllGatherで重量行列のみをシャードし、単一GPUベースラインとビット単位で同一のバウンドを生成する。
論文 参考訳(メタデータ) (2026-06-08T11:56:29Z) - Deterministic Realization of Classical Dissipation on Quantum Computers [0.0]
量子デバイス上の格子ボルツマン (LB) は、単体ゲートの進化を散逸するエルフ衝突ステップと調整しなければならない。
MRT(Multiple-relaxation-time)クラスでは、m_r'=_r,m_r$ with $_rin[-1,1]$という、近視的対角モーメント緩和の一般的な設定で作業します。
主な結果は散逸 MRT ブロックであり、平衡モーメントベクトル$mmathrmeq=Mfmathrm の構築である。
論文 参考訳(メタデータ) (2026-04-28T09:36:40Z) - ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers [11.576817774473398]
既存のアテンションアクセラレータは、しばしば正確なソフトマックスのセマンティクスを交換し、融合されたコアカーネルに依存する。
本稿では,実算術における厳密なソフトマックスのセマンティクスを近似可能な$mathcalO(ulog n)$ FP32の相対誤差境界で予約するオンラインソフトマックスアテンションをアルゴリズム的に再構成するbfELSAを提案する。
HMMA/GMMA Core命令に依存し、FP32パスを提供しないFlashAttention-2/3とは異なり、ELSAはA100とリソースで同一に動作する。
論文 参考訳(メタデータ) (2026-04-26T16:41:30Z) - TwinFormer: A Dual-Level Transformer for Long-Sequence Time-Series Forecasting [0.0]
TwinFormerは時系列予測のための階層型トランスフォーマーである。
入力を重複しない時間パッチに分割し、2段階に分けて処理する。
軽量GRUは、直接マルチ水平予測のために、グローバルにコンテキスト化されたパッチトークンを集約する。
論文 参考訳(メタデータ) (2025-12-13T11:50:18Z) - Learning and Computation of $Φ$-Equilibria at the Frontier of Tractability [85.07238533644636]
$Phi$-equilibriaは、オンライン学習とゲーム理論の中心にある、強力で柔軟なフレームワークだ。
効率的なオンラインアルゴリズムは、$textpoly(d, k)/epsilon2$ラウンドを使用して、平均$Phi$-regretを最大$epsilon$で生成することを示す。
また、オンライン設定において、ほぼ一致した下限を示し、その結果、$Phi$-regretの学習可能性を取得する偏差の族が初めて得られる。
論文 参考訳(メタデータ) (2025-02-25T19:08:26Z) - Near Sample-Optimal Reduction-based Policy Learning for Average Reward
MDP [58.13930707612128]
この研究は、平均報酬マルコフ決定過程(AMDP)における$varepsilon$-Optimal Policyを得る際のサンプルの複雑さを考察する。
我々は、状態-作用対当たりの$widetilde O(H varepsilon-3 ln frac1delta)$サンプルを証明し、$H := sp(h*)$は任意の最適ポリシーのバイアスのスパンであり、$varepsilon$は精度、$delta$は失敗確率である。
論文 参考訳(メタデータ) (2022-12-01T15:57:58Z) - Near-Optimal Regret Bounds for Multi-batch Reinforcement Learning [54.806166861456035]
本研究では,有限水平マルコフ決定過程(MDP)によってモデル化されたエピソディック強化学習(RL)問題をバッチ数に制約を加えて検討する。
我々は,$tildeO(sqrtSAH3Kln (1/delta))$tildeO(cdot)をほぼ最適に後悔するアルゴリズムを設計し,$(S,A,H,K)$の対数項を$K$で隠蔽する。
技術的貢献は2つある: 1) 探索のためのほぼ最適設計スキーム
論文 参考訳(メタデータ) (2022-10-15T09:22:22Z) - Reward-Mixing MDPs with a Few Latent Contexts are Learnable [75.17357040707347]
報酬混合マルコフ決定過程(RMMDP)におけるエピソード強化学習の検討
我々のゴールは、そのようなモデルにおける時間段階の累積報酬をほぼ最大化する、ほぼ最適に近いポリシーを学ぶことである。
論文 参考訳(メタデータ) (2022-10-05T22:52:00Z) - Sharper Convergence Guarantees for Asynchronous SGD for Distributed and
Federated Learning [77.22019100456595]
通信周波数の異なる分散計算作業者のトレーニングアルゴリズムを示す。
本研究では,より厳密な収束率を$mathcalO!!(sigma2-2_avg!)とする。
また,不均一性の項は,作業者の平均遅延によっても影響されることを示した。
論文 参考訳(メタデータ) (2022-06-16T17:10:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。