論文の概要: Incast-Free MoE Rate-Based Scheduling
- arxiv url: http://arxiv.org/abs/2607.26340v1
- Date: Tue, 28 Jul 2026 23:25:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.496115
- Title: Incast-Free MoE Rate-Based Scheduling
- Title(参考訳): インキャストフリーMoEレートベーススケジューリング
- Abstract要約: そこで本研究では,MoEワークロードに適した,プロアクティブなフェアスケジューリングフレームワークを提案する。
我々は、このフレームワークが常にインキャストを排除し、リンク利用を100%近く維持し、集合的完了時間(CCT)を削減することを実証した。
- 参考スコア(独自算出の注目度): 40.157059622066804
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture of Experts (MoE) architectures have become key to large language models; however, their typical round-robin (RR) scheduling introduces significant bottlenecks. In this paper, we demonstrate that RR causes a previously-undiscovered exponential incast phenomenon with MoE traffic. We propose an alternative proactive fair scheduling framework tailored for MoE workloads, which effectively prevents fabric oversubscription. We also outline how it can be implemented in NICs. Finally, through extensive simulations with real and synthetic workloads, we demonstrate that this framework consistently eliminates incast, maintains a near-100% link utilization, and reduces Collective Completion Time (CCT).
- Abstract(参考訳): Mixture of Experts (MoE) アーキテクチャは大規模言語モデルの鍵となっているが、典型的なラウンドロビン(RR)スケジューリングは重大なボトルネックをもたらす。
本稿では, RRがMoEトラフィックを伴う指数的インキャスト現象を引き起こすことを実証する。
そこで本研究では,MoEワークロードに適したプロアクティブなフェアスケジューリングフレームワークを提案し,布地過多を効果的に防止する。
NICでどのように実装できるかについても概説する。
最後に、実ワークロードと合成ワークロードとの広範なシミュレーションを通じて、このフレームワークが一貫してインキャストを排除し、リンク利用を100%近く維持し、集合的完了時間(CCT)を短縮することを示した。
関連論文リスト
- Implicit Maximum Likelihood Estimation for Real-time Generative Model Predictive Control [5.692340907039085]
Implicit Maximum Likelihood Estimation (IMLE) は、計画のための新たな生成モデリング手法である。
本結果は,IMLEが標準オフライン強化学習ベンチマーク上での競合性能を実証するものである。
我々はまた、IMLEをクローズドループの人間ナビゲーションシナリオで検証し、高速かつ適応的な計画生成を可能にする方法を示す。
論文 参考訳(メタデータ) (2026-03-14T03:39:31Z) - A Representation-Consistent Gated Recurrent Framework for Robust Medical Time-Series Classification [0.0]
隠れ状態表現における時間的一貫性を強制する規則化された正規化戦略を導入するための表現一貫性を持つゲートリカレントフレームワーク(RC-GRF)を提案する。
提案するフレームワークはモデルに依存しないため,内部ゲーティング機構を変更することなく,既存のゲート型リカレントアーキテクチャに統合することができる。
論文 参考訳(メタデータ) (2026-02-10T17:16:49Z) - Unlocking the Power of Mixture-of-Experts for Task-Aware Time Series Analytics [18.97715342585514]
時系列分析は、天気予報、金融詐欺検出、IoTシステムの欠落データに対する計算、行動認識のための分類など、さまざまな現実世界のアプリケーションで広く利用されている。
MoEは強力なアーキテクチャでありながら、タスクに依存しないルータとチャネル相関をモデル化する能力の欠如により、時系列分析における汎用タスクへの適応に依然として不足している。
PatchMoEと呼ばれる新しいMoEベースの時系列フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-26T12:44:46Z) - Elucidated Rolling Diffusion Models for Probabilistic Weather Forecasting [52.6508222408558]
Eucidated Rolling Diffusion Models (ERDM)を紹介する。
ERDMはEucidated Diffusion Models (EDM) の原理的, 性能的設計とローリング予測構造を統一する最初のフレームワークである
2D Navier-StokesシミュレーションとERA5グローバル気象予報の1.5円解像度では、ERDMはキー拡散ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2025-06-24T21:44:31Z) - Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design [59.00758127310582]
本稿では、事前学習された高密度LCMをより小さなMoEモデルに変換する新しいフレームワークRead-MEを提案する。
当社のアプローチでは,専門家の抽出にアクティベーション空間を用いる。
Read-MEは、同様のスケールの他の人気のあるオープンソース高密度モデルよりも優れています。
論文 参考訳(メタデータ) (2024-10-24T19:48:51Z) - Revisiting SMoE Language Models by Evaluating Inefficiencies with Task Specific Expert Pruning [78.72226641279863]
SMOE(Sparse Mixture of Expert)モデルは、言語モデリングにおける高密度モデルに代わるスケーラブルな代替品として登場した。
本研究は,SMoEアーキテクチャの設計に関する意思決定を行うために,タスク固有のモデルプルーニングについて検討する。
適応型タスク対応プルーニング手法 UNCURL を導入し,MoE 層当たりの専門家数をオフラインで学習する手法を提案する。
論文 参考訳(メタデータ) (2024-09-02T22:35:03Z) - Sparse Model Soups: A Recipe for Improved Pruning via Model Averaging [24.64264715041198]
Sparse Model Soups (SMS) は,各プルー・リトレインサイクルを前フェーズから平均モデルに開始することでスパースモデルをマージする新しい手法である。
SMSはスパース性を保ち、スパースネットワークの利点を悪用し、モジュール化され、完全に並列化可能であり、IMPのパフォーマンスを大幅に改善する。
論文 参考訳(メタデータ) (2023-06-29T08:49:41Z) - Gated Recurrent Neural Networks with Weighted Time-Delay Feedback [55.596897987498174]
本稿では,重み付き時間遅延フィードバック機構を備えたゲートリカレントユニット(GRU)を導入し,時系列データの長期依存性をモデル化する手法を提案する。
提案したモデルである $tau$-GRU は、繰り返し単位の連続時間定式化の離散版であり、力学は遅延微分方程式(DDE)によって制御される。
論文 参考訳(メタデータ) (2022-12-01T02:26:34Z) - Toward Certified Robustness Against Real-World Distribution Shifts [65.66374339500025]
我々は、データから摂動を学ぶために生成モデルを訓練し、学習したモデルの出力に関して仕様を定義する。
この設定から生じるユニークな挑戦は、既存の検証者がシグモイドの活性化を厳密に近似できないことである。
本稿では,古典的な反例誘導的抽象的洗練の概念を活用するシグモイドアクティベーションを扱うための一般的なメタアルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-06-08T04:09:13Z) - Continuous-Time Bayesian Networks with Clocks [33.774970857450086]
グラフ結合したセミマルコフ連鎖の集合を構成するために,ノードワイズクロックのセットを導入する。
パラメータと構造推論のためのアルゴリズムを提供し、局所的な依存関係を利用する。
論文 参考訳(メタデータ) (2020-07-01T09:33:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。