論文の概要: Tuning Collective Patterns to Alleviate Congestion in Shared AI Clusters
- arxiv url: http://arxiv.org/abs/2609.04417v1
- Date: Thu, 03 Sep 2026 19:32:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.804462
- Title: Tuning Collective Patterns to Alleviate Congestion in Shared AI Clusters
- Title(参考訳): 共有AIクラスタの混雑を軽減するための集合パターンのチューニング
- Abstract要約: 分散AIトレーニングには、複数のGPUノード間でのデータ交換が繰り返される。
AIクラスタの混雑を回避するための現在のアプローチは、ワークロード全体に対するグローバルなコントロールを前提としている。
我々は、混雑に対応するために、GPUノード間のデータ交換の繰り返しパターンをチューニングするシステムREACTを構築します。
- 参考スコア(独自算出の注目度): 1.7699712680857242
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Distributed AI training involves recurring rounds of data exchange between multiple pairs of GPU nodes. Slowdown in even one flow due to congestion can cause the entire communication round to slowdown. Current approaches for evading congestion in AI clusters assume global control over the entire workload (e.g. coordinating the schedule of all jobs) or assume infrastructural support (e.g. adaptive routing in switches). They are thus ill-suited in a shared cloud setting where AI jobs belonging to one user can face external congestion from other users' jobs or background traffic beyond its own control. In this paper, we build a system, REACT, that tunes the recurring pattern of data exchange between GPU nodes (known as communication collectives) in response to congestion. REACT works at the application (communication library) layer, where it detects congestion at runtime using readily available flow stats, and tunes the collective pattern to alleviate congestion - changing the set of incident flows while retaining the semantics of information exchange (e.g. selecting which node aggregates data in an AllReduce tree). REACT requires no explicit support from the underlying network infrastructure and can be unilaterally deployed by individual users in a shared cloud setting. We prototype REACT as a shim layer over NCCL, and evaluate it on a shared academic GPU cluster - enabling REACT improves communication performance (algorithm bandwidth) by 13%-38% under network congestion. Our simulations across a range of congestion scenarios further reveal up to 75% performance improvement, highlighting the effectiveness of our approach.
- Abstract(参考訳): 分散AIトレーニングには、複数のGPUノード間でのデータ交換が繰り返される。
渋滞による1フローのスローダウンは、全通信ラウンドを減速させる可能性がある。
AIクラスタの混雑を回避するための現在のアプローチでは、ワークロード全体(例えば、すべてのジョブのスケジュールを調整する)をグローバルにコントロールするか、あるいはインフラストラクチャサポート(例えば、スイッチの適応ルーティング)を前提としています。
そのため、あるユーザのAIジョブが、他のユーザのジョブや、自身のコントロール以上のバックグラウンドトラフィックから外部の渋滞に直面することができるような、共有クラウド環境では不適当である。
本稿では,混雑に対応するために,GPUノード間のデータ交換の繰り返しパターンを調整したREACTシステムを構築する。
REACTはアプリケーション(通信ライブラリ)層で動作し、簡単に利用可能なフロー統計データを使用して実行時に混雑を検知し、集約を緩和するために集合パターンを調整する。
REACTは基盤となるネットワークインフラストラクチャからの明示的なサポートを必要としない。
我々は、NCCL上のシム層としてREACTを試作し、それを共有学術GPUクラスタ上で評価し、ネットワーク混雑下での通信性能(アルゴリズム帯域幅)を13%~38%向上させる。
さまざまな渋滞シナリオを対象としたシミュレーションでは、最大75%のパフォーマンス向上が明らかになり、アプローチの有効性が明らかになりました。
関連論文リスト
- Collective Communication Profiling of Modern-day Machine Learning Workloads [2.2816873176308907]
機械学習ジョブには、AllReduce、AllGather、Broadcastといったオペレーションを使った定期的なコミュニケーションが含まれる。
これらの操作は、高い帯域幅とバースト的なトラフィックパターンを生み出し、ネットワークの混雑とパケットロスにつながる可能性がある。
これらのパターンを分析することは必須であり、機械学習のワークロードの種類によってネットワークリソースのプロビジョニングに役立ちます。
論文 参考訳(メタデータ) (2025-07-03T20:59:36Z) - Streaming DiLoCo with overlapping communication: Towards a Distributed Free Lunch [66.84195842685459]
大規模言語モデル(LLM)のトレーニングは通常、トレーニング時間を短縮するために、多数のアクセラレータに分散される。
近年、DiLoCoのような分散アルゴリズムはそのようなコロケーション制約を緩和している。
我々は、数十億のパラメータのトレーニングを分散し、以前と同じような品質に到達できることを実験的に示す。
論文 参考訳(メタデータ) (2025-01-30T17:23:50Z) - FusionLLM: A Decentralized LLM Training System on Geo-distributed GPUs with Adaptive Compression [55.992528247880685]
分散トレーニングは、システム設計と効率に関する重要な課題に直面します。
大規模深層ニューラルネットワーク(DNN)のトレーニング用に設計・実装された分散トレーニングシステムFusionLLMを提案する。
本システムと手法は,収束性を確保しつつ,ベースライン法と比較して1.45~9.39倍の高速化を実現可能であることを示す。
論文 参考訳(メタデータ) (2024-10-16T16:13:19Z) - Over-the-Air Federated Edge Learning with Hierarchical Clustering [21.51594138166343]
OTA(Over-the-air)アグリゲーションでは、パラメータサーバ(PS)の助けを借りて、モバイルユーザ(MU)がグローバルモデルに関するコンセンサスに到達することを目標としている。
OTA FLでは、MUはトレーニングラウンド毎にローカルデータを使用してモデルをトレーニングし、同じ周波数帯域を非符号化で同時に送信する。
OTA FLは通信コストが大幅に削減されているが、チャネル効果やノイズの影響を受けやすい。
我々は、中間サーバ(IS)を用いてMUがより密集した場所にクラスタを形成する無線ベースの階層FLスキームを提案する。
論文 参考訳(メタデータ) (2022-07-19T12:42:12Z) - Implementing Reinforcement Learning Datacenter Congestion Control in NVIDIA NICs [64.26714148634228]
渋滞制御 (CC) アルゴリズムの設計は非常に困難になる。
現在、計算能力に制限があるため、ネットワークデバイスにAIモデルをデプロイすることはできない。
我々は,近年の強化学習CCアルゴリズムに基づく計算軽度解を構築した。
論文 参考訳(メタデータ) (2022-07-05T20:42:24Z) - Improving the Performance of a NoC-based CNN Accelerator with Gather
Support [6.824747267214373]
ディープラーニング技術は、CNNのための効率的な並列コンピューティングアーキテクチャの必要性を促進する。
CNNのワークロードには1対1のトラフィックと1対1のトラフィックに加えて、多対1のトラフィックが導入されている。
本稿では,メッシュベースのNoCにおいて,複数対1のトラフィックをサポートするために,出力定常シストリックアレイを用いて収集パケットを利用することを提案する。
論文 参考訳(メタデータ) (2021-08-01T23:33:40Z) - Cloud Collectives: Towards Cloud-aware Collectives forML Workloads with
Rank Reordering [8.81194405760133]
Cloud Collectivesは、参加するフレームワークの並べ替えによって集合を加速するプロトタイプである。
Collectivesは非侵襲的であり、コードの変更も既存のアプリケーションの再構築も必要とせず、クラウドプロバイダのサポートなしで動作します。
パブリッククラウドでのアレーダ操作に対するCloud Collectivesの予備的な応用は、複数のマイクロベンチマークで最大3.7倍、実際のワークロードで1.3倍のスピードアップをもたらす。
論文 参考訳(メタデータ) (2021-05-28T20:14:38Z) - Gradient Coding with Dynamic Clustering for Straggler-Tolerant
Distributed Learning [55.052517095437]
勾配降下(GD)は、複数の労働者にデータセットを分散することで学習タスクの並列化に広く用いられている。
分散同期gdにおけるイテレーション完了時間ごとの重要なパフォーマンスボトルネックは$straggling$ workersである。
コード化された分散技術は、最近ストラグラーを緩和し、労働者に冗長な計算を割り当てることでgdイテレーションを高速化するために導入された。
本稿では,従来のトラグリング動作に依存する可能性のあるコードの中から,冗長なデータを労働者に割り当てて選択する動的GC方式を提案する。
論文 参考訳(メタデータ) (2021-03-01T18:51:29Z) - Joint Parameter-and-Bandwidth Allocation for Improving the Efficiency of
Partitioned Edge Learning [73.82875010696849]
機械学習アルゴリズムは、人工知能(AI)モデルをトレーニングするために、ネットワークエッジにデプロイされる。
本稿では,パラメータ(計算負荷)割り当てと帯域幅割り当ての新しい共同設計に焦点を当てる。
論文 参考訳(メタデータ) (2020-03-10T05:52:15Z) - Reinforcement Learning Based Vehicle-cell Association Algorithm for
Highly Mobile Millimeter Wave Communication [53.47785498477648]
本稿では,ミリ波通信網における車とセルの関連性について検討する。
まず、ユーザ状態(VU)問題を離散的な非車両関連最適化問題として定式化する。
提案手法は,複数のベースライン設計と比較して,ユーザの複雑性とVUEの20%削減の合計で最大15%のゲインが得られる。
論文 参考訳(メタデータ) (2020-01-22T08:51:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。