論文の概要: COMPASS-ABS: Reducing Fragmentation in Shared GPU Clusters for Deep Learning Training Workloads
- arxiv url: http://arxiv.org/abs/2609.18519v1
- Date: Wed, 16 Sep 2026 11:49:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.777148
- Title: COMPASS-ABS: Reducing Fragmentation in Shared GPU Clusters for Deep Learning Training Workloads
- Title(参考訳): CompASS-ABS:ディープラーニングトレーニングワークロードのための共有GPUクラスタのフラグメンテーション削減
- Abstract要約: リソースのフラグメンテーションにより、共有GPUクラスタが不使用になり、DLTジョブが実行され、長いターンアラウンドタイムに耐えることになる。
本稿では、歴史的ワークロードの知識に依存しない部分ノードの概念に基づいて構築されたメトリクスであるSchduler-induced Fragmentation(SIF)を紹介する。
次に、Compass-ABSを提案する。これはCompact-ASSured(COMPASS)アルゴリズムを用いて、密アンカーベース空間(ABS)内のクラスタ状態を閉じ込める。
- 参考スコア(独自算出の注目度): 0.9310318514564274
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: With the rapid advancement of deep learning technology, shared GPU clusters receive an increasing number of deep learning training (DLT) jobs. Yet resource fragmentation make such clusters underutilized and forces the DLT jobs running on them to endure long turnaround times. Extensive research has been devoted to quantifying fragmentation and developing scheduling algorithms that alleviate its impact. However, existing fragmentation measures break down in the absence of workload distribution information, while current schedulers cannot continuously maintain resource fragmentation at a low level. To tackle these problems, we first introduce Scheduler-Induced Fragmentation (SIF), a metric built on the notion of partial-nodes that is independent of historical workload knowledge. We then propose COMPASS-ABS, which employs the COMPact-ASSured (COMPASS) algorithm to confine the cluster state within a tight Anchor-Based Space (ABS), whose construction fully leverages the topological alignment between dominant workload size and node capacity. Moreover. We also prove that it ensures SIF is bounded by $\frac{2}{N}$ under a workload composition condition that matches both theory and production. Evaluations implemented on a physical cluster and a simulated cluster demonstrate COMPASS-ABS effectiveness at improving resource utilization, reducing DLT job completion time by reducing fragmentation.
- Abstract(参考訳): ディープラーニング技術の急速な進歩により、共有GPUクラスタは、より多くのディープラーニングトレーニング(DLT)ジョブを受け取るようになる。
しかし、リソースの断片化により、そのようなクラスタは不使用になり、DLTジョブが実行され、長いターンアラウンドタイムに耐えることになる。
大規模な研究は断片化の定量化と、その影響を緩和するスケジューリングアルゴリズムの開発に費やされている。
しかし、現在のスケジューラは、リソースの断片化を低いレベルで継続的に維持することはできない。
これらの問題に対処するために、我々はまず、歴史的ワークロードの知識に依存しない部分ノードの概念に基づいて構築されたメトリクスであるSchduler-induced Fragmentation(SIF)を導入する。
次に,Compact-ASSured (COMPASS)アルゴリズムを用いて,支配的ワークロードサイズとノードキャパシティのトポロジ的アライメントを完全に活用した,タイトなアンカーベース空間(ABS)内でクラスタ状態を閉じ込めるCompact-ASSured (COMPASS)アルゴリズムを提案する。
さらに。
また、SIF が$\frac{2}{N}$ で有界であることを保証する。
物理クラスタとシミュレーションクラスタに実装した評価は,資源利用を改善するためのCompASS-ABSの有効性を示し,断片化を低減してDLTジョブ完了時間を短縮する。
関連論文リスト
- Semantic-Aware Scheduling for GPU Clusters with Large Language Models [60.14838697778884]
我々は、スケジューラと管理するジョブ間のセマンティックギャップを橋渡しするフレームワークであるSchedMateを提案する。
SchedMateは見過ごされ、構造化されていないデータソース(ソースコード、ランタイムログ、履歴ジョブ)から深い洞察を抽出する。
我々は、SchedMateが平均ジョブ完了時間を最大1.91倍に短縮し、スケジューリング性能を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2025-10-02T02:01:02Z) - Resource Heterogeneity-Aware and Utilization-Enhanced Scheduling for Deep Learning Clusters [26.874684454125152]
本稿では,資源利用を促進できる最適化フレームワークに基づくタスクレベルスケジューラHadarを提案する。
Hadarは、最先端のGavelと比較して、総時間の長さを1.20倍に加速する。
HadarEはDLモデルのトレーニングにおいてかなりのスピードアップを示しており、AmazonのAWS(あるいは当社のラボ)クラスタ上での合計期間を50%(または80%)短縮しています。
論文 参考訳(メタデータ) (2025-03-13T22:13:20Z) - DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs [86.76714527437383]
本稿では,事前学習したFFN層を計算ブロックに分割することで,分散化を実現するDSMoEを提案する。
我々は,Sigmoid アクティベーションとストレートスルー推定器を用いた適応型エキスパートルーティングを実装し,トークンがモデル知識の様々な側面に柔軟にアクセスできるようにする。
LLaMAモデルを用いた実験により、DSMoEは既存のプルーニング法やMoE法に比べて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-02-18T02:37:26Z) - Scalable Federated Unlearning via Isolated and Coded Sharding [76.12847512410767]
フェデレートされたアンラーニングは、クライアントレベルのデータエフェクトを削除するための有望なパラダイムとして登場した。
本稿では,分散シャーディングと符号化コンピューティングに基づく,スケーラブルなフェデレーション・アンラーニング・フレームワークを提案する。
論文 参考訳(メタデータ) (2024-01-29T08:41:45Z) - CoDeC: Communication-Efficient Decentralized Continual Learning [6.663641564969944]
エッジでのトレーニングは、異なる場所で生成された継続的な進化データを活用する。
プライバシーに関する懸念は、空間的にも時間的に分散したデータにおいても、このコロケーションを禁止している。
通信効率の高い分散型連続学習アルゴリズムであるCoDeCを提案する。
論文 参考訳(メタデータ) (2023-03-27T16:52:17Z) - Efficient Parallel Split Learning over Resource-constrained Wireless
Edge Networks [44.37047471448793]
本稿では,エッジコンピューティングパラダイムと並列分割学習(PSL)の統合を提唱する。
そこで本研究では,モデル学習を高速化するために,効率的な並列分割学習(EPSL)という革新的なPSLフレームワークを提案する。
提案するEPSLフレームワークは,目標精度を達成するために必要なトレーニング遅延を著しく低減することを示す。
論文 参考訳(メタデータ) (2023-03-26T16:09:48Z) - Doing More by Doing Less: How Structured Partial Backpropagation
Improves Deep Learning Clusters [9.17259958324486]
ディープラーニングモデルのトレーニングは、リソース集約的で、重要な計算、メモリ、ネットワークリソースを消費する。
本研究では,分散トレーニングにおける個々の作業者のバックプロパゲーション量を制御する手法である構造化部分バックプロパゲーション(SPB)を提案する。
JigSawは,大規模クラスタの効率を最大28%向上できることがわかった。
論文 参考訳(メタデータ) (2021-11-20T20:34:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。