論文の概要: WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs
- arxiv url: http://arxiv.org/abs/2607.02391v1
- Date: Thu, 02 Jul 2026 16:25:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.920007
- Title: WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs
- Title(参考訳): WattGPU: 見えないGPUとLLMの推論パワーとレイテンシを予測する
- Abstract要約: 大規模言語モデル(LLM)推論ワークロードは、データセンターのエネルギー消費に急速に貢献している。
We introduced WattitWatt, feature two predictive model for mean GPU power draw and Intertext-Token$ITL。
我々は,42個のオープンソースLCMのデータセット上で,厳密なLeft-one-GPU-outとLeave-one-LLM-outクロスバリデーションを用いたモデルの評価を行った。
- 参考スコア(独自算出の注目度): 0.9558392439655014
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM) inference workloads are a rapidly growing contributor to data center energy consumption. Optimizing these deployments requires matching specific LLMs to the most efficient GPUs, but operators currently lack the tools to do so without exhaustively profiling each combination. While some predictive models exist, they still require profiling data and struggle to generalize to hardware unseen during training. To address this, we introduce \textit{WattGPU}, featuring two predictive models for mean GPU power draw and Inter-Token Latency (ITL). Our approach leverages only publicly available LLM metadata and GPU specifications, eliminating the need for hardware access or profiling while enabling generalization to unseen NVIDIA server-grade GPUs and LLMs. We evaluate our models using rigorous leave-one-GPU-out and leave-one-LLM-out cross-validation on a dataset of 42 open-source LLMs (0.1B--27B parameters) and 8 GPUs under both offline and server scenarios. The mean power draw model achieves a median absolute percentage error of $\leq3.4\%$ for offline and $\leq13.5\%$ for server scenarios on unseen GPUs, while the latency model achieves $\leq8.5\%$ in server mode, both maintaining strong GPU ranking correlations for server scenarios (Kendall $τ\geq0.76$). Compared to standard physically grounded baselines -- Load-Scaled Thermal Design Power (TDP) for power draw and roofline for latency -- our models reduce median absolute percentage error by approximately 4$\times$ on unseen LLM-GPU combinations for server scenarios or approximately 2$\times$ for completely unseen GPUs. WattGPU's data and code are publicly available at https://github.com/maufadel/wattgpu.
- Abstract(参考訳): 大規模言語モデル(LLM)推論ワークロードは、データセンターのエネルギー消費に急速に貢献している。
これらのデプロイメントを最適化するには、特定のLLMを最も効率的なGPUに合わせる必要があるが、現時点では、それぞれの組み合わせを徹底的にプロファイリングすることなく、それを行うためのツールが不足している。
いくつかの予測モデルは存在するが、まだプロファイリングデータを必要としており、トレーニング中に見えないハードウェアに一般化するのに苦労している。
これを解決するために、平均GPUパワードローの予測モデルとインタートークンレイテンシ(ITL)の2つのモデルを特徴付ける「textit{WattGPU}」を紹介した。
このアプローチでは,利用可能なLLMメタデータとGPU仕様のみを活用し,ハードウェアアクセスやプロファイリングの必要性を排除し,NVIDIAサーバグレードのGPUやLLMを一般化する。
オフラインおよびサーバシナリオの両方で42のオープンソースLLM(0.1B-27Bパラメータ)と8のGPUのデータセット上で、厳密なLeft-one-GPU-outとLeft-one-LLM-outのクロスバリデーションを使用して、モデルを評価した。平均パワードローイングモデルは、オフラインとサーバシナリオの両方で中央値の絶対パーセンテージエラーが$\leq3.4\%、未使用GPUでは$\leq13.5\%、未使用GPUでは$\leq8.5\%、サーバーモードでは$$$$$は$\leq8.5\%、サーバシナリオでは強力なGPUランキング相関が維持されている(Kendall $τ\geq0.76$)。
WattGPUのデータとコードはhttps://github.com/maufadel/wattgpu.comで公開されている。
関連論文リスト
- LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs [45.51664355320938]
本稿では,コモディティGPU上での3Bから32Bパラメータなど,中規模の言語モデルトレーニングのためのエンドツーエンド/C++実装を提案する。
これは、標準的な8ビットトレーニングパイプラインを実行し、追加のアルゴリズム近似なしで実行し、FLOP使用率を約50%維持する。
論文 参考訳(メタデータ) (2025-12-17T10:51:45Z) - WarmServe: Enabling One-for-Many GPU Prewarming for Multi-LLM Serving [17.92164698813269]
既存のマルチLLMサービスシステムは、より悪い推論性能でGPUの利用を最適化する。
我々は、将来のワークロードに関する知識を積んだモデルを読み込む1対多のGPUプリワームを可能にするために、普遍的なGPUワーカーを提案する。
WarmServeは、最先端のオートスケーリングベースのシステムと比較して、TTFTを最大50.8$timesで改善する。
論文 参考訳(メタデータ) (2025-12-10T09:47:40Z) - NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding [54.88765757043535]
この研究は、統計的なn-gram言語モデルのデータ構造を再考し、GPU最適化推論の高速かつ並列な操作を可能にする。
我々のアプローチは NGPU-LM と呼ばれ、7% 未満の計算オーバーヘッドを持つ全ての主要な ASR モデルに対して、カスタマイズ可能なgreedy decoding を導入している。
提案手法は,ビーム探索による顕著な遅延を回避しつつ,greedy と beam search の精度ギャップの50%以上を排除できる。
論文 参考訳(メタデータ) (2025-05-28T20:43:10Z) - Can Large Language Models Predict Parallel Code Performance? [1.5221392705893568]
本稿では,Large Language Models (LLM) がハードウェアに依存しないGPU性能予測に代替的なアプローチを提供するかどうかを考察する。
LLMはRooflineモデルについて強く理解しており、明示的なプロファイリングデータを備えた場合、100%の分類精度を達成する。
以上の結果から,より優れたデータセットと迅速な戦略により,LLMはHPCルーフライン解析および性能ポータビリティのための実用的なツールとなる可能性が示唆された。
論文 参考訳(メタデータ) (2025-05-06T21:41:20Z) - Characterization of GPU TEE Overheads in Distributed Data Parallel ML Training [7.236249885667945]
信頼できるコンピューティング(CC)または信頼できる実行エンクレーブ(TEE)は、クラウドでセキュアなコンピューティングを実現するための最も一般的なアプローチである。
NVIDIAによるGPU TEEの導入により、モデルウェイトやデータをクラウドプロバイダにリークすることなく、マシンラーニング(ML)モデルをトレーニングすることが可能になった。
本稿では,GPU TEEを用いた分散データ並列(DDP)MLトレーニングの実行に伴う性能オーバーヘッドについて,詳細な解析を行った。
論文 参考訳(メタデータ) (2025-01-20T22:23:50Z) - MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs [55.95879347182669]
MoEアーキテクチャは、推論コストの比例的な増加なしにモデルキャパシティを向上できることで有名である。
MoE-LightningはCPU-GPU-I/OパイプラインスケジュールであるCGOPipeを導入し、ページ重み付けにより高いリソース利用を実現する。
MoE-Lightningは、単一のT4 GPU(16GB)上でMixtral 8x7Bの最先端オフロード可能なLLM推論システムよりも最大10.3倍高いスループットを実現することができる
論文 参考訳(メタデータ) (2024-11-18T01:06:12Z) - Mélange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity [27.87327662815485]
大規模言語モデル(LLM)はますます多くのオンラインサービスに統合されているが、デプロイにはコストがかかる。
我々は,所与のLLMサービスに対して,最小コストのGPUアロケーションを自動かつ効率的に導出するフレームワークであるM'elangeを紹介する。
M'elangeは、会話設定で最大77%、ドキュメントベースの設定で33%、混合設定で51%のデプロイメントコストを削減する。
論文 参考訳(メタデータ) (2024-04-22T18:56:18Z) - FusionAI: Decentralized Training and Deploying LLMs with Massive
Consumer-Level GPUs [57.12856172329322]
我々は、巨大な未使用のコンシューマレベルのGPUをアンロックする分散システムを構想する。
このシステムは、CPUとGPUメモリの制限、ネットワーク帯域幅の低さ、ピアとデバイスの多様性など、重要な課題に直面している。
論文 参考訳(メタデータ) (2023-09-03T13:27:56Z) - PARIS and ELSA: An Elastic Scheduling Algorithm for Reconfigurable
Multi-GPU Inference Servers [0.9854614058492648]
NVIDIAのAmpere GPUアーキテクチャは、1つの大きなモノリシックGPUを複数の小さな"GPUパーティション"に"再構成"する機能を提供する。
本稿では,この新しいGPUアーキテクチャを再構成性で検討し,高性能なマルチGPUML推論サーバを開発する。
論文 参考訳(メタデータ) (2022-02-27T23:30:55Z) - PLSSVM: A (multi-)GPGPU-accelerated Least Squares Support Vector Machine [68.8204255655161]
Support Vector Machines (SVM) は機械学習で広く使われている。
しかし、現代的で最適化された実装でさえ、最先端ハードウェア上の大きな非自明な高密度データセットにはうまくスケールしない。
PLSSVMはLVMのドロップイン代替として使用できる。
論文 参考訳(メタデータ) (2022-02-25T13:24:23Z) - Adaptive Elastic Training for Sparse Deep Learning on Heterogeneous
Multi-GPU Servers [65.60007071024629]
本稿では,Adaptive SGDが4つの最先端ソリューションよりも精度が高いことを示す。
本稿では,Adaptive SGDが時間と精度で4つの最先端ソリューションより優れていることを示す。
論文 参考訳(メタデータ) (2021-10-13T20:58:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。