論文の概要: From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs
- arxiv url: http://arxiv.org/abs/2607.26571v1
- Date: Wed, 29 Jul 2026 07:50:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.573204
- Title: From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs
- Title(参考訳): TokensからWatt-hours:現代のGPUにおけるLCM推論の解析エネルギー推定
- Authors: Tina Vartziotis, Rodopi Kosteli, Elli Vartziotis, George Dasoulas, Michael Keckeisen, Konstantinos Skianis, Sotirios Kotsopoulos, Francesca Dominici,
- Abstract要約: 本報告では,NVIDIA H100級加速器の大規模言語モデル (LLM) 推定エネルギーを直接測定せずに推定するための,解析的,実験的に校正されたGPUレベルの手法を提案する。
提案手法は,FP16/BF16テンソルコア計算と高帯域幅メモリ動作のためのパラメータスケール変換器FLOP会計,メモリトラヒック係数,ハードウェア固有のエネルギー係数を組み合わせた。
この手法はさらに、総エネルギーを計算、パラメータアクセス、キー-値-キャッシュ書き込み、および注意-読み取りコンポーネントに分解し、モデルサイズ、コンテキスト長、生成トーケン数によるスケーリング動作を可能にする。
- 参考スコア(独自算出の注目度): 6.041312734387813
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The operational energy consumption of large language model (LLM) inference is becoming an increasingly important component of the environmental footprint of deployed AI systems. However, direct measurement of inference energy often requires hardware telemetry, power instrumentation, or infrastructure-specific monitoring, limiting its applicability in comparative studies, early-stage system design, and sustainability reporting. This report presents an analytically structured, empirically calibrated, GPU-level methodology for estimating LLM inference energy on NVIDIA H100-class accelerators without direct runtime measurement. The proposed estimator combines parameter-scaled transformer FLOP accounting, calibrated memory-traffic factors, and hardware-specific energy coefficients for FP16/BF16 tensor-core computation and high-bandwidth-memory movement. It explicitly separates prompt prefill from autoregressive decoding, enabling energy estimates for input tokens, output tokens, and complete inference requests. The methodology further decomposes total energy into compute, parameter-access, key-value-cache write, and attention-read components, allowing the scaling behavior with model size, context length, and generated-token count to be analyzed. The resulting estimates are not intended to replace physical power measurements; rather, they provide transparent, reproducible, and assumption-explicit approximations suitable for model comparison, green-coding analysis, and design-time evaluation of LLM inference workloads.
- Abstract(参考訳): 大規模言語モデル(LLM)推論の運用エネルギー消費は、デプロイされたAIシステムの環境フットプリントにおいて、ますます重要なコンポーネントになりつつある。
しかしながら、推論エネルギーを直接測定するには、ハードウェアテレメトリ、電力機器、インフラ固有の監視が必要であり、比較研究、早期システム設計、サステナビリティレポートの適用性を制限している。
本報告では,NVIDIA H100級加速器上でのLCM推定エネルギーを直接実行時測定なしで推定するための,解析的に構造化された,実証的に調整されたGPUレベルの手法を提案する。
提案手法は,パラメータスケール変換器FLOP会計,メモリトラヒックの校正,FP16/BF16テンソルコア計算のためのハードウェア固有のエネルギー係数と高帯域メモリ運動を組み合わせた。
自動回帰デコードからプロンプトプリフィルを明示的に分離し、入力トークン、出力トークン、完全な推論要求のエネルギー推定を可能にする。
この手法はさらに、総エネルギーを計算、パラメータアクセス、キー-値-キャッシュ書き込み、および注目読出コンポーネントに分解し、モデルサイズ、コンテキスト長、生成トーケン数によるスケーリング動作を分析する。
結果として得られた見積もりは、物理的パワー測定を置き換えることを意図せず、モデル比較、グリーンコーディング分析、LLM推論ワークロードの設計時評価に適した、透明で再現性があり、仮定-明示的な近似を提供する。
関連論文リスト
- Beyond Test-Time Compute Strategies: Advocating Energy-per-Token in LLM Inference [1.522424334864671]
大規模言語モデル(LLM)は、様々なタスクにまたがる優れた性能を示すが、かなりのエネルギーと計算コストが伴う。
SLM(Small Language Models)は、単純なテキスト生成タスクに対して正確な応答を提供する。
これらの戦略は追加のエネルギーコストを導入し、エネルギー精度のトレードオフを生み出す。
論文 参考訳(メタデータ) (2026-03-04T15:20:55Z) - Towards Green AI: Decoding the Energy of LLM Inference in Software Development [46.879983975894135]
AI支援ツールはソフトウェア開発にますます統合されているが、大きな言語モデル(LLM)に依存しているため、相当な計算とエネルギーコストが伴う。
モデルが入力を処理して内部表現を構築した(1)プリフィルと,(2)デコードで格納された状態を用いて出力トークンを生成する(2)プリフィルとを区別し,LCM推定エネルギー消費の位相レベル解析を行う。
論文 参考訳(メタデータ) (2026-02-05T14:38:19Z) - Understanding Efficiency: Quantization, Batching, and Serving Strategies in LLM Energy Use [4.513690948889834]
大規模言語モデル(LLM)はますます本番環境に配備され、計算資源やエネルギー需要の負担をトレーニングから推論へとシフトさせるのに寄与している。
我々は,同じモデルにおけるエネルギー消費のオーダー・オブ・マグニチュードの違いを,Emphsystemレベルの設計選択がいかに引き起こすかを示す。
我々の発見は、よりグリーンなAIサービスのための位相認識エネルギープロファイリングとシステムレベルの最適化を動機付けている。
論文 参考訳(メタデータ) (2026-01-29T22:16:25Z) - Information Capacity: Evaluating the Efficiency of Large Language Models via Text Compression [53.39128997308138]
テキスト圧縮性能に基づくモデル効率の指標である情報容量を導入する。
主流のオープンソースモデルに対する実証的な評価は、シリーズ内のさまざまなサイズのモデルが一貫した情報容量を示すことを示している。
情報容量の特徴的な特徴は、入力と出力の両方のトークン数に影響を与えるトークン化効率が組み込まれていることである。
論文 参考訳(メタデータ) (2025-11-11T10:07:32Z) - Energy Considerations of Large Language Model Inference and Efficiency Optimizations [28.55549828393871]
大規模言語モデル(LLM)の規模と採用が拡大するにつれて、その計算と環境コストは上昇し続けている。
多様なNLPおよびAIワークロードにまたがる共通推論効率最適化のエネルギー含意を系統的に分析する。
本研究により, 推定効率最適化の適切な適用により, 最適化されていないベースラインから最大73%のエネルギー使用量を削減できることが判明した。
論文 参考訳(メタデータ) (2025-04-24T15:45:05Z) - Sustainable LLM Inference for Edge AI: Evaluating Quantized LLMs for Energy Efficiency, Output Accuracy, and Inference Latency [6.306413686006502]
我々はOllamaライブラリから28の量子化大言語モデル(LLM)を包括的に分析する。
我々は、複数の量子化レベルおよびタスクタイプにわたるエネルギー効率、推論性能、出力精度を評価する。
その結果,異なる量子化設定におけるエネルギー効率,推定速度,精度のトレードオフが明らかになった。
論文 参考訳(メタデータ) (2025-04-04T11:29:30Z) - From Dense to Sparse: Event Response for Enhanced Residential Load Forecasting [48.22398304557558]
住宅負荷予測のためのイベント応答型知識ガイド手法(ERKG)を提案する。
ERKGは、異なる家電の電力使用状況の推定、負荷系列からのイベント関連スパース知識のマイニングを取り入れている。
論文 参考訳(メタデータ) (2025-01-06T05:53:38Z) - Computing Within Limits: An Empirical Study of Energy Consumption in ML Training and Inference [2.553456266022126]
機械学習(ML)は大きな進歩を遂げているが、その環境のフットプリントは依然として懸念されている。
本稿では,グリーンMLの環境影響の増大を認め,グリーンMLについて検討する。
論文 参考訳(メタデータ) (2024-06-20T13:59:34Z) - Evaluating natural language processing models with generalization
metrics that do not need access to any training or testing data [66.11139091362078]
本稿では,Hugingface から事前学習した大規模トランスフォーマーに対して,一般化指標を用いた最初のモデル選択結果を提案する。
ニッチな状況にもかかわらず、ヘビーテール(HT)の観点から派生したメトリクスは、特にNLPタスクにおいて有用である。
論文 参考訳(メタデータ) (2022-02-06T20:07:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。