論文の概要: Greenpixie's AI Token Methodology: Assessing the Energy, Water and $\mathrm{CO_2\text{-}eq}$ Impact of AI Tokens for Open and Closed Weight Models
- arxiv url: http://arxiv.org/abs/2609.33965v1
- Date: Sun, 27 Sep 2026 22:10:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.702515
- Title: Greenpixie's AI Token Methodology: Assessing the Energy, Water and $\mathrm{CO_2\text{-}eq}$ Impact of AI Tokens for Open and Closed Weight Models
- Title(参考訳): Greenpixie's AI Token Methodology: Assessing the Energy, Water and $\mathrm{CO_2\text{-}eq}$ Impact of AI Tokens for Open and Closed Weight Models
- Abstract要約: 本稿では,クラウドホスト型大規模言語モデル(LLM)のエネルギーコストを推定する手法について述べる。
また、これらのエネルギー測定を用いて、二酸化炭素(mathrmCO-texteq$)排出量、使用量と実施量、AIトークン当たりの水消費量を推定する方法について述べる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We describe a methodology for estimating the per-token energy cost of cloud-hosted large language model (LLM) inference, separating between input (prefill) and output (decode) tokens. Graphics processing unit (GPU) energy usage is measured during inference benchmarking with open-weights models on a wide range of text-based tasks. The remaining server energy contribution from non-GPU hardware is estimated from the inference wall time. Bayesian linear regression is used to model the relationship between energy per token and LLM size, request traffic, and hardware deployment configuration. Proprietary frontier LLMs of unknown size and deployment are binned into size buckets based on naming conventions and performance priors, and the space of possible LLM configurations is sampled with Monte-Carlo methods to give a representative average energy per token and uncertainty. We also describe how these energy measurements can be used to estimate the carbon-dioxide equivalent ($\mathrm{CO_2\text{-}eq}$) emissions, both usage and embodied, and water consumed per token of AI inference. This methodology provides actionable data that enables reductions in cost, electricity usage, $\mathrm{CO_2\text{-}eq}$ emitted and water consumed in cloud and Software as a Service (SaaS).
- Abstract(参考訳): 本稿では,クラウドホスト型大言語モデル (LLM) の入力(プリフィル) と出力(デコード) トークンの分離により,クラウドホスト型大言語モデル (LLM) のトーケン毎のエネルギーコストを推定する手法について述べる。
グラフィックス処理ユニット(GPU)エネルギー使用量は、幅広いテキストベースのタスクにおけるオープンウェイトモデルによる推論ベンチマーク中に測定される。
非GPUハードウェアからの残りのサーバエネルギーコントリビューションは、推測壁時間から推定される。
ベイズ線形回帰は、トークン当たりのエネルギーとLLMサイズ、要求トラフィック、ハードウェア配置構成の関係をモデル化するために用いられる。
未知のサイズと展開のプロプライエタリフロンティアLSMは命名規則と性能の先行に基づいてサイズバケットに結合され、可能なLCM構成の空間はモンテカルロ法でサンプリングされ、トークン当たりの平均エネルギーと不確実性を示す。
また、これらのエネルギー測定を用いて、AI推論のトークンごとに消費される二酸化炭素の排出量(\mathrm{CO_2\text{-}eq}$)を推定する方法について述べる。
この方法論は、コスト、電力使用量の削減、$\mathrm{CO_2\text{-}eq}$出力、クラウドで消費される水とSaaS(Software as a Service)を可能にする実行可能なデータを提供します。
関連論文リスト
- Green AI: Cost of LLM-Based Code Completion [43.39187796844033]
コード補完は、ソフトウェア開発において、大規模言語モデル(LLM)の最も広く使われているアプリケーションの1つである。
LLMの精度が向上したにもかかわらず、推論のエネルギーコストは未調査のままである。
本研究では,LLMコード補完における精度とエネルギー消費のトレードオフについて検討する。
論文 参考訳(メタデータ) (2026-09-27T20:54:10Z) - From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs [6.041312734387813]
本報告では,NVIDIA H100級加速器の大規模言語モデル (LLM) 推定エネルギーを直接測定せずに推定するための,解析的,実験的に校正されたGPUレベルの手法を提案する。
提案手法は,FP16/BF16テンソルコア計算と高帯域幅メモリ動作のためのパラメータスケール変換器FLOP会計,メモリトラヒック係数,ハードウェア固有のエネルギー係数を組み合わせた。
この手法はさらに、総エネルギーを計算、パラメータアクセス、キー-値-キャッシュ書き込み、および注意-読み取りコンポーネントに分解し、モデルサイズ、コンテキスト長、生成トーケン数によるスケーリング動作を可能にする。
論文 参考訳(メタデータ) (2026-07-29T07:50:55Z) - Understanding Efficiency: Quantization, Batching, and Serving Strategies in LLM Energy Use [4.513690948889834]
大規模言語モデル(LLM)はますます本番環境に配備され、計算資源やエネルギー需要の負担をトレーニングから推論へとシフトさせるのに寄与している。
我々は,同じモデルにおけるエネルギー消費のオーダー・オブ・マグニチュードの違いを,Emphsystemレベルの設計選択がいかに引き起こすかを示す。
我々の発見は、よりグリーンなAIサービスのための位相認識エネルギープロファイリングとシステムレベルの最適化を動機付けている。
論文 参考訳(メタデータ) (2026-01-29T22:16:25Z) - Energy-Weighted Flow Matching for Offline Reinforcement Learning [53.64306385597818]
本稿では, 生成モデルにおけるエネルギー誘導について検討し, 対象分布をp(mathbf x)exp(-beta mathcal E(mathcal x))$, $p(mathbf x)$, $mathcal E(mathcal x)$と定義する。
補助モデルを必要としないエネルギー誘導流を直接学習するEFM(Energy-weighted Flow Match)を導入する。
我々はこの方法論をエネルギー重み付けに拡張する
論文 参考訳(メタデータ) (2025-03-06T21:10:12Z) - Prompt engineering and its implications on the energy consumption of Large Language Models [4.791072577881446]
ソフトウェア工学における大規模言語モデル(LLM)は、計算資源、データセンター、二酸化炭素排出に関する深刻な問題を引き起こす。
本稿では,コード生成タスクにおけるLlama 3モデルの炭素排出に及ぼすPETの影響について検討する。
論文 参考訳(メタデータ) (2025-01-10T11:49:31Z) - Power Hungry Processing: Watts Driving the Cost of AI Deployment? [74.19749699665216]
生成された多目的AIシステムは、機械学習(ML)モデルをテクノロジに構築するための統一的なアプローチを約束する。
この「一般性」の野心は、これらのシステムが必要とするエネルギー量と放出する炭素量を考えると、環境に急激なコストがかかる。
これらのモデルを用いて,代表的なベンチマークデータセット上で1,000の推論を行うのに必要なエネルギーと炭素の量として,デプロイメントコストを測定した。
本稿は、多目的MLシステムの展開動向に関する議論から締めくくり、エネルギーと排出の面でコストの増大に対して、その実用性はより意図的に重み付けされるべきである、と警告する。
論文 参考訳(メタデータ) (2023-11-28T15:09:36Z) - Counting Carbon: A Survey of Factors Influencing the Emissions of
Machine Learning [77.62876532784759]
機械学習(ML)は、モデルトレーニングプロセス中に計算を実行するためにエネルギーを使用する必要がある。
このエネルギーの生成には、使用量やエネルギー源によって、温室効果ガスの排出という観点からの環境コストが伴う。
本稿では,自然言語処理とコンピュータビジョンにおいて,95のMLモデルの炭素排出量の時間的および異なるタスクに関する調査を行う。
論文 参考訳(メタデータ) (2023-02-16T18:35:00Z) - Dissecting FLOPs along input dimensions for GreenAI cost estimations [0.0]
GreenAIのプロモーターは、ニューラルネットワークの計算コストの尺度として浮動小数点演算(FLOP)を使うことを提案した。
本稿では,α-FLOPと呼ばれる畳み込み層に対する浮動小数点演算の計算法を提案する。
論文 参考訳(メタデータ) (2021-07-26T04:08:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。