論文の概要: GreenBench: Benchmarking Energy Efficiency and Carbon Footprint of Open-Source LLM Inference on Apple Silicon
- arxiv url: http://arxiv.org/abs/2608.28667v1
- Date: Mon, 24 Aug 2026 04:46:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.697957
- Title: GreenBench: Benchmarking Energy Efficiency and Carbon Footprint of Open-Source LLM Inference on Apple Silicon
- Title(参考訳): GreenBench: Apple Silicon上でのオープンソースのLCM推論のエネルギー効率とカーボンフットプリントのベンチマーク
- Authors: Rajeswari Kannan, Raj Firke, Shreya Bengle, Srushti Deshmukh,
- Abstract要約: 本稿では,5つのオープンソースの大規模言語モデル(LLM)のエネルギー効率,スループット,炭素フットプリントを評価するベンチマークフレームワークであるGreenBenchについて述べる。
Apple M4 Proは、持続的推論中にCPU+GPUパッケージの電力をわずか0.47W、総システム電力は8-12Wしか引き出さないことがわかった。
より小さなモデル(3-3.8B)は、より大きなモデル(7-9B)よりも2.6-4.2倍高いスループットとトークン当たりのエネルギーを最大62%削減する
私たちは、インドと米国のグリッドのCO2推定で、パッケージとシステムレベルで、トーケン毎のエネルギーを提供しています。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid proliferation of Large Language Models (LLMs) has raised concerns about their environmental impact during inference. While Green AI research has focused on datacenter GPUs and embedded platforms, the energy profile of LLM inference on Apple Silicon, with its unified memory architecture, remains unstudied. This paper presents GreenBench, a benchmarking framework that evaluates the energy efficiency, throughput, and carbon footprint of five open-source LLMs (3-9B parameters) across three NLP tasks on an Apple M4 Pro with 48 GB unified memory. Using macOS powermetrics for direct power measurement and Ollama's nanosecond-precision timing, we find that the M4 Pro draws only 0.47 W of CPU+GPU package power during sustained inference, with total system power of 8-12 W, achieving 30-40x better energy efficiency per token than datacenter GPUs in single-user deployment. Smaller models (3-3.8B) deliver 2.6-4.2x higher throughput and up to 62% less energy per token than larger models (7-9B). Pareto analysis identifies Qwen 2.5 (7B) as the optimal accuracy-efficiency trade-off at 57% MMLU and 59 tokens/s, while Llama 3.2 (3B) suits latency-critical applications at 175 tokens/s. We provide per-token energy at package and system levels with CO2 estimates for India and US grids.
- Abstract(参考訳): LLM(Large Language Models)の急速な普及は、推論中の環境への影響を懸念している。
Green AI研究はデータセンタGPUと組み込みプラットフォームに重点を置いているが、Apple SiliconにおけるLLM推論のエネルギープロファイルは、その統一メモリアーキテクチャとともに、まだ研究されていない。
本稿では,メモリ48GBのApple M4 Pro上の3つのNLPタスクにまたがる5つのオープンソースのLCM(3-9Bパラメータ)のエネルギー効率,スループット,炭素フットプリントを評価するベンチマークフレームワークであるGreenBenchを提案する。
macOSの電力測定とOllamaのナノ秒精度のタイミングを用いて、M4 Proは継続推論中にCPU+GPUパッケージの電力をわずか0.47W、総システム電力は8~12W、シングルユーザ展開時のデータセンタGPUよりもトークン当たりのエネルギー効率が30~40倍向上していることがわかった。
小型モデル (3-3.8B) は2.6-4.2倍のスループットを持ち、トークン当たりのエネルギーは大型モデル (7-9B) よりも最大62%少ない。
Pareto 分析では Qwen 2.5 (7B) が 57% MMLU と 59 トークン/s の最適精度効率トレードオフであり、Llama 3.2 (3B) は 175 トークン/s の遅延クリティカルなアプリケーションに適している。
私たちは、インドと米国のグリッドのCO2推定で、パッケージとシステムレベルで、トーケン毎のエネルギーを提供しています。
関連論文リスト
- Babbling Suppression: Making LLMs Greener One Token at a Time [46.879983975894135]
大規模言語モデル(LLM)は、現代のソフトウェア開発でますます使われている。
LLMは「バブリング(babbling)」と呼ばれ、さらなる認知、経済、エネルギーコストを発生させる。
本研究は, 解の精度を損なうことなく, 不要な出力を削減するための実用的, モデルに依存しない手法を提案する。
論文 参考訳(メタデータ) (2026-04-08T07:21:02Z) - Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters [169.7981969517903]
Step 3.5 Flashは、フロンティアレベルのエージェントインテリジェンスと計算効率を橋渡しする。
エージェントを構築する上で最も重要なもの、すなわち、シャープな推論と高速で信頼性の高い実行に重点を置いています。
論文 参考訳(メタデータ) (2026-02-11T07:53:51Z) - Towards Green AI: Decoding the Energy of LLM Inference in Software Development [46.879983975894135]
AI支援ツールはソフトウェア開発にますます統合されているが、大きな言語モデル(LLM)に依存しているため、相当な計算とエネルギーコストが伴う。
モデルが入力を処理して内部表現を構築した(1)プリフィルと,(2)デコードで格納された状態を用いて出力トークンを生成する(2)プリフィルとを区別し,LCM推定エネルギー消費の位相レベル解析を行う。
論文 参考訳(メタデータ) (2026-02-05T14:38:19Z) - Green MLOps: Closed-Loop, Energy-Aware Inference with NVIDIA Triton, FastAPI, and Bio-Inspired Thresholding [0.0]
バイオインスパイアされたフレームワークは、タンパク質の折りたたみエネルギー盆地をコストの展望にマッピングする。
電力対エネルギーのトレードオフが望ましい場合にのみ、要求が認められます。
結果は、バイオ物理エネルギーモデルとグリーンMLORTOpsを結びつけ、生産におけるクローズドループエネルギー認識推論の実践的で監査可能な基礎を提供する。
論文 参考訳(メタデータ) (2026-01-06T15:50:11Z) - Guidelines for the Quality Assessment of Energy-Aware NAS Benchmarks [26.441107070248016]
エネルギーを意識したベンチマークは、NASがモデルエネルギー消費を精度から引き離すことを可能にすることを目的としている。
これらの原則に基づいてEA-HAS-Benchを分析し、GPU測定APIの選択が結果の品質に大きな影響を与えることを発見した。
論文 参考訳(メタデータ) (2025-05-21T15:16:41Z) - EfficientLLM: Efficiency in Large Language Models [64.3537131208038]
大規模言語モデル(LLM)は大きな進歩を導いてきたが、その増加とコンテキストウィンドウは計算、エネルギー、金銭的コストを禁止している。
本稿では,新しいベンチマークであるEfficientLLMを紹介する。
論文 参考訳(メタデータ) (2025-05-20T02:27:08Z) - How Hungry is AI? Benchmarking Energy, Water, and Carbon Footprint of LLM Inference [0.0]
本稿では,商用データセンタにデプロイされる30の最先端モデルを対象とした,AI推論の環境フットプリントを定量化する,新たなインフラストラクチャ対応ベンチマークフレームワークを提案する。
以上の結果から,O3とDeepSeek-R1が最もエネルギー集約的なモデルとして出現し,GPT-4.1ナノの70倍以上のGPT-4.1ナノを消費し,Claude-3.7 Sonnetはエコ効率で最高であることがわかった。
AIは安価で速くなっているが、そのグローバルな採用はリソース消費を不均等にしている。
論文 参考訳(メタデータ) (2025-05-14T17:47:00Z) - BitNet b1.58 2B4T Technical Report [118.78752947128682]
BitNet b1.58 2B4Tは、最初のオープンソースでネイティブな1ビットのLarge Language Model(LLM)を2-billionパラメータスケールで導入する。
4兆トークンのコーパスでトレーニングされたこのモデルは、言語理解、数学的推論、コーディングの習熟度、会話能力に関するベンチマークで厳格に評価されている。
論文 参考訳(メタデータ) (2025-04-16T17:51:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。