論文の概要: LLMET: Enabling Cross-Layer Evaluation of Emerging M3D Memories for Energy-Efficient LLM Serving
- arxiv url: http://arxiv.org/abs/2607.26491v1
- Date: Wed, 29 Jul 2026 05:37:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.548345
- Title: LLMET: Enabling Cross-Layer Evaluation of Emerging M3D Memories for Energy-Efficient LLM Serving
- Title(参考訳): LLMET:エネルギー効率向上のためのM3D記憶装置のクロスレイア評価
- Abstract要約: 大規模言語モデル(LLM)の運用は、デプロイメントの規模が拡大するにつれ、大きなシステム課題になりつつある。
L2キャッシュを40MBから1GBに拡張するM3D技術は、Llama3.1-70Bプリフィルフェーズ中にチップエネルギーを44%削減する。
エッジプラットフォームとワークロードでは、8MBのキャッシュサイズを256MBに増やすと、デコードによる省エネが30%に達する。
- 参考スコア(独自算出の注目度): 4.919283218375612
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The energy consumption of Large Language Model (LLM) serving is becoming a major system challenge as deployment scales, driven by hardware power and thermal constraints and rising electricity costs. A key contributor to chip energy dissipation is data movement between limited on-chip cache and off-chip High Bandwidth Memory (HBM). Meanwhile, emerging memory technologies such as monolithic 3D (M3D) integration of cache memories at the Back-End-Of-Line (BEOL) of logic chips enable larger and denser on-chip memories, creating new opportunities to reduce costly off-chip traffic. However, it remains unclear whether continuously scaling on-chip memory using emerging technologies can effectively improve the energy efficiency of LLM serving. To address this gap, we develop LLMET (LLM with Emerging Technology), a validated cross-layer simulation framework, and conduct a comprehensive study on the impact of large-capacity on-chip memory technologies across a broad range of models, applications and platforms. Utilizing M3D technology to expand the L2 cache from 40MB to 1GB yields a 44% reduction in chip energy during the Llama3.1-70B prefill phase with a 16K context window, based on LLMET simulation on a dual NVIDIA A100 GPU setup. On the 8x NVIDIA B200-like platform, extending the L2 cache from 128MB to 4GB saves the prefill energy by up to 24%. For the edge platform and workloads, the decode energy saving reaches 30% when increasing the 8MB cache size to 256MB. These results highlight the promise of ultra-large on-chip memories for energy-efficient LLM serving systems.
- Abstract(参考訳): 大規模言語モデル(LLM)のエネルギー消費は、ハードウェアパワーと熱的制約と電力コストの上昇により、展開規模が拡大するにつれ、大きなシステム課題になりつつある。
チップエネルギーの消耗に寄与する重要な要因は、オンチップキャッシュとオフチップハイ帯域メモリ(HBM)の間のデータ移動である。
一方、論理チップのBack-End-Of-Line(BEOL)におけるキャッシュメモリのモノリシックな3D(M3D)統合のような新興メモリ技術は、チップ上のメモリをより大きく高密度にすることで、チップ外トラフィックのコスト削減に新たな機会を生み出している。
しかし、新興技術を用いたオンチップメモリの継続的なスケーリングがLLMの効率を効果的に向上するかどうかは不明である。
このギャップに対処するため、我々は、検証された層間シミュレーションフレームワークであるLLMET(LLM with Emerging Technology)を開発し、広範囲のモデル、アプリケーション、プラットフォームにおける大規模オンチップメモリ技術の影響について包括的な研究を行う。
M3D技術を利用してL2キャッシュを40MBから1GBに拡張すると、デュアルNVIDIA A100 GPUセットアップのLLMETシミュレーションに基づいて、Llama3.1-70Bプレフィルフェーズで16Kコンテキストウィンドウでチップエネルギーを44%削減できる。
8x NVIDIA B200のようなプラットフォームでは、L2キャッシュを128MBから4GBに拡張することで、プリフィルエネルギーを最大24%削減できる。
エッジプラットフォームとワークロードでは、8MBのキャッシュサイズを256MBに増やすと、デコードによる省エネが30%に達する。
これらの結果は、エネルギー効率の良いLCMサービスシステムにおける超大型オンチップメモリの実現を浮き彫りにしている。
関連論文リスト
- Mixture-of-Parallelisms: Towards Memory-Efficient Training Stack for Mixture-of-Experts Models [67.17268530365189]
本稿では,Mixture-of-Experts(MoE)モデルのためのメモリ効率のトレーニングスタックを紹介する。
さまざまなレイヤやMoEモデルのトレーニングパイプラインのステージにおいて、さまざまな既存および新しい並列処理テクニックを組み合わせて、特殊化する。
論文 参考訳(メタデータ) (2026-07-02T08:06:57Z) - RPU -- A Reasoning Processing Unit [4.783828820539779]
Reasoning Processing Unit (RPU) は、現代のメモリウォールの課題に対処するために設計されたチップレットベースのアーキテクチャである。
RPUは、Llama3-405B上のISO-TDPで最大45.3倍のレイテンシと18.6倍のスループットを実現している。
論文 参考訳(メタデータ) (2026-02-20T19:13:19Z) - CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference [19.989162649002274]
エッジMLLM推論のためのチップレットベースの異種ニアメモリ高速化であるCHIMEを提案する。
FastVLM (0.6B/1.7B) とMobileVLM (1.7B/3B) では、CHIMEは54倍のスピードアップと最大246倍のエネルギー効率を達成する。
論文 参考訳(メタデータ) (2025-12-12T03:59:36Z) - Sangam: Chiplet-Based DRAM-PIM Accelerator with CXL Integration for LLM Inferencing [2.9665163298601342]
推論、特にデコードフェーズは、メモリバウンドGEMVまたはフラットGEMM操作によって支配される。
既存のインメモリソリューションは、メモリ容量の削減などの限界に直面している。
この作業は、これらの制限に対処するチップレットベースのメモリモジュールを提供する。
論文 参考訳(メタデータ) (2025-11-15T16:39:51Z) - LightMem: Lightweight and Efficient Memory-Augmented Generation [72.21680105265824]
我々は、メモリシステムの性能と効率のバランスをとるLightMemという新しいメモリシステムを紹介した。
人間の記憶のアトキンソン・シフリンモデルにインスパイアされたLightMemは、メモリを3つの相補的なステージにまとめる。
GPTとQwenのバックボーンを用いたLongMemEvalの実験では、LightMemは高いベースライン(最大10.9%のゲイン)を上回り、トークンの使用量を最大117倍に削減している。
論文 参考訳(メタデータ) (2025-10-21T17:58:17Z) - MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models [72.61076288351201]
メモリ効率の良いオフロードミニシーケンス推論(MOM)を提案する。
MOMは重要なレイヤを小さな“ミニシーケンス”に分割し、KVキャッシュのオフロードとシームレスに統合する。
Meta-Llama-3.2-8Bでは、単一のA100 80GB GPU上での最大コンテキスト長を155kから455kに拡張する。
論文 参考訳(メタデータ) (2025-04-16T23:15:09Z) - MEADOW: Memory-efficient Dataflow and Data Packing for Low Power Edge LLMs [5.88896081401217]
大規模言語モデルのオフチップメモリアクセスを大幅に削減するフレームワークであるMEADOWを紹介する。
MEADOW は GEMM ベースの LLM 実装と比較して 1.5x と 2.5x のデコードとプリフィル遅延を示す。
MEADOWは、従来のLLM最適化作業と比較して、エンドツーエンドのレイテンシの改善を40%以上達成している。
論文 参考訳(メタデータ) (2025-02-14T23:50:37Z) - MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs [55.95879347182669]
MoEアーキテクチャは、推論コストの比例的な増加なしにモデルキャパシティを向上できることで有名である。
MoE-LightningはCPU-GPU-I/OパイプラインスケジュールであるCGOPipeを導入し、ページ重み付けにより高いリソース利用を実現する。
MoE-Lightningは、単一のT4 GPU(16GB)上でMixtral 8x7Bの最先端オフロード可能なLLM推論システムよりも最大10.3倍高いスループットを実現することができる
論文 参考訳(メタデータ) (2024-11-18T01:06:12Z) - Harnessing Your DRAM and SSD for Sustainable and Accessible LLM Inference with Mixed-Precision and Multi-level Caching [35.83447642182576]
大規模言語モデル(LLM)は目覚ましい能力を示している。
LLMの展開は、現在のAIアプリケーションから排出される二酸化炭素の主要な部分である。
本稿では,古いハードウェア上でのLCM推論を可能にするモデルモジュール化アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-17T08:33:39Z) - Fine-Tuning and Deploying Large Language Models Over Edges: Issues and Approaches [64.42735183056062]
大規模言語モデル(LLM)は、専門的な深層モデルから汎用的な基礎モデルへと進化してきた。
LLMは、ローカルデータセットの微調整と、ネットワークエッジ上のデプロイメントのためのかなりのメモリを必要とする。
LLMは、画像、オーディオ、ビデオ、マルチモーダルコンテンツを作成するために、テキスト生成を超えて拡張されている。
LLMの持続的成長を支援するため,モデル微調整およびモデル圧縮技術が開発されている。
論文 参考訳(メタデータ) (2024-08-20T09:42:17Z) - vTensor: Flexible Virtual Tensor Management for Efficient LLM Serving [53.972175896814505]
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
論文 参考訳(メタデータ) (2024-07-22T14:37:58Z) - Fast Matrix Multiplications for Lookup Table-Quantized LLMs [58.11584672945781]
FLUTEはLUT量子化LLM用のフレキシブルなルックアップテーブルエンジンである。
バッチサイズ32と量子化グループサイズ128では、FLUTEカーネルは既存のGEMMカーネルよりも2〜4倍高速である。
論文 参考訳(メタデータ) (2024-07-15T17:55:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。