論文の概要: The Illusion of Power Capping in LLM Decode: A Phase-Aware Energy Characterisation Across Attention Architectures
- arxiv url: http://arxiv.org/abs/2605.11999v1
- Date: Tue, 12 May 2026 11:48:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.830307
- Title: The Illusion of Power Capping in LLM Decode: A Phase-Aware Energy Characterisation Across Attention Architectures
- Title(参考訳): LLMデコードにおけるパワーキャッピングのイリュージョン: 注意アーキテクチャ間の相認識エネルギー特性
- Authors: Bole Ma, Ayesha Afzal, Jan Eitzinger, Gerhard Wellein,
- Abstract要約: パワーキャッピングはLLMの標準のGPUエネルギーレバーである。
自動回帰復号化(autoregressive decode)という,生産サービスを支配しているフェーズに対して,その外観が視覚的であることを示す。
アーキテクチャに依存した3つのDVFS行動クラスを同定し、新しい注意代替品間の共通エネルギーパターンを特徴付ける。
- 参考スコア(独自算出の注目度): 1.6415503215215101
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Power capping is the standard GPU energy lever in LLM serving, and it appears to work: throughput drops, power readings fall, and energy budgets are met. We show the appearance is illusory for the phase that dominates production serving: autoregressive decode. Across four attention paradigms -- GQA, MLA, Gated DeltaNet, and Mamba2 -- on NVIDIA H200, decode draws only 137--300\,W on a 700\,W GPU; no cap ever triggers, because memory-bound decode saturates HBM bandwidth rather than compute and leaves power headroom untouched. Firmware-initiated clock throttling compounds the illusion: these deviations can corrupt any throughput measurement that attributes them to the cap. SM clock locking dissolves both confounds. By targeting the lever that is actually on the critical path, clock locking Pareto-dominates power capping universally, recovering up to 32\% of decode energy at minimal throughput loss. We identify three architecture-dependent DVFS behavioural classes and characterise a common energy pattern across novel attention replacements: a heavy prefill cost recouped by efficient decode, eventually halving total request energy relative to GQA at production batch sizes.
- Abstract(参考訳): LLMの標準GPUエネルギレバーであるパワーカッピングは、スループット低下、電力リード低下、エネルギー予算の充足など、うまく機能しているようだ。
自動回帰復号化(autoregressive decode)という,生産サービスを支配しているフェーズに対して,その外観が視覚的であることを示す。
GQA, MLA, Gated DeltaNet, Mamba2の4つの注目パラダイム – NVIDIA H200では、700\,W GPU上では137--300\,Wしか描画できない。
ファームウェアによって起動されたクロックスロットリングは、錯覚を生じさせる。これらの偏差は、キャップに作用するスループットの測定を損なう可能性がある。
SMクロックロックは両方の欠点を解消する。
クリティカルパス上のレバーをターゲットとすることで、クロックロックのパレートは、最大32倍のデコードエネルギーを最小のスループット損失で回復させる。
アーキテクチャに依存したDVFSの動作クラスを3つ同定し、新しい注意代替品間の共通エネルギーパターンを特徴付ける: 効率的なデコードにより再計算された重いプリフィルコストで、最終的に生産バッチサイズでGQAと比較して総要求エネルギーを半減する。
関連論文リスト
- A Persistent-State Dataflow Accelerator for Memory-Bound Linear Attention Decode on FPGA [10.452946241750562]
Gated DeltaNet(GDN)は、成長するKVキャッシュを固定サイズのリカレントステートに置き換える線形アテンションメカニズムである。
このボトルネックはアルゴリズムではなくアーキテクチャであることが示され、全てのサブクワッド列モデルはデコード時に 1 FLOP/B 未満の演算強度を示す。
オンチップBRAMにおいて,フル2MBのリカレント状態を持続的に保持することにより,このボトルネックを解消するFPGAアクセラレータを提案する。
論文 参考訳(メタデータ) (2026-03-06T06:03:38Z) - VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding [52.69880888587866]
現在のビデオ大言語モデル(ビデオLLM)は、典型的にはエンコーダビジョンを介してフレームを符号化し、自己回帰(AR)LLMを使用して理解と生成を行う。
本稿では,言語モデル(DLM)に基づく拡散ビデオLLMであるVidLaDAを提案する。
実験によると、VidLaDAは最先端のARベースラインと競合し、DLMベースラインを上回り、MARS-Cacheは精度を損なうことなく12倍のスピードアップを提供する。
論文 参考訳(メタデータ) (2026-01-25T15:02:01Z) - Prefill vs. Decode Bottlenecks: SRAM-Frequency Tradeoffs and the Memory-Bandwidth Ceiling [5.606289163036201]
エネルギー消費は、大規模言語モデルの展開によるコストと環境への影響を規定する。
本稿では,LLM推論のエネルギー効率と性能に及ぼすオンチップサイズと動作周波数の影響について検討する。
論文 参考訳(メタデータ) (2025-12-26T15:42:29Z) - TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference [48.40143137402824]
MLA(Multi-Head Latent Attention)は、キー値の状態を低ランクの潜在ベクトルに圧縮し、このベクトルだけをキャッシュしてメモリを減少させる。
しかし、テンソル並列性(TP)では、アテンションヘッドは複数のデバイスにまたがって計算され、各デバイスはフルキャッシュをロードしなければならない。
本稿では,潜在表現と各頭部の入力次元をデバイス間で分割し,シャード毎に独立して注目を行い,結果を全再現と組み合わせる方式であるTPLAを提案する。
論文 参考訳(メタデータ) (2025-08-21T15:25:40Z) - Hadamard Attention Recurrent Transformer: A Strong Baseline for Stereo Matching Transformer [53.62241289871256]
Adamard Attention Recurrent Stereo Transformer(HART)について紹介する。
HARTには、以下のコンポーネントを組み込んだ新しいアテンションメカニズムが含まれている。
反映的な領域では、HARTはKITTI 2012ベンチマークで1位にランクインした。
論文 参考訳(メタデータ) (2025-01-02T02:51:16Z) - On Sparsifying Encoder Outputs in Sequence-to-Sequence Models [90.58793284654692]
我々はTransformerをテストベッドとして、エンコーダとデコーダの間にあるゲートの層を導入します。
ゲートは、パリシティ誘導L0ペナルティの期待値を用いて正規化される。
このスペーサー化が2つの機械翻訳と2つの要約タスクに与える影響について検討する。
論文 参考訳(メタデータ) (2020-04-24T16:57:52Z) - Memory Organization for Energy-Efficient Learning and Inference in
Digital Neuromorphic Accelerators [0.4030910640265943]
ニューロモルフィックハードウェアのエネルギー効率は、エネルギー貯蔵、アクセス、およびシナプスパラメータの更新によって大きく影響を受ける。
畳み込み層における接続性などの構造接続のための機能符号化を導入する。
時間的パターンを維持するために訓練された2層スパイクニューラルネットワークでは、ビットマップ(PB-BMP)ベースの組織がスパースネットワークをより効率的にエンコードすることができる。
論文 参考訳(メタデータ) (2020-03-05T19:19:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。