論文の概要: A Queueing-Theoretic Framework for Stability Analysis of LLM Inference with KV Cache Memory Constraints
- arxiv url: http://arxiv.org/abs/2605.04595v1
- Date: Wed, 06 May 2026 07:42:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.707451
- Title: A Queueing-Theoretic Framework for Stability Analysis of LLM Inference with KV Cache Memory Constraints
- Title(参考訳): KVキャッシュメモリ制約を考慮したLCM推論の安定性解析のための待ち行列理論フレームワーク
- Authors: Chengyi Nie, Nian Si, Zijie Zhou,
- Abstract要約: 計算とGPUメモリの制約を明示的に組み込んだ最初の待ち行列理論フレームワークを紹介した。
我々は,LLM推論サービスが待ち行列の成長を伴わずに着信需要を維持できるかどうかを判断する厳密な安定性と不安定性条件を導出する。
以上の結果から, 予測安定性条件は精度が高く, 偏差が10%以内であることが示唆された。
- 参考スコア(独自算出の注目度): 4.636275494777427
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid adoption of large language models (LLMs) has created significant challenges for efficient inference at scale. Unlike traditional workloads, LLM inference is constrained by both computation and the memory overhead of key-value (KV) caching, which accelerates decoding but quickly exhausts GPU memory. In this paper, we introduce the first queueing-theoretic framework that explicitly incorporates both computation and GPU memory constraints into the analysis of LLM inference. Based on this framework, we derive rigorous stability and instability conditions that determine whether an LLM inference service can sustain incoming demand without unbounded queue growth. This result offers a powerful tool for system deployment, potentially addressing the core challenge of GPU provisioning. By combining an estimated request arrival rate with our derived stable service rate, operators can calculate the necessary cluster size to avoid both costly over-purchasing and performance-violating under-provisioning. We further validate our theoretical predictions through extensive experiments in real GPU production environments. Our results show that the predicted stability conditions are highly accurate, with deviations typically within 10%.
- Abstract(参考訳): 大規模言語モデル(LLM)の急速な採用は、大規模で効率的な推論のための大きな課題を生み出している。
従来のワークロードとは異なり、LLM推論は計算とキー値(KV)キャッシュのメモリオーバーヘッドの両方によって制約される。
本稿では,計算とGPUメモリの制約をLLM推論に明示的に組み込んだ最初の待ち行列理論フレームワークを提案する。
この枠組みに基づき、LLM推論サービスが待ち行列の成長を伴わずに着信需要を持続できるかどうかを判定する厳密な安定性と不安定性条件を導出する。
この結果、システムデプロイメントのための強力なツールが提供され、GPUプロビジョニングのコア課題に対処する可能性がある。
推定要求到着率と得られた安定したサービスレートを組み合わせることで、コストのかかるオーバー購入とパフォーマンス違反のアンダープロビジョンの両方を避けるために必要なクラスタサイズを計算できる。
我々は、実際のGPU生産環境での広範な実験を通じて、我々の理論予測をさらに検証する。
以上の結果から, 予測安定性条件は精度が高く, 偏差が10%以内であることが示唆された。
関連論文リスト
- Fast KVzip: Efficient and Accurate LLM Inference with Gated KV Eviction [50.99402504483692]
凍結重み付き言語モデルのための新しいゲーティングベースのKVキャッシュ消去手法を提案する。
私たちのアプローチは、プリフィルとデコードの両方の段階にシームレスに統合されます。
実験の結果,KVキャッシュの最大70%を除去しながら,ほぼ無作為な性能を維持していることがわかった。
論文 参考訳(メタデータ) (2026-01-25T03:07:54Z) - READER: Retrieval-Assisted Drafter for Efficient LLM Inference [0.0386965802948046]
自己回帰言語モデルはトークンシーケンスよりも分解された確率をインスタンス化するが、その厳密なシーケンシャルなデコーディングプロセスは、遅延推論に固有の低いバウンドを課す。
このボトルネックは、大規模生成モデルのスケーラブルなデプロイにおける中心的な障害として現れています。
本稿では,補助的ドラフトモデルのトレーニングを回避した投機的復号化フレームワークREADERを提案する。
論文 参考訳(メタデータ) (2025-08-12T16:47:48Z) - Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache [67.47789629197857]
本稿では,トランスヘッド次元の不均一な役割を生かした学習自由フレームワークを提案する。
フーリエアテンションは、長コンテキスト非感性次元をフーリエ基底に投影することにより、その時間的進化を固定長のスペクトル係数で近似する。
本稿では,FourierAttention が LongBench と Needle-In-A-Haystack 上で最高の長文精度を実現することを示す。
論文 参考訳(メタデータ) (2025-06-13T15:35:54Z) - The Larger the Merrier? Efficient Large AI Model Inference in Wireless Edge Networks [56.37880529653111]
大規模計算モデル(LAIM)サービスの需要は、従来のクラウドベースの推論から、低レイテンシでプライバシ保護のアプリケーションのためのエッジベースの推論へのパラダイムシフトを推進している。
本稿では,事前学習したLAIMをデバイス上のサブモデルとサーバ上のサブモデルに分割して配置するLAIM推論方式について検討する。
論文 参考訳(メタデータ) (2025-05-14T08:18:55Z) - Optimizing LLM Inference: Fluid-Guided Online Scheduling with Memory Constraints [14.341123057506827]
大規模言語モデル(LLM)は、今日のアプリケーションでは必須であるが、推論手順は重要な計算資源を必要とする。
本稿では,多段階オンラインスケジューリング問題としてLLM推論最適化を定式化する。
我々は,アルゴリズム設計をガイドするトラクタブルなベンチマークを提供するために,流体力学近似を開発した。
論文 参考訳(メタデータ) (2025-04-15T16:00:21Z) - Online Scheduling for LLM Inference with KV Cache Constraints [22.133592174540052]
大規模言語モデル(LLM)推論は、レイテンシとリソース利用を最適化するための効率的なスケジューリングを必要とする集約的なプロセスである。
KVキャッシュのメモリを効果的に管理しながら、推論遅延を最小限に抑える、新しい理論的なスケジューリングアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-02-10T23:11:44Z) - SqueezeLLM: Dense-and-Sparse Quantization [80.32162537942138]
LLMにおける生成推論の主なボトルネックは、単一のバッチ推論のための計算ではなく、メモリ帯域幅である。
学習後量子化フレームワークであるSqueezeLLMを導入し、最大3ビットの超低精度でのロスレス圧縮を実現する。
本フレームワークは,2次情報に基づく最適ビット精度割当を探索する感度ベース非一様量子化法と,2次情報に基づくDense-and-Sparse分解法と,2次情報量割当値と感度重み値を効率的にスパース形式で格納するDense-and-Sparse分解法である。
論文 参考訳(メタデータ) (2023-06-13T08:57:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。