論文の概要: Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization
- arxiv url: http://arxiv.org/abs/2607.08057v1
- Date: Thu, 09 Jul 2026 02:11:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.39417
- Title: Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization
- Title(参考訳): 大規模言語モデルの効率化に向けて:システム対応KVキャッシュ最適化に関する調査
- Abstract要約: 大規模言語モデル(LLM)を提供するためのシステム対応KVインフラストラクチャに焦点を当てる。
我々の研究は急速に発展している領域を体系化し、現代のLLMサービスインフラにおけるKVキャッシュ設計の理解と革新の基盤を提供する。
- 参考スコア(独自算出の注目度): 15.075255332478394
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite the rapid advancements of large language models (LLMs), LLM serving systems remain memory-intensive and costly. The key-value (KV) cache, which stores KV tensors during autoregressive decoding, is crucial for enabling low-latency, high-throughput LLM inference serving. In this survey, we focus on system-aware KV infrastructure for serving LLMs (abbreviated as sKis). We revisit recent work from a system behavior perspective, organizing existing efforts into three dimensions: execution and scheduling (temporal), placement and migration (spatial), and representation and retention (structural). Furthermore, we analyze cross-behavior co-design affinity and behavior-objective links, highlighting future opportunities. Our work systematizes a rapidly evolving area, providing a foundation for understanding and innovating KV cache designs in modern LLM serving infrastructure.
- Abstract(参考訳): 大規模言語モデル(LLM)の急速な進歩にもかかわらず、LLMサービスシステムはメモリ集約的でコストがかかるままである。
自己回帰デコード中にKVテンソルを格納するKVキャッシュは、低レイテンシで高スループットのLSM推論サービスを実現するために重要である。
本調査では,LLM(sKis)を提供するシステム対応KVインフラストラクチャに着目した。
システム行動の観点から最近の作業を再考し、実行とスケジューリング(一時)、配置とマイグレーション(空間)、表現と保持(構造)の3つの次元に編成する。
さらに,クロスビヘイビア・コデザイン親和性と行動対象リンクを分析し,今後の可能性を強調した。
我々の研究は急速に発展している領域を体系化し、現代のLLMサービスインフラにおけるKVキャッシュ設計の理解と革新の基盤を提供する。
関連論文リスト
- KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems [6.2114179704860275]
LLMシステムは、高価値な構造化前の知識選択プロセスにますます依存している。
このような信号をプロンプトにシリアライズすると、バックエンドはフラットなトークンシーケンスのみを観測し、デコード中に全キー値(KV)状態の密度と均一な消費を強制する。
本稿では,パッシブ・プロンプト・コンストラクション・ヒントから第1級物理実行アーティファクトへ構造化知識を高めるパラダイムシフト実行抽象化である知識アクセス計画(KAP)を提案する。
論文 参考訳(メタデータ) (2026-07-27T10:51:38Z) - Empirical Recipes for Efficient and Compact Vision-Language Models [54.92440500651415]
リソース制約のある設定における視覚言語モデル(VLM)は低レイテンシと高スループットを必要とする。
実験的なエンドツーエンドの効率分析と系統的なプロファイル推論を行い、主要なボトルネックを特定します。
精度を保ちながらレイテンシを大幅に低減する,コンパクトなVLMに適した最適化レシピを開発した。
論文 参考訳(メタデータ) (2026-03-17T17:17:40Z) - Fast KVzip: Efficient and Accurate LLM Inference with Gated KV Eviction [50.99402504483692]
凍結重み付き言語モデルのための新しいゲーティングベースのKVキャッシュ消去手法を提案する。
私たちのアプローチは、プリフィルとデコードの両方の段階にシームレスに統合されます。
実験の結果,KVキャッシュの最大70%を除去しながら,ほぼ無作為な性能を維持していることがわかった。
論文 参考訳(メタデータ) (2026-01-25T03:07:54Z) - STAGE: A Symbolic Tensor grAph GEnerator for distributed AI system co-design [6.182971013882298]
Symbolic(STAGE)は、高忠実度実行トレースを合成して、ワークロード実行を正確にモデル化するフレームワークである。
包括的な並列化戦略をサポートしており、LLMアーキテクチャやシステム構成の幅広い範囲を探索することができる。
論文 参考訳(メタデータ) (2025-11-13T16:44:56Z) - Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey [69.45421620616486]
本研究は、大規模言語モデル(LLM)用に設計された離散トークン化手法の最初の構造的分類と解析である。
古典的および近代的なパラダイムにまたがる8つの代表的なVQ変種を分類し、アルゴリズムの原理を分析し、力学を訓練し、LLMパイプラインとの統合に挑戦する。
コードブックの崩壊、不安定な勾配推定、モダリティ固有の符号化制約など、重要な課題を特定する。
論文 参考訳(メタデータ) (2025-07-21T10:52:14Z) - A Survey on Large Language Model Acceleration based on KV Cache Management [21.4802409745396]
大規模言語モデル(LLM)は、自然言語処理、コンピュータビジョン、マルチモーダルタスクなど、幅広い領域に革命をもたらした。
LLMの計算とメモリ要求は、それらを現実世界、長期コンテキスト、リアルタイムアプリケーションにスケールする際に大きな課題を生じさせる。
このサーベイは、LLMアクセラレーションのためのKVキャッシュ管理戦略を包括的に概観し、トークンレベル、モデルレベル、システムレベルの最適化に分類する。
論文 参考訳(メタデータ) (2024-12-27T04:17:57Z) - SOLO: A Single Transformer for Scalable Vision-Language Modeling [74.05173379908703]
我々はvisiOn-Language mOdelingのための単一変換器SOLOを提案する。
SOLOのような統一された単一トランスフォーマーアーキテクチャは、LVLMにおけるこれらのスケーラビリティ上の懸念に効果的に対処する。
本稿では,オープンソースの7B LVLMであるSOLOの開発のための,最初のオープンソーストレーニングレシピを紹介する。
論文 参考訳(メタデータ) (2024-07-08T22:40:15Z) - LLM Inference Unveiled: Survey and Roofline Model Insights [62.92811060490876]
大規模言語モデル(LLM)推論は急速に進化しており、機会と課題のユニークなブレンドを提示している。
本調査は, 研究状況を要約するだけでなく, 屋上モデルに基づく枠組みを導入することによって, 従来の文献レビューから際立っている。
このフレームワークは、ハードウェアデバイスにLSMをデプロイする際のボトルネックを特定し、実用上の問題を明確に理解する。
論文 参考訳(メタデータ) (2024-02-26T07:33:05Z) - Perceiver-VL: Efficient Vision-and-Language Modeling with Iterative
Latent Attention [100.81495948184649]
本稿では,長いビデオやテキストなどの高次元マルチモーダル入力を効率的に処理する視覚・言語フレームワークPerceiver-VLを提案する。
我々のフレームワークは、多くの最先端のトランスフォーマーベースモデルで使用される自己注意の二次的な複雑さとは対照的に、線形複雑性でスケールする。
論文 参考訳(メタデータ) (2022-11-21T18:22:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。