論文の概要: From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving
- arxiv url: http://arxiv.org/abs/2607.02574v1
- Date: Tue, 30 Jun 2026 16:12:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.331143
- Title: From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving
- Title(参考訳): テンソルバッファから分散メモリ階層へ:LLMサービングのためのKVキャッシュ管理に関する調査
- Abstract要約: この調査は30以上のKV管理システムとフレームワークを分類する。
xは、ローカルページ、非集約パイプ、共有ストア、メモリプール、ハイブリッド層という5つのアーキテクチャのアーカイタイプを明らかにしている。
- 参考スコア(独自算出の注目度): 8.745358190342953
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The key-value (KV) cache has become a first-order memory object in LLM serving rather than a temporary per-request tensor. This survey classifies more than thirty KV-management systems and frameworks using four axes: locality, lifetime, ownership, and substrate. The axes reveal five architectural archetypes -- local-paged, disaggregated-pipeline, shared-store, memory-pool, and hybrid-tier. Once workload and hardware are fixed, ownership accounts for much of the remaining design variance among distributed systems. The survey also audits current evaluations and identifies seven missing KV-specific measurements, linking them to open problems in fault tolerance, isolation, tiered eviction, speculative decoding, MoE serving, and shared-cache semantics.
- Abstract(参考訳): キー値(KV)キャッシュは、一時的に要求するテンソルではなく、LLMの1次メモリオブジェクトになっている。
本調査では, 局所性, 寿命, 所有権, 基板の4軸を用いて, 30以上のKV管理システムとフレームワークを分類した。
xは、ローカルページ、非集約パイプ、共有ストア、メモリプール、ハイブリッド層という5つのアーキテクチャのアーカイタイプを明らかにしている。
ワークロードとハードウェアが修正されると、オーナシップは分散システム間の設計のばらつきの大部分を担います。
この調査は、現在の評価を監査し、7つの欠落したKV固有の測定値を特定し、障害耐性、隔離、結束排除、投機的復号化、MoEサービス、共有キャッシュセマンティクスのオープンな問題にリンクする。
関連論文リスト
- SemPIC: Learning Semantic Position-Independent KV Caches [26.14495003304512]
emphSemPICはLoRA対応のWriterをトレーニングし、ネイティブなレイヤごとのドキュメントKVを振る舞いの蒸留を通じてコンパイルする。
KV Gradient Checkpointing – キャッシュされたKVをスレッディングすることなく、ピークトレーニングメモリを削減する。
論文 参考訳(メタデータ) (2026-07-30T11:45:24Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference [9.416125453771361]
長文大言語モデル(LLM)推論は、メモリフットプリントとキー値キャッシュのデコードコストによって、ますます制限されている。
我々は、GQAベースのLLMのためのリソース効率の良いKV-cache圧縮フレームワークであるCompressKVを提案する。
LongBench と Needle-in-a-Haystack の実験により、CompressKV はメモリ予算全体で既存の KV-cache 消去手法を一貫して上回っていることが示された。
論文 参考訳(メタデータ) (2026-06-23T11:59:46Z) - MawForge: Memory-Bounded Expert Materialization for Local Mixture-of-Experts Inference [0.0]
ローカルMoEは、ディスク上に全モデルを格納することで、制約付き統一メモリマシンで実践することができる。
パフォーマンスは、慣れたフットプリント、KVキャッシュサイズ、ルートローカリティ、メモリプレッシャーに対する専門家の再利用のバランスに依存する。
論文 参考訳(メタデータ) (2026-06-17T00:33:45Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - PRISM: Fast Online LLM Serving via Scheduling-Memory Co-design [5.476189551376108]
本稿では、要求対応のラッドツリー(DART)とクエリ対応のスケジューラ(QAS)を共同設計し、要求の受け入れを正確なKV保持と整合させるPRISMを提案する。
評価の結果,最強のベースラインに対して,PRISMはQPS P99 TTFT平均を23.3%,P99 TTFT平均を37.1%削減し,KV-cacheの精度は4Bモデルと13Bモデルでそれぞれ5.9,12.2ポイント向上した。
論文 参考訳(メタデータ) (2026-05-09T00:48:25Z) - Predictive Multi-Tier Memory Management for KV Cache in Large-Scale GPU Inference [0.0]
キーバリュー(KV)キャッシュメモリ管理は、大規模GPU推論サービスにおける主要なボトルネックである。
現在のシステムは3つの複合的非効率性に悩まされている。
3つの問題すべてに対処する統一システムを提案する。
論文 参考訳(メタデータ) (2026-04-19T21:34:09Z) - MEPIC: Memory Efficient Position Independent Caching for LLM Serving [16.99046229452175]
位置,要求,バッチ間でのチャンクKVの再利用を可能にするメモリ効率のよいシステムを提案する。
MePICはチャンクKVをページストレージにアライメントし、再計算をトークンレベルからブロックレベルにシフトする。
論文 参考訳(メタデータ) (2025-12-18T18:04:01Z) - SemShareKV: Efficient KVCache Sharing for Semantically Similar Prompts via Token-Level LSH Matching [0.8307668828380427]
大規模言語モデル(LLM)のためのKVキャッシュ共有圧縮フレームワークである textitSemShareKV を提案する。
正確なトークンマッチに頼る代わりに、SemShareKVは、トークン埋め込みにローカリティ感受性ハッシュ(LSH)を使用してファジィトークンマッチングを適用し、位置情報をよりよく保存するためにロータリー位置埋め込み(Rotary Position Embedding、RoPE)を組み込んでいる。
多様な要約データセットの実験では、最大6.25$times$スピードアップと42%低いGPUメモリ使用率で5kトークンが入力され、品質劣化は無視できる。
論文 参考訳(メタデータ) (2025-09-29T14:16:13Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - SCBench: A KV Cache-Centric Analysis of Long-Context Methods [61.025422435235456]
KVキャッシュ中心の視点から長文の手法を評価するベンチマークであるSCBenchを紹介する。
我々は、Gated Linear RNNsやMamba-Attention Hybridsを含む8つのカテゴリの長期コンテキストソリューションについて、広範なKVキャッシュ中心の分析を行う。
本研究は,O(n)メモリとサブO(n2)プリフィルによるスパース符号化が堅牢に動作する一方で,サブO(n)メモリ手法がマルチターンシナリオに悩まされていることを示す。
論文 参考訳(メタデータ) (2024-12-13T17:59:52Z) - MiniCache: KV Cache Compression in Depth Dimension for Large Language Models [48.03117580340151]
キーバリュー(KV)キャッシュは、以前に生成されたトークンのキー値状態を格納する。
KVキャッシュのサイズはシーケンス長とともに線形に増加し、長いコンテキスト入力と広範囲なシーケンス生成を必要とするアプリケーションの課題を提起する。
レイヤ間のKVキャッシュを,新しい奥行きの観点から圧縮する,MiniCacheという,シンプルで効果的なアプローチを提案する。
論文 参考訳(メタデータ) (2024-05-23T09:43:52Z) - KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache [67.9776980972508]
我々はKIVIというチューニング不要な2ビットKVキャッシュ量子化アルゴリズムを開発した。
KIVI は Llama, Falcon, Mistral のモデルを $mathbf2.6times$ less peak memory を使用しながらほぼ同じ品質を維持することができる。
論文 参考訳(メタデータ) (2024-02-05T06:06:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。