論文の概要: MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression
- arxiv url: http://arxiv.org/abs/2607.00760v1
- Date: Wed, 01 Jul 2026 10:44:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.85735
- Title: MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression
- Title(参考訳): MosaicKV:動的2次元KVキャッシュ圧縮による長期LLMの実現
- Abstract要約: 長いコンテキストのLLMサービスは、数十万から数百万のトークンでプロンプトを持続し、キーバリュー(KV)キャッシュをファーストオーダーのサービスコストにする。
MosaicKVは、非常に長いコンテキストを提供するための動的2次元圧縮システムである。
- 参考スコア(独自算出の注目度): 6.5757024278093565
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-context LLM services now sustain prompts with hundreds of thousands to millions of tokens, making the key-value (KV) cache a first-order serving cost. Because the cache grows linearly with context length, it can exhaust GPU memory, force smaller batches, and reduce serving throughput. Prior KV cache compression techniques typically target only the sequence dimension or only the channel dimension, which leaves limited headroom as context windows scale. Compressing both dimensions promises higher memory reduction, but applying the two forms of compression directly leads to significant accuracy loss. This paper introduces MosaicKV, a dynamic two-D (dimensional) KV cache compression system for extremely long-context serving. MosaicKV uses dynamic two-D compression to address the accuracy challenge, exploiting the non-uniform importance distribution of elements within the KV cache. Instead of applying one compression pattern globally, MosaicKV identifies important elements for each KV vector and selects compression strategies at the granularity of KV cache segments. To address the performance challenge, where fine-grained sparsity and compression management overhead can offset the gains from compression, MosaicKV introduces compressed KV cache management. This mechanism uses underutilized GPU and CPU resources to maintain compressed KV caches and accelerate attention computation. Evaluation on an H800 GPU with multiple LLMs shows that MosaicKV delivers up to 16x attention speedup, 4.8x lower decode latency, and 7.3x higher throughput than the uncompressed baseline. At the same time, it reduces memory usage by 3x and incurs only 1.76% average accuracy loss on LongBench and RULER.
- Abstract(参考訳): 長いコンテキストのLLMサービスは、数十万から数百万のトークンでプロンプトを持続し、キーバリュー(KV)キャッシュをファーストオーダーのサービスコストにする。
キャッシュはコンテキスト長とともに線形に成長するため、GPUメモリを消費し、より小さなバッチを強制し、スループットを低下させることができる。
以前のKVキャッシュ圧縮技術は典型的には、コンテキストウィンドウスケールとして限られたヘッドルームを残したシーケンスディメンションまたはチャンネルディメンションのみを対象としていた。
両次元を圧縮することでメモリの削減が期待できるが、この2種類の圧縮は直接的に精度を低下させる。
本稿では,超長文サービスのための動的2次元(次元)KVキャッシュ圧縮システムであるMosaicKVを紹介する。
MosaicKVは動的2次元圧縮を用いて精度の課題に対処し、KVキャッシュ内の要素の均一でない重要度分布を利用する。
グローバルに1つの圧縮パターンを適用する代わりに、MosaicKVは各KVベクトルの重要な要素を特定し、KVキャッシュセグメントの粒度で圧縮戦略を選択する。
微細な間隔と圧縮管理オーバーヘッドが圧縮から利益を相殺できるパフォーマンス問題に対処するため、MosaicKVは圧縮KVキャッシュ管理を導入している。
このメカニズムは、未使用のGPUとCPUリソースを使用して、圧縮されたKVキャッシュを維持し、注意計算を高速化する。
複数のLLMを持つH800 GPUの評価では、MosaicKVは16倍のアテンションスピードアップ、4.8倍のデコード遅延、7.3倍のスループットを提供する。
同時にメモリ使用量を3倍に削減し、LongBenchとRULERの平均精度損失は1.76%に留まる。
関連論文リスト
- MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering [75.0394545769057]
KVキャッシュは、LLMプリフィルを介して歴史的なトークンのキーバリューを格納する。
MuKV は KV キャッシュ圧縮モジュールと半階層的検索手法を特徴とする手法である。
長時間ストリーミングのVideoQAベンチマークの実験では、MKVはメモリとオンラインQA効率を犠牲にすることなく、回答の正確性を大幅に向上することが示された。
論文 参考訳(メタデータ) (2026-05-21T10:13:03Z) - VeriCache: Turning Lossy KV Cache into Lossless LLM Inference [24.571166055469508]
私たちは、フルKV-cacheデコードと同じ出力を保証する最初の推論フレームワークであるVeriCacheを紹介します。
VeriCacheはフルKVキャッシュよりも最大4倍高いスループットを実現していることを示す。
論文 参考訳(メタデータ) (2026-05-17T19:18:39Z) - DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity [50.52392445266824]
そこで本稿では,KV表現における長距離間類似性と高共有遅延成分を動機とする残差ベースのKVキャッシュ圧縮フレームワークを提案する。
DeltaKVはトークンを捨てる代わりに、検索した履歴参照に対するセマンティックな残基をエンコードし、保存を著しく削減する。
実験によると、DeltaKVは、LongBench、SCBench、AIMEでほぼロスレスの精度を維持しながら、KVキャッシュメモリを元の29%に削減している。
論文 参考訳(メタデータ) (2026-02-08T15:14:36Z) - PackKV: Reducing KV Cache Memory Footprint through LLM-Aware Lossy Compression [8.427136461713706]
汎用的で効率的なKVキャッシュ管理フレームワークである textbfPackKV を提案する。
PackKVはレイテンシクリティカルとスループットクリティカルの両方の推論シナリオをサポートする。
論文 参考訳(メタデータ) (2025-12-30T20:05:32Z) - KV Cache Transform Coding for Compact Storage in LLM Inference [2.20003167536462]
KVTCは、KVキャッシュをコンパクトなオンGPUとオフGPUストレージに圧縮する軽量トランスフォーメーションコーダである。
KVキャッシュの冗長性を活用することで、KVTCは推論と長文の精度を維持しながら最大20$times$圧縮を達成する。
我々は、AIME25、LiveCodeBench、GSM8K、MMLU、Qasper、RULER、MATH-500を含むベンチマークで、Llama 3、Mistral NeMo、R1-Qwen 2.5モデルでKVTCをテストする。
論文 参考訳(メタデータ) (2025-11-03T18:20:35Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference [61.412894960600205]
大きな言語モデル(LLM)は、長いテキストを処理する際に大きなGPUメモリを必要とする。
ChunkKVは、セマンティックチャンクを基本的な圧縮単位として扱うことで、KVキャッシュ圧縮を再定義する。
結果: ChunkKVは最先端の手法を最大8.7%精度で上回る。
論文 参考訳(メタデータ) (2025-02-01T03:49:47Z) - KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing [58.29726147780976]
我々は,層間をKVキャッシュで共有し,層間圧縮を実現する,textit KVSharerと呼ばれるプラグアンドプレイ方式を提案する。
実験の結果、textit KVSharerはKVキャッシュの計算を30%削減し、メモリ消費を削減できることがわかった。
我々は,textit KVSharerが既存の層内KVキャッシュ圧縮手法と互換性があることを検証する。
論文 参考訳(メタデータ) (2024-10-24T08:06:41Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - KV-Compress: Paged KV-Cache Compression with Variable Compression Rates per Attention Head [0.8158530638728501]
そこで我々は,PagedAttentionフレームワーク内で連続KVブロックを除去する新しい圧縮手法であるKV-Compressを紹介する。
本手法は,Mistral-7B-Instruct-v0.2およびLlama-3.1-8B-InstructのLongBenchにおける圧縮KVの総数を4倍に減らしながら,最先端の性能を実現する。
Llama-3.1-8B-InstructとLlama-3.1-70B-Instruct-FP8の評価は、圧縮速度を最大8倍まで達成し、性能に悪影響を及ぼすことなく、フルキャッシュ性能の90%以上を維持しながら、最大64倍まで向上する。
論文 参考訳(メタデータ) (2024-09-30T19:09:13Z) - KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache [67.9776980972508]
我々はKIVIというチューニング不要な2ビットKVキャッシュ量子化アルゴリズムを開発した。
KIVI は Llama, Falcon, Mistral のモデルを $mathbf2.6times$ less peak memory を使用しながらほぼ同じ品質を維持することができる。
論文 参考訳(メタデータ) (2024-02-05T06:06:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。