論文の概要: Kitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost
- arxiv url: http://arxiv.org/abs/2511.18643v1
- Date: Sun, 23 Nov 2025 22:54:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-11-25 18:34:24.946246
- Title: Kitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost
- Title(参考訳): Kitty: 動的チャネルワイズ精度向上による2ビットKVキャッシュの高精度かつ効率的な量子化
- Abstract要約: Kittyは、混合精度KVキャッシュのためのアルゴリズムとシステムの共同設計である。
KVメモリを8倍近い精度で削減し、最大8倍のバッチと2.1倍-4.1倍のスループットを実現した。
- 参考スコア(独自算出の注目度): 24.865752290192372
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The KV cache is a dominant memory bottleneck for LLM inference. While 4-bit KV quantization preserves accuracy, 2-bit often degrades it, especially on long-context reasoning. We close this gap via an algorithm-system co-design for mixed-precision KV caching: Kitty. On the algorithm side, extensive experiments show that Dynamic Channel-wise Precision Boost -- which ranks Key-cache channels by sensitivity and keeps only a small fraction at higher precision -- maintains near-zero loss in accuracy drop while approaching 2-bit memory. The main challenge is handling dynamic 4-bit channel boosts while keeping the page layout coalesced and the dequantization uniform, with no scattered reads or hard-coded masks. Kitty addresses these issues by decompose each mixed-precision Key page into two tensors with unified 2-bit precision. Based on this, Kitty provides a page-centric KV layout, Triton-compatible page dequantization kernels, and a lightweight runtime pipeline that preserves coalescing and avoids divergence. Across seven tasks and two model families (Qwen3, LLaMA3), Kitty cuts KV memory by nearly 8x with negligible accuracy loss, enabling up to 8x larger batches and 2.1x-4.1x higher throughput under the same memory budget. We release the full implementation of Kitty at https://github.com/Summer-Summer/Kitty.
- Abstract(参考訳): KVキャッシュはLLM推論における主要なメモリボトルネックである。
4ビットのKV量子化は精度を保つが、2ビットはしばしば劣化する。
我々はこのギャップを、混合精度KVキャッシングのためのアルゴリズムとシステムの共同設計で埋める: Kitty。
アルゴリズム側では、Dynamic Channel-wise Precision Boost -- キーキャッシュチャネルを感度でランク付けし、高い精度でわずかに保持する — が、2ビットメモリに近づきながら、ほぼゼロの精度低下を維持していることを示している。
主な課題は、ページレイアウトを合体させながらダイナミックな4ビットチャネルのブーストを処理し、読み出しやハードコードされたマスクを使わずにデカンタライズすることです。
Kittyは、各混合精度キーページを2ビットの精度で2つのテンソルに分解することで、これらの問題に対処する。
これに基づいてKittyは、ページ中心のKVレイアウト、Triton互換のページデクエンタライズカーネル、コネッションを保存し、分散を回避する軽量ランタイムパイプラインを提供する。
7つのタスクと2つのモデルファミリ(Qwen3、LLaMA3)で、KittyはKVメモリをほぼ8倍の精度で削減し、最大8倍のバッチと2.1x-4.1倍のスループットを実現した。
Kittyの完全な実装はhttps://github.com/Summer-Summer/Kitty.comで公開しています。
関連論文リスト
- CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration [67.17709877327232]
ケイトKVは、一貫したヘッドに対して重要なトークン情報のみを保持するハイブリッドKVキャッシュ方式である。
Cate KV はメモリ使用量を最大$2.72 times$に減らし、シングルサンプル入力で$2.18times$に減らした。
論文 参考訳(メタデータ) (2026-08-31T06:02:37Z) - SPECTRA: Pushing the KV Cache Beyond the 2-Bit Cliff via Spectral Transform Coding [14.865252861545672]
大規模言語モデル (LLM) はエージェント時代の長い入力を読み取る傾向にある。
既存のほとんどのメソッドは、保存されたすべての値を同じ低い精度に下げることで、KVキャッシュを圧縮する。
我々は、信号を運ぶチャネルにビット予算を集中させる訓練不要のドロップインであるSPECTRAを開発する。
論文 参考訳(メタデータ) (2026-08-08T04:43:22Z) - MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression [6.5757024278093565]
長いコンテキストのLLMサービスは、数十万から数百万のトークンでプロンプトを持続し、キーバリュー(KV)キャッシュをファーストオーダーのサービスコストにする。
MosaicKVは、非常に長いコンテキストを提供するための動的2次元圧縮システムである。
論文 参考訳(メタデータ) (2026-07-01T10:44:57Z) - OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization [14.533966202649806]
そこで本研究では,アテンション・アウェアの共分散構造をオフラインで推定するUltra-low-bit KVキャッシュ量子化手法を提案する。
このようにして、KV量子化は、注意が実際に消費する共分散構造と整合する。
提案手法は,5つのタスクにまたがる最大32kトークンの推論トレースを用いて,最近の推論モデルを用いて評価する。
論文 参考訳(メタデータ) (2026-05-18T02:24:29Z) - RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache [28.54642982960947]
大規模言語モデル(LLM)は様々なタスクにまたがって高い性能を示すが、長い入力コンテキストでの推論はメモリサイズと帯域幅によってボトルネックとなる。
既存のメソッドは、消去または量子化によってキャッシュを減らすが、通常は2つを分離して扱う。
本稿では、KVキャッシュ圧縮をレート歪み問題とみなし、同じビット割り当て方式の2つの端点の消去と量子化を行う。
論文 参考訳(メタデータ) (2026-05-08T15:15:06Z) - KVzap: Fast, Adaptive, and Faithful KV Cache Pruning [1.3320917259299652]
我々は、KVzipの高速な入力適応近似であるKVzapを導入し、プリフィルとデコードの両方で機能する。
KVzapは、無視できる精度の損失を伴うKVキャッシュ圧縮を2ドル~4ドルで達成し、KVpressのリーダーボード上で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-01-12T08:27:47Z) - XQuant: Achieving Ultra-Low Bit KV Cache Quantization with Cross-Layer Compression [54.28208936996186]
大規模言語モデル(LLM)は、様々な自然言語処理タスクにまたがる顕著な機能を示している。
量子化は、歴史的情報を保持しながらメモリ消費を減らすための有望な解決策として現れてきた。
超低等価ビット幅KVキャッシュ量子化を実現するトレーニングフリーでプラグアンドプレイのフレームワークであるXQuantを提案する。
論文 参考訳(メタデータ) (2025-10-13T10:17:21Z) - PatternKV: Flattening KV Representation Expands Quantization Headroom [37.83913102876393]
自己回帰 LLM における KV キャッシュは冗長な再計算を排除しているが、推論時に支配的なメモリと帯域幅のボトルネックとして出現している。
KV量子化はキャッシュコストを削減するキーレバーであるが、ネイティブなKV分布が平坦性に欠けるため、精度は急激に低下する。
Kキャッシュは、コンテキストとともに徐々に進化する安定した構造を維持し、Vキャッシュは潜在意味規則性を持つことを示す。
論文 参考訳(メタデータ) (2025-10-05T12:09:14Z) - R-KV: Redundancy-aware KV Cache Compression for Reasoning Models [77.84539432982307]
共振モデル(R-KV)のための冗長性を考慮したKVキャッシュ圧縮を提案する。
R-KVはKVキャッシュの10%しか使用せず、完全なKVキャッシュ性能のほぼ100%を保っている。
驚くべきことに、R-KVは完全なKVキャッシュ性能の105%を達成し、KVキャッシュの16%を達成している。
論文 参考訳(メタデータ) (2025-05-30T02:03:24Z) - KVmix: Gradient-Based Layer Importance-Aware Mixed-Precision Quantization for KV Cache [13.662270631753135]
量子化は、KVキャッシュによって引き起こされるメモリ圧力を効果的に軽減することができる。
KVmix と呼ばれる KV キャッシュのための新しい混合精度量子化法を提案する。
論文 参考訳(メタデータ) (2025-05-18T07:04:53Z) - SVDq: 1.25-bit and 410x Key Cache Compression for LLM Attention [0.0]
KVキャッシュ圧縮技術の主な3つのタイプ、すなわちスパシティ、チャネル圧縮、量子化が同定された。
本研究は,Kキャッシュの混合精度定量化法であるSVDqを提案する。
論文 参考訳(メタデータ) (2025-02-21T08:55:21Z) - QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache [67.84112700032007]
大きな言語モデル(LLM)は、長いコンテキスト設定のためにエッジデバイスにデプロイされることが増えている。
これらのシナリオでは、キーバリュー(KV)キャッシュがGPUメモリとレイテンシの両方において主要なボトルネックとなっている。
そこで本研究では,ターゲットモデルのアーキテクチャを共有するが,階層的な4ビット量子化KVキャッシュと4ビット量子化重みを併用して高速化を行う,新たな自己推論型デコーディングフレームワークであるQuantSpecを提案する。
論文 参考訳(メタデータ) (2025-02-05T20:43:48Z) - More Tokens, Lower Precision: Towards the Optimal Token-Precision Trade-off in KV Cache Compression [71.42818367729573]
大規模言語モデル(LLM)では、KVキャッシュのメモリ使用量は推論において重大なボトルネックとなっている。
KVプルーニングやKV量子化を含む主流のKV圧縮法は、主にトークンまたは精度寸法を別々に扱う。
本稿では,KVキャッシュ圧縮におけるトークン精度トレードオフを包括的に検討する。
論文 参考訳(メタデータ) (2024-12-17T09:20:31Z) - ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression [10.003118268356017]
ロングコンテキストは推論効率に重大な課題をもたらす。
本稿では,意味クラスタの粒度でトークンをリコールするClusterKVを紹介する。
実験結果から、ClusterKVは32kのコンテキスト長を持つ様々なタスクにおいて、無視可能な精度の損失が得られることがわかった。
論文 参考訳(メタデータ) (2024-12-04T10:58:27Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z) - KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache [67.9776980972508]
我々はKIVIというチューニング不要な2ビットKVキャッシュ量子化アルゴリズムを開発した。
KIVI は Llama, Falcon, Mistral のモデルを $mathbf2.6times$ less peak memory を使用しながらほぼ同じ品質を維持することができる。
論文 参考訳(メタデータ) (2024-02-05T06:06:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。