論文の概要: A JoLT for the KV Cache: Near-Lossless KV Cache Compression via Joint Tucker and JL-Residual Allocation for LLMs
- arxiv url: http://arxiv.org/abs/2607.12550v2
- Date: Fri, 17 Jul 2026 17:45:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.192682
- Title: A JoLT for the KV Cache: Near-Lossless KV Cache Compression via Joint Tucker and JL-Residual Allocation for LLMs
- Title(参考訳): KVキャッシュ用JoLT:ジョイントタッカーによるニアロスレスKVキャッシュ圧縮とLCM用JL残留アロケーション
- Abstract要約: キー値(KV)キャッシュは、トランスフォーマー推論の主要なメモリコストとなっている。
低ランク法はキャッシュの2次元スライス、またはヘッド当たり行列またはクロス層特徴ブロックを分解し、量子化法は各エントリのビット幅を下げる。
提案手法は,トークンと特徴軸のみを圧縮し,頭部と層軸をそのまま残す部分的タッカー分解法である。
ランダム化されたSVDの派生型であるFlashJoLTは、1024のコンテキストで5-13倍の圧縮時間のスピードアップと品質の一致を提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The key-value (KV) cache has become the dominant memory cost of transformer inference: it grows with batch size, context length, and depth, and at long context it, rather than the model weights, sets the throughput ceiling. Existing reductions fall into two families. Low-rank methods factor two-dimensional slices of the cache, either per-head matrices or cross-layer feature blocks, and quantization methods lower the bit-width of every entry. Neither exploits the fact that the cache at a layer is naturally a third-order tensor whose three axes, the heads, the tokens, and the features, carry very different amounts of redundancy. We take this tensor view directly. Our method, JoLT (Joint Lagrangian Tucker), applies a partial Tucker decomposition that compresses only the token and feature axes while leaving the head and layer axes intact, then restores the energy that truncation discards with a rotated low-bit residual: a random orthogonal rotation followed by low-bit quantization. A single Lagrangian dual allocates the Tucker ranks and the residual bit-widths together, per layer group and separately for keys and values, under one byte budget. The result is a near-lossless 2-3x compression. Perplexity stays near-lossless on both a grouped-query-attention model (Mistral-7B-v0.3) and a multi-head-attention model (LLaMA-2-13B), and GSM8K accuracy and needle-in-a-haystack retrieval hold at the uncompressed baseline at 2x on both architectures and through 3x on the GQA model. At 2x, JoLT reconstructs the cache to relative Frobenius error 0.009 (K) and 0.006 (V) on both architectures. A randomized-SVD variant, FlashJoLT, delivers a 5-13x compression-time speedup at 1024-token context and matched quality.
- Abstract(参考訳): キー値(KV)キャッシュは、バッチサイズ、コンテキスト長、深さで成長し、長いコンテキストでは、モデルの重みではなくスループットの天井を設定する。
既存の削減は2つの家族に該当する。
低ランク法では、キャッシュの2次元スライスを、ヘッド行列またはクロス層特徴ブロックで決定し、量子化法は各エントリのビット幅を下げる。
層内のキャッシュが自然に3階テンソルであり、3つの軸、頭、トークン、特徴が全く異なる冗長性を持つという事実は、どちらも利用しない。
私たちはこのテンソルビューを直接取ります。
提案手法であるJoLT (Joint Lagrangian Tucker) では, トークンと特徴軸のみを圧縮し, 頭部と層軸をそのまま残しながら部分的タッカー分解を行った。
1つのラグランジアン双対は、タッカーのランクと残りのビット幅を、層群ごとに、また1バイトの予算の下で、キーと値を別々に割り当てる。
その結果、ほぼロスレスな2-3倍圧縮が得られる。
Mistral-7B-v0.3)とMulti-head-attention model (LLaMA-2-13B)、GSM8Kの精度とニードル・イン・ア・ヘイスタック検索ホールドは両アーキテクチャの2倍、GQAモデルでは3倍である。
2xでは、JoLTは両方のアーキテクチャ上で相対的なフロベニウス誤差0.009(K)と0.006(V)にキャッシュを再構築する。
ランダム化されたSVDの派生型であるFlashJoLTは、1024のコンテキストで5-13倍の圧縮時間のスピードアップと品質の一致を提供する。
関連論文リスト
- Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers [4.632241550169362]
学習後キャッシュであるLooped Latent Attention (LLA)を導入し, ループ固有のK/Vベクトルを, 注目が集まるとのみ再構成する。
キャッシュ予算の整合により、ヘッド軸MLA、層間共有、KV量子化、最終ループ再利用に優れる。
同じ利点は、Ouro-2.6B-シンキングを抑え、Huginn-3.5Bに転送する。
論文 参考訳(メタデータ) (2026-07-16T20:58:16Z) - OCTOPUS: Optimized KV Cache for Transformers via Octahedral Parametrization Under optimal Squared error quantization [13.284869342523095]
キー値(KV)は自己回帰推論におけるメモリ帯域幅とフットプリントを支配している。
最近の回転プリコンディショニングコーデック(TurboQuant, PolarQuant)は、KV圧縮のほぼ最適レシピである。
OCTOPUSはこのパラダイムを回転座標三重項の結合量子化によって前進させる。
論文 参考訳(メタデータ) (2026-05-20T14:19:51Z) - MoE-nD: Per-Layer Mixture-of-Experts Routing for Multi-Axis KV Cache Compression [7.208745673318648]
既存の圧縮法は、それぞれ4次元KVテンソルの1軸に作用する。
それぞれの圧縮操作に対して異なる層が非常に異なる応答を示す。
そこで我々は,各レイヤを個別にルーティングするMix-of-expertsフレームワークであるMoE-nDを提案する。
論文 参考訳(メタデータ) (2026-04-20T01:20:26Z) - Sequential KV Cache Compression via Probabilistic Language Tries: Beyond the Per-Vector Shannon Limit [0.0]
最近のKVキャッシュ量子化の研究はTurboQuantで終わり、トランスフォーマーキー値キャッシュのベクターあたりの圧縮に対するシャノンエントロピー限界に近づいた。
この制限は、KVキャッシュをシーケンスとして圧縮するという、実際に問題となる問題よりも厳密に弱い問題に適用される。
KVキャッシュに格納されているトークンは、任意の浮動小数点データではなく、モデルがトレーニングした正確な形式言語からのサンプルであり、モデルは、その言語のほぼ最適予測子を構築することで構成される。
論文 参考訳(メタデータ) (2026-04-10T22:48:19Z) - KVSculpt: KV Cache Compression as Distillation [7.085426079187912]
KVキャッシュ圧縮は、効率的なLLM推論に重要である。
既存のメソッドは、純粋な消去 -- どのKVペアを保持するかを選択する -- から、類似のペアをより少ないものに組み合わせたマージまで、さまざまです。
我々は、このスペクトルの反対側に移動するKVSculptを提案する。
鍵はL-BFGSで最適化され、最小二乗で閉形式で解かれる。
論文 参考訳(メタデータ) (2026-03-29T19:14:25Z) - PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache [61.57938553036056]
トレーニング不要なKVキャッシュ管理手法であるPackCacheを導入し,KVキャッシュを3つの協調機構でコンパクト化する。
効率の面では、PackCacheは48フレームの長いシーケンスで1.7-2.2倍のエンドツーエンド生成を高速化する。
論文 参考訳(メタデータ) (2026-01-07T19:51:06Z) - XQuant: Achieving Ultra-Low Bit KV Cache Quantization with Cross-Layer Compression [54.28208936996186]
大規模言語モデル(LLM)は、様々な自然言語処理タスクにまたがる顕著な機能を示している。
量子化は、歴史的情報を保持しながらメモリ消費を減らすための有望な解決策として現れてきた。
超低等価ビット幅KVキャッシュ量子化を実現するトレーニングフリーでプラグアンドプレイのフレームワークであるXQuantを提案する。
論文 参考訳(メタデータ) (2025-10-13T10:17:21Z) - TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference [48.40143137402824]
MLA(Multi-Head Latent Attention)は、キー値の状態を低ランクの潜在ベクトルに圧縮し、このベクトルだけをキャッシュしてメモリを減少させる。
しかし、テンソル並列性(TP)では、アテンションヘッドは複数のデバイスにまたがって計算され、各デバイスはフルキャッシュをロードしなければならない。
本稿では,潜在表現と各頭部の入力次元をデバイス間で分割し,シャード毎に独立して注目を行い,結果を全再現と組み合わせる方式であるTPLAを提案する。
論文 参考訳(メタデータ) (2025-08-21T15:25:40Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing [58.29726147780976]
我々は,層間をKVキャッシュで共有し,層間圧縮を実現する,textit KVSharerと呼ばれるプラグアンドプレイ方式を提案する。
実験の結果、textit KVSharerはKVキャッシュの計算を30%削減し、メモリ消費を削減できることがわかった。
我々は,textit KVSharerが既存の層内KVキャッシュ圧縮手法と互換性があることを検証する。
論文 参考訳(メタデータ) (2024-10-24T08:06:41Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM [37.87634266742105]
キーバリュー(KV)キャッシングは,大規模言語モデル(LLM)推論における生成速度を高速化するデファクトとなっている。
既存の方法は、重要でないトークンをドロップしたり、全てのエントリを均一に定量化することに依存している。
本稿では,高速なKVキャッシュ圧縮フレームワークであるGEARを提案する。
論文 参考訳(メタデータ) (2024-03-08T18:48:30Z) - KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache [67.9776980972508]
我々はKIVIというチューニング不要な2ビットKVキャッシュ量子化アルゴリズムを開発した。
KIVI は Llama, Falcon, Mistral のモデルを $mathbf2.6times$ less peak memory を使用しながらほぼ同じ品質を維持することができる。
論文 参考訳(メタデータ) (2024-02-05T06:06:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。