論文の概要: SpectrumKV: Per-Token Mixed-Precision KV Cache Transfer for Prefill-Decode Disaggregated LLM Serving
- arxiv url: http://arxiv.org/abs/2606.08635v1
- Date: Sun, 07 Jun 2026 13:57:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:06.308743
- Title: SpectrumKV: Per-Token Mixed-Precision KV Cache Transfer for Prefill-Decode Disaggregated LLM Serving
- Title(参考訳): SpectrumKV: Prefill-Decode Disaggregated LLMサービングのためのKVキャッシュ転送
- Authors: Yang Pengju,
- Abstract要約: Prefill-Decode (PD) はトークン生成からのプロンプト処理を分解する。
PD側キー値(KV)削減法は主にバイナリである。
本稿では、バイナリ選択が有用な設計空間を未使用のまま残していることを論じる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Prefill-decode (PD) disaggregation decouples prompt processing from token generation, but it also turns the key-value (KV) cache into a network payload. Existing PD-side KV reduction methods are mostly binary: selected tokens are transmitted at full precision and the rest are not transmitted. This paper argues that binary selection leaves a useful design space unused. SpectrumKV assigns a precision level to each token instead: attention sinks and other high-importance tokens are protected at FP16, medium-importance tokens are sent at INT8, and low-importance tokens are sent at INT4 when the model can tolerate it. The main practical complication is that INT4 tolerance is model-dependent. Qwen2.5-7B catastrophically fails under INT4 KV quantization, while Mistral-7B and Gemma-2-9B remain stable. SpectrumKV therefore runs a lightweight deployment-time probe: three aggressive NIAH trials under a 3-tier policy. Models that pass use FP16+INT8+INT4; models that fail fall back to FP16+INT8. Across Qwen2.5-7B-Instruct, Mistral-7B-Instruct-v0.3, and Gemma-2-9B-it, SpectrumKV improves quality at the same transfer budget. At a 50% normalized KV budget on WikiText-2, SpectrumKV changes perplexity by +1.97%,-0.06%, and-0.44%, respectively, compared with PDTrim's +25.85%, +22.07%, and +35.63%. On NIAH retrieval at 4096 tokens, the adaptive policy reaches 52.6% on Qwen at the aggressive b=0.3 budget versus 26.3% for PDTrim, and reaches 100% by b=0.5; Mistral and Gemma preserve retrieval under the 3-tier policy. End-to-end GPU timing of the transfer path shows 50-62% TTFT reductions at b=0.5. These results suggest that PD KV transfer should be treated as a precision-allocation problem, not only as token pruning.
- Abstract(参考訳): Prefill-Decode (PD) はトークン生成からのプロンプト処理を分離するが、キー値(KV)キャッシュをネットワークペイロードに変換する。
既存のPD側KV還元法はほとんどバイナリであり、選択されたトークンは完全精度で送信され、残りは送信されない。
本稿では、バイナリ選択が有用な設計空間を未使用のまま残していることを論じる。
注意シンクやその他の高貴なトークンはFP16で保護され、中貴なトークンはINT8で送信され、低貴なトークンはINT4で送信される。
主な現実的な複雑さは、INT4 の寛容性がモデルに依存していることである。
Qwen2.5-7BはINT4 KVの量子化の下で破滅的に失敗し、Mistral-7BとGemma-2-9Bは安定している。
それゆえ、SpectrumKVは3段階のポリシーの下で3つの攻撃的なNIAH試行という、軽量な展開時間プローブを実行している。
FP16+INT8+INT4;失敗するモデルはFP16+INT8にフォールバックする。
Qwen2.5-7B-インストラクト、Mistral-7B-インストラクト-v0.3、Gemma-2-9B-itで、SpectrumKVは同じ転送予算で品質を改善する。
WikiText-2上で50%の正規化されたKV予算で、SpectrumKVはPDTrimの+25.85%、+22.07%、+35.63%に比べて、それぞれ+1.97%、-0.06%、-0.44%のパープレキシティを変更する。
4096トークンでのIAH検索では、適応ポリシーはQwenで52.6%、PDTrimでは26.3%、b=0.5で100%、MistralとGemmaは3段階のポリシーで検索する。
転送パスのエンドツーエンドGPUタイミングは、b=0.5で50-62%のTTFT減少を示す。
以上の結果から,PD KV転送はトークンプルーニングだけでなく,高精度転位問題として扱われるべきであることが示唆された。
関連論文リスト
- Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Towards Joint Quantization and Token Pruning of Vision-Language Models [53.978753457744055]
トークンプルーニングと低ビット量子化は、推論コストの削減を補完する。
我々は、低ビット推論と決定論的視覚トーケンプルーニングを統一する協調量子化&プルーニングフレームワークを提案する。
標準VLMベンチマークの実験では、同じ低ビット状態下でのステージワイドベースラインよりもロバスト性が改善された。
論文 参考訳(メタデータ) (2026-04-19T08:18:29Z) - Quantization Impact on the Accuracy and Communication Efficiency Trade-off in Federated Learning for Aerospace Predictive Maintenance [0.0]
フェデレートラーニング(FL)は、分散航空宇宙艦隊間のプライバシ保護による予測メンテナンスを可能にする。
本稿では,対称均一量子化がカスタム設計軽量畳み込みモデルの精度-効率トレードオフに与える影響について検討する。
Int4はFD001とFD002でFP32と区別できない精度を実現する。
論文 参考訳(メタデータ) (2026-04-09T17:13:15Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - Speeding Up MACE: Low-Precision Tricks for Equivarient Force Fields [51.95157731126864]
機械学習力場は高い計算コストで正確な分子動力学(MD)を提供することができる。
この論文は、計算ボトルネックを特定し、低精度の実行ポリシーを評価することで、MACEを安価かつ高速にすることを目的としている。
論文 参考訳(メタデータ) (2025-10-23T14:02:34Z) - AnTKV: Anchor Token-Aware Sub-Bit Vector Quantization for KV Cache in Large Language Models [27.605195979962474]
量子化は、大規模言語モデルにおけるKVキャッシュのメモリフットプリントを削減するために、効果的で軽量なソリューションとして登場した。
我々は、アンカートークン対応ベクトル量子化を利用してKVキャッシュを圧縮するデュアルステージフレームワークAnTKVを提案する。
実験により、AnTKVは従来の手法と4ビットで一致またはオーバーし、超低ビット量子化下でのパープレキシティを著しく低減することが示された。
論文 参考訳(メタデータ) (2025-06-24T10:45:48Z) - SwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformation [32.62031120968721]
本稿では,プロンプトトークンのプリフィル計算(FLOP)を削減することを目的とした,新しいモデル変換および蒸留手法であるSwiftKVを提案する。
SwiftKVは、後のレイヤのKVキャッシュを以前のレイヤの出力を使ってプリフィルし、プロンプトトークンが後層のレイヤをスキップできるようにする。
Llama-3.1-70B の 16K トークン/s に変換される正規化推論スループットの 560 TFlops/GPU を実現することができる。
論文 参考訳(メタデータ) (2024-10-04T22:45:26Z) - KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization [67.74400574357472]
LLMは、大きなコンテキストウィンドウを必要とするアプリケーションでの利用が増えており、この大きなコンテキストウィンドウでは、KVキャッシュのアクティベーションが推論時のメモリ消費の主要な要因として表面化している。
量子化はKVキャッシュのアクティベーションを圧縮する上で有望な手法であるが、既存のソリューションは4ビット以下の精度でアクティベーションを正確に表現できない。
我々の研究であるKVQuantは、いくつかの新しい手法を取り入れることで、低精度のKVキャッシュ量子化を容易にする。
論文 参考訳(メタデータ) (2024-01-31T18:58:14Z) - Zero-TPrune: Zero-Shot Token Pruning through Leveraging of the Attention Graph in Pre-Trained Transformers [4.621220151374309]
トケンプルーニングは、エッジデバイスにおける指数関数的に増加する推論コストに対処する、新たなソリューションである。
トークンプルーニングにおけるトークンの重要性と類似性を両立する最初のゼロショット手法であるZero-TPruneを提案する。
視覚タスクにおけるZero-TPruneの性能を、様々な視覚変換器のバックボーンに適用し、ImageNet上でテストすることで評価する。
論文 参考訳(メタデータ) (2023-05-27T02:08:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。