論文の概要: QuantMLA: Function-Aligned Dual-Path Quantization for Low-Bit MLA KV Caching
- arxiv url: http://arxiv.org/abs/2609.36760v2
- Date: Wed, 30 Sep 2026 03:53:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.169643
- Title: QuantMLA: Function-Aligned Dual-Path Quantization for Low-Bit MLA KV Caching
- Title(参考訳): QuantMLA:低ビットMLA KVキャッシングのための関数配向デュアルパス量子化
- Abstract要約: MLA(Multi-Head Latent Attention)は、コンテンツに対する表現力のあるマルチヘッドアテンションキャッシュと、RoPEパスの非出力を可能にする。
我々は低ビットデュアルパス量子化のための関数整列フレームワークQuantMLAを紹介する。
我々は,アテンション計算に直接アンパックとデクエント化を統合する,ネイティブな低ビットMLAアテンションカーネルを開発した。
- 参考スコア(独自算出の注目度): 29.861793725319867
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-Head Latent Attention (MLA) enables expressive multi-head attention with compact caches for its content and decoupled RoPE paths, yet cache memory still scales linearly with context length and batch size. In this work, we establish a systematic model of MLA's dual-path quantization errors, characterizing their distinct effects on attention-output distortion and explaining the pronounced amplification of RoPE-path errors. Guided by this analysis, we introduce QuantMLA, a function-aligned framework for low-bit dual-path quantization. We derive path-specific transformation spaces that preserve full-precision computation while remaining fully fusible into model parameters offline, eliminating online transformation overhead. Within these spaces, QuantMLA learns path-specific transformations with function-aligned objectives: attention-output reconstruction captures the content path's coupled matching and aggregation errors, while positional QK reconstruction preserves the RoPE-induced component of the attention logits and admits a theoretical bound on output distortion. Across four MLA model families, QuantMLA enables, to our knowledge, the first reported joint INT4 caching of the content and RoPE caches with minimal accuracy degradation. Further compressing the content cache to INT2 while retaining the RoPE key cache at INT4 maintains competitive performance on challenging reasoning and code benchmarks. We develop a native low-bit MLA attention kernel that integrates unpacking and dequantization directly into attention computation. The physical cache layout provides 3.59x compression at 128K context, while a cache-pressure serving workload achieves 5.168x higher whole-job output throughput than BF16. The code will be released upon acceptance.
- Abstract(参考訳): MLA(Multi-Head Latent Attention)は、コンテンツに対するコンパクトなキャッシュとRoPEパスの分離による表現力のあるマルチヘッドアテンションを実現するが、キャッシュメモリはコンテキスト長とバッチサイズに線形にスケールする。
本研究では,MLAの二重経路量子化誤差の体系的モデルを構築し,それらが注意出力歪みに与える影響を特徴付けるとともに,RoPE経路誤差の顕著な増幅を説明する。
この分析で導かれたQuantMLAは、低ビットデュアルパス量子化のための関数整列フレームワークである。
オンライン変換のオーバーヘッドをなくし,完全精度を保ちながらモデルパラメータに完全に融合するパス固有の変換空間を導出する。
注意出力再構成は、コンテンツパスのマッチングとアグリゲーションのエラーをキャプチャし、位置QK再構成は、注意ログのRoPEによって引き起こされるコンポーネントを保存し、出力歪みに関する理論的拘束力を認める。
QuantMLAは4つのMLAモデルファミリをまたいで、私たちの知る限り、コンテンツのINT4キャッシュとRoPEキャッシュを最小限の精度で生成する。
さらにINT4のRoPEキーキャッシュを維持しながら、コンテンツキャッシュをINT2に圧縮することは、挑戦的な推論とコードベンチマークの競合性能を維持する。
我々は,アテンション計算に直接アンパックとデクエント化を統合する,ネイティブな低ビットMLAアテンションカーネルを開発した。
物理キャッシュレイアウトは、128Kのコンテキストで3.59倍の圧縮を提供し、キャッシュ・プレッシャ・サービス・ワークロードはBF16よりも5.168倍高い出力スループットを達成する。
コードは受理時にリリースされます。
関連論文リスト
- Beyond KV Reconstruction: Functional Reconstruction for MLA Draft Models in Speculative Decoding [36.446302092919495]
MLAのドラフト構造をキャッシュ圧縮よりも機能的再構成として定式化する。
Llama/Qwenの4つのドラフトターゲットペア、TransMLAとMHA2MLA、HFとvLLM、200のプロンプトタスクにまたがる192のモデル-コンバータ-バックエンド-メソッド-タスク構成を評価した。
論文 参考訳(メタデータ) (2026-07-29T10:54:46Z) - OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond [50.440302567029654]
マルチモーダルインテリジェンスにより、Key-Valueキャッシュは効率的なデプロイメントのための主要なメモリボトルネックとなった。
本研究では、チャネルごとの量子化パラダイムの本質的な限界を再考する。
X-LLMのための高精度かつ軽量なKVキャッシュ圧縮フレームワークOScaRを提案する。
論文 参考訳(メタデータ) (2026-05-19T10:53:03Z) - SAW-INT4: System-Aware 4-Bit KV-Cache Quantization for Real-World LLM Serving [42.268254679163725]
KV-cacheは、現実世界のLLMサービスにおける主要なボトルネックである。
多くのKV-cache圧縮法は実用的なサービス制約に違反している。
我々は、ページ化されたKV-cacheレイアウトに直接統合する融合回転量子化カーネルを実装した。
論文 参考訳(メタデータ) (2026-04-21T07:12:23Z) - Latent-Condensed Transformer for Efficient Long Context Modeling [60.72493959155964]
大規模言語モデルに対するLCA(Latent-Condensed Attention)を提案する。
LCAはMLAの潜伏空間内のコンテキストを凝縮し、表現はセマンティック潜伏ベクトルと位置キーに切り離される。
LCAは、最大2.5$times$プリフィルスピードアップと128Kコンテキストでの90%のKVキャッシュ削減を実現している。
論文 参考訳(メタデータ) (2026-04-14T08:40:31Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z) - MiniCache: KV Cache Compression in Depth Dimension for Large Language Models [48.03117580340151]
キーバリュー(KV)キャッシュは、以前に生成されたトークンのキー値状態を格納する。
KVキャッシュのサイズはシーケンス長とともに線形に増加し、長いコンテキスト入力と広範囲なシーケンス生成を必要とするアプリケーションの課題を提起する。
レイヤ間のKVキャッシュを,新しい奥行きの観点から圧縮する,MiniCacheという,シンプルで効果的なアプローチを提案する。
論文 参考訳(メタデータ) (2024-05-23T09:43:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。