論文の概要: High-accuracy Low-Bit KV-Cache Quantization via Local Distribution Restoration
- arxiv url: http://arxiv.org/abs/2607.16248v1
- Date: Sat, 27 Jun 2026 01:22:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.055794
- Title: High-accuracy Low-Bit KV-Cache Quantization via Local Distribution Restoration
- Title(参考訳): 局所分布復元による高速低ビットKVキャッシュ量子化
- Abstract要約: 1ビットのKV-cache量子化は、RULERの下でのLlama-3.1-8Bの精度を84.2%から47.8%に下げる。
本稿では,局所分布復元手法を提案する。これは,局所分布リスクの高いステップを量子化ロジット特徴から検出する手法である。
我々はDGAPを実装し、効率的なリスク検知器と修正器を用いて、局所的な分布復元を実現する。
- 参考スコア(独自算出の注目度): 6.253842504362098
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-context large language model inference relies on the KV cache to avoid redundant attention computation, but incurs high memory and bandwidth overheads. Low-bit KV-cache quantization reduces this cost, yet it severely degrade quality; particularly, one-bit quantization reduces accuracy from 84.2% to 47.8% on Llama-3.1-8B under RULER. Rather than common beliefs that absolute error of logits, we find that the root cause is structured local misranking, where the distribution of logits in top-K region is drifted. We thereby propose local distribution restoration, a new technique that detects steps with high local distribution risk from quantized-logit features and restores only the selected top-K candidate distribution before token selection. We implement DGAP to achieve local distribution restoration, with efficient risk detcetors and correctors. Expeirments show that on Llama-3.1-8B, DGAP recovers K1V1 RULER accuracy from 47.8% to 83.2% and reduces distribution drift from 0.38 to 0.14; across Llama, Mistral, and Qwen models, it preserves the persistent low-bit KV-cache footprint with modest decode overhead.
- Abstract(参考訳): 長期コンテキストの大規模言語モデル推論は、冗長な注意計算を避けるためにKVキャッシュに依存するが、高いメモリと帯域幅のオーバーヘッドを引き起こす。
低ビットのKVキャッシュ量子化は、このコストを低減させるが、特に1ビットの量子化は、RULERの下でのLlama-3.1-8Bの精度を84.2%から47.8%に下げる。
丸太の絶対誤差という一般的な信念よりも、根本原因は局所的ミスランクであり、トップK領域における太字の分布はドリフトしている。
そこで我々は,局所分布復元手法を提案する。これは,局所分布リスクの高いステップを量子化ロジット特徴から検出し,選択したトップK候補分布のみをトークン選択前に復元する手法である。
我々はDGAPを実装し、効率的なリスク検知器と修正器を用いて、局所的な分布復元を実現する。
Llama-3.1-8Bでは、DGAPはK1V1 RULERの精度を47.8%から83.2%に回復し、分布のドリフトを0.38から0.14に下げる。
関連論文リスト
- The Structure of Quantization Damage in LLMs: Why the Next Bit Should Be Spent Globally [0.0]
後学習量子化(PTQ)は、大規模言語モデル(LLM)を提供するコストを削減するために広く用いられている。
我々は、量子化の損傷の発生源と、小さな追加の精度予算の配分方法について検討する。
論文 参考訳(メタデータ) (2026-09-01T17:53:41Z) - Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation [6.129872931808218]
キー値(KV)キャッシュの量子化は、Large Language Model(LLM)推論メモリの削減に広く利用されている。
本研究では,KVキャッシュ量子化下でのアライメント保存について検討する。
低ビット量子化は安全アライメントを静かに破壊することができる。
論文 参考訳(メタデータ) (2026-06-01T02:02:20Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - Runtime-Certified Bounded-Error Quantized Attention [0.0]
本稿では,実行時対応型KVキャッシュアーキテクチャを提案する。
二項誤差分解は、キー量子化および(ii)値再構成誤差から、(i)注目分布歪みに対するヘッド当たり、ステップ当たりのバウンダリが得られる。
PG-19、NIAH、RULERのベンチマークにおいて、このシステムは言語モデリングと検索タスクのためのノイズ内の密度の高いFP16 KV品質と一致している。
論文 参考訳(メタデータ) (2026-05-20T08:04:40Z) - Discovery of Hidden Miscalibration Regimes [52.452902154360565]
モデルは何らかの入力を体系的に過信し、他人を過信することがある。
対応する誤校正分野を定義し,それを推定するための診断フレームワークを提案する。
提案手法は,入力空間のキャリブレーションを意識した表現を学習し,学習幾何学におけるカーネルの平滑化による符号付き局所的誤校正を推定する。
論文 参考訳(メタデータ) (2026-05-13T13:07:50Z) - Near-Oracle KV Selection via Pre-hoc Sparsity for Long-Context Inference [54.467557491325046]
本稿では,注意スコアの前にKVエントリを選択し,明示的な精度制御を行うプリホックスパシティ(PrHS)を提案する。
PrHSは検索オーバーヘッドを90%以上削減し、HShareよりも3倍高い精度で検索できる。
これはLongBenchの平均劣化率を1%以下に抑え、FLOPを約15%減らし、9.9倍のレイテンシと2.8倍のスループットを得る。
論文 参考訳(メタデータ) (2026-02-09T07:05:23Z) - CacheClip: Accelerating RAG with Effective KV Cache Reuse [8.016679032026824]
CacheClipは、高速TTFTとハイジェネレーション品質の両方を実現する新しいフレームワークである。
本手法は,(1)選択的KVキャッシュ再計算のための補助モデル誘導トークン選択,(2)冗長な注意シンクを排除するための共有プレフィックス,(3)局所コヒーレンスを維持するためのグループ化戦略の3つの手法を統合する。
論文 参考訳(メタデータ) (2025-10-11T09:28:26Z) - PatternKV: Flattening KV Representation Expands Quantization Headroom [37.83913102876393]
自己回帰 LLM における KV キャッシュは冗長な再計算を排除しているが、推論時に支配的なメモリと帯域幅のボトルネックとして出現している。
KV量子化はキャッシュコストを削減するキーレバーであるが、ネイティブなKV分布が平坦性に欠けるため、精度は急激に低下する。
Kキャッシュは、コンテキストとともに徐々に進化する安定した構造を維持し、Vキャッシュは潜在意味規則性を持つことを示す。
論文 参考訳(メタデータ) (2025-10-05T12:09:14Z) - Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models [4.238165821317982]
LieQは、極端に低ビット圧縮下でのサブ7Bモデルの精度を維持するという課題に対処するメトリック駆動フレームワークである。
提案手法では,3つの相補的レイヤワイド診断手法(パープレキシティ・ドロップ,表現コンパクト性,トップkエネルギーゲイン)を導入している。
Qwen3-4Bでは、2.05ビット量子化でFP16ベースライン性能の95.9%を回復し、GPTQを19.7%、AWQを18.1%上回った。
論文 参考訳(メタデータ) (2025-08-05T11:17:04Z) - Unlocking Data-free Low-bit Quantization with Matrix Decomposition for KV Cache Compression [87.5604418100301]
キー値(KV)キャッシングは,大規模言語モデルの推論を高速化する重要な手法である。
既存の手法はしばしば精度を損なうか、キャリブレーションのために余分なデータを必要とする。
テンソル分解法に基づく新しいデータフリー低ビット量子化手法である textbfDecoQuant を導入する。
論文 参考訳(メタデータ) (2024-05-21T08:35:10Z) - Generalized Focal Loss V2: Learning Reliable Localization Quality
Estimation for Dense Object Detection [78.11775981796367]
GFLV2 (ResNet-101) は14.6 FPSで46.2 APを達成し、以前の最先端ATSSベースライン (43.6 AP at 14.6 FPS) をCOCO tt test-devで絶対2.6 APで上回った。
コードはhttps://github.com/implus/GFocalV2.comから入手できる。
論文 参考訳(メタデータ) (2020-11-25T17:06:37Z) - Generalized Focal Loss: Learning Qualified and Distributed Bounding
Boxes for Dense Object Detection [85.53263670166304]
一段検出器は基本的に、物体検出を密度の高い分類と位置化として定式化する。
1段検出器の最近の傾向は、局所化の質を推定するために個別の予測分岐を導入することである。
本稿では, 上記の3つの基本要素, 品質推定, 分類, ローカライゼーションについて述べる。
論文 参考訳(メタデータ) (2020-06-08T07:24:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。