論文の概要: WitCert: Sound Runtime Risk Observability and Gating for KV-Cache Quantization
- arxiv url: http://arxiv.org/abs/2607.28699v1
- Date: Thu, 30 Jul 2026 11:04:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.39269
- Title: WitCert: Sound Runtime Risk Observability and Gating for KV-Cache Quantization
- Title(参考訳): WitCert: KVキャッシュ量子化のためのサウンドランタイムのリスク監視とゲーティング
- Authors: Fanzhe Wei, Li Liu,
- Abstract要約: KV-cache量子化は今日、オフラインベンチマーク平均によって検証されている。
デプロイされたシステムは、現在提供されている要求に圧縮がダメージを与えているかどうかを判断できない。
我々はこれを「KV量子化のためのDTrace」と証明可能な健全なランタイムメータを与える。
- 参考スコア(独自算出の注目度): 6.272878315342466
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: KV-cache quantization is validated today by offline benchmark averages; a deployed system cannot tell whether compression is damaging the request it is serving right now. We give it a provably sound runtime meter, a "DTrace for KV quantization": a per-(layer, head, step) upper bound on the total variation between exact and compressed attention. The meter has two tiers: a deterministic band-norm-witness bound, sound for any cache-preserving black-box quantizer and for any query (adaptive-safe, worst-case Cauchy-Schwarz plus RoPE band-unitarity), and a tighter probabilistic certificate for a controlled subtractively-dithered INT8 quantizer under an explicit request-level failure budget (stated for non-adaptive queries; core theorems machine-checked in Lean 4). Three results. Observability: the meter enters SGLang through an environment-guarded patch, and any scheme registered as one tensor function is measured in live serving. Repair: meter-driven gating, risk-ranked where the witness is saturated and certified where it is informative, empirically restores the quality floor at benchmark scale. For example, raw-cast FP8 improves from 22.8 back to 79.7 on hard RULER tasks, with the difference from uncompressed bounded at [+0.0, +0.8] by a paired test. Analysis: aggressive schemes survive on cross-layer error cancellation, not per-step fidelity. In a 28-layer sweep, no single layer's pollution alone loses anything (0/28), and the certified INT8 cache serves 1.88 times more KV tokens at the same memory in SGLang.
- Abstract(参考訳): KV-cache量子化は今日、オフラインベンチマーク平均によって検証されている。デプロイされたシステムは、現在提供されている要求に圧縮がダメージを与えているかどうかを判断できない。
KV量子化のためのDTrace (DTrace for KV Quantization: 層, 頭, ステップ) は, 正確な注意点と圧縮された注意点の総変動に上限がある。
決定論的バンドノームビット境界、キャッシュ保存ブラックボックス量子化器とクエリ(アダプティブセーフで最悪のケースであるCauchy-SchwarzとRoPEバンドユニタリティ)のためのサウンド、明示的な要求レベルの障害予算(非適応クエリ、コア定理はLean 4でマシンチェックされている)の下で、制御されたサブトラクショナルなINT8量子化器のための厳密な確率証明である。
3つの結果。
可観測性: メーターは環境保護パッチを通じてSGLangに入り、1つのテンソル関数として登録されたスキームはライブサービスで測定される。
修復: メーター駆動のゲーティングで、目撃者が飽和し、情報のある場所で認定されたリスクランクが、ベンチマークスケールで品質フロアを実証的に復元する。
例えば、生キャスト FP8 は硬質 RULER のタスクで 22.8 から 79.7 に改善され、対のテストで [+0.0, +0.8] の非圧縮バウンドとの違いがある。
分析: 攻撃的スキームはステップ毎の忠実さではなく、層間エラーキャンセルで生き残る。
28層のスイープでは、単一層の汚染だけで何も失わない(0/28)し、認証されたINT8キャッシュはSGLangの同じメモリで1.88倍のKVトークンを提供する。
関連論文リスト
- Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Data-Free Quality Guard Yet Invent Procedure Steps in Agentic Execution [0.0]
専門家は、データチープの品質ガードのスタックをクリアすると、圧縮された言語モデルを受け入れる。
3つのモデルファミリーにまたがって、優雅に圧縮されたモデルはすべてのガードをクリアし、指示にはない手順を発明した。
我々は,事前登録されたパワーカナリア上で,信頼区間のペア化による盲点と解離を特徴付ける。
論文 参考訳(メタデータ) (2026-07-30T13:33:09Z) - RoPE-Aware Bit Allocation for KV-Cache Quantization [52.099459337231345]
Block-GTQはTurboQuant-MSE上に構築されたキーキャッシュ量子化のためのビットアロケータである。
これは、RoPEクエリキーのロジットを10モデル診断パネルに保存する。
128Kコンテキストでfp16 FlashAttention2より1.34倍高速で動作する。
論文 参考訳(メタデータ) (2026-06-23T00:17:48Z) - Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation [6.129872931808218]
キー値(KV)キャッシュの量子化は、Large Language Model(LLM)推論メモリの削減に広く利用されている。
本研究では,KVキャッシュ量子化下でのアライメント保存について検討する。
低ビット量子化は安全アライメントを静かに破壊することができる。
論文 参考訳(メタデータ) (2026-06-01T02:02:20Z) - Runtime-Certified Bounded-Error Quantized Attention [0.0]
本稿では,実行時対応型KVキャッシュアーキテクチャを提案する。
二項誤差分解は、キー量子化および(ii)値再構成誤差から、(i)注目分布歪みに対するヘッド当たり、ステップ当たりのバウンダリが得られる。
PG-19、NIAH、RULERのベンチマークにおいて、このシステムは言語モデリングと検索タスクのためのノイズ内の密度の高いFP16 KV品質と一致している。
論文 参考訳(メタデータ) (2026-05-20T08:04:40Z) - The Illusion of Equivalence: Systematic FP16 Divergence in KV-Cached Autoregressive Inference [2.954681536906518]
KVキャッシングは自己回帰変換器推論におけるユビキタス最適化である。
FP16 KVキャッシュ推論は基本的に再計算と等価ではないことを示す。
論文 参考訳(メタデータ) (2026-04-16T15:59:40Z) - Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression [4.049313299965171]
この圧縮と加速のギャップによって、我々は測定されたレイテンシーをターゲットとした実用的な順序付きパイプラインを研究した。
我々は、非構造化プルーニング、量子化対応トレーニング(QAT)、知識蒸留(KD)の3つの広く使われている技術を組み合わせている。
すべての設定で、順序付けされたパイプラインは、単一のテクニック単独よりも、より精度の高いレイテンシフロンティアを実現する。
論文 参考訳(メタデータ) (2026-04-05T06:13:47Z) - TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference [48.40143137402824]
MLA(Multi-Head Latent Attention)は、キー値の状態を低ランクの潜在ベクトルに圧縮し、このベクトルだけをキャッシュしてメモリを減少させる。
しかし、テンソル並列性(TP)では、アテンションヘッドは複数のデバイスにまたがって計算され、各デバイスはフルキャッシュをロードしなければならない。
本稿では,潜在表現と各頭部の入力次元をデバイス間で分割し,シャード毎に独立して注目を行い,結果を全再現と組み合わせる方式であるTPLAを提案する。
論文 参考訳(メタデータ) (2025-08-21T15:25:40Z) - vCache: Verified Semantic Prompt Caching [95.16654660556975]
本稿では,ユーザ定義エラー率保証を備えた最初の検証済みセマンティックキャッシュであるvCacheを提案する。
オンライン学習アルゴリズムを使用して、キャッシュされたプロンプト毎に最適な閾値を推定し、追加のトレーニングなしで信頼性の高いキャッシュ応答を可能にする。
我々の実験によると、vCacheは特定のエラー境界を一貫して満たし、最先端の静的な閾値と微調整された埋め込みベースラインより優れています。
論文 参考訳(メタデータ) (2025-02-06T04:16:20Z) - SoftPatch+: Fully Unsupervised Anomaly Classification and Segmentation [84.07909405887696]
本論文は、完全教師なし産業異常検出(すなわち、ノイズデータ付き教師なしAD)を初めて検討したものである。
メモリベースの非教師なしAD手法であるSoftPatchとSoftPatch+を提案する。
既存の手法と比較して、SoftPatchは通常のデータの強力なモデリング能力を維持し、コアセットにおける過信問題を軽減する。
様々なノイズシナリオで実施された総合的な実験により、SoftPatchとSoftPatch+はMVTecAD、ViSA、BTADのベンチマークで最先端のADメソッドよりも優れていた。
論文 参考訳(メタデータ) (2024-12-30T11:16:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。