論文の概要: Codec-Gauge: Learning Compression-Friendly Gauges for Transformer KV Caches
- arxiv url: http://arxiv.org/abs/2607.20538v1
- Date: Fri, 10 Jul 2026 17:18:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.22368
- Title: Codec-Gauge: Learning Compression-Friendly Gauges for Transformer KV Caches
- Title(参考訳): Codec-Gauge: トランスフォーマーKVキャッシュのための圧縮フレンドリーなゲージ学習
- Abstract要約: 長文トランスフォーマー推論は、KVキャッシュ圧縮や量子化にますます依存している。
我々は,キャッシュ調整後のレイヤであるCodec-Gaugeを紹介した。
- 参考スコア(独自算出の注目度): 25.55174329283001
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context Transformer inference increasingly relies on KV-cache compression or quantization. Prior rotation and transform-coding results suggest that the channel basis of each key/value vector affects how faithfully a fixed backend preserves model behavior. We introduce Codec-Gauge, a post-training cache-coordinate layer that learns small orthogonal channel transforms around existing compression and quantization backends. Its frequency-distribution objective combines a token-channel DCT spectral-centroid loss with a smooth rate proxy to concentrate KV energy in low-frequency codec-facing layouts. We evaluate actual compression and decompression using measured bytes and rolling compressed-history scoring. Across six models at $3$, $4$, and $6$ bits/value, learned gauges reduce zfp KL divergence by $44.0\%$ on average relative to raw coordinates and outperform random, Hadamard, DCT, and PCA/KLT controls. The same gauges improve quality preservation for block-uniform and KIVI-style quantization. Experiments on a 27B model and long-context task prompts reproduce the quality trend, while serial storage and timing measurements validate the implemented compressed-cache paths. These results establish cache-coordinate geometry as a practical post-training variable for improving compression fidelity without changing model weights, attention semantics, or backend coding rules.
- Abstract(参考訳): 長文トランスフォーマー推論は、KVキャッシュ圧縮や量子化にますます依存している。
事前の回転および変換符号化の結果は、各キー/値ベクトルのチャネル基底が、固定されたバックエンドがモデル挙動を忠実に保持する方法に影響を与えることを示唆している。
キャッシュ調整後のレイヤであるCodec-Gaugeを導入し、既存の圧縮と量子化バックエンドを中心に、小さな直交チャネル変換を学習する。
その周波数分布目的は、トークンチャネルDCTスペクトルセントロイド損失とスムーズなレートプロキシを組み合わせることで、低周波コーデック面レイアウトにおいてKVエネルギーを集中させる。
実測バイトと転がり圧縮履歴スコアを用いた実圧縮と非圧縮の評価を行った。
6つのモデルの3ドル、4ドル、6ドルのビット/値で、学習ゲージはzfp KLの発散率を、生の座標や乱数、アダマール、DCT、PCA/KLTの制御よりも平均4.0 %下げる。
同じゲージはブロックユニフォームとKIVIスタイルの量子化の保存性を向上させる。
27Bモデルと長時間コンテキストタスクの実験は品質トレンドを再現し、シリアルストレージとタイミング測定は実装された圧縮キャッシュパスを検証する。
これらの結果は、モデル重み、注意の意味論、バックエンドのコーディングルールを変更することなく圧縮忠実度を改善するための実践的な後学習変数としてキャッシュ調整幾何を確立している。
関連論文リスト
- KV Cache Compression Through the Lens of Transform Coding [9.884224071643606]
本稿では,アテンション・アウェア・トランスフォーメーション・コーディング(AATC)を紹介し,アテンション・アウェア・トランスフォーメーションの歪みを最小限に抑えるために,キャリブレーション・セット上のビットを割り当てる。
提案手法は, ほぼロスレスの精度を約5.8倍の圧縮で達成する一方, 各ベースラインは少なくともいくつかの設定で劣化する。
論文 参考訳(メタデータ) (2026-08-14T11:08:01Z) - DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression [0.0]
DepthWeave-KVはトークン適応型キャッシュ圧縮手法で、近隣のトランスフォーマー層にまたがるキーと値の状態を分解する。
DepthWeave-KVは、メモリ使用量を大幅に削減した、ほぼ完全なタスク品質を実現する。
論文 参考訳(メタデータ) (2026-07-07T17:29:01Z) - End-to-End Context Compression at Scale [81.70601323130997]
長期コンテキスト言語モデル推論は、KVキャッシュがコンテキスト長とともに増加するにつれて、メモリによってボトルネックとなる。
KVキャッシュを圧縮する最近の技術は、モデル品質を著しく低下させるか、あるいはかなりの時間を要するか、1つの長いプロンプトを圧縮するために計算する。
既存のアプローチは、精度-効率のフロンティア上のKVキャッシュ圧縮と競合しない。
論文 参考訳(メタデータ) (2026-06-08T15:43:16Z) - OCTOPUS: Optimized KV Cache for Transformers via Octahedral Parametrization Under optimal Squared error quantization [13.284869342523095]
キー値(KV)は自己回帰推論におけるメモリ帯域幅とフットプリントを支配している。
最近の回転プリコンディショニングコーデック(TurboQuant, PolarQuant)は、KV圧縮のほぼ最適レシピである。
OCTOPUSはこのパラダイムを回転座標三重項の結合量子化によって前進させる。
論文 参考訳(メタデータ) (2026-05-20T14:19:51Z) - EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction [55.026048429595384]
EchoKVは、標準と圧縮された推論間のオンデマンド移行を可能にする柔軟なKVキャッシュ圧縮スキームである。
高速で低コストなトレーニングを可能にする2段階の微調整戦略を導入する。
論文 参考訳(メタデータ) (2026-03-24T07:58:42Z) - CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing [54.34080239841088]
CommonKVは、隣接パラメータ共有による層間KVキャッシュ圧縮のトレーニング不要な方法である。
提案手法は,様々な圧縮比で既存の低ランクおよびクロスレイヤーの手法より一貫して優れていることを示す。
論文 参考訳(メタデータ) (2025-08-22T06:55:45Z) - KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding [72.12756830560217]
Transformer Decodersをベースとした大規模言語モデル(LLM)が、会話生成AIの選択肢として好まれている。
デコーダアーキテクチャの全体的な優位性にもかかわらず、推論中にキーバリューキャッシュが徐々に増加し、主要な効率ボトルネックとなっている。
キーバリューベクトル次元を潜在空間にダウンサンプリングすることで、KVキャッシュのフットプリントを大幅に削減し、推論速度を向上させることができる。
論文 参考訳(メタデータ) (2025-07-15T12:52:12Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。