論文の概要: CacheBridge: Efficient Cross-Model KV Cache Transfer
- arxiv url: http://arxiv.org/abs/2609.00891v1
- Date: Tue, 01 Sep 2026 08:20:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.477942
- Title: CacheBridge: Efficient Cross-Model KV Cache Transfer
- Title(参考訳): CacheBridge: 効率的なクロスモデルKVキャッシュ転送
- Authors: Xingyu Qu, Siyuan Lu, Zhiyu Chen, Sheng Wang, Tao Lin,
- Abstract要約: フルヘッドマッピングは、ターゲットのKVヘッドを各ソースのKVヘッドから選択したレイヤにマッピングすることで、アーキテクチャ上の違いに敏感な転送品質を実現する。
CacheBridgeは、アーキテクチャインデクシングされたマッパーサポート、アテンションアラインなキャリブレーション、バウンダリされたマッパー構築を共同設計する。
Qwen3 $14mathrmBto32mathrmB$では、マッパーストレージを8times$に減らし、アプリケーションを3.0times$に加速し、キャリブレーションデータの10分の1とフルヘッドにマッチし、500シークエンス構築を92.63から8に短縮する。
- 参考スコア(独自算出の注目度): 12.058564378845373
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sharing context between LLMs in a multi-model system requires the receiving model to prefill the shared prefix because KV caches are model-specific. Recent closed-form cross-model KV transfer, hereafter Full-Head Mapping, avoids this replay by fitting a training-free affine mapper from source to target caches. However, its full-head design maps each target KV head from every source KV head in the selected layers, making transfer quality sensitive to architectural differences and causing mapper storage and application cost to grow with layer support. To this end, we introduce CacheBridge, which co-designs architecture-indexed mapper support, attention-aligned calibration, and bounded mapper construction while retaining a closed-form affine interface for online deployment. CacheBridge restricts each target head to a matched source head, weights reconstruction errors by causal attention sensitivity, and uses a fused GPU kernel to construct weighted sufficient statistics without materializing full observation tensors. Across three transfer directions, CacheBridge recovers the two Ministral 3 transfer directions where Full-Head Mapping loses substantial accuracy while preserving 99.83\% mean target retention on Qwen3. On Qwen3 $14\mathrm{B}\to32\mathrm{B}$, it reduces mapper storage by $8\times$, accelerates application by up to $3.0\times$, matches \fullhead with one tenth of the calibration data, and reduces 500-sequence construction from 92.63 to 8.63 seconds ($10.7\times$).
- Abstract(参考訳): マルチモデルシステムにおけるLLM間のコンテキスト共有は、KVキャッシュがモデル固有のため、共有プレフィックスをプリフィルするために受信モデルを必要とする。
最近のクローズドフォームのクロスモデルKV転送は、フルヘッドマッピングの後、トレーニング不要アフィンマッパーをソースからターゲットキャッシュに適合させることで、このリプレイを回避する。
しかし、そのフルヘッド設計では、ターゲットのKVヘッドを各ソースのKVヘッドから選択したレイヤにマッピングすることで、アーキテクチャ上の違いに敏感な転送品質を実現し、マッパーストレージとアプリケーションコストは層のサポートによって増大する。
この目的のために、我々はCacheBridgeを紹介します。これは、アーキテクチャインデクシングされたマッパーサポート、アテンションアラインキャリブレーション、バウンダリされたマッパー構築を、オンラインデプロイメントのためのクローズドフォームのアフィンインターフェースを維持しながら、共同設計します。
CacheBridgeは、各ターゲットヘッドを一致したソースヘッドに制限し、因果的注意感度で再構成エラーを重み付け、融合GPUカーネルを使用して、完全な観測テンソルを具体化せずに十分な統計量を構築する。
3つの転送方向にわたって、CacheBridgeは、Qwen3上の平均目標保持率99.83\%を維持しながら、フルヘッドマッピングがかなりの精度を失う2つのミニストラー3転送方向を復元する。
Qwen3 $14\mathrm{B}\to32\mathrm{B}$では、マッパーストレージを8\times$に減らし、アプリケーションを最大3.0\times$に加速し、キャリブレーションデータの10分の1にマッチし、500列構成を92.63秒から8.63秒(10.7\times$)に短縮する。
関連論文リスト
- Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse [3.9548951874725433]
本稿では,ソースのKVキャッシュを再利用し,プリフィルをスキップするクロスモデルKVキャッシュ転送を提案する。
モデルKVは、ソースとターゲットが共有するKVヘッド数とヘッド次元が一致するような、マッチングされたKV対にまたがる線形構造を持つことがわかった。
このリニアマッパーは4対でレシーバーのスタンドアローンプリフィル精度の73-98%を保持し、2つが急降下する。
論文 参考訳(メタデータ) (2026-08-04T16:26:47Z) - A JoLT for the KV Cache: Near-Lossless KV Cache Compression via Joint Tucker and JL-Residual Allocation for LLMs [0.0]
キー値(KV)キャッシュは、トランスフォーマー推論の主要なメモリコストとなっている。
低ランク法はキャッシュの2次元スライス、またはヘッド当たり行列またはクロス層特徴ブロックを分解し、量子化法は各エントリのビット幅を下げる。
提案手法は,トークンと特徴軸のみを圧縮し,頭部と層軸をそのまま残す部分的タッカー分解法である。
ランダム化されたSVDの派生型であるFlashJoLTは、1024のコンテキストで5-13倍の圧縮時間のスピードアップと品質の一致を提供する。
論文 参考訳(メタデータ) (2026-07-14T09:23:20Z) - ICaRus: Identical Cache Reuse for Efficient Multi Model Inference [14.040073161061578]
ICaRusは、複数のモデルで同一のKVキャッシュをすべての層で共有できる新しいアーキテクチャである。
ICaRusは最大11.1倍のP95レイテンシを実現し、8つの異なるモデルを持つマルチエージェントワークフローにおいて3.8倍のスループットを実現している。
論文 参考訳(メタデータ) (2026-02-27T14:21:45Z) - PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache [61.57938553036056]
トレーニング不要なKVキャッシュ管理手法であるPackCacheを導入し,KVキャッシュを3つの協調機構でコンパクト化する。
効率の面では、PackCacheは48フレームの長いシーケンスで1.7-2.2倍のエンドツーエンド生成を高速化する。
論文 参考訳(メタデータ) (2026-01-07T19:51:06Z) - KV Cache Transform Coding for Compact Storage in LLM Inference [2.20003167536462]
KVTCは、KVキャッシュをコンパクトなオンGPUとオフGPUストレージに圧縮する軽量トランスフォーメーションコーダである。
KVキャッシュの冗長性を活用することで、KVTCは推論と長文の精度を維持しながら最大20$times$圧縮を達成する。
我々は、AIME25、LiveCodeBench、GSM8K、MMLU、Qasper、RULER、MATH-500を含むベンチマークで、Llama 3、Mistral NeMo、R1-Qwen 2.5モデルでKVTCをテストする。
論文 参考訳(メタデータ) (2025-11-03T18:20:35Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache [67.84112700032007]
大きな言語モデル(LLM)は、長いコンテキスト設定のためにエッジデバイスにデプロイされることが増えている。
これらのシナリオでは、キーバリュー(KV)キャッシュがGPUメモリとレイテンシの両方において主要なボトルネックとなっている。
そこで本研究では,ターゲットモデルのアーキテクチャを共有するが,階層的な4ビット量子化KVキャッシュと4ビット量子化重みを併用して高速化を行う,新たな自己推論型デコーディングフレームワークであるQuantSpecを提案する。
論文 参考訳(メタデータ) (2025-02-05T20:43:48Z) - KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing [58.29726147780976]
我々は,層間をKVキャッシュで共有し,層間圧縮を実現する,textit KVSharerと呼ばれるプラグアンドプレイ方式を提案する。
実験の結果、textit KVSharerはKVキャッシュの計算を30%削減し、メモリ消費を削減できることがわかった。
我々は,textit KVSharerが既存の層内KVキャッシュ圧縮手法と互換性があることを検証する。
論文 参考訳(メタデータ) (2024-10-24T08:06:41Z) - KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache [67.9776980972508]
我々はKIVIというチューニング不要な2ビットKVキャッシュ量子化アルゴリズムを開発した。
KIVI は Llama, Falcon, Mistral のモデルを $mathbf2.6times$ less peak memory を使用しながらほぼ同じ品質を維持することができる。
論文 参考訳(メタデータ) (2024-02-05T06:06:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。