論文の概要: Semantic Cache Distillation: Efficient State Transfer via Reuse and Selective Patching
- arxiv url: http://arxiv.org/abs/2606.07684v1
- Date: Fri, 05 Jun 2026 02:46:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:05.273325
- Title: Semantic Cache Distillation: Efficient State Transfer via Reuse and Selective Patching
- Title(参考訳): セマンティックキャッシュ蒸留:再利用と選択的パッチングによる効率的な状態転送
- Authors: Qianli Ma, Zhiqing Tang, Hanshuai Cui, Zhi Yao, Weijia Jia,
- Abstract要約: セマンティックキャッシュ蒸留(SCD)は、生のKV伝送をコンパクトなセマンティックコードに置き換える。
SCDは最大2.65ドル(約2,500円)のTTFTスピードアップを提供する。
- 参考スコア(独自算出の注目度): 10.751183015853863
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Disaggregated serving alleviates memory bottlenecks in Large Language Model (LLM) inference but creates a severe communication bottleneck: transmitting high-dimensional Key-Value (KV) caches often dominates time-to-first-token (TTFT). Moreover, reusing caches across heterogeneous models (e.g., base and fine-tuned variants) causes semantic misalignment that accumulates over layers, degrading generation quality. We propose Semantic Cache Distillation (SCD), a loss-constrained framework that replaces raw KV transmission with compact semantic codes. SCD addresses these challenges via two mechanisms: (1) Reuse, which reconstructs most layers from low-rank subspaces to minimize transfer cost, and (2) Patch, which predicts normalized inputs at sparse transition layers to truncate error propagation. Empirically, SCD delivers up to 2.65 $\times$ TTFT speedup over the oracle consumer prefill and dominates quantization and selective recomputation baselines on the quality--latency Pareto frontier in bandwidth-constrained regimes, while keeping generation quality within 5\% F1 of the oracle.
- Abstract(参考訳): 大言語モデル(LLM)推論におけるメモリボトルネックを緩和するが、高次元キーバリュー(KV)キャッシュの転送はTTFT(Time-to-first-token)を支配下に置く。
さらに、異種モデル(例えば、ベースと微調整の亜種)にまたがるキャッシュの再利用は、層の上に蓄積するセマンティックなミスアライメントを引き起こし、生成品質を低下させる。
生のKV伝送をコンパクトなセマンティックコードに置き換える損失抑制フレームワークであるセマンティックキャッシュ蒸留(SCD)を提案する。
SCDは,(1)低ランク部分空間からほとんどの層を再構成して転送コストを最小化する再利用,(2)スパース遷移層における正規化入力を予測してエラーの伝播をトランケートするパッチという2つのメカニズムによって,これらの課題に対処する。
経験的に、SCDは、オラクルの消費者プリフィル上で最大2.65ドル\times$ TTFTのスピードアップを提供し、オークルの5\% F1の範囲で生成品質を維持しながら、帯域幅制限された状態における品質-遅延パレートフロンティアの量子化と選択的な再計算ベースラインを支配している。
関連論文リスト
- Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs [59.973833105841685]
対向移動性を改善するための重要な課題は、異なるモデル間で共有される本質的な視覚的焦点を効果的に捉えることである。
本稿では、FRA-Attackを提案する。このFRA-Attackは、周波数領域の統一正規化の観点から、両方の課題に対処する。
機能アライメントのために、パッチ機能に対する高パスDCTは、冗長なグローバル構造を抑圧し、MLLMの固有の視覚的焦点を持つ高周波帯域の損失に集中する。
勾配最適化のために、代用勾配を変調するテキストモデルに依存しない低パス正規化器である周波数領域勾配正規化(FGR)を導入する。
論文 参考訳(メタデータ) (2026-05-20T08:15:56Z) - RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse [5.597099794399441]
RelayCachingはトレーニング不要な推論手法で、前のエージェントから復号フェーズKVキャッシュを直接再利用する。
RelayCachingは80%以上のKVキャッシュの再利用を実現し、TTFTを標準パイプラインと比較して最大4.7倍のコストで削減できることを示す。
論文 参考訳(メタデータ) (2026-02-28T04:46:28Z) - ProCache: Constraint-Aware Feature Caching with Selective Computation for Diffusion Transformer Acceleration [14.306565517230775]
Diffusion Transformer (DiTs) は、生成モデリングにおいて最先端のパフォーマンスを達成したが、その高い計算コストは、リアルタイムデプロイメントを妨げている。
既存の手法では,(1) 均一なキャッシング間隔がDiTの非一様時間ダイナミクスと一致しないこと,(2) 過大なキャッシング間隔によるナイーブな機能再利用が重大なエラーの蓄積につながること,の2つの重要な制限が課されている。
ProCacheはトレーニング不要な動的機能キャッシュフレームワークで、2つのコアコンポーネントを介してこれらの問題に対処する。
論文 参考訳(メタデータ) (2025-12-19T07:27:19Z) - XQuant: Achieving Ultra-Low Bit KV Cache Quantization with Cross-Layer Compression [54.28208936996186]
大規模言語モデル(LLM)は、様々な自然言語処理タスクにまたがる顕著な機能を示している。
量子化は、歴史的情報を保持しながらメモリ消費を減らすための有望な解決策として現れてきた。
超低等価ビット幅KVキャッシュ量子化を実現するトレーニングフリーでプラグアンドプレイのフレームワークであるXQuantを提案する。
論文 参考訳(メタデータ) (2025-10-13T10:17:21Z) - KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding [72.12756830560217]
Transformer Decodersをベースとした大規模言語モデル(LLM)が、会話生成AIの選択肢として好まれている。
デコーダアーキテクチャの全体的な優位性にもかかわらず、推論中にキーバリューキャッシュが徐々に増加し、主要な効率ボトルネックとなっている。
キーバリューベクトル次元を潜在空間にダウンサンプリングすることで、KVキャッシュのフットプリントを大幅に削減し、推論速度を向上させることができる。
論文 参考訳(メタデータ) (2025-07-15T12:52:12Z) - QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache [67.84112700032007]
大きな言語モデル(LLM)は、長いコンテキスト設定のためにエッジデバイスにデプロイされることが増えている。
これらのシナリオでは、キーバリュー(KV)キャッシュがGPUメモリとレイテンシの両方において主要なボトルネックとなっている。
そこで本研究では,ターゲットモデルのアーキテクチャを共有するが,階層的な4ビット量子化KVキャッシュと4ビット量子化重みを併用して高速化を行う,新たな自己推論型デコーディングフレームワークであるQuantSpecを提案する。
論文 参考訳(メタデータ) (2025-02-05T20:43:48Z) - FiRST: Finetuning Router-Selective Transformers for Input-Adaptive Latency Reduction [16.84400858871298]
本稿では、層固有のルータを用いて、各入力シーケンスに対して適応的に変換器層のサブセットを選択することでレイテンシを低減するアルゴリズムであるFiRSTを提案する。
FiRSTは品質を認識しながら高速な推論を可能にするKVキャッシュとの互換性を維持する。
私たちのアプローチでは、入力適応性は重要であり、タスクによって異なるタスク固有の中間層が隠れた表現を進化させる上で重要な役割を担っています。
論文 参考訳(メタデータ) (2024-10-16T12:45:35Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。