論文の概要: Sparse Prefix Caching for Hybrid and Recurrent LLM Serving
- arxiv url: http://arxiv.org/abs/2605.05219v1
- Date: Fri, 17 Apr 2026 09:24:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 06:56:26.605773
- Title: Sparse Prefix Caching for Hybrid and Recurrent LLM Serving
- Title(参考訳): ハイブリッド・リカレントLDMサービング用スパースプリフィックスキャッシング
- Authors: Mikhail Shirokikh, Sergey Nikolenko,
- Abstract要約: 重なり合う深さの分布の下で,スパースプレフィックスキャッシングをチェックポイント配置として定式化する。
リクエストが非自明なプレフィックスを共有する場合、実世界のデータ上で標準非対称性によって追跡されるフロンティアを一貫して改善することを示す。
正確な出力を保持し、リカレント計算自体を変更したり、新しいリカレント更新カーネルを必要としたりしない。
- 参考スコア(独自算出の注目度): 0.7284556903703034
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prefix caching is a key latency optimization for autoregressive LLM serving, yet existing systems assume dense per-token key/value reuse. State-space models change the structure of the problem: a recurrent layer can resume from a single stored state rather than requiring the entire token history. This asymmetry opens a new design point between no reuse and dense caching: store exact recurrent states at a sparse set of checkpoint positions and, on a cache hit, resume from the deepest stored checkpoint and recompute the remaining suffix exactly. We formalize sparse prefix caching as checkpoint placement under a distribution over overlap depths, yielding an exact O(NM) dynamic program. For use cases where requests share a non-trivial prefix (e.g. asking different questions about a single long document), we show that our method consistently improves the Pareto frontier traced by standard heuristics on real-world data. Across QuALITY and System Prompts, distribution-aware placement dominates every fixed-budget baseline on the measured layer-group Pareto frontier and matches or outperforms the strongest heuristic (block caching) while typically using substantially fewer checkpoints, with the largest gains at low checkpoint budgets where the overlap distribution is most non-uniform. The method is most relevant when many requests share a substantial but not identical prefix within a retained cache entry. It preserves exact outputs, does not change the recurrent computation itself or require new recurrent update kernels, applies to recurrent/SSM layers whose hidden state can be extracted and restored exactly, and for hybrid models can be combined with existing KV-cache compression techniques.
- Abstract(参考訳): プリフィックスキャッシュは自動回帰LDMサービスのための重要なレイテンシ最適化である。
状態空間モデルは問題の構造を変化させる: 再帰的なレイヤはトークン履歴全体を必要とせず、単一の保存状態から再開することができる。
この非対称性は、再利用と密集キャッシングの間に新しい設計ポイントを開く: チェックポイント位置のスパースセットに正確なリカレント状態を格納し、キャッシュヒット時に、最も深い格納されたチェックポイントから再開し、残りのサフィックスを正確に再コンパイルする。
重なり合う深さの分布の下で,スパースプレフィックスキャッシングをチェックポイント配置として定式化し,正確なO(NM)動的プログラムを生成する。
リクエストが非自明なプレフィックスを共有する場合(例えば、単一の長い文書について異なる質問をする場合)、我々の手法は現実世界のデータに対する標準的なヒューリスティックスによって追跡されるパレートフロンティアを一貫して改善することを示す。
Qualities と System Prompts 全体では、分散を意識した配置は、測定された層群であるParetoフロンティア上の固定予算ベースラインを全て支配し、最も強いヒューリスティック(ブロックキャッシング)にマッチまたは上回る。
この方法は、多くのリクエストが保持されたキャッシュエントリ内で、実質的ではあるが同一でないプレフィックスを共有する場合に最も関係がある。
正確な出力を保持し、リカレント計算自体を変更したり、新しいリカレント更新カーネルを必要としたり、隠れた状態を正確に抽出して復元できる再カレント/SSM層に適用したり、ハイブリッドモデルのために既存のKV-cache圧縮技術と組み合わせることができる。
関連論文リスト
- A Parametric Memory Head for Continual Generative Retrieval [52.66674234249913]
生成情報検索(GenIR)は、検索を単一のニューラルモデルに統合し、クエリから直接ドキュメント識別子(ドシデント)をデコードする。
逐次適応は、新たに追加された文書の検索を改善するが、以前のスライスの性能は著しく低下することを示す。
本稿では,モジュール型パラメトリックメモリヘッドで適応モデルを拡張するメモリのみの安定化ステージである,後適応メモリチューニング(PAMT)を提案する。
論文 参考訳(メタデータ) (2026-04-25T17:38:51Z) - Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing [29.913403615975174]
高いスループットでトランスフォーマー言語モデルを実行するには、冗長な計算を避けるためにキーバリュー(KV)をキャッシュする必要がある。
KVキャッシュのメモリフットプリントは著しく、サービスコストに大きな影響を与えます。
本稿では,ランダムな層間注意(ランダムな層間注意,ランダムな層間注意,ランダムな層間注意)を提案する。
論文 参考訳(メタデータ) (2026-04-03T14:56:17Z) - TokenLake: A Unified Segment-level Prefix Cache Pool for Fine-grained Elastic Long-Context LLM Serving [12.80179556886128]
セグメントレベルのプレフィックス・キャッシュ・プールであるTokenLakeを提案する。
キャッシュインターフェースを使用して、リクエストのクエリテンソル、プレフィックス、キャッシュ対応操作を公開します。
TokenLakeはスループットを最大2.6$times$と2.0$times$に改善し、ヒット率を2.0$times$と2.1$times$に向上させることができる。
論文 参考訳(メタデータ) (2025-08-24T05:45:16Z) - EPIC: Efficient Position-Independent Caching for Serving Large Language Models [19.510078997414606]
キャッシングは、リクエスト間でキーバリューベクトルを再利用することで、パフォーマンスを向上させる。
既存のコンテキストキャッシュでは、リクエストにまたがる正確なプレフィックスが必要である。
位置独立キャッシング (PIC) を導入し, プレフィックスによらず KV ベクトルのモジュラー再利用を可能にする。
また、新しいLegoLinkアルゴリズムを取り入れたサービスシステムEPICも導入しています。
論文 参考訳(メタデータ) (2024-10-20T08:42:29Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - Training-Free Exponential Context Extension via Cascading KV Cache [49.608367376911694]
カスケードサブキャッシュバッファを利用して,最も関連性の高いトークンを選択的に保持する機構を導入する。
本手法は,1Mトークンのフラッシュアテンションと比較して,プリフィルステージ遅延を6.8倍削減する。
論文 参考訳(メタデータ) (2024-06-24T03:59:17Z) - Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference [78.65321721142624]
我々はキー値(KV)キャッシュによって課されるメモリボトルネックに焦点を当てる。
既存のKVキャッシュ手法は、比較的重要でないKVペアの大きなスワストを刈り取ったり、取り除いたりすることでこの問題に対処する。
本稿では,固定サイズキャッシュと退避型キャッシュを簡易に統合したLESSを提案する。
論文 参考訳(メタデータ) (2024-02-14T18:54:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。