論文の概要: PTStore (Prefix Tensor Store): Distributed Prefix Caching and Replication for High Throughput Inference Serving
- arxiv url: http://arxiv.org/abs/2607.22648v1
- Date: Thu, 25 Jun 2026 21:51:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.005979
- Title: PTStore (Prefix Tensor Store): Distributed Prefix Caching and Replication for High Throughput Inference Serving
- Title(参考訳): PTStore(Prefix Tensor Store):分散プレフィックスキャッシュと高スループット推論のレプリケーション
- Abstract要約: PTStoreは、再利用可能なKVキャッシュプレフィックスを形成する人気のあるテンソルを配布し、複製する。
これにより、KVキャッシュにアクセスするレイテンシが減少し、負荷の不均衡が軽減される。
PTStoreは分散化により、LLM推論のためのKVキャッシュのサイズを桁違いに拡張することができる。
- 参考スコア(独自算出の注目度): 0.40886617595285935
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Inspired by the design of client caching in Content Delivery Networks (CDNs), PTStore distributes and replicates popular tensors that form reusable KV cache prefixes, which are the main technique used by state of art approaches to accelerate inferences. This reduces the latency of accessing the KV cache and alleviates load imbalance caused by a disproportionately large number of requests on servers containing popular tensors. Furthermore, thanks to decentralization, PTStore allows the expansion of the size of the KV cache for LLM inference by orders of magnitude. As a result, PTStore can execute inferences on long passage Q\&A datasets 5-6 times more efficiently than current baselines, which do not aggregate memory across different nodes and GPUs and therefore require regenerating the KV cache.
- Abstract(参考訳): コンテンツ配信ネットワーク(CDN)におけるクライアントキャッシュの設計にインスパイアされたPTStoreは、再利用可能なKVキャッシュプレフィックスを形成する一般的なテンソルを配布し、複製する。
これにより、KVキャッシュへのアクセスのレイテンシを低減し、一般的なテンソルを含むサーバでの大量のリクエストによる負荷の不均衡を軽減することができる。
さらに、分散化により、TStoreはLLM推論のためのKVキャッシュのサイズを桁違いに拡張することができる。
その結果、PTStoreは、現在のベースラインの5~6倍の効率で、異なるノードやGPU間でメモリを集約しないため、KVキャッシュを再生する必要がある。
関連論文リスト
- Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - ObjectCache: Layerwise Object-Storage Retrieval for KV Cache Reuse [6.734363135861142]
プリフィックスKVキャッシュはLLMサービスにおいて重要なメカニズムとなっている。
現在のシステムは、KVキャッシュをリモートDRAMプールに保持し、サービスクラスタのサイズとコストを増大させる。
ストレージサーバがKVキャッシュデータをGPUが消費する順番に配信するように,ストレージプロトコルと転送スケジュールを共同設計するObjectCacheを提案する。
論文 参考訳(メタデータ) (2026-05-16T16:48:46Z) - IceCache: Memory-efficient KV-cache Management for Long-Sequence LLMs [12.353502602473695]
キーバリュー(KV)キャッシュは、大規模言語モデルにおける推論の加速に重要な役割を果たす。
セマンティックトークンクラスタリングとPagedAttentionを統合した新しいKVキャッシュ管理戦略を提案する。
256の予算で、IceCacheは完全なKVキャッシュモデルによって達成された元の精度の99%を維持している。
論文 参考訳(メタデータ) (2026-04-12T09:02:20Z) - Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing [29.913403615975174]
高いスループットでトランスフォーマー言語モデルを実行するには、冗長な計算を避けるためにキーバリュー(KV)をキャッシュする必要がある。
KVキャッシュのメモリフットプリントは著しく、サービスコストに大きな影響を与えます。
本稿では,ランダムな層間注意(ランダムな層間注意,ランダムな層間注意,ランダムな層間注意)を提案する。
論文 参考訳(メタデータ) (2026-04-03T14:56:17Z) - Zipage: Maintain High Request Concurrency for LLM Reasoning through Compressed PagedAttention [58.012620801746046]
復号フェーズにおけるKVキャッシュは、高コンカレンシーサービスを制限する重要な要因となっている。
本稿では,トークン単位のKVキャッシュ消去とPagedAttentionを組み合わせたCompressed PagedAttentionを提案する。
そこで我々は,高速LLM推論エンジンZipageを開発した。
論文 参考訳(メタデータ) (2026-03-01T14:01:36Z) - SWAN: Sparse Winnowed Attention for Reduced Inference Memory via Decompression-Free KV-Cache Compression [7.603859408568262]
大きな言語モデル(LLM)は、キーバリュー(KV)キャッシュの巨大なメモリフットプリントのため、自動回帰推論において重大なボトルネックに直面します。
SWANは、このオーバーヘッドをなくす、新しい、微調整不要なフレームワークである。
提案手法はオフライン行列を用いてKV-cacheを回転させプルークする。
論文 参考訳(メタデータ) (2025-11-24T09:41:24Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - SpeCache: Speculative Key-Value Caching for Efficient Generation of LLMs [44.41154292836592]
我々は,完全なKVキャッシュをオフロードし,各デコードステップでKVペアを動的にフェッチするSpeCacheを提案する。
LongBenchとNeedle-in-a-Haystackベンチマークの実験では、SpeCacheがVRAMの使用を効果的に削減していることが確認されている。
論文 参考訳(メタデータ) (2025-03-20T14:01:56Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - Compute Or Load KV Cache? Why Not Both? [6.982874528357836]
Cakeは計算資源とI/Oリソースを並列に最適に利用する新しいKVキャッシュローディングシステムである。
Cakeは、計算のみの手法やI/Oのみの手法と比較して、TTFT(Time to First Token)の平均2.6倍の削減を実現している。
論文 参考訳(メタデータ) (2024-10-04T01:11:09Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z) - Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference [78.65321721142624]
我々はキー値(KV)キャッシュによって課されるメモリボトルネックに焦点を当てる。
既存のKVキャッシュ手法は、比較的重要でないKVペアの大きなスワストを刈り取ったり、取り除いたりすることでこの問題に対処する。
本稿では,固定サイズキャッシュと退避型キャッシュを簡易に統合したLESSを提案する。
論文 参考訳(メタデータ) (2024-02-14T18:54:56Z) - KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache [67.9776980972508]
我々はKIVIというチューニング不要な2ビットKVキャッシュ量子化アルゴリズムを開発した。
KIVI は Llama, Falcon, Mistral のモデルを $mathbf2.6times$ less peak memory を使用しながらほぼ同じ品質を維持することができる。
論文 参考訳(メタデータ) (2024-02-05T06:06:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。