論文の概要: MVR-cache: Optimizing Semantic Caching via Multi-Vector Retrieval and Learned Prompt Segmentation
- arxiv url: http://arxiv.org/abs/2605.24914v1
- Date: Sun, 24 May 2026 07:33:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.507561
- Title: MVR-cache: Optimizing Semantic Caching via Multi-Vector Retrieval and Learned Prompt Segmentation
- Title(参考訳): MVRキャッシュ:マルチベクトル検索と学習プロンプトセグメンテーションによるセマンティックキャッシングの最適化
- Authors: Ali Noshad, Zishan Zheng, Yinjun Wu,
- Abstract要約: 検索精度を大幅に向上させる新しいセマンティックキャッシング手法であるMVR-cacheを導入する。
MVR-cacheは、知的に分割を促す学習可能なセグメンテーションモデルの上に構築されている。
最新の技術と比較すると、MVRキャッシュはキャッシュヒット率を最大37%向上させる。
- 参考スコア(独自算出の注目度): 4.3943116175907315
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: To reduce LLM costs and latency, semantic caching systems must accurately identify when a new prompt matches a cached one. Current methods often rely on simplistic similarity measures, which limit their effectiveness. We introduce MVR-cache, a novel semantic caching approach that significantly improves retrieval accuracy by integrating Multi-Vector Retrieval (MVR). MVR-cache is built upon a learnable segmentation model that intelligently splits prompts, enabling fine-grained similarity comparisons via MaxSim. We derive the model's training objective from a rigorous theoretical analysis. This can ensure that optimizing this objective directly maximizes cache hits under strict correctness constraints. To solve the resulting non-differentiable combinatorial optimization problem, we leverage a reinforcement learning-based training strategy with the theoretically grounded objectives as the reward. Experimental results on established benchmarks across diverse tasks confirm that in comparison to the state-of-the-art, MVR-cache consistently increases the cache hit rates by up to 37% while maintaining the same correctness guarantees. MVR-cache is available at https://github.com/PKU-SDS-lab/MVR-Cache
- Abstract(参考訳): LLMのコストとレイテンシを低減するために、セマンティックキャッシングシステムは、新しいプロンプトがキャッシュされたプロンプトといつ一致しているかを正確に識別する必要がある。
現在の方法はしばしば、その効果を制限する単純な類似度尺度に頼っている。
MVR-cacheは,Multi-Vector Retrieval(MVR)を統合することで,検索精度を大幅に向上するセマンティックキャッシング手法である。
MVR-cacheは学習可能なセグメンテーションモデルに基づいて構築されており、プロンプトをインテリジェントに分割し、MaxSimを介して詳細な類似性比較を可能にする。
我々は厳密な理論的分析からモデルの訓練目標を導出する。
これにより、この目的を最適化することで、厳密な正当性制約の下でキャッシュヒットを直接最大化することが可能になる。
結果として生じる非微分不可能な組合せ最適化問題を解決するために,理論上基礎となる目的を報酬として強化学習に基づくトレーニング戦略を活用する。
様々なタスクにわたる確立されたベンチマーク実験の結果、MVRキャッシュは最新技術と比較してキャッシュヒット率を最大37%向上し、同じ正確性保証を維持していることを確認した。
MVR-cacheはhttps://github.com/PKU-SDS-lab/MVR-Cacheで利用可能である。
関連論文リスト
- MemShare: Memory Efficient Inference for Large Reasoning Models through KV Cache Reuse [14.695547830142516]
大規模推論モデル(LRM)は数学的推論や形式論理のタスクにおいて大きな進歩を遂げた。
長い連鎖配列を生成する傾向は、推論中にかなりのメモリオーバーヘッドを引き起こす。
メモリオーバーヘッドを効果的に低減する新しいKVキャッシュ管理手法であるMemShareを提案する。
論文 参考訳(メタデータ) (2025-07-29T02:05:51Z) - vCache: Verified Semantic Prompt Caching [95.16654660556975]
本稿では,ユーザ定義エラー率保証を備えた最初の検証済みセマンティックキャッシュであるvCacheを提案する。
オンライン学習アルゴリズムを使用して、キャッシュされたプロンプト毎に最適な閾値を推定し、追加のトレーニングなしで信頼性の高いキャッシュ応答を可能にする。
我々の実験によると、vCacheは特定のエラー境界を一貫して満たし、最先端の静的な閾値と微調整された埋め込みベースラインより優れています。
論文 参考訳(メタデータ) (2025-02-06T04:16:20Z) - MPIC: Position-Independent Multimodal Context Caching System for Efficient MLLM Serving [28.024240207609854]
本稿では,マルチモーダル情報管理におけるより効果的な手法として,位置独立キャッシングを提案する。
我々は,システムレベルの課題とアルゴリズムレベルの課題に対処するため,MPICというキャッシングシステムの設計と実装を行った。
論文 参考訳(メタデータ) (2025-02-04T03:13:09Z) - XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference [9.65524177141491]
大規模言語モデル(LLM)推論は出力トークンを1つずつ生成し、多くの冗長な計算に繋がる。
KV-Cacheフレームワークは時間と空間の複雑さを妥協する。
既存の研究では、推論精度に重要でないキャッシュデータの一部を削除することで、メモリ消費を減らすことができる。
各レイヤのキャッシュサイズをパーソナライズしてカスタマイズすることで,メモリの大幅な削減が期待できることを示す。
論文 参考訳(メタデータ) (2024-12-08T11:32:08Z) - PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation [97.41972925670508]
大規模視覚言語モデル(LVLM)は、推論中に重要な計算とメモリオーバーヘッドを引き起こす。
ここでは、PrefixKVについて述べる。ここでは、Prefixは、元のシーケンスの位置ではなく、重要度に基づいて、上位ランクのKVを意味する。
本手法は他の手法と比較して最先端の性能を実現する。
論文 参考訳(メタデータ) (2024-12-04T15:48:59Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - CORM: Cache Optimization with Recent Message for Large Language Model Inference [57.109354287786154]
メモリフットプリントを大幅に最小化するKVキャッシュを最適化する革新的な手法を提案する。
KVキャッシュ消去ポリシーであるCORMは、モデル微調整を必要とせずに、推論に必要なキーと値のペアを動的に保持する。
検証の結果,CORMはKVキャッシュの推論メモリ使用量を最大70%削減し,LongBenchの6つのタスクで性能劣化を無視できることがわかった。
論文 参考訳(メタデータ) (2024-04-24T16:11:54Z) - Accelerating Deep Learning Classification with Error-controlled
Approximate-key Caching [72.50506500576746]
我々は、近似キーキャッシングと名付けた新しいキャッシングパラダイムを提案する。
近似キャッシュはDL推論の負荷を軽減し、システムのスループットを向上するが、近似誤差を導入する。
我々は古典的なLRUと理想的なキャッシュのキャッシュシステム性能を解析的にモデル化し、期待される性能のトレース駆動評価を行い、提案手法の利点を最先端の類似キャッシュと比較した。
論文 参考訳(メタデータ) (2021-12-13T13:49:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。