論文の概要: LaCache: Robust Semantic Caching for LLM Serving
- arxiv url: http://arxiv.org/abs/2608.01718v1
- Date: Mon, 03 Aug 2026 05:31:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 21:56:46.377822
- Title: LaCache: Robust Semantic Caching for LLM Serving
- Title(参考訳): LaCache: LLMサービングのためのロバストなセマンティックキャッシング
- Abstract要約: キャッシュ・コリジョン・アタックに対処する新しいセマンティック・キャッシュ・スキームであるLaCacheを紹介する。
LaCacheはクエリのキャッシュヒットのみをチェックするのではなく、最初のkデコードされたトークンのキャッシュヒットをチェックする。
悪質な応答を同時に引き起こし、良質なクエリと衝突する敵クエリを作成できないことを実証する。
- 参考スコア(独自算出の注目度): 10.741523413040559
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Semantic caching, which reuses responses to semantically similar requests via their embeddings, has seen growing adoption in LLM serving, offering faster responses and reduced costs. Yet existing schemes are fundamentally vulnerable to cache-collision attacks, wherein an adversary pollutes the cache by injecting crafted queries, corrupting responses to subsequent legitimate requests. We present LaCache, a novel semantic caching scheme that addresses this vulnerability through a conceptually simple yet principled redesign. The key insight is that while the adversary has full control over the adversarial query, it has far less control over its response, which must simultaneously satisfy multiple semantic constraints. Rather than checking only the cache hit of a query, LaCache additionally checks the cache hit of its first k (speculatively) decoded tokens. This design yields two concrete benefits. First, it provides formally guaranteed resilience against cache-collision attacks: we prove that it is impossible to craft adversarial queries that simultaneously elicit malicious responses and collide with benign queries. Second, the enriched index supplies additional semantic context for cache retrieval, improving response relevance. Empirical evaluation across diverse LLMs and benchmarks validates both LaCache's security guarantees and efficiency gains, pointing to a promising direction for robust semantic caching.
- Abstract(参考訳): セマンティックキャッシュは、セマンティックに類似したリクエストに対する応答を埋め込みを通じて再利用するが、LLMサービスの採用が増加し、レスポンスの高速化とコスト削減を実現している。
しかし、既存のスキームはキャッシュ・コリエーション・アタックに根本的な脆弱性があり、敵は、工芸的なクエリを注入してキャッシュを汚染し、その後の正当な要求に対するレスポンスを損なう。
この脆弱性に対処する新しいセマンティックキャッシュスキームであるLaCacheを紹介します。
鍵となる洞察は、敵は敵のクエリを完全に制御するが、その応答に対する制御ははるかに少なく、同時に複数のセマンティック制約を満たさなければならないということである。
クエリのキャッシュヒットのみをチェックする代わりに、LaCacheは最初のk(特に)デコードされたトークンのキャッシュヒットをチェックする。
この設計は2つの具体的な利点をもたらす。
まず、キャッシュ・コリジョン・アタックに対して正式に保証されたレジリエンスを提供する。悪意のある応答を同時に引き起こし、良質なクエリと衝突する敵クエリを作成できないことを証明します。
第二に、リッチインデックスは、キャッシュ検索のための追加のセマンティックコンテキストを提供し、応答関連性を改善します。
多様なLLMとベンチマークによる実証的な評価は、LaCacheのセキュリティ保証と効率向上の両方を検証し、堅牢なセマンティックキャッシングの有望な方向性を示している。
関連論文リスト
- Web Cache Overflow: Exploiting Imprecise Keys for Cache Degradation and Beyond [3.374749757360864]
キャッシュキーに不要に含まれるリクエスト要素を悪用して、冗長なキャッシュエントリを生成することができることを示す。
影響を受けやすいデプロイメントでは、そのような重複コピーの持続的な生成は、キャッシュ効率を低下させ、元の負荷を増加させる。
我々は、正確なキャッシュキー設計が、この悪用ベクトルに対する最も直接的な緩和であり、セキュリティのベストプラクティスとして認識されるべきである、と結論付けている。
論文 参考訳(メタデータ) (2026-08-05T12:12:33Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching [75.02865981328509]
キャッシュは、以前計算されたモデル出力をタイムステップで再利用することで計算を減らす。
本稿では,動的キャッシュポリシーであるSensitivity-Aware Caching(SenCache)を提案する。
SenCacheは、同様の計算予算の下で、既存のキャッシュメソッドよりも視覚的品質が向上する。
論文 参考訳(メタデータ) (2026-02-27T17:36:09Z) - From Similarity to Vulnerability: Key Collision Attack on LLM Semantic Caching [7.164841206695704]
本稿では,キャッシュ衝突による整合性リスクに関する最初の体系的研究について述べる。
我々は、ブラックボックス衝突攻撃を起動する自動化フレームワークであるCacheAttackを紹介した。
金融エージェントに関するケーススタディでは、これらの脆弱性の現実的な影響が示されている。
論文 参考訳(メタデータ) (2026-01-30T15:37:00Z) - Semantic Caching for Low-Cost LLM Serving: From Offline Learning to Online Adaptation [54.61034867177997]
キャッシング推論応答は、大きな言語モデルに他の前方を通さずに、それらを検索することができる。
従来の正確なキャッシュは、クエリ間のセマンティックな類似性を見落とし、不要な再計算をもたらす。
本稿では,未知のクエリおよびコスト分布下でのセマンティックキャッシュ消去のための,原則的,学習ベースのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-11T06:53:27Z) - vCache: Verified Semantic Prompt Caching [95.16654660556975]
本稿では,ユーザ定義エラー率保証を備えた最初の検証済みセマンティックキャッシュであるvCacheを提案する。
オンライン学習アルゴリズムを使用して、キャッシュされたプロンプト毎に最適な閾値を推定し、追加のトレーニングなしで信頼性の高いキャッシュ応答を可能にする。
我々の実験によると、vCacheは特定のエラー境界を一貫して満たし、最先端の静的な閾値と微調整された埋め込みベースラインより優れています。
論文 参考訳(メタデータ) (2025-02-06T04:16:20Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - Hidden Web Caches Discovery [3.9272151228741716]
本稿では,タイミング解析を用いたキャッシュ検出手法を提案する。
このアプローチはキャッシュのステータスヘッダへの依存性を排除し、あらゆるWebサーバに適用できます。
論文 参考訳(メタデータ) (2024-07-23T08:58:06Z) - MeanCache: User-Centric Semantic Caching for LLM Web Services [8.350378532274405]
キャッシングは、繰り返しクエリの推論コストを削減するための自然なソリューションである。
本稿では,LLMベースのサービスのためのユーザ中心セマンティックキャッシュであるMeanCacheを紹介する。
MeanCacheは、セマンティックに類似したクエリを特定して、キャッシュヒットやミスを判定する。
論文 参考訳(メタデータ) (2024-03-05T06:23:50Z) - Accelerating Deep Learning Classification with Error-controlled
Approximate-key Caching [72.50506500576746]
我々は、近似キーキャッシングと名付けた新しいキャッシングパラダイムを提案する。
近似キャッシュはDL推論の負荷を軽減し、システムのスループットを向上するが、近似誤差を導入する。
我々は古典的なLRUと理想的なキャッシュのキャッシュシステム性能を解析的にモデル化し、期待される性能のトレース駆動評価を行い、提案手法の利点を最先端の類似キャッシュと比較した。
論文 参考訳(メタデータ) (2021-12-13T13:49:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。