論文の概要: Risk-Constrained Freshness-Aware Semantic Caching for Open-Web Retrieval-Augmented LLMs
- arxiv url: http://arxiv.org/abs/2607.04281v1
- Date: Sun, 05 Jul 2026 12:47:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.882736
- Title: Risk-Constrained Freshness-Aware Semantic Caching for Open-Web Retrieval-Augmented LLMs
- Title(参考訳): オープンWeb検索用LDMにおけるリスク制約付きフレッシュネス対応セマンティックキャッシング
- Abstract要約: 本稿では,キャッシュ再利用をリスク制約のある時間的推論問題として扱う3層セマンティックキャッシュであるFreshCacheを提案する。
FreshCacheは、その確率が回答、URLリスト、ページ内容の階層ごとのエラー予算を下回る場合にのみ、再利用を承認する。
24時間評価ウィンドウでは、FreshCache_MLPが97%の検索API保存を0.1%のハッシュベースのストールエラーで達成している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Semantic caching reduces the latency and cost of retrieval-augmented generation (RAG) by serving cached answers to semantically similar queries, but most existing methods do not model the time-varying freshness of open-web evidence. We present FreshCache, a three-tier semantic cache that treats cache reuse as a risk-constrained temporal inference problem: before approving a cache hit, FreshCache estimates the probability that the cached result is stale using a fitted exponential decay model enhanced by a learned MLP, and approves reuse only when that probability falls below a per-tier error budget across answers (epsilon = 0.10), URL lists (epsilon = 0.20), and page content (epsilon = 0.35). This allows the system to degrade gracefully as entries age rather than forcing a binary choice between a stale hit and a full pipeline execution. We introduce FreshCache-Bench, a benchmark of 8,072 base queries across five freshness classes with ground truth staleness labels drawn from real web snapshots at 1, 12, 24 hours, and 7 days after a baseline crawl, expanded to 31,201 queries via paraphrase generation. At the 24-hour evaluation window, FreshCache_MLP achieves 97% search API savings at 0.1% hash-based stale error, and an LLM-judge evaluation on 396 confirmed change pairs shows that only 34.3% of detected content changes actually affect answer correctness, placing true answer-affecting stale error at approximately 0.034%. The rule-based FreshCache achieves 98% search savings at 3.3% stale error under a temporal holdout calibration, outperforming SemanticTTL (14.9% stale, 72% saved), vCache (7.2% stale, 47% saved), and SCALM (5.2% stale, 96% saved). Ablations show the temporal risk gate accounts for an 11.6 point reduction in stale error over similarity-only reuse, and the learned MLP reduces stale error a further 3.2 points over the rule-based model.
- Abstract(参考訳): セマンティックキャッシュは、キャッシュされた回答をセマンティックに類似したクエリに提供することにより、検索強化生成(RAG)のレイテンシとコストを低減するが、既存のほとんどのメソッドは、オープンWebエビデンスの時間変化の鮮度をモデル化していない。
キャッシュヒットを承認する前に、FreshCacheは、キャッシュされた結果が、学習されたMLPによって強化されたインフレーション・インフレーション・インフレーション・インフレーション・モデルを用いて、安定化している確率を推定し、その確率が、回答(epsilon = 0.10)、URLリスト(epsilon = 0.20)、ページコンテンツ(epsilon = 0.35)にまたがる階層ごとのエラー予算を下回る場合にのみ、再利用を承認する。
これにより、システムは、古いヒットと完全なパイプライン実行の間のバイナリ選択を強制するのではなく、エントリの年齢として優雅に分解できる。
我々は,実Webスナップショットから1,12,24時間,7日後に抽出された真偽の正当性ラベルを持つ5つの新鮮度クラスの8,072のベースクエリのベンチマークであるFreshCache-Benchを紹介し,パラフレーズ生成により31,201クエリに拡張した。
24時間評価ウィンドウでは、FreshCache_MLPが97%の検索API保存を0.1%のハッシュベースのストールエラーで達成し、396の確認された変更ペアに対するLCM-judge評価では、検出されたコンテンツの変更の34.3%のみが回答の正当性に影響を与え、真に回答に影響を及ぼすストールエラーは約0.034%であることを示している。
ルールベースのFreshCacheは、時間的ホールドアウトキャリブレーションで3.3%のスタルエラーで98%の検索セーブを達成し、SemanticTTL(14.9%のスタル、72%のセーブ)、vCache(7.2%のスタル、47%のセーブ)、SCALM(5.2%のスタル、96%のセーブ)を上回った。
アブレーションにより、時間的リスクゲートは類似性のみの再利用よりも11.6ポイントのストールエラーを減少させ、学習されたMLPはルールベースモデルよりもさらに3.2ポイントのストールエラーを減少させる。
関連論文リスト
- Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Grounded Cache Routing for Retrieval-Augmented Generation: When Is It Safe to Reuse an Answer? [0.0]
我々は、4つの安価なゲートが同時に保持されている場合にのみキャッシュされた応答を許容するエビデンス検証キャッシュルータであるGroundedCacheを提案する。
我々は、ヒットレートだけでなく、キャッシュ安全性をストレステストする6段階のワークロードを構築し、オペレーター向けメトリックであるunsafe-served rate (USR)を導入する。
2つのデータセットと12,000の実LLM世代(Qwen2.5-7B-Instruct on vLLM with Automatic Prefix Caching)、GroundedCacheはUSRをすべてのHotpotQAシステムで0.0%、mtRAGドキュメントドリフトで1.5%まで駆動する。
論文 参考訳(メタデータ) (2026-05-26T16:50:02Z) - StepCache: Step-Level Reuse with Lightweight Verification and Selective Patching for LLM Serving [0.0]
StepCacheはバックエンドに依存しないステップレベルの再利用レイヤで、出力を順序付けられたステップに分割します。
StepCacheは、選択的パッチによって失敗したリージョンのみを再生する。
平均レイテンシは2.13秒から0.67秒、中央レイテンシは2.42秒から0.01秒、p95レイテンシは3.38秒から3.30秒に減少する。
論文 参考訳(メタデータ) (2026-03-24T17:19:26Z) - SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching [75.02865981328509]
キャッシュは、以前計算されたモデル出力をタイムステップで再利用することで計算を減らす。
本稿では,動的キャッシュポリシーであるSensitivity-Aware Caching(SenCache)を提案する。
SenCacheは、同様の計算予算の下で、既存のキャッシュメソッドよりも視覚的品質が向上する。
論文 参考訳(メタデータ) (2026-02-27T17:36:09Z) - CacheMind: From Miss Rates to Why -- Natural-Language, Trace-Grounded Reasoning for Cache Replacement [0.0]
Retrieval-Augmented Generation(RAG)とLarge Language Models(LLM)を使用してキャッシュトレースに対するセマンティック推論を可能にするツールであるCacheMindを紹介する。
アーキテクトは、"なぜPC Xに関連付けられたメモリアクセスが、より多くの排除を引き起こすのか?
キャッシュ置換問題に対するLCMベースの推論のための最初の検証済みベンチマークスイートであるCacheMindBenchを紹介する。
論文 参考訳(メタデータ) (2026-02-12T21:28:23Z) - Semantic Caching for Low-Cost LLM Serving: From Offline Learning to Online Adaptation [54.61034867177997]
キャッシング推論応答は、大きな言語モデルに他の前方を通さずに、それらを検索することができる。
従来の正確なキャッシュは、クエリ間のセマンティックな類似性を見落とし、不要な再計算をもたらす。
本稿では,未知のクエリおよびコスト分布下でのセマンティックキャッシュ消去のための,原則的,学習ベースのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-11T06:53:27Z) - vCache: Verified Semantic Prompt Caching [95.16654660556975]
本稿では,ユーザ定義エラー率保証を備えた最初の検証済みセマンティックキャッシュであるvCacheを提案する。
オンライン学習アルゴリズムを使用して、キャッシュされたプロンプト毎に最適な閾値を推定し、追加のトレーニングなしで信頼性の高いキャッシュ応答を可能にする。
我々の実験によると、vCacheは特定のエラー境界を一貫して満たし、最先端の静的な閾値と微調整された埋め込みベースラインより優れています。
論文 参考訳(メタデータ) (2025-02-06T04:16:20Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - MeanCache: User-Centric Semantic Caching for LLM Web Services [8.350378532274405]
キャッシングは、繰り返しクエリの推論コストを削減するための自然なソリューションである。
本稿では,LLMベースのサービスのためのユーザ中心セマンティックキャッシュであるMeanCacheを紹介する。
MeanCacheは、セマンティックに類似したクエリを特定して、キャッシュヒットやミスを判定する。
論文 参考訳(メタデータ) (2024-03-05T06:23:50Z) - Accelerating Deep Learning Classification with Error-controlled
Approximate-key Caching [72.50506500576746]
我々は、近似キーキャッシングと名付けた新しいキャッシングパラダイムを提案する。
近似キャッシュはDL推論の負荷を軽減し、システムのスループットを向上するが、近似誤差を導入する。
我々は古典的なLRUと理想的なキャッシュのキャッシュシステム性能を解析的にモデル化し、期待される性能のトレース駆動評価を行い、提案手法の利点を最先端の類似キャッシュと比較した。
論文 参考訳(メタデータ) (2021-12-13T13:49:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。