論文の概要: Which Eviction Policy Should an LLM Cache Use? A Systematic Study Across Workloads, Capacities, and Encoders
- arxiv url: http://arxiv.org/abs/2608.20280v1
- Date: Thu, 20 Aug 2026 17:14:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.658313
- Title: Which Eviction Policy Should an LLM Cache Use? A Systematic Study Across Workloads, Capacities, and Encoders
- Title(参考訳): LLMキャッシュはどれを使うべきか? ワークロード、能力、エンコーダの体系的研究
- Authors: Yash Kulkarni, Shubham Harkare, Arvind Suresh Yogesh Babu,
- Abstract要約: 3つの順序付き重複クエリコーパス,3つのキャッシュ容量,2つのエンコーダにまたがるセマンティック・冗長性ポリシーを評価する。
評価された政策は, いずれの設定でも0.041ポイント以上改善されない。
- 参考スコア(独自算出の注目度): 1.4719924357068723
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Semantic caches reuse an LLM response when the incoming query embedding lies near a cached query, but proposed eviction policies have rarely been compared under one protocol. Using CLEVER, we evaluate FIFO, LRU, LFU, ARC, GDSF, a single-pass streaming adaptation of SISO, and a semantic-redundancy policy across three ordered, deduplicated query corpora, three cache capacities, and two encoders. No evaluated policy improves on LFU by more than 0.041 percentage points in any of the eighteen settings. Replacement is not irrelevant: FIFO and streaming SISO trail LFU by as much as 8.67 and 8.55 points, respectively, at tight capacity. We explain the missing upside with a conditional packing result. Under exact lookup and insert-on-miss, a newly inserted entry cannot have a resident neighbor within the hit radius, so a geometry-aware eviction rule receives little new redundancy signal. A separate audit exposes a larger problem with the evaluated operating point. At MiniLM's median nearest-neighbor threshold, only 2.1-3.9% of sampled LMSYS and QQP hits are judged answer-substitutable, reducing raw hit rates of 51-60% to quality-adjusted rates of 1.1-2.2%. The cross-encoder study further shows that thresholds do not transfer between embedding models. LFU is the strongest simple default in this protocol; deployment decisions should first establish answer validity and then test sub-point policy differences with exact search.
- Abstract(参考訳): セマンティックキャッシュは、入ってくるクエリの埋め込みがキャッシュされたクエリの近くにある場合、LSM応答を再利用するが、提案された消去ポリシーを1つのプロトコルで比較することは滅多にない。
CLEVERを用いて、FIFO、LRU、LFU、ARC、GDSF、SISOのシングルパスストリーミング適応、および3つの順序付き重複クエリコーパス、3つのキャッシュ容量、2つのエンコーダのセマンティック・冗長性ポリシーを評価する。
評価された政策は, いずれの設定でも0.041ポイント以上改善されない。
FIFOとストリーミングSISOトレイルLFUはそれぞれ8.67ポイントと8.55ポイントの厳しい容量で置き換えられる。
条件付き梱包結果の欠落について説明する。
正確なルックアップと挿入オンミスの下では、新たに挿入されたエントリは、ヒット半径内に隣接した隣人を持つことができないため、幾何認識の消去規則は、ほとんど新しい冗長信号を受け取らない。
別個の監査は、評価された操作点に関するより大きな問題を露呈する。
MiniLMの最寄りの閾値では、サンプルのLMSYSとQQPヒットの2.1-3.9%しか解答可能と判断されず、51-60%の生ヒット率から品質調整率1.1-2.2%まで低下している。
クロスエンコーダの研究は、しきい値が埋め込みモデル間で転送されないことも示している。
LFUは、このプロトコルで最強の単純なデフォルトであり、デプロイメントの決定は、まず答えの妥当性を確立し、次に正確な検索でサブポイントポリシーの違いをテストするべきである。
関連論文リスト
- Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - Decision-Aware Memory Cards: Counterfactual-Inspired Context Selection and Compression for Tool-Using LLM Agents [3.964533007623828]
現代の大規模言語モデル(LLM)エージェントは、行動の時点で決定に関連のある証拠を必要とする。
本稿では、事例コンテキストグラフを構築し、候補単位の決定指向ユーティリティを推定し、選択したエビデンスを型付きメモリカードに圧縮するCICLについて述べる。
CICLは、ツール使用エージェントの意思決定クリティカルコンテキストの測定、ランキング、圧縮のための実用的なレイヤを提供する。
論文 参考訳(メタデータ) (2026-06-06T13:02:28Z) - Sequential Consensus for Multi-Agent LLM Debates: A Wald-SPRT compute governor with calibration-based failure detection [0.0]
マルチエージェントの議論は事実と推論を改善するが、ほとんどのレシピは固定されたラウンドカウントを選択する。
我々は,LLM討論のプラグイン計算として,Wald's Sequential Probability Ratio Test (SPRT)を適用した。
GSM8Kでは、ルールは1.01ラウンド(4.06 LLMコール)で97.0%の精度で終了するが、15回のコールで固定5の討論では99.0%の精度で終了する。
MMLUでは、キャリブレーションされたKLは約0に崩壊し、ルール上限は2.1倍のコストで99.5%となる。
論文 参考訳(メタデータ) (2026-05-18T23:43:12Z) - Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models [20.61766907174782]
本稿では,動的境界評価(DBE)を提案する。これは各モデルの境界を積極的に把握し,グローバルに匹敵する難易度尺度に配置する。
DBEは、3つのアーティファクトを提供する: (i) 安全性、能力、真実性をカバーした校正項目銀行で、9ドルの基準LCMで検証された難易度ラベル付きで、 (ii) スキルガイド境界探索(SGBS)、 (ii) APIレベルクエリアクセスのみを使用して、所定のターゲットLSMの境界項目を見つける検索アルゴリズム、 (iii) 新しいLCMを統一能力尺度に配置し、ターゲットが外に落ちたときに適応的に評価セットを拡大する評価プロトコル。
論文 参考訳(メタデータ) (2026-05-07T13:15:31Z) - LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests [0.0]
コーディングエージェントとLLMベースのアプリケーションは、通常、潜在的に敏感なコンテンツをクラウドのLLM APIに送信し、ログ化、保持、トレーニングに使用されるか、召喚される可能性がある。
プライバシ保護型LCM要求に対する8つの手法の系統的実証評価を行った。
MCPやOpenAI互換のAPIと互換性のあるオープンソースシムで、全8つ(あるいはデプロイメントがまだ実現不可能な、牽引可能な研究段階のサブセット)を実装しています。
論文 参考訳(メタデータ) (2026-04-13T21:05:42Z) - vCache: Verified Semantic Prompt Caching [95.16654660556975]
本稿では,ユーザ定義エラー率保証を備えた最初の検証済みセマンティックキャッシュであるvCacheを提案する。
オンライン学習アルゴリズムを使用して、キャッシュされたプロンプト毎に最適な閾値を推定し、追加のトレーニングなしで信頼性の高いキャッシュ応答を可能にする。
我々の実験によると、vCacheは特定のエラー境界を一貫して満たし、最先端の静的な閾値と微調整された埋め込みベースラインより優れています。
論文 参考訳(メタデータ) (2025-02-06T04:16:20Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z) - Fake Alignment: Are LLMs Really Aligned Well? [91.26543768665778]
本研究では,複数質問とオープンエンド質問の相違点について検討した。
ジェイルブレイク攻撃パターンの研究にインスパイアされた我々は、これが不一致の一般化によって引き起こされたと論じている。
論文 参考訳(メタデータ) (2023-11-10T08:01:23Z) - Offline Minimax Soft-Q-learning Under Realizability and Partial Coverage [100.8180383245813]
オフライン強化学習(RL)のための値ベースアルゴリズムを提案する。
ソフトマージン条件下でのバニラQ関数の類似した結果を示す。
我々のアルゴリズムの損失関数は、推定問題を非線形凸最適化問題とラグランジフィケーションとしてキャストすることによって生じる。
論文 参考訳(メタデータ) (2023-02-05T14:22:41Z) - Minimax Off-Policy Evaluation for Multi-Armed Bandits [58.7013651350436]
有界報酬を用いたマルチアームバンディットモデルにおけるオフポリシー評価の問題点について検討する。
3つの設定でミニマックスレート・オプティマティックな手順を開発。
論文 参考訳(メタデータ) (2021-01-19T18:55:29Z) - Sparse Feature Selection Makes Batch Reinforcement Learning More Sample
Efficient [62.24615324523435]
本稿では,スパース線形関数近似を用いた高次元バッチ強化学習(RL)の統計的解析を行う。
候補となる機能が多数存在する場合,提案手法がバッチRLをより効率的にサンプリングできるという事実に光を当てる。
論文 参考訳(メタデータ) (2020-11-08T16:48:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。