論文の概要: StepCache: Step-Level Reuse with Lightweight Verification and Selective Patching for LLM Serving
- arxiv url: http://arxiv.org/abs/2603.28795v1
- Date: Tue, 24 Mar 2026 17:19:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:02.476377
- Title: StepCache: Step-Level Reuse with Lightweight Verification and Selective Patching for LLM Serving
- Title(参考訳): StepCache: LLM実行のための軽量検証と選択パッチ付きステップレベル再利用
- Abstract要約: StepCacheはバックエンドに依存しないステップレベルの再利用レイヤで、出力を順序付けられたステップに分割します。
StepCacheは、選択的パッチによって失敗したリージョンのみを再生する。
平均レイテンシは2.13秒から0.67秒、中央レイテンシは2.42秒から0.01秒、p95レイテンシは3.38秒から3.30秒に減少する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We address LLM serving workloads where repeated requests share a common solution structure but differ in localized constraints, such as output schema, variable names, or numeric constants. Prior caching approaches typically reuse either full responses (semantic caching) or model-internal KV/prefix states, which are respectively brittle under partial changes or tightly coupled to specific backends. We present StepCache, a backend-agnostic step-level reuse layer that segments outputs into ordered steps, retrieves the best-matching cached request, verifies steps using lightweight task-aware checks, and regenerates only failing regions via selective patching. StepCache additionally supports strict structured-output enforcement for JSON, including single-step extraction, required-key constraints, and one-shot repair, as well as conservative skip-reuse fallbacks for semantic changes. For linear equations, StepCache promotes verification into correction via a bounded repair loop with a deterministic fallback that guarantees correctness when the backend model fails. In a CPU-only perturbation-heavy micro-benchmark on math and JSON variants, averaged over three seeds, StepCache reduces mean latency from 2.13 s to 0.67 s, median latency from 2.42 s to 0.01 s, and p95 latency from 3.38 s to 3.30 s. It also reduces total token usage from 36.1k to 27.3k and improves end-to-end correctness from 72.5% to 100% under task-specific checks and a stitched-output integrity check. Across requests, 79.7% take the reuse-only fast path, 5.4% require patching, and 14.9% trigger skip-reuse.
- Abstract(参考訳): 繰り返し要求が共通のソリューション構造を共有するが、出力スキーマや変数名、数値定数といった局所的な制約が異なる、LLMサービスワークロードに対処する。
従来のキャッシュアプローチでは、一般的にフルレスポンス(セマンティックキャッシュ)またはモデル内部KV/プレフィックスステートを再利用する。
StepCacheはバックエンドに依存しないステップレベルの再利用レイヤで、出力を順序付けられたステップに分割し、最適なキャッシュ要求を検索し、軽量なタスク認識チェックを使用してステップを検証する。
StepCacheはまた、シングルステップの抽出、必須キーの制約、ワンショットの修復、セマンティックな変更に対する保守的なスキップ-再利用のフォールバックを含む、JSONの厳格な構造化出力の強制をサポートする。
線形方程式の場合、StepCacheは、バックエンドモデルが失敗する場合の正確性を保証する決定論的フォールバックで、境界付き修復ループによる検証の修正を促進する。
CPUのみの摂動重く、数学とJSONの変種に関するマイクロベンチマークでは、平均3つの種を平均して、StepCacheは平均レイテンシを2.13秒から0.67秒、中央レイテンシを2.42秒から0.01秒、p95レイテンシを3.38秒から3.30秒に短縮する。
また、総トークン使用量を36.1kから27.3kに減らし、タスク固有のチェックと縫合出力整合性チェックの下で、エンドツーエンドの正しさを72.5%から100%に改善する。
リクエスト全体では、79.7%が再利用のみの高速パス、5.4%がパッチが必要、14.9%がスキップ-リユースをトリガーする。
関連論文リスト
- Validating Hybrid-State Cache Recovery for GLM-5.3-Flash with vLLM and LMCache [6.185334606321749]
ハイブリッド言語モデルが一貫性のない状態から再開している間、外部キャッシュ転送が成功する。
既存のチェックポイントアライメント原理を45層GLM-5.3-Flashモデルに適用する。
論文 参考訳(メタデータ) (2026-09-14T04:46:09Z) - Shared KV Caching for Replicated 27B Inference: Correctness Failures and Performance Boundaries [6.185334606321749]
256 GiB LMCacheプールを共有する2つのシングルGPU 27B vLLMレプリカについて検討した。
複製を交互に行う6ターン合成セッションは、32kと128kの初期文脈で約35%と45%改善した。
論文 参考訳(メタデータ) (2026-09-14T04:37:44Z) - KVShareArena: KV-Cache Reuse Across Contexts and Model Checkpoints [14.86076891340077]
KVShare-cacheは、取得したチャンクとエージェントレポートのプロンプトコンテキストとモデルチェックポイントをまたいだ再利用を行う。
再計算を必要としない修正位置は、質問が一度に複数の情報源を必要とするまで十分である。
KVArena-cacheはキャッシュなしと完全再計算の間のギャップを割ってすべてのメソッドをスコアする。
論文 参考訳(メタデータ) (2026-09-09T14:53:45Z) - Same Request, Different Answer: Quantization Amplifies Cache-Induced Divergence in LLM Serving [0.0]
サービスエンジンがリクエスト間で共有プロンプトプレフィックスのキーと値テンソルを再利用するプリフィックスキャッシュは、主要なオープンソーススタックでデフォルトで有効になっている。
キャッシュを有効にし、2つのエンジンと4つの重み付けフォーマットで無効にする。
繰り返し実行はすべての構成においてビット識別され、800回中0回であり、他の非決定性源を0.5%に制限している。
論文 参考訳(メタデータ) (2026-09-04T05:27:34Z) - KeyPooling: Measuring Where LLM API Relay Paths Collapse Prompt Cache Isolation [53.952294884822955]
大規模言語モデル(LLM)APIは、顧客の認証を別々に行うが、多くの場合、共有プロバイダ認証を通じて要求を転送する。
KeyPoolingは、キャッシュのルックアップと書き込みを通じて顧客のアイデンティティをトレースする測定方法である。
すべての顧客がプロバイダ強化されたドメインに入る必要があります。
論文 参考訳(メタデータ) (2026-08-18T08:12:34Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Risk-Constrained Freshness-Aware Semantic Caching for Open-Web Retrieval-Augmented LLMs [0.0]
本稿では,キャッシュ再利用をリスク制約のある時間的推論問題として扱う3層セマンティックキャッシュであるFreshCacheを提案する。
FreshCacheは、その確率が回答、URLリスト、ページ内容の階層ごとのエラー予算を下回る場合にのみ、再利用を承認する。
24時間評価ウィンドウでは、FreshCache_MLPが97%の検索API保存を0.1%のハッシュベースのストールエラーで達成している。
論文 参考訳(メタデータ) (2026-07-05T12:47:36Z) - vCache: Verified Semantic Prompt Caching [95.16654660556975]
本稿では,ユーザ定義エラー率保証を備えた最初の検証済みセマンティックキャッシュであるvCacheを提案する。
オンライン学習アルゴリズムを使用して、キャッシュされたプロンプト毎に最適な閾値を推定し、追加のトレーニングなしで信頼性の高いキャッシュ応答を可能にする。
我々の実験によると、vCacheは特定のエラー境界を一貫して満たし、最先端の静的な閾値と微調整された埋め込みベースラインより優れています。
論文 参考訳(メタデータ) (2025-02-06T04:16:20Z) - Accelerating Diffusion Transformer via Error-Optimized Cache [17.666577782052205]
Diffusion Transformer (DiT) はコンテンツ生成の重要な方法である。
既存のキャッシュ手法は、前回のステップからDiT機能を再利用し、次のステップで計算をスキップすることで、生成を加速する。
我々はこの問題を解決するために textbfError-textbfOptimized textbfCache (textbfEOC) を提案する。
論文 参考訳(メタデータ) (2025-01-31T15:58:15Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - Training-Free Exponential Context Extension via Cascading KV Cache [49.608367376911694]
カスケードサブキャッシュバッファを利用して,最も関連性の高いトークンを選択的に保持する機構を導入する。
本手法は,1Mトークンのフラッシュアテンションと比較して,プリフィルステージ遅延を6.8倍削減する。
論文 参考訳(メタデータ) (2024-06-24T03:59:17Z) - MeanCache: User-Centric Semantic Caching for LLM Web Services [8.350378532274405]
キャッシングは、繰り返しクエリの推論コストを削減するための自然なソリューションである。
本稿では,LLMベースのサービスのためのユーザ中心セマンティックキャッシュであるMeanCacheを紹介する。
MeanCacheは、セマンティックに類似したクエリを特定して、キャッシュヒットやミスを判定する。
論文 参考訳(メタデータ) (2024-03-05T06:23:50Z) - Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference [78.65321721142624]
我々はキー値(KV)キャッシュによって課されるメモリボトルネックに焦点を当てる。
既存のKVキャッシュ手法は、比較的重要でないKVペアの大きなスワストを刈り取ったり、取り除いたりすることでこの問題に対処する。
本稿では,固定サイズキャッシュと退避型キャッシュを簡易に統合したLESSを提案する。
論文 参考訳(メタデータ) (2024-02-14T18:54:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。