論文の概要: Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching
- arxiv url: http://arxiv.org/abs/2607.15516v1
- Date: Fri, 17 Jul 2026 00:03:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.71962
- Title: Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching
- Title(参考訳): キャッシュ対応プロンプト圧縮:LLM APIキャッシングのための2層コストモデル
- Abstract要約: AnthropicのSonnet 4.6 APIで,そのコストを実証的に評価した。
キャッシュ対応プロンプト圧縮(CAPC)を提案する。
CAPCはLongBench-v2の16/16構成で最も安価な戦略である。
- 参考スコア(独自算出の注目度): 7.336436436266022
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Production LLM deployments combine two cost-reduction primitives: prompt caching (a discounted rate for re-used token prefixes) and prompt compression (fewer tokens sent). The compression literature has standardized on query-aware methods that produce a different compressed prefix per query, mechanically invalidating the prefix-strict cache on every call. We characterize this cost empirically on Anthropic's Sonnet 4.6 API and find caching is far from the rho=1.0 ideal the literature assumes: Sonnet's cache has a two-tier architecture with a sharp threshold near 3,500 tokens, below which the hit rate plateaus at rho~0.83 across 30-call sessions. Our cost model predicts, and experiments confirm, that under realistic rho, query-aware compression beats naive caching at high compression ratios (r>=6). We propose Cache-Aware Prompt Compression (CAPC), pairing query-agnostic compression with explicit cache_control plus a tier-preserving ratio bound that prevents over-compression from pushing the cached prefix into the hot tier. CAPC is the cheapest strategy in 16/16 configurations on LongBench-v2, with mean savings of 49% over cache-only, 64% over query-aware compression, and 90% over vanilla, at quality within 0.05 of the uncompressed baseline. We validate CAPC on three production workloads: an enterprise tool-using assistant with a 94k-token schema prefix (51.7% cost reduction at r=3); a graphify knowledge-graph RAG pipeline across two codebases (9.3x vs cache-all on FastAPI, 2.4x on httpx); and the public tau-bench retail benchmark (50 tasks), where CAPC is the cheapest of four strategies with reward exactly equal to vanilla (both 36/50, p=1.00) while query-aware compression is the most expensive at +40.1% over vanilla -- the first production confirmation of the crossover model's negative-ROI prediction on a public benchmark.
- Abstract(参考訳): プロダクションLSMのデプロイには、プロンプトキャッシュ(再使用トークンプレフィックスの割引レート)とプロンプト圧縮(より少ないトークンの送信)という2つのコスト削減プリミティブが組み合わされている。
圧縮文献は、クエリ毎に異なる圧縮プレフィックスを生成するクエリ対応メソッドを標準化し、コール毎にプレフィックス制限キャッシュを機械的に無効化している。
我々は、AnthropicのSonnet 4.6 APIでこのコストを実証的に特徴付け、キャッシングはRho=1.0の理想とはかけ離れた理想であると考えている。
提案するコストモデルでは,現実的なrhoではクエリ対応圧縮が,高い圧縮比 (r>=6) で単純キャッシングに勝ることを確認した。
本稿では,キャッシュ・アウェア・プロンプト圧縮(CAPC)と明示的なキャッシュ制御によるクエリ非依存圧縮と,過剰圧縮がキャッシュプレフィックスをホット・ティアに押し込むのを防ぐ階層保存比バウンダリを提案する。
CAPCはLongBench-v2の16/16構成で最も安価な戦略であり、キャッシュオンリーで49%、クエリアウェア圧縮で64%、バニラで90%の節約が可能で、圧縮されていないベースラインの0.05以内である。
94k-tokenスキーマプレフィックス(r=3で51.7%のコスト削減),グラフ化知識グラフRAGパイプライン(FastAPIの9.3x対キャッシュオール,httpxの2.4x),パブリックタウベンチ小売ベンチマーク(50タスク)の3つの運用ワークロードに対してCAPCを検証する。
関連論文リスト
- VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference [53.883871460875234]
VoxZipは、セマンティックアンコールされたKVキャッシュ圧縮フレームワークである。
第1段階では、音声トークンを時間的に調整、圧縮、融合するために明示的なセマンティックアンカーとして自動音声認識(ASR)文字を使用する。
第2段階では、時間的に減衰した蓄積された注意に基づいて動的フィルタリング戦略を採用し、非定常トークンを除去する。
論文 参考訳(メタデータ) (2026-08-09T08:17:18Z) - How Query Visibility Changes KV-Cache Compression Rankings: A Matched-Budget Audit [5.366718741784969]
KV-cache圧縮法は、圧縮前にコンテキストに付加されたクエリで主に評価される。
本稿では,3つの自明なベースラインに対する6つの圧縮手法の一致した予算監査について述べる。
論文 参考訳(メタデータ) (2026-07-11T09:30:35Z) - FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference [0.0]
FreqDepthKVは、隣接層KV状態を共有低周波深さ成分とスパース高周波残差に分解する推論時キャッシュ圧縮法である。
軽量なオンラインプローブは、リコンストラクションに敏感なアテンションログへの貢献に応じて、アテンションヘッドを共有深度、残留深度、または正確なキャッシュモードに割り当てる。
FreqDepthKVは、長いコンテキストの質問応答、針の検索、要約、コード生成ベンチマークを通じて、かなり小さなキャッシュ予算の下でタスクの正確性を保持する。
論文 参考訳(メタデータ) (2026-07-07T17:26:28Z) - End-to-End Context Compression at Scale [81.70601323130997]
長期コンテキスト言語モデル推論は、KVキャッシュがコンテキスト長とともに増加するにつれて、メモリによってボトルネックとなる。
KVキャッシュを圧縮する最近の技術は、モデル品質を著しく低下させるか、あるいはかなりの時間を要するか、1つの長いプロンプトを圧縮するために計算する。
既存のアプローチは、精度-効率のフロンティア上のKVキャッシュ圧縮と競合しない。
論文 参考訳(メタデータ) (2026-06-08T15:43:16Z) - Grounded Cache Routing for Retrieval-Augmented Generation: When Is It Safe to Reuse an Answer? [0.0]
我々は、4つの安価なゲートが同時に保持されている場合にのみキャッシュされた応答を許容するエビデンス検証キャッシュルータであるGroundedCacheを提案する。
我々は、ヒットレートだけでなく、キャッシュ安全性をストレステストする6段階のワークロードを構築し、オペレーター向けメトリックであるunsafe-served rate (USR)を導入する。
2つのデータセットと12,000の実LLM世代(Qwen2.5-7B-Instruct on vLLM with Automatic Prefix Caching)、GroundedCacheはUSRをすべてのHotpotQAシステムで0.0%、mtRAGドキュメントドリフトで1.5%まで駆動する。
論文 参考訳(メタデータ) (2026-05-26T16:50:02Z) - KV Cache Transform Coding for Compact Storage in LLM Inference [2.20003167536462]
KVTCは、KVキャッシュをコンパクトなオンGPUとオフGPUストレージに圧縮する軽量トランスフォーメーションコーダである。
KVキャッシュの冗長性を活用することで、KVTCは推論と長文の精度を維持しながら最大20$times$圧縮を達成する。
我々は、AIME25、LiveCodeBench、GSM8K、MMLU、Qasper、RULER、MATH-500を含むベンチマークで、Llama 3、Mistral NeMo、R1-Qwen 2.5モデルでKVTCをテストする。
論文 参考訳(メタデータ) (2025-11-03T18:20:35Z) - Compressing Many-Shots in In-Context Learning [61.231471139896506]
マルチショットプロンプトを圧縮することにより,ICL推論のメモリと計算効率を向上させる手法を提案する。
まず,既存のプロンプト圧縮手法がマルチショット圧縮には有効でないことを示す。
本稿では,レイヤワイド圧縮手法であるMemComを提案する。
論文 参考訳(メタデータ) (2025-10-17T16:57:42Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - Lookahead Q-Cache: Achieving More Consistent KV Cache Eviction via Pseudo Query [48.52389201779425]
KVキャッシュメモリの使用は、長いテキストシーケンスで大幅に増加する。
プリフィルステージアテンションスコアを用いた既存のKVキャッシュ消去手法Pruneトークン
Lookahead Q-Cacheは、真のデコードステージクエリをよりよく近似するために、低コストの疑似ルックアヘッドクエリを生成する。
論文 参考訳(メタデータ) (2025-05-24T10:34:38Z) - R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search [61.4807238517108]
CoT(Chain-of-Thought)推論は、ステップバイステップの問題解決を可能にすることで、大きな言語モデル(LLM)を強化する。
CoTのLong-CoTへの拡張はトークン長の増加による計算オーバーヘッドを大幅に増加させる。
ローカル情報とコヒーレンスの両方を保存する2段階のチャンクレベル圧縮フレームワークであるR1-Compressを提案する。
論文 参考訳(メタデータ) (2025-05-22T16:06:59Z) - KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing [58.29726147780976]
我々は,層間をKVキャッシュで共有し,層間圧縮を実現する,textit KVSharerと呼ばれるプラグアンドプレイ方式を提案する。
実験の結果、textit KVSharerはKVキャッシュの計算を30%削減し、メモリ消費を削減できることがわかった。
我々は,textit KVSharerが既存の層内KVキャッシュ圧縮手法と互換性があることを検証する。
論文 参考訳(メタデータ) (2024-10-24T08:06:41Z) - ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification [19.985314022860432]
KVキャッシュは、再計算を避けるために、以前のトークンからキーと値の状態を格納する。
KVキャッシュ圧縮はトークンの正当性を識別し、重要でないトークンを積極的に圧縮しながら重要な情報を保存する。
LLMの高精度かつ効率的なKVキャッシュ量子化手法ZipCacheを提案する。
論文 参考訳(メタデータ) (2024-05-23T07:37:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。