論文の概要: Probing the Prompt KV Cache: Where It Becomes Dispensable
- arxiv url: http://arxiv.org/abs/2605.30574v1
- Date: Thu, 28 May 2026 21:07:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.235978
- Title: Probing the Prompt KV Cache: Where It Becomes Dispensable
- Title(参考訳): プロンプトKVキャッシュの証明
- Abstract要約: 以前のKVキャッシュ圧縮スキームは、プリミティブキャッシュがデコード、ドロップまたは要約時に部分的に冗長であり、精度の低下が少ないことを実証的に示していた。
どのレイヤ、何個のデコードステップ、どの形式のプロンプトがタスクを壊さずにKVキャッシュに置換できるのか。
制御されたスプライス介入が層切断と復号ステップを乗り越え、この冗長性は内容ではなく形(チャットテンプレートの足場)であることを示す。
- 参考スコア(独自算出の注目度): 9.529147118376464
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Prior KV cache compression schemes empirically demonstrate that the prompt cache is partially redundant during decoding, dropping or summarising entries with little accuracy loss. We ask when and what kind of redundancy: at which layers, after how many decoding steps, and in what form can the prompt span KV cache be replaced without breaking the task. A controlled splice intervention swept over layer cutoff and decoding steps shows this redundancy is about form (chat template scaffolding) rather than content. Replacing the upper layer prompt span KV cache with KV cache from a chat template scaffold whose user content is a neutral filler recovers near clean accuracy, while zeroing the same slots collapses accuracy. The dissociation replicates across the Qwen3, Gemma 3, and Llama 3 families on multiple datasets.
- Abstract(参考訳): 以前のKVキャッシュ圧縮スキームは、プリミティブキャッシュがデコード、ドロップまたは要約時に部分的に冗長であり、精度の低下が少ないことを実証的に示していた。
どのレイヤ、何個のデコードステップ、どの形式のプロンプトがタスクを壊さずにKVキャッシュに置換できるのか。
制御されたスプライス介入が層切断と復号ステップを乗り越え、この冗長性は内容ではなく形(チャットテンプレートの足場)であることを示す。
上層プロンプトをKVキャッシュにKVキャッシュに置き換えることで、ユーザ内容が中立なフィラーであるチャットテンプレートスキャフォールトから、同じスロットをゼロにしながら、ほぼクリーンな精度を回復する。
解離は、複数のデータセット上のQwen3、Gemma 3、Llama 3ファミリーを複製する。
関連論文リスト
- KVShareArena: KV-Cache Reuse Across Contexts and Model Checkpoints [14.86076891340077]
KVShare-cacheは、取得したチャンクとエージェントレポートのプロンプトコンテキストとモデルチェックポイントをまたいだ再利用を行う。
再計算を必要としない修正位置は、質問が一度に複数の情報源を必要とするまで十分である。
KVArena-cacheはキャッシュなしと完全再計算の間のギャップを割ってすべてのメソッドをスコアする。
論文 参考訳(メタデータ) (2026-09-09T14:53:45Z) - SemPIC: Learning Semantic Position-Independent KV Caches [26.14495003304512]
emphSemPICはLoRA対応のWriterをトレーニングし、ネイティブなレイヤごとのドキュメントKVを振る舞いの蒸留を通じてコンパイルする。
KV Gradient Checkpointing – キャッシュされたKVをスレッディングすることなく、ピークトレーニングメモリを削減する。
論文 参考訳(メタデータ) (2026-07-30T11:45:24Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering [75.0394545769057]
KVキャッシュは、LLMプリフィルを介して歴史的なトークンのキーバリューを格納する。
MuKV は KV キャッシュ圧縮モジュールと半階層的検索手法を特徴とする手法である。
長時間ストリーミングのVideoQAベンチマークの実験では、MKVはメモリとオンラインQA効率を犠牲にすることなく、回答の正確性を大幅に向上することが示された。
論文 参考訳(メタデータ) (2026-05-21T10:13:03Z) - PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache [61.57938553036056]
トレーニング不要なKVキャッシュ管理手法であるPackCacheを導入し,KVキャッシュを3つの協調機構でコンパクト化する。
効率の面では、PackCacheは48フレームの長いシーケンスで1.7-2.2倍のエンドツーエンド生成を高速化する。
論文 参考訳(メタデータ) (2026-01-07T19:51:06Z) - KVReviver: Reversible KV Cache Compression with Sketch-Based Token Reconstruction [20.53279247581787]
スケッチアルゴリズムに基づく可逆的なKVキャッシュ圧縮手法であるKVReviverを提案する。
2kのコンテキストでは、同じエンドツーエンドの推論精度を維持しながら、KVキャッシュの予算の10%しか必要としない。
32kのコンテキストでは、同等または同等の精度の2%の精度の損失を達成する。
論文 参考訳(メタデータ) (2025-12-01T03:59:20Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - ReCalKV: Low-Rank KV Cache Compression via Head Reordering and Offline Calibration [69.57122277845293]
ReCalKVは,キーと値の調整を施した低ランクKVキャッシュ圧縮手法である。
キーズでは、構造的に類似した頭部をグループにクラスタリングし、より正確な低ランク近似を可能にするSimisity aware Recontext (HSR)を提案する。
本稿では,オフラインヘッドワイド値(OVC)を提案する。これはトレーニングなしでキャリブレーションデータを用いて,効率的に値予測行列を校正する。
論文 参考訳(メタデータ) (2025-05-30T08:49:27Z) - KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing [58.29726147780976]
我々は,層間をKVキャッシュで共有し,層間圧縮を実現する,textit KVSharerと呼ばれるプラグアンドプレイ方式を提案する。
実験の結果、textit KVSharerはKVキャッシュの計算を30%削減し、メモリ消費を削減できることがわかった。
我々は,textit KVSharerが既存の層内KVキャッシュ圧縮手法と互換性があることを検証する。
論文 参考訳(メタデータ) (2024-10-24T08:06:41Z) - CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion [15.344568214955688]
大規模な言語モデル(LLM)は、必要なコンテキストを提供するために、入力に複数のテキストチャンクを組み込むことが多い。
長いLLM入力のプリフィルを高速化するため、別のLLM入力のプレフィックスとしてコンテキストが再利用された場合、テキストのKVキャッシュをプリコンプリートし、KVキャッシュを再使用することができる。
本稿では,KVキャッシュを高速に組み合わせて,高価なプリフィルと同世代の品質を実現する方法を提案する。
論文 参考訳(メタデータ) (2024-05-26T06:00:17Z) - Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference [78.65321721142624]
我々はキー値(KV)キャッシュによって課されるメモリボトルネックに焦点を当てる。
既存のKVキャッシュ手法は、比較的重要でないKVペアの大きなスワストを刈り取ったり、取り除いたりすることでこの問題に対処する。
本稿では,固定サイズキャッシュと退避型キャッシュを簡易に統合したLESSを提案する。
論文 参考訳(メタデータ) (2024-02-14T18:54:56Z) - CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving [31.766738294505767]
CacheGenは、大きな言語モデルのための高速なコンテキストローディングモジュールである。
カスタムテンソルエンコーダを使用して、KVキャッシュをコンパクトなビットストリーム表現にエンコードする。
KVキャッシュの異なる部分の圧縮レベルを適用して、利用可能な帯域幅の変化に対処する。
論文 参考訳(メタデータ) (2023-10-11T07:08:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。