論文の概要: HijackKV: New Threat in Position-Independent KV Cache Reuse
- arxiv url: http://arxiv.org/abs/2607.19957v1
- Date: Wed, 22 Jul 2026 09:32:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.049036
- Title: HijackKV: New Threat in Position-Independent KV Cache Reuse
- Title(参考訳): HijackKV: 位置に依存しないKVキャッシュ再利用の新たな脅威
- Abstract要約: キーバリュー(KV)キャッシュは、大規模言語モデル(LLM)の推論遅延を低減する
この設計には新たな脅威であるKVキャッシュハイジャックが導入されている。
この脆弱性を体系的に活用する最初のアタックフレームワークであるHIJACKKVを紹介する。
- 参考スコア(独自算出の注目度): 18.183961370228833
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Key-Value (KV) cache reduces inference latency in large language models (LLMs). Traditional prefix-based reuse has low cache hit rates across inference requests because it requires exact token and position matches. To improve efficiency, recent system optimizations introduce position-independent KV reuse, allowing KV cache to be reused whenever identical text chunks appear, regardless of their position in the sequence. We show this design introduces a new threat, KV Cache Hijacking. Since KV caches are retrieved by token match but encode the context in which they were originally computed, the KV tied to a benign-looking token chunk may encode an attacker-controlled prefix. When later reused in a victim query, this contaminated KV silently hijacks the model's behavior, even if no attacker-controlled text appears in the input. We introduce HIJACKKV, the first attack framework that systematically exploits this vulnerability, demonstrating its severity and practicality. HIJACKKV optimizes an attacker-controlled prefix, so that the KV computed for a subsequent common benign text encodes the attacker's goal, while the text remains unchanged for future cache hits. HIJACKKV achieves an average 94% success rate in a single attempt, remains effective under realistic constraints including low hit rates (10%) and frequent recomputation (50%), persists over multi-turn interactions, and transfers across models in black-box settings. We further provide design insights for building secure KV reuse systems.
- Abstract(参考訳): キーバリュー(KV)キャッシュは、大きな言語モデル(LLM)の推論遅延を低減する。
従来のプレフィックスベースの再利用は、正確なトークンと位置マッチングを必要とするため、推論要求間のキャッシュヒット率を低くする。
効率を改善するために、最近のシステム最適化では位置に依存しないKVの再利用が導入されており、シーケンス内の位置に関係なく、同じテキストチャンクが現れるたびにKVキャッシュを再利用することができる。
この設計には新たな脅威であるKVキャッシュハイジャックが導入されている。
KVキャッシュはトークンマッチングによって検索されるが、最初に計算されたコンテキストをエンコードするので、良質なトークンチャンクに結び付けられたKVは攻撃者が制御したプレフィックスをエンコードすることができる。
後に被害者クエリで再利用された場合、この汚染されたKVは、たとえ攻撃者が制御したテキストが入力に現れなくても、モデルの動きを静かにハイジャックする。
我々は,この脆弱性を体系的に悪用した最初の攻撃フレームワークHIJACKKVを紹介し,その重大さと実用性を示す。
HIJACKKVは攻撃者が制御するプレフィックスを最適化するので、その後の一般的な良心テキストに対して計算されたKVは攻撃者の目標を符号化する。
HIJACKKVは1回の試行で平均94%の成功率を達成し、低ヒット率(10%)や頻繁な再計算(50%)といった現実的な制約の下で有効であり、マルチターンインタラクションを継続し、ブラックボックス設定でモデル間で転送する。
さらに、安全なKV再利用システムを構築するための設計上の洞察を提供する。
関連論文リスト
- AnchorKV: Safety-Aware KV Cache Compression via Soft Penalty with a Refusal Anchor [20.7510970936151]
大規模言語モデル(LLM)は、生成的推論や長いコンテキストタスクにおいて、以前のアーキテクチャよりも優れている。
その大きなサイズは、メモリ使用量、エネルギーコスト、デバイス上のデプロイメントにおいて大きな課題をもたらします。
有害なプロンプトに関連するキー空間の方向からトークン保持スコアをバイアスする,KVキャッシュ圧縮のドロップイン修正であるAnchorKVを提案する。
論文 参考訳(メタデータ) (2026-06-16T12:43:18Z) - KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression [3.9838043625801967]
推論言語モデルは長いチェーン・オブ・ソート(CoT)を生成する
CoTはデコードフェーズ中に大量のKVキャッシュを蓄積する。
KVキャッシュ圧縮はメモリオーバーヘッドを減らすための有望な手法として登場した。
論文 参考訳(メタデータ) (2026-05-01T15:54:13Z) - DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity [50.52392445266824]
そこで本稿では,KV表現における長距離間類似性と高共有遅延成分を動機とする残差ベースのKVキャッシュ圧縮フレームワークを提案する。
DeltaKVはトークンを捨てる代わりに、検索した履歴参照に対するセマンティックな残基をエンコードし、保存を著しく削減する。
実験によると、DeltaKVは、LongBench、SCBench、AIMEでほぼロスレスの精度を維持しながら、KVキャッシュメモリを元の29%に削減している。
論文 参考訳(メタデータ) (2026-02-08T15:14:36Z) - SpecAttn: Co-Designing Sparse Attention with Self-Speculative Decoding [3.47505166101801]
SpecAttnは、検証誘導スパースアテンションを持つ自己投機的復号法である。
バニラ自動回帰復号法よりも2.81$times$高いスループットと、最先端のパリティベースの復号法よりも1.29$times$高いスループットを実現している。
論文 参考訳(メタデータ) (2026-02-06T22:12:52Z) - KV-CAR: KV Cache Compression using Autoencoders and KV Reuse in Large Language Models [3.5171501100868876]
KVキャッシュはシーケンス長と埋め込み次元で成長し、しばしばモデル自体のメモリフットプリントを超える。
KV CARは,モデル忠実性を維持しつつ,KVキャッシュストレージを大幅に削減する,統一的で非依存なアーキテクチャフレームワークである。
Wikitext、C4、PIQA、WinograndeデータセットにわたるGPT 2とTinyLLaMAモデルの評価は、KV CARが最大47.85パーセントのKVキャッシュメモリ削減を達成したことを示している。
論文 参考訳(メタデータ) (2025-12-07T08:40:52Z) - KVReviver: Reversible KV Cache Compression with Sketch-Based Token Reconstruction [20.53279247581787]
スケッチアルゴリズムに基づく可逆的なKVキャッシュ圧縮手法であるKVReviverを提案する。
2kのコンテキストでは、同じエンドツーエンドの推論精度を維持しながら、KVキャッシュの予算の10%しか必要としない。
32kのコンテキストでは、同等または同等の精度の2%の精度の損失を達成する。
論文 参考訳(メタデータ) (2025-12-01T03:59:20Z) - Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference [17.46930265810127]
キーバリュー(KV)キャッシュは、冗長な計算を避けるために中間注意計算(キーとバリューペア)を格納する。
本稿では,攻撃者がKV-cacheから直接センシティブなユーザ入力を再構築できることを実証し,脆弱性の包括的解析を行った。
我々は,新しい,軽量で効率的な防御機構であるKV-Cloakを提案する。
論文 参考訳(メタデータ) (2025-08-13T02:48:25Z) - Cache Me If You Can: How Many KVs Do You Need for Effective Long-Context LMs? [79.58770714228983]
言語モデルは、書籍要約のようなタスクに対して、ますます長いコンテキストを扱う。
これによりキーバリュー(KV)キャッシュのメモリコストが増大する。
以前の多くの研究でKVをメモリから外す方法が提案されているが、そのアプローチは好ましい設定に適合している。
KVフットプリント*は、記憶中のKVエントリの量と寿命の両方を考慮し、統一された計量として提案する。
論文 参考訳(メタデータ) (2025-06-20T16:21:12Z) - R-KV: Redundancy-aware KV Cache Compression for Reasoning Models [77.84539432982307]
共振モデル(R-KV)のための冗長性を考慮したKVキャッシュ圧縮を提案する。
R-KVはKVキャッシュの10%しか使用せず、完全なKVキャッシュ性能のほぼ100%を保っている。
驚くべきことに、R-KVは完全なKVキャッシュ性能の105%を達成し、KVキャッシュの16%を達成している。
論文 参考訳(メタデータ) (2025-05-30T02:03:24Z) - FlowKV: Enhancing Multi-Turn Conversational Coherence in LLMs via Isolated Key-Value Cache Management [48.904743679691414]
FlowKVはKVキャッシュ管理のための新しいマルチターン分離機構である。
蓄積された圧縮KVキャッシュを過去のターンから保存する。
古い文脈の再圧縮を防ぎ、破滅的な忘れを和らげる。
論文 参考訳(メタデータ) (2025-05-21T10:20:46Z) - KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing [58.29726147780976]
我々は,層間をKVキャッシュで共有し,層間圧縮を実現する,textit KVSharerと呼ばれるプラグアンドプレイ方式を提案する。
実験の結果、textit KVSharerはKVキャッシュの計算を30%削減し、メモリ消費を削減できることがわかった。
我々は,textit KVSharerが既存の層内KVキャッシュ圧縮手法と互換性があることを検証する。
論文 参考訳(メタデータ) (2024-10-24T08:06:41Z) - PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling [38.732413451399]
ピラミッドKVは新規かつ効果的なKVキャッシュ圧縮法である。
提案手法は,KVキャッシュの12%しか保持せず,完全なKVキャッシュでモデルの性能と一致していることを示す。
Needle-in-a-Haystack実験では、Praamid KVは長文理解の維持において競合する手法より優れている。
論文 参考訳(メタデータ) (2024-06-04T07:51:30Z) - Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs [82.08922896531618]
大規模言語モデル(LLM)における生成推論のメモリフットプリントを削減するプラグイン・アンド・プレイ方式である適応KVキャッシュ圧縮を導入する。
我々は,アテンションモジュールの本質的な構造を明らかにするために,ターゲットプロファイリングを行う。
認識された構造に基づいて、我々はKVキャッシュを適応的に構築する: 注意頭上の長距離コンテキストを排除し、局所的なコンテキストを強調し、特別なトークンを中心とした注意頭上の特別なトークンを排除し、すべてのトークンに広く参加する注目頭に対して標準のKVキャッシュのみを使用する。
論文 参考訳(メタデータ) (2023-10-03T05:17:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。