論文の概要: AgentKVShift: Efficient KV Cache Reuse for Agentic Memory Systems
- arxiv url: http://arxiv.org/abs/2607.21604v1
- Date: Fri, 15 May 2026 16:29:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.935224
- Title: AgentKVShift: Efficient KV Cache Reuse for Agentic Memory Systems
- Title(参考訳): AgentKVShift: エージェントメモリシステムのための効率的なKVキャッシュ再利用
- Abstract要約: AgentKVShift(エージェントKVShift)は、検索したメモリ単位ごとに動作させる訓練不要のプローブ誘導残差補正手法である。
我々は,AgentKVShiftがキャッシュの10~30%をリフレッシュしながら,ほぼ完全な再計算性能を実現することを示す。
このほぼフルに近いパフォーマンスに達するには最大5倍の低い再計算が必要で、以前の再利用メソッドは45~55%のリフレッシュしか得られない。
- 参考スコア(独自算出の注目度): 15.913507689262573
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Memory-augmented LLM agents maintain context across hundreds of interactions through agentic memory systems that actively curate retrieved content with LLM-generated metadata such as summaries, keywords, and tags. From an inference cost standpoint, every retrieval triggers a full re-encoding of these structured memory units into Key-Value (KV) states, which dominates prefill latency. Existing training-free KV reuse methods mitigate this by selectively recomputing a small fraction of tokens, but were designed for RAG-style raw passages and degrade on structured agentic memories. We present AgentKVShift, a training-free, probe-guided KV residual correction method that operates per retrieved memory unit. One of the crucial insights we demonstrate is that the per-memory KV reuse residual decomposes into a shared memory-level offset plus small token-wise fluctuations. Estimating this offset from a small probe set allows us to correct every reused token by a single weighted correction. Unlike prior reuse methods which decide which tokens to recompute and leave the rest of the cache stale, AgentKVShift also corrects the tokens it does not recompute, turning the refresh budget into useful signal across the entire chunk. Across four open-source LLMs spanning 3B to 32B parameters and two long-horizon agentic memory benchmarks (long-term dialogue and agentic applications), AgentKVShift achieves near full recompute performance while refreshing only 10-30% of the cache, outperforming baselines at the same recompute ratio. It requires up to 5x lower recompute to reach this near-full performance, which prior reuse methods only attain at 45-55% refresh. In this regime, AgentKVShift delivers prefill speedups of 2-3.5x over no-KV-reuse on a single A100. AgentKVShift orthogonally composes with KV cache quantization, retaining over 2x the F1 of prior reuse methods under aggressive 2- and 4-bit settings.
- Abstract(参考訳): メモリ拡張LDMエージェントは、検索したコンテンツを要約、キーワード、タグなどのLLM生成メタデータで積極的にキュレートするエージェントメモリシステムを通じて、数百のインタラクションのコンテキストを維持する。
推論コストの観点から、すべての検索は、これらの構造化メモリユニットをキーバリュー(KV)状態に完全に再エンコードする。
既存のトレーニング不要なKV再利用手法では、トークンの少数を選択的に再計算することでこれを緩和するが、RAGスタイルの生のパスのために設計され、構造化されたエージェントメモリで分解される。
本稿では,学習不要でプローブ誘導型KV残差補正手法であるAgentKVShiftについて述べる。
私たちが示した重要な洞察の1つは、メモリ単位のKV再利用が、共有メモリレベルのオフセットとトークン単位の小さなゆらぎに分解されるということです。
このオフセットを小さなプローブ集合から推定することで、すべての再利用トークンを1つの重み付き補正で修正することができる。
キャッシュスタルのどのトークンをリコンプリートするかを判断する以前の再利用方法とは異なり、AgentKVShiftは再コンプリートしないトークンを修正し、リフレッシュ予算をチャンク全体にわたって有用なシグナルに変換する。
3Bから32Bパラメータにまたがる4つのオープンソースLCMと2つの長い水平エージェントメモリベンチマーク(長期対話とエージェントアプリケーション)にまたがって、AgentKVShiftはキャッシュの10~30%だけをリフレッシュし、同じ再計算比でベースラインを上回っている。
このほぼフルに近いパフォーマンスに達するには最大5倍の低い再計算が必要で、以前の再利用メソッドは45~55%のリフレッシュしか得られない。
この体制では、エージェントKVShiftは1つのA100上で非KV再使用に対して2-3.5倍のプリフィル速度を提供する。
AgentKVShiftはKVキャッシュの量子化を直交的に構成し、アグレッシブな2ビットと4ビットの設定の下で、以前の再利用手法のF1の2倍の値を保持する。
関連論文リスト
- Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior [107.2098567818173]
Latent Recurrent Transformer (LRT) は自己回帰変換器の軽量化である。
LRTは、次のトークンのリカレントメモリとして、前のトークンから高レベルなソース層隠れステートを再利用する。
論文 参考訳(メタデータ) (2026-05-26T10:10:26Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - Echo: KV-Cache-Free Associative Recall with Spectral Koopman Operators [45.88028371034407]
スペクトルクープマン注意(SKA)を中心に構築されたKV-cacheフリー連想リコールアーキテクチャ
我々は、SKA(Spectral Koopman Attention)を中心に構築されたKV-cacheフリーな連想型リコールアーキテクチャであるEchoを紹介する。
論文 参考訳(メタデータ) (2026-05-07T22:26:27Z) - The Residual Stream Is All You Need: On the Redundancy of the KV Cache in Transformer Inference [3.378773775514883]
キー値(KV)キャッシュは、トランスフォーマー推論において必須の状態として広く扱われる。
各層におけるキーと値が残留ストリームの決定論的射影であることを証明する。
我々は、境界メモリ推論スキームであるKV-Directを用いて、この結果に基づいて構築する。
論文 参考訳(メタデータ) (2026-03-20T05:59:50Z) - RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse [5.597099794399441]
RelayCachingはトレーニング不要な推論手法で、前のエージェントから復号フェーズKVキャッシュを直接再利用する。
RelayCachingは80%以上のKVキャッシュの再利用を実現し、TTFTを標準パイプラインと比較して最大4.7倍のコストで削減できることを示す。
論文 参考訳(メタデータ) (2026-02-28T04:46:28Z) - KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning [8.216400469571084]
効率的な実施計画のためのKVキャッシュ型メモリ管理システムKEEPを提案する。
KEEPは,(1)混合粒度メモリグループによるKVキャッシュ再計算を低減する静的動的メモリ構築アルゴリズム,(2)異なるメモリグループ間の重要なクロスアテンションを動的に識別するマルチホップメモリ再計算アルゴリズム,(3)不均衡なKVキャッシュのロードと異なるレイヤ間のクロスアテンションを排除するレイヤバランスのメモリローディングという3つの重要なイノベーションを特徴としている。
論文 参考訳(メタデータ) (2026-02-27T01:48:07Z) - DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity [50.52392445266824]
そこで本稿では,KV表現における長距離間類似性と高共有遅延成分を動機とする残差ベースのKVキャッシュ圧縮フレームワークを提案する。
DeltaKVはトークンを捨てる代わりに、検索した履歴参照に対するセマンティックな残基をエンコードし、保存を著しく削減する。
実験によると、DeltaKVは、LongBench、SCBench、AIMEでほぼロスレスの精度を維持しながら、KVキャッシュメモリを元の29%に削減している。
論文 参考訳(メタデータ) (2026-02-08T15:14:36Z) - KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse [30.48395228595732]
KVLinkは、大規模言語モデル(LLM)における効率的なキー値(KV)キャッシュ再利用のためのアプローチである。
KVLinkは、連結後のグローバルな位置と一致するように、推論時にKVキャッシュの位置埋め込みを調整することと、自己注意を回復するためにトレーニング可能な特別なトークンを使用することである。
7つのデータセットにわたる実験によると、KVLinkは最先端の手法よりも平均4%の精度で質問応答を改善する。
論文 参考訳(メタデータ) (2025-02-21T23:34:29Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - Training-Free Exponential Context Extension via Cascading KV Cache [49.608367376911694]
カスケードサブキャッシュバッファを利用して,最も関連性の高いトークンを選択的に保持する機構を導入する。
本手法は,1Mトークンのフラッシュアテンションと比較して,プリフィルステージ遅延を6.8倍削減する。
論文 参考訳(メタデータ) (2024-06-24T03:59:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。