論文の概要: StepKV: Step-Aware KV Cache Compression for LLM Agents
- arxiv url: http://arxiv.org/abs/2609.22158v2
- Date: Tue, 22 Sep 2026 07:50:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.748995
- Title: StepKV: Step-Aware KV Cache Compression for LLM Agents
- Title(参考訳): StepKV:LDMエージェントのためのステップ対応KVキャッシュ圧縮
- Abstract要約: キーバリュー(KV)キャッシングは、効率的な自己回帰型大言語モデル(LLM)推論に不可欠である。
KVキャッシュ圧縮はこのコストを軽減し、キャッシュされたトークンのサブセットだけを保持する。
StepKVは、推論ステップをファーストクラスの保持ユニットとして扱うことで、この目標に対処する。
- 参考スコア(独自算出の注目度): 48.99760785589948
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Key-value (KV) caching is essential for efficient autoregressive large language model (LLM) inference, but the cache grows linearly with context length, increasing storage and decoding costs. KV cache compression mitigates this cost by retaining only a subset of cached tokens. This challenge is particularly important for multi-step LLM agents, where a query expands into trajectories of reasoning, tool interactions, and retrieved observations. Existing pruning methods typically treat the cache as a flat token stream and rank tokens by recency or attention saliency. This creates a mismatch between the unit of compression and the unit of reasoning: token-level pruning removes individual entries, whereas useful information in multi-step agents is often organized into reasoning steps with uneven and delayed importance. Consequently, an early observation or intermediate decision may receive little recent attention yet remain essential for later evidence synthesis. We term this failure mode Reasoning Continuity Disruption.These observations motivate KV cache compression that jointly considers token- and reasoning-step-level information. StepKV addresses this goal by treating reasoning steps as first-class retention units. It associates cache entries with their generating steps, estimates step utility from trajectory-derived signals, and combines this utility with token-level saliency. The resulting scores globally rank prunable tokens, from which StepKV retains the top-scoring entries under a target budget. StepKV thus provides a step-centric perspective for agent KV cache compression. Across multi-hop QA and long-horizon web reasoning tasks, StepKV sustains accuracy under low KV budgets where token-level baselines degrade sharply, offering a more robust efficiency-accuracy trade-off for multi-step agent inference.
- Abstract(参考訳): キーバリューキャッシュ(KV)は、効率的な自己回帰型大言語モデル(LLM)推論に必須であるが、キャッシュはコンテキスト長、ストレージの増加、デコードコストの増大とともに線形に増大する。
KVキャッシュ圧縮はこのコストを軽減し、キャッシュされたトークンのサブセットだけを保持する。
この課題は多段階のLCMエージェントにとって特に重要であり、クエリは推論、ツールの相互作用、および検索された観察の軌跡へと拡張される。
既存のプルーニング手法では、キャッシュを平らなトークンストリームとして扱うのが一般的である。
トークンレベルのプルーニングは個々のエントリを削除しますが、マルチステップエージェントの有用な情報は、不均一で遅延された重要性を持つ推論ステップにまとめられます。
その結果、初期の観察や中間的な決定はほとんど注目されないが、後続の証拠合成には不可欠である。
これらの観測はKVキャッシュの圧縮を動機付け、トークンと推論ステップの情報を共同で検討する。
StepKVは、推論ステップをファーストクラスの保持ユニットとして扱うことで、この目標に対処する。
キャッシュエントリを生成ステップに関連付け、トラジェクトリ由来の信号からステップユーティリティを推定し、このユーティリティとトークンレベルのサリエンシを結合する。
結果のスコアは全世界でプルナブルトークンにランク付けされ、そこからStepKVは目標予算の下で上位のスコアを保持できる。
StepKVはエージェントKVキャッシュ圧縮のためのステップ中心の視点を提供する。
マルチホップQAとロングホライズンWeb推論タスク全体で、トークンレベルのベースラインが急激に低下するKV予算の下で、StepKVは精度を保ち、マルチステップエージェント推論のためのより堅牢な効率-精度トレードオフを提供する。
関連論文リスト
- CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration [67.17709877327232]
ケイトKVは、一貫したヘッドに対して重要なトークン情報のみを保持するハイブリッドKVキャッシュ方式である。
Cate KV はメモリ使用量を最大$2.72 times$に減らし、シングルサンプル入力で$2.18times$に減らした。
論文 参考訳(メタデータ) (2026-08-31T06:02:37Z) - Kwai Summary Attention Technical Report [69.40814939510126]
長文の能力は、次世代の大規模言語モデルの最も重要な方向性の1つになっている。
標準ソフトマックスアテンションは、シーケンスの長さに関して2次時間複雑性を示す。
歴史的文脈を圧縮することでシーケンスモデリングコストを削減する新しいアテンションメカニズムであるKwai Summary Attention (KSA)を提案する。
論文 参考訳(メタデータ) (2026-04-27T12:59:53Z) - Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs [26.951325519894525]
本稿では,軽量保持ゲートを介して各トークンの創出時の本質的な重要性を学習する手法を提案する。
我々は,特に低メモリ環境において,強い信念と学習可能な検索ベースラインを一貫して上回ることを示す。
一部の設定ではフルキャッシュモデルを超えており、選択的な保持が正規化の一形態として機能することを示している。
論文 参考訳(メタデータ) (2025-12-03T00:20:35Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - More Tokens, Lower Precision: Towards the Optimal Token-Precision Trade-off in KV Cache Compression [71.42818367729573]
大規模言語モデル(LLM)では、KVキャッシュのメモリ使用量は推論において重大なボトルネックとなっている。
KVプルーニングやKV量子化を含む主流のKV圧縮法は、主にトークンまたは精度寸法を別々に扱う。
本稿では,KVキャッシュ圧縮におけるトークン精度トレードオフを包括的に検討する。
論文 参考訳(メタデータ) (2024-12-17T09:20:31Z) - Compressing KV Cache for Long-Context LLM Inference with Inter-Layer Attention Similarity [24.118503938098307]
textscPoDはトークンの重要度に応じてメモリを割り当てる。
textscPoDは、パフォーマンスを損なうことなく、KVキャッシュメモリ使用量を最大35%削減する。
論文 参考訳(メタデータ) (2024-12-03T08:29:27Z) - A Simple and Effective $L_2$ Norm-Based Strategy for KV Cache Compression [13.981807478365452]
キーバリューキャッシュサイズを減らすための既存のアプローチは、圧縮戦略を学ぶためのモデルを微調整するか、シーケンス長を減らすためにアテンションスコアを利用するかのいずれかである。
キャッシュされたKVペアに対して、$L$とアテンションスコアとの間に明らかな相関関係が見られ、キー埋め込みの低い$L$がデコード時に高いアテンションスコアをもたらす。
実験の結果,この単純な手法により,言語モデリングやニードル・イン・ア・ヘイスタックタスクでは50%,パスキー検索タスクでは90%,精度を損なうことなく,KVキャッシュサイズを50%削減できることがわかった。
論文 参考訳(メタデータ) (2024-06-17T11:35:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。