論文の概要: CommitKV: Lifecycle-Aware KV Cache Compression via Commit Transitions for Multi-Turn Agents
- arxiv url: http://arxiv.org/abs/2608.07855v1
- Date: Sat, 08 Aug 2026 01:50:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.533291
- Title: CommitKV: Lifecycle-Aware KV Cache Compression via Commit Transitions for Multi-Turn Agents
- Title(参考訳): コミットKV:マルチスレッドエージェントのコミット遷移によるライフサイクル対応KVキャッシュ圧縮
- Abstract要約: CommitKVはコミット遷移を通じてKVライフサイクルを特定する。
様々なベンチマーク実験により、CommitKVはエージェントメモリの使用を減らし、エンドツーエンドの推論を高速化し、既存のKVキャッシュ圧縮手法よりも高い精度を達成することが示された。
- 参考スコア(独自算出の注目度): 35.61503438883196
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-turn Reasoning-and-Acting (ReAct) agents accumulate growing trajectories of reasoning, tool calls, and observations. Their key-value (KV) caches grow accordingly, increasing memory use and attention cost during model inference. Existing KV cache compression methods reduce these costs by evicting states with low attention scores. However, low attention in the current turn does not imply future irrelevance, as temporarily inactive information may become important later. Snapshot-based eviction methods therefore do not explicitly distinguish temporarily dormant information from information that appears to have completed its role. In this paper, we present CommitKV, which identifies KV lifecycles through commit transitions. Specifically, CommitKV first divides completed agent events into token pages and compares each eligible page's deletion effect before a tool-call commit and after the commit's returned observation has been incorporated. Based on these paired measurements, CommitKV distinguishes dormant pages from high-to-low completion candidates. It then applies a greedy joint test, accepting candidates for retirement only when their combined post-commit effect remains bounded. Finally, at a later compression checkpoint, accepted pages are excluded, a bounded set of pages awaiting post-commit measurement is protected, and the remaining KV states are retained within the cache budget using the same token indices for keys, values, and absolute positions. These mechanisms ensure that CommitKV can distinguish dormant information from information that has completed its observed role and can be safely removed. Experiments on various benchmarks show that CommitKV reduces agent memory use, accelerates end-to-end inference, and achieves higher accuracy than existing KV cache compression methods.
- Abstract(参考訳): マルチターン推論・実行(Reasoning-and-Acting、ReAct)エージェントは、推論、ツール呼び出し、観察の増大軌跡を蓄積する。
キー値(KV)キャッシュはそれに従って増大し、モデル推論時のメモリ使用量と注意コストが増大する。
既存のKVキャッシュ圧縮手法は、注意スコアの低い状態を除去することで、これらのコストを削減する。
しかし、その後、一時的に不活発な情報が重要になるため、現在の方向での注目度が低くなることは将来の無関係を示唆するものではない。
したがって、スナップショットに基づく消去法は、一時的に休息する情報をその役割を完了したと思われる情報と明確に区別しない。
本稿では,コミット遷移によるKVライフサイクルを識別するCommitKVを提案する。
具体的には、CommitKVは、完了したエージェントイベントをトークンページに分割し、ツールコールコミットの前とコミットの返却された観察が組み込まれた後の各ページの削除効果を比較する。
これらのペア測定に基づいて、CommitKVは休眠ページとハイ・ツー・ロー・コンプリート候補を区別する。
その後、greedy joint testを適用し、統合されたポストコミット効果が束縛されたままの場合にのみ、退職候補を受け入れる。
最後に、後続の圧縮チェックポイントにおいて、許容ページを除外し、コミット後測定待ちのページのバウンダリセットを保護し、鍵、値、絶対位置の同じトークンインデックスを使用して、残りのKV状態をキャッシュ予算内に保持する。
これらのメカニズムにより、CommitKVは、観察された役割を完了し、安全に除去できる情報から休息情報を識別することができる。
様々なベンチマーク実験により、CommitKVはエージェントメモリの使用を減らし、エンドツーエンドの推論を高速化し、既存のKVキャッシュ圧縮手法よりも高い精度を達成することが示された。
関連論文リスト
- ResKV: Reconstructing Omitted Attention Contributions for Fixed-Budget KV Cache Compression [25.24197102648478]
KVキャッシュ圧縮は、効率的な長文推論に不可欠である。
マージベースの代替手段は、より多くの情報を保持するが、正確に保持すべきキーと値を摂動することができる。
本稿では,固定KV予算を正確な主キャッシュとコンパクトな残留キャッシュに分割するResKVを提案する。
論文 参考訳(メタデータ) (2026-07-31T16:16:45Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs [97.36238579001544]
コンテキスト長が拡張された大規模言語モデル(LLM)は、キー値(KV)キャッシュに依存して、以前のトークンに対する注意をサポートする。
KVキャッシュを維持することは、KVキャッシュ圧縮メソッドを動機付け、かなりのメモリオーバーヘッドを引き起こす。
GRKVは,圧縮キャッシュとフルキャッシュのアテンション出力の差を直接最小化する,トレーニング不要なKV-cacheマージ手法である。
論文 参考訳(メタデータ) (2026-05-29T10:16:30Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - When Hidden States Drift: Can KV Caches Rescue Long-Range Speculative Decoding? [19.77569541429818]
投機的復号化はLLM推論を加速させるが、SOTAの隠れ状態に基づく起草者は長距離減衰に悩まされる。
我々はコンテキスト情報保存の観点から長距離減衰を再考する。
KVShotは3つの再利用パラダイムを比較する診断フレームワークである。
論文 参考訳(メタデータ) (2026-04-29T08:25:01Z) - Expected Attention: KV Cache Compression by Estimating Attention from Future Queries Distribution [2.894551569099569]
我々は、KVペアの重要性を予測し、将来のクエリがそれに参加するかを予測する、トレーニング不要な圧縮手法である、textbfExpected Attentionを紹介した。
本手法はプリフィルとデコードの両方のフェーズでシームレスに動作し,両シナリオにおいて常に最先端のベースラインよりも優れています。
$textbfweがKVPressをリリースした。KVキャッシュ圧縮メソッドの実装とベンチマークを可能にする包括的なライブラリだ。
論文 参考訳(メタデータ) (2025-10-01T08:12:14Z) - KeepKV: Eliminating Output Perturbation in KV Cache Compression for Efficient LLMs Inference [16.53643930310808]
KeepKVは、厳しいメモリ制約下で性能を保ちながら出力摂動を排除するために設計された、新しい適応KVキャッシュマージ手法である。
KeepKVはメモリ使用量を大幅に削減し、推論スループットを2倍以上に向上し、10%のKVキャッシュ予算でも優れた生成品質を維持している。
論文 参考訳(メタデータ) (2025-04-14T06:58:00Z) - More Tokens, Lower Precision: Towards the Optimal Token-Precision Trade-off in KV Cache Compression [71.42818367729573]
大規模言語モデル(LLM)では、KVキャッシュのメモリ使用量は推論において重大なボトルネックとなっている。
KVプルーニングやKV量子化を含む主流のKV圧縮法は、主にトークンまたは精度寸法を別々に扱う。
本稿では,KVキャッシュ圧縮におけるトークン精度トレードオフを包括的に検討する。
論文 参考訳(メタデータ) (2024-12-17T09:20:31Z) - No Token Left Behind: Reliable KV Cache Compression via Importance-Aware
Mixed Precision Quantization [31.806112535762367]
キーバリューキャッシングは、生成型大規模言語モデル(LLM)の推論速度とスループットを加速する重要な技術となっている。
論文 参考訳(メタデータ) (2024-02-28T06:34:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。