論文の概要: KVCMAS: Efficient KV cache Correction for Shared Context in Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2609.34060v2
- Date: Tue, 06 Oct 2026 04:25:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.216046
- Title: KVCMAS: Efficient KV cache Correction for Shared Context in Multi-Agent Systems
- Title(参考訳): KVCMAS:マルチエージェントシステムにおける共有コンテキストの効率的なKVキャッシュ補正
- Abstract要約: KVCMASは、コンパクトな低ランク状態を用いたクロスエージェントキャッシュ逸脱を表す。
追加の参照プリフィルなしで、エージェントワークフローに沿って修正をシームレスにチェーンする。
制御されたサービストレースの下では、KVキャッシュの共有なしに、推論よりも2.0倍のTTFTスピードアップを提供する。
- 参考スコア(独自算出の注目度): 12.768679406770984
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Prompt-specialized multi-agent systems enable multiple agents to share a model while performing complementary roles to solve complex tasks. However, agent-specific prefixes change the KV cache generated for the same shared context, causing each agent to repeatedly prefill the growing context and construct a separate cache with high computation and memory overhead. Selective recomputation reduces this redundancy but still retains substantial model execution, while existing delta correction methods either support only recurring context relations or maintain memory-intensive online correction states for dynamically changing context. For first seen shared context, these methods also construct a reference cache outside the agent workflow, and an approximate correction at the first agent affects the outputs passed to subsequent agents. We present KVCMAS, an online KV cache correction framework that represents cross-agent cache deviations using compact low-rank states and seamlessly chains corrections along the agent workflow without an additional reference prefill. This design supports dynamically changing shared context while preserving an exact first-agent cache. Across multiple language and vision-language workloads, KVCMAS matches or improves the accuracy of prior KV cache sharing methods while achieving the lowest TTFT under highly concurrent serving. Under controlled serving traces, it provides a 2.0x TTFT speedup over inference without KV cache sharing and reduces peak GPU memory by up to 3.7x relative to a prior KV cache correction method. These results establish KVCMAS as an accurate and scalable KV cache sharing approach for prompt-specialized multi-agent serving.
- Abstract(参考訳): Prompt-specialized multi-agent system では、複数のエージェントが複雑なタスクを解くために補完的な役割を担いながらモデルを共有することができる。
しかし、エージェント固有のプレフィックスは、同じ共有コンテキストで生成されたKVキャッシュを変更するため、各エージェントは、成長するコンテキストを繰り返しプリフィルし、高い計算とメモリオーバーヘッドを持つ別のキャッシュを構築する。
Selective recomputationは、この冗長性を減少させるが、実際のモデル実行は維持するが、既存のデルタ補正手法は、コンテキストリレーションのみをサポートするか、動的に変化するコンテキストに対してメモリ集約的なオンライン修正状態を維持するかのいずれかである。
最初の共有コンテキストの場合、これらのメソッドはエージェントワークフローの外で参照キャッシュを構築し、最初のエージェントでの近似補正は後続のエージェントに渡される出力に影響を与える。
KVCMASは、コンパクトな低ランク状態を用いたクロスエージェントキャッシュの偏差を表すオンラインKVキャッシュ補正フレームワークであり、参照前処理を追加せずにエージェントワークフローに沿ってシームレスに連鎖する。
この設計は、正確なファーストエージェントキャッシュを保持しながら、共有コンテキストの動的変更をサポートする。
複数の言語およびビジョン言語ワークロードで、KVCMASはKVキャッシュ共有手法の精度を一致または改善し、高い並列サービス下では最低のTTFTを達成する。
制御されたサービストレースの下では、KVキャッシュの共有を伴わない2.0x TTFTの速度アップを提供し、以前のKVキャッシュ補正法と比較してピークGPUメモリを最大3.7倍まで削減する。
これらの結果から,KVCMASは高速かつスケーラブルなKVキャッシュ共有手法として確立された。
関連論文リスト
- PReCache: Efficient KV Cache Sharing for Multi-LoRA Agents via Low-Rank Precomputation and Neutral Reconstruction [9.162948089580143]
マルチLORAエージェントシステムは、共通のバックボーンモデルを共有することで、効率的なロール計算を可能にする。
既存のKVキャッシュ共有メソッドは、この繰り返しプリフィルを減らすが、追加のトレーニングやアーキテクチャ上の制約が必要になる。
PReCacheはトレーニング不要のKVキャッシュ共有フレームワークで、PreLRSharedとReBaseSharedという2つの設計がある。
論文 参考訳(メタデータ) (2026-09-28T00:24:14Z) - ForkKV: Scaling Multi-LoRA Agent Serving via Copy-on-Write Disaggregated KV Cache [8.323914332215598]
Low-Rank Adaptation (LoRA)は、サービス中に重要なメモリフットプリントボトルネックを導入する。
LoRAの構造特性を活用することで、ForkKVはKVキャッシュを巨大な共有コンポーネントに物理的に分離する。
ForkKVは最先端のマルチLORAサービスシステムのスループットを最大3.0倍に向上することを示す。
論文 参考訳(メタデータ) (2026-04-07T18:52:25Z) - RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse [5.597099794399441]
RelayCachingはトレーニング不要な推論手法で、前のエージェントから復号フェーズKVキャッシュを直接再利用する。
RelayCachingは80%以上のKVキャッシュの再利用を実現し、TTFTを標準パイプラインと比較して最大4.7倍のコストで削減できることを示す。
論文 参考訳(メタデータ) (2026-02-28T04:46:28Z) - PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache [61.57938553036056]
トレーニング不要なKVキャッシュ管理手法であるPackCacheを導入し,KVキャッシュを3つの協調機構でコンパクト化する。
効率の面では、PackCacheは48フレームの長いシーケンスで1.7-2.2倍のエンドツーエンド生成を高速化する。
論文 参考訳(メタデータ) (2026-01-07T19:51:06Z) - KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems [25.770173970846884]
KVCOMMは、マルチエージェント推論における効率的なプリフィルを可能にする、トレーニング不要のフレームワークである。
KVCOMMはキャッシュされたサンプル終端アンカーのプールを参照することにより、共有コンテンツのKVキャッシュを推定し、調整する。
KVCOMMは多様なマルチエージェントワークロード間で70%以上の再利用率を達成する。
論文 参考訳(メタデータ) (2025-10-14T18:00:01Z) - GUI-KV: Efficient GUI Agents via KV Cache with Spatio-Temporal Awareness [75.00019285120878]
キーバリュー(KV)キャッシュは、これを緩和することができるが、フルキャッシュの保存は、画像重大なコンテキストでは禁じられている。
既存のキャッシュ圧縮手法はGUIの空間的および時間的冗長性を考慮しないため、最適化されていない。
再学習を必要としないGUIエージェントのKVキャッシュ圧縮方式であるGUI-KVを紹介する。
論文 参考訳(メタデータ) (2025-10-01T05:37:54Z) - dKV-Cache: The Cache for Diffusion Language Models [53.85291644298835]
Diffusion Language Models (DLMs) は自己回帰型言語モデルにとって有望な競合と見なされている。
本稿では,DLMの復調過程に対するKVキャッシュ機構,遅延KVキャッシュを提案する。
我々のアプローチは、異なるトークンが拡散過程を通して異なる表現力学を持つという観察によって動機付けられている。
論文 参考訳(メタデータ) (2025-05-21T17:32:10Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z) - CORM: Cache Optimization with Recent Message for Large Language Model Inference [57.109354287786154]
メモリフットプリントを大幅に最小化するKVキャッシュを最適化する革新的な手法を提案する。
KVキャッシュ消去ポリシーであるCORMは、モデル微調整を必要とせずに、推論に必要なキーと値のペアを動的に保持する。
検証の結果,CORMはKVキャッシュの推論メモリ使用量を最大70%削減し,LongBenchの6つのタスクで性能劣化を無視できることがわかった。
論文 参考訳(メタデータ) (2024-04-24T16:11:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。