論文の概要: KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems
- arxiv url: http://arxiv.org/abs/2510.12872v1
- Date: Tue, 14 Oct 2025 18:00:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-10-16 20:13:28.37026
- Title: KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems
- Title(参考訳): KVCOMM: 効率的なLLMベースのマルチエージェントシステムのためのオンラインクロスコンテキストKVキャッシュ通信
- Abstract要約: KVCOMMは、マルチエージェント推論における効率的なプリフィルを可能にする、トレーニング不要のフレームワークである。
KVCOMMはキャッシュされたサンプル終端アンカーのプールを参照することにより、共有コンテンツのKVキャッシュを推定し、調整する。
KVCOMMは多様なマルチエージェントワークロード間で70%以上の再利用率を達成する。
- 参考スコア(独自算出の注目度): 25.770173970846884
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-agent large language model (LLM) systems are increasingly adopted for complex language processing tasks that require communication and coordination among agents. However, these systems often suffer substantial overhead from repeated reprocessing of overlapping contexts across agents. In typical pipelines, once an agent receives a message from its predecessor, the full context-including prior turns-must be reprocessed from scratch, leading to inefficient processing. While key-value (KV) caching is an effective solution for avoiding redundant computation in single-agent settings where prefixes remain unchanged, it cannot be directly reused in multi-agent scenarios due to diverging prefixes introduced by agent-specific context extensions. We identify that the core challenge lies in the offset variance of KV-caches across agents. To address this, we propose KVCOMM, a training-free framework that enables efficient prefilling in multi-agent inference by reusing KV-caches and aligning cache offsets of overlapping contexts under diverse prefix contexts. KVCOMM estimates and adjusts KV-caches for shared content by referencing a pool of cached examples-termed anchors-that store observed cache deviations under varying prefixes. The anchor pool is maintained and updated online, allowing dynamic adaptation to distinct user requests and context structures. KVCOMM achieves over 70% reuse rate across diverse multi-agent workloads, including retrieval-augmented generation, math reasoning, and collaborative coding tasks, all without quality degradation. Particularly, when each fully-connected agent receives 1K input tokens with 512 prefix tokens and 512 output tokens under a five-agent setting, KVCOMM achieves up to 7.8x speedup compared to the standard prefill pipeline, reducing TTFT from ~430 ms to ~55 ms.
- Abstract(参考訳): マルチエージェント大規模言語モデル(LLM)システムは、エージェント間の通信と協調を必要とする複雑な言語処理タスクにますます採用されている。
しかしながら、これらのシステムはエージェント間で重複するコンテキストの再処理によってかなりのオーバーヘッドを被ることが多い。
典型的なパイプラインでは、エージェントが前者からメッセージを受け取ると、完全なコンテキストを含む以前のターンはスクラッチから再処理され、非効率な処理に繋がる。
キー値(KV)キャッシングは、プレフィックスが変更されていない単一エージェント設定で冗長な計算を避けるための有効なソリューションであるが、エージェント固有のコンテキスト拡張によって導入されたプレフィックスのばらつきにより、マルチエージェントシナリオで直接再利用することはできない。
中心となる課題は、エージェント間のKVカッチのオフセット分散にある。
そこで我々は,KV-cachesを再利用し,重複するコンテキストのキャッシュオフセットを様々なプレフィックスコンテキスト下で整列させることにより,マルチエージェント推論における効率的なプリフィルを可能にするトレーニングフリーフレームワークであるKVCOMMを提案する。
KVCOMMは、キャッシュされたサンプル終端アンカーのプールを参照することにより、共有コンテンツのKVキャッシュを推定し、調整する。
アンカープールはオンラインで維持および更新され、異なるユーザリクエストとコンテキスト構造への動的適応を可能にする。
KVCOMMは、検索強化世代、数学推論、協調コーディングタスクなど、さまざまなマルチエージェントワークロード間で70%以上の再利用率を達成する。
特に、各完全接続エージェントが512のプレフィックストークンと512の出力トークンを持つ1K入力トークンを5エージェント設定で受信すると、KVCOMMは標準プリフィルパイプラインに比べて最大7.8倍のスピードアップを達成し、TTFTを430msから55msに短縮する。
関連論文リスト
- Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models [65.49950267695267]
我々はコヒーレンス保存コンテクスト蒸留によるパラメトリックメモリの効率的な圧縮フレームワークであるOmni2LoRAを紹介する。
本手法は,マルチモーダルメモリを固定予算で再利用可能なパラメータ状態に変換することにより,応答時間のマルチモーダルトーケン負荷をゼロにする。
論文 参考訳(メタデータ) (2026-08-10T07:49:10Z) - Learning Agent Execution for KV-Cache Management in Agentic Serving [25.021363822677515]
マルチエージェントLLMサービスのためのエージェント対応KV-cacheランタイム層であるCacheScoutを提案する。
鍵となる洞察は、将来のKV-cacheの再利用は、キャッシュのレイテンシ単独ではなく、エージェントの実行セマンティクスによって管理されることである。
CacheScout は KV-cache のヒット率を 10-18 ポイント改善し,平均 TTFT を 18-45% 削減し,平均 TTFT を 29-38% 削減し,ピークスループットを 57% 向上させることを示した。
論文 参考訳(メタデータ) (2026-07-16T22:28:19Z) - Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior [107.2098567818173]
Latent Recurrent Transformer (LRT) は自己回帰変換器の軽量化である。
LRTは、次のトークンのリカレントメモリとして、前のトークンから高レベルなソース層隠れステートを再利用する。
論文 参考訳(メタデータ) (2026-05-26T10:10:26Z) - LCGuard: Latent Communication Guard for Safe KV Sharing in Multi-Agent Systems [23.069920143607153]
大規模言語モデル(LLM)ベースのマルチエージェントシステムは、複雑なタスクをコーディネートするための中間的通信に依存している。
最近の研究は、特にトランスフォーマーキー値(KV)キャッシュによる遅延通信が効率を改善し、よりリッチなタスク関連情報を保存できることを示している。
マルチエージェントLLMシステムにおける安全なKVベースの潜在通信のためのフレームワークである textbfLCGuard を紹介する。
論文 参考訳(メタデータ) (2026-05-21T17:42:12Z) - AgentKVShift: Efficient KV Cache Reuse for Agentic Memory Systems [15.913507689262573]
AgentKVShift(エージェントKVShift)は、検索したメモリ単位ごとに動作させる訓練不要のプローブ誘導残差補正手法である。
我々は,AgentKVShiftがキャッシュの10~30%をリフレッシュしながら,ほぼ完全な再計算性能を実現することを示す。
このほぼフルに近いパフォーマンスに達するには最大5倍の低い再計算が必要で、以前の再利用メソッドは45~55%のリフレッシュしか得られない。
論文 参考訳(メタデータ) (2026-05-15T16:29:36Z) - RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse [5.597099794399441]
RelayCachingはトレーニング不要な推論手法で、前のエージェントから復号フェーズKVキャッシュを直接再利用する。
RelayCachingは80%以上のKVキャッシュの再利用を実現し、TTFTを標準パイプラインと比較して最大4.7倍のコストで削減できることを示す。
論文 参考訳(メタデータ) (2026-02-28T04:46:28Z) - Q-KVComm: Efficient Multi-Agent Communication Via Adaptive KV Cache Compression [0.0]
我々は,圧縮キー値(KV)キャッシュ表現をエージェント間で直接送信できる新しいプロトコルであるQ-KVCommを紹介する。
Q-KVCommはセマンティックな忠実さを維持しながら5-6倍の圧縮比を達成し、コヒーレンスの品質スコアはすべてのシナリオで0.77以上である。
我々の研究は、テキストベースの情報交換から表現ベースの情報交換へ移行し、LLMエージェント通信のための新しいパラダイムを確立する。
論文 参考訳(メタデータ) (2025-11-27T10:45:41Z) - JigsawComm: Joint Semantic Feature Encoding and Transmission for Communication-Efficient Cooperative Perception [7.867653563872962]
JigsawCommはエンドツーエンドのトレーニング、セマンティックアウェア、通信効率の良いCPフレームワークである。
正規化エンコーダを使用して、意味的関連性とスパースな特徴を抽出する。
軽量のFeature Utility Estimatorを使用して、各エージェントの機能を最終認識タスクへのコントリビューションを予測する。
論文 参考訳(メタデータ) (2025-11-21T23:36:24Z) - RCR-Router: Efficient Role-Aware Context Routing for Multi-Agent LLM Systems with Structured Memory [57.449129198822476]
RCRは、マルチエージェント大言語モデル(LLM)システムのためのロールアウェアコンテキストルーティングフレームワークである。
役割とタスクステージに基づいて、各エージェントに対して意味的に関連するメモリサブセットを動的に選択する。
軽量スコアリングポリシは、メモリ選択をガイドし、エージェント出力を共有メモリストアに統合する。
論文 参考訳(メタデータ) (2025-08-06T21:59:34Z) - Compress, Gather, and Recompute: REFORMing Long-Context Processing in Transformers [58.98923344096319]
REFORMは、2フェーズアプローチによって、長いコンテキストを効率的に処理する新しい推論フレームワークである。
RULERとBABILongでそれぞれ1Mコンテキスト長で50%以上と27%のパフォーマンス向上を達成した。
また、Infinite-BenchとMM-NIAHのベースラインを上回り、さまざまなタスクやドメインの柔軟性を示す。
論文 参考訳(メタデータ) (2025-06-01T23:49:14Z) - FlowKV: Enhancing Multi-Turn Conversational Coherence in LLMs via Isolated Key-Value Cache Management [48.904743679691414]
FlowKVはKVキャッシュ管理のための新しいマルチターン分離機構である。
蓄積された圧縮KVキャッシュを過去のターンから保存する。
古い文脈の再圧縮を防ぎ、破滅的な忘れを和らげる。
論文 参考訳(メタデータ) (2025-05-21T10:20:46Z) - KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse [35.97391418064724]
KVLinkは、大規模言語モデル(LLM)における効率的なキー値(KV)キャッシュ再利用のためのアプローチである。
KVLinkは、連結後のグローバルな位置と一致するように、推論時にKVキャッシュの位置埋め込みを調整することと、自己注意を回復するためにトレーニング可能な特別なトークンを使用することである。
7つのデータセットにわたる実験によると、KVLinkは最先端の手法よりも平均4%の精度で質問応答を改善する。
論文 参考訳(メタデータ) (2025-02-21T23:34:29Z) - QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache [67.84112700032007]
大きな言語モデル(LLM)は、長いコンテキスト設定のためにエッジデバイスにデプロイされることが増えている。
これらのシナリオでは、キーバリュー(KV)キャッシュがGPUメモリとレイテンシの両方において主要なボトルネックとなっている。
そこで本研究では,ターゲットモデルのアーキテクチャを共有するが,階層的な4ビット量子化KVキャッシュと4ビット量子化重みを併用して高速化を行う,新たな自己推論型デコーディングフレームワークであるQuantSpecを提案する。
論文 参考訳(メタデータ) (2025-02-05T20:43:48Z) - EPIC: Efficient Position-Independent Caching for Serving Large Language Models [19.510078997414606]
キャッシングは、リクエスト間でキーバリューベクトルを再利用することで、パフォーマンスを向上させる。
既存のコンテキストキャッシュでは、リクエストにまたがる正確なプレフィックスが必要である。
位置独立キャッシング (PIC) を導入し, プレフィックスによらず KV ベクトルのモジュラー再利用を可能にする。
また、新しいLegoLinkアルゴリズムを取り入れたサービスシステムEPICも導入しています。
論文 参考訳(メタデータ) (2024-10-20T08:42:29Z) - Training-Free Exponential Context Extension via Cascading KV Cache [49.608367376911694]
カスケードサブキャッシュバッファを利用して,最も関連性の高いトークンを選択的に保持する機構を導入する。
本手法は,1Mトークンのフラッシュアテンションと比較して,プリフィルステージ遅延を6.8倍削減する。
論文 参考訳(メタデータ) (2024-06-24T03:59:17Z) - LoCoCo: Dropping In Convolutions for Long Context Compression [77.26610232994508]
本稿では,Long Context Compression(LoCoCo)のための新しいアプローチであるDropping In Convolutionsを提案する。
LoCoCoは、固定サイズキーバリュー(KV)キャッシュのみを使用し、推論と微調整の両方のステージで効率を向上させることができる。
論文 参考訳(メタデータ) (2024-06-08T01:35:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。