論文の概要: ForkKV: Scaling Multi-LoRA Agent Serving via Copy-on-Write Disaggregated KV Cache
- arxiv url: http://arxiv.org/abs/2604.06370v1
- Date: Tue, 07 Apr 2026 18:52:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-09 17:30:51.189694
- Title: ForkKV: Scaling Multi-LoRA Agent Serving via Copy-on-Write Disaggregated KV Cache
- Title(参考訳): ForkKV: Copy-on-Write Disaggregated KVキャッシュによるマルチロラエージェントのスケーリング
- Authors: Shao Wang, Rui Ren, Lin Gui,
- Abstract要約: Low-Rank Adaptation (LoRA)は、サービス中に重要なメモリフットプリントボトルネックを導入する。
LoRAの構造特性を活用することで、ForkKVはKVキャッシュを巨大な共有コンポーネントに物理的に分離する。
ForkKVは最先端のマルチLORAサービスシステムのスループットを最大3.0倍に向上することを示す。
- 参考スコア(独自算出の注目度): 8.323914332215598
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The serving paradigm of large language models (LLMs) is rapidly shifting towards complex multi-agent workflows where specialized agents collaborate over massive shared contexts. While Low-Rank Adaptation (LoRA) enables the efficient co-hosting of these specialized agents on a single base model, it introduces a critical memory footprint bottleneck during serving. Specifically, unique LoRA activations cause Key-Value (KV) cache divergence across agents, rendering traditional prefix caching ineffective for shared contexts. This forces redundant KV cache maintenance, rapidly saturating GPU capacity and degrading throughput. To address this challenge, we introduce ForkKV, a serving system for multi-LoRA agent workflows centered around a novel memory management paradigm in OS: fork with copy-on-write (CoW). By exploiting the structural properties of LoRA, ForkKV physically decouples the KV cache into a massive shared component (analogous to the parent process's memory pages) and lightweight agent-specific components (the child process's pages). To support this mechanism, we propose a DualRadixTree architecture that allows newly forked agents to inherit the massive shared cache and apply CoW semantics for their lightweight unique cache. Furthermore, to guarantee efficient execution, we design ResidualAttention, a specialized kernel that reconstructs the disaggregated KV cache directly within on-chip SRAM. Comprehensive evaluations across diverse language models and practical datasets of different tasks demonstrate that ForkKV achieves up to 3.0x the throughput of state-of-the-art multi-LoRA serving systems with a negligible impact on generation quality.
- Abstract(参考訳): 大規模言語モデル(LLM)のサービスパラダイムは、複雑なマルチエージェントワークフローへと急速にシフトしている。
Low-Rank Adaptation (LoRA)は、これらの特殊なエージェントを単一のベースモデルで効率的にコホスティングすることを可能にするが、サービス中の重要なメモリフットプリントボトルネックを導入する。
具体的には、ユニークなLoRAアクティベーションは、キーバリュー(KV)キャッシュをエージェント間で分散させ、従来のプレフィックスキャッシュを共有コンテキストに非効率にする。
これにより、冗長なKVキャッシュのメンテナンス、GPU容量の急激な飽和、スループットの低下を余儀なくされる。
この課題に対処するために、OSの新たなメモリ管理パラダイムを中心としたマルチLORAエージェントワークフローのサービスシステムであるForkKVを紹介した。
LoRAの構造的特性を活用することで、ForkKVはKVキャッシュを巨大な共有コンポーネント(親プロセスのメモリページと類似)と軽量エージェント固有のコンポーネント(子プロセスのページ)に物理的に分離する。
このメカニズムをサポートするために、新しくフォークされたエージェントが巨大な共有キャッシュを継承し、軽量なユニークなキャッシュにCoWセマンティクスを適用することができるDualRadixTreeアーキテクチャを提案する。
さらに、効率的な実行を保証するため、オンチップSRAM内で分散KVキャッシュを直接再構築する専用カーネルResidualAttentionを設計する。
多様な言語モデルと様々なタスクの実践的データセットの総合的な評価は、ForkKVが生成品質に無視できない影響を持つ最先端のマルチロラサービスシステムのスループットを最大3.0倍に達成していることを示している。
関連論文リスト
- ICaRus: Identical Cache Reuse for Efficient Multi Model Inference [14.040073161061578]
ICaRusは、複数のモデルで同一のKVキャッシュをすべての層で共有できる新しいアーキテクチャである。
ICaRusは最大11.1倍のP95レイテンシを実現し、8つの異なるモデルを持つマルチエージェントワークフローにおいて3.8倍のスループットを実現している。
論文 参考訳(メタデータ) (2026-02-27T14:21:45Z) - DeltaKV: Residual-Based KV Cache Compression via Long-Range Similarity [50.52392445266824]
そこで本稿では,KV表現における長距離間類似性と高共有遅延成分を動機とする残差ベースのKVキャッシュ圧縮フレームワークを提案する。
DeltaKVはトークンを捨てる代わりに、検索した履歴参照に対するセマンティックな残基をエンコードし、保存を著しく削減する。
実験によると、DeltaKVは、LongBench、SCBench、AIMEでほぼロスレスの精度を維持しながら、KVキャッシュメモリを元の29%に削減している。
論文 参考訳(メタデータ) (2026-02-08T15:14:36Z) - LRAgent: Efficient KV Cache Sharing for Multi-LoRA LLM Agents [9.162948089580143]
マルチLoRAエージェントのためのKVキャッシュ共有フレームワークであるLRAgentを提案する。
LRAgentはキャッシュを、事前訓練された重みから共有ベースコンポーネント、LoRA重みからアダプタ依存コンポーネントに分解する。
LRAgentは、完全に共有されたキャッシュに近いスループットとタイムツーファーストのレイテンシを実現する。
論文 参考訳(メタデータ) (2026-02-01T06:36:46Z) - Joint Encoding of KV-Cache Blocks for Scalable LLM Serving [3.3230675313521716]
既存のKV-cache圧縮手法は剛性に依存し、テンソルレイアウトを乱したり、特別な計算を必要とする。
KV-cacheブロックの連成符号化を提案し、要求と入力チャンクに類似したブロックを融合して共有表現を生成する。
これにより、KV-cacheメモリのボトルネックが軽減され、特別なハードウェアを使わずに高コンカレンシー機能をサポートする。
論文 参考訳(メタデータ) (2026-01-06T14:50:58Z) - KVShare: An LLM Service System with Efficient and Effective Multi-Tenant KV Cache Reuse [17.301289617498448]
マルチテナントシナリオ下で要求間でKVキャッシュを共有するKVキャッシュ管理モジュールを提案する。
KVShareはTTFTを最大9.39倍に削減し、完全なKV再計算に比べてスループットを1.2倍に向上させる。
KVShareはSOTA法に比べて精度が20.38%向上している。
論文 参考訳(メタデータ) (2025-03-17T16:43:35Z) - QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache [67.84112700032007]
大きな言語モデル(LLM)は、長いコンテキスト設定のためにエッジデバイスにデプロイされることが増えている。
これらのシナリオでは、キーバリュー(KV)キャッシュがGPUメモリとレイテンシの両方において主要なボトルネックとなっている。
そこで本研究では,ターゲットモデルのアーキテクチャを共有するが,階層的な4ビット量子化KVキャッシュと4ビット量子化重みを併用して高速化を行う,新たな自己推論型デコーディングフレームワークであるQuantSpecを提案する。
論文 参考訳(メタデータ) (2025-02-05T20:43:48Z) - CSR:Achieving 1 Bit Key-Value Cache via Sparse Representation [63.65323577445951]
キャッシュスパース表現(CSR)と呼ばれる新しい手法を提案する。
CSRは、密度の高いKey-Valueキャッシュテンソルをスパースインデックスとウェイトに変換し、LLM推論中によりメモリ効率のよい表現を提供する。
我々の実験は、CSRが最先端KVキャッシュ量子化アルゴリズムに匹敵する性能を達成することを示した。
論文 参考訳(メタデータ) (2024-12-16T13:01:53Z) - SCBench: A KV Cache-Centric Analysis of Long-Context Methods [61.025422435235456]
KVキャッシュ中心の視点から長文の手法を評価するベンチマークであるSCBenchを紹介する。
我々は、Gated Linear RNNsやMamba-Attention Hybridsを含む8つのカテゴリの長期コンテキストソリューションについて、広範なKVキャッシュ中心の分析を行う。
本研究は,O(n)メモリとサブO(n2)プリフィルによるスパース符号化が堅牢に動作する一方で,サブO(n)メモリ手法がマルチターンシナリオに悩まされていることを示す。
論文 参考訳(メタデータ) (2024-12-13T17:59:52Z) - Lossless KV Cache Compression to 2% [22.98828332096935]
この研究は、KVキャッシュを元のサイズの2%未満に圧縮することを目的とした、新しいアーキテクチャであるCLLA(Cross-Layer Latent Attention)を導入している。
CLLAは、アテンションヘッド/ディメンション低減、レイヤ共有、量子化技術を結合的なフレームワークに統合する。
論文 参考訳(メタデータ) (2024-10-20T02:17:35Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。