論文の概要: PReCache: Efficient KV Cache Sharing for Multi-LoRA Agents via Low-Rank Precomputation and Neutral Reconstruction
- arxiv url: http://arxiv.org/abs/2609.34054v1
- Date: Mon, 28 Sep 2026 00:24:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-04 07:25:47.433313
- Title: PReCache: Efficient KV Cache Sharing for Multi-LoRA Agents via Low-Rank Precomputation and Neutral Reconstruction
- Title(参考訳): PReCache: 低ランクプリ計算とニュートラル再構成によるマルチLORAエージェントの効率的なKVキャッシュ共有
- Abstract要約: マルチLORAエージェントシステムは、共通のバックボーンモデルを共有することで、効率的なロール計算を可能にする。
既存のKVキャッシュ共有メソッドは、この繰り返しプリフィルを減らすが、追加のトレーニングやアーキテクチャ上の制約が必要になる。
PReCacheはトレーニング不要のKVキャッシュ共有フレームワークで、PreLRSharedとReBaseSharedという2つの設計がある。
- 参考スコア(独自算出の注目度): 9.162948089580143
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multi-LoRA agent systems enable efficient role specialization by sharing a common backbone model. However, each agent repeatedly processes the growing shared trajectory and constructs its own KV cache, introducing substantial memory and computation redundancy in long-horizon tasks. Existing KV cache sharing methods reduce this repeated prefill, but they either require additional training or architectural constraints or retain substantial model computation. Moreover, direct cache reuse causes the current agent to rely on cache states generated by the previous agent's adapter, weakening the role-specific behavior encoded by its own LoRA. We present PReCache, a training-free KV cache sharing framework with two designs, namely PreLRShared and ReBaseShared, that share the base cache computed using the pretrained weights and precompute a compact agent-specific low-rank (LR) cache. To remove repeated prefill, PreLRShared precomputes each agent's LR cache when the shared context is first processed, allowing the current agent to use its own LR cache without reprocessing context processed by previous agents. To improve sharing accuracy, ReBaseShared reconstructs the shared base cache from adapter-free hidden states, reducing the remaining error caused by the previous agent's adapted representation. To minimize its reconstruction cost, we propose two inference schemes tailored to single-stream inference and concurrent serving, performing the same reconstruction after each agent's turn or alongside its execution, respectively. Across multiple models and agent benchmarks, PreLRShared achieves up to a 3.1x TTFT speedup and a 2.3x improvement in per-request throughput over inference without KV cache sharing. ReBaseShared best preserves accuracy overall among the evaluated cache-sharing methods, with an average drop of only 1.1 points relative to inference without cache sharing.
- Abstract(参考訳): マルチLORAエージェントシステムは、共通のバックボーンモデルを共有することで、効率的なロール特殊化を可能にする。
しかし、各エージェントは、増大する共有軌跡を繰り返し処理し、KVキャッシュを構築し、長い水平タスクにかなりのメモリと計算の冗長性をもたらす。
既存のKVキャッシュ共有手法は、この繰り返しプリフィルを減らすが、追加のトレーニングやアーキテクチャ上の制約を必要とするか、あるいは重要なモデル計算を保持する。
さらに、直接キャッシュの再利用により、現在のエージェントは前のエージェントのアダプタによって生成されたキャッシュ状態に依存するようになり、独自のLoRAによってコードされるロール固有の振る舞いが弱まる。
トレーニング不要なKVキャッシュ共有フレームワークであるPReCacheについて述べる。これはPreLRSharedとReBaseSharedの2つの設計で、事前トレーニングされた重みを使って計算されたベースキャッシュを共有し、コンパクトなエージェント固有の低ランクキャッシュ(LR)をプリコンパイルする。
繰り返しプリフィルを削除するために、PreLRSharedは共有コンテキストが最初に処理されたときに各エージェントのLRキャッシュをプリコンプリートする。
共有精度を向上させるために、ReBaseSharedは、共有ベースキャッシュをアダプタなしの隠れ状態から再構築し、前のエージェントの適応表現による残りのエラーを減らす。
再構成コストを最小化するために,各エージェントのターン後に,あるいは実行後にそれぞれ同じ再構成を行う,単一ストリーム推論と同時サービスに適した2つの推論スキームを提案する。
複数のモデルとエージェントベンチマークで、PreLRSharedは最大3.1倍のTTFTスピードアップを実現し、KVキャッシュ共有のない推論よりも要求ごとのスループットを2.3倍改善した。
ReBaseSharedは、評価されたキャッシュ共有方法の中で、キャッシュ共有のない推論に対して平均1.1ポイントの精度を最善に維持する。
関連論文リスト
- KVCMAS: Efficient KV cache Correction for Shared Context in Multi-Agent Systems [12.768679406770984]
KVCMASは、コンパクトな低ランク状態を用いたクロスエージェントキャッシュ逸脱を表す。
追加の参照プリフィルなしで、エージェントワークフローに沿って修正をシームレスにチェーンする。
制御されたサービストレースの下では、KVキャッシュの共有なしに、推論よりも2.0倍のTTFTスピードアップを提供する。
論文 参考訳(メタデータ) (2026-09-28T00:39:50Z) - KVShareArena: KV-Cache Reuse Across Contexts and Model Checkpoints [14.86076891340077]
KVShare-cacheは、取得したチャンクとエージェントレポートのプロンプトコンテキストとモデルチェックポイントをまたいだ再利用を行う。
再計算を必要としない修正位置は、質問が一度に複数の情報源を必要とするまで十分である。
KVArena-cacheはキャッシュなしと完全再計算の間のギャップを割ってすべてのメソッドをスコアする。
論文 参考訳(メタデータ) (2026-09-09T14:53:45Z) - Back from the Future: Key-Value Cache Management by Counter-Causal Surprise [67.1056509495879]
近年,キーバリュー(KV)キャッシュ管理が重要な研究方向として注目されている。
より最近のトークンからよく予測できる過去のトークンは冗長である,という洞察に動機づけられた,単純かつ効果的なKV消去スキームを提案する。
我々は,他の最先端手法と比較して,競争力や性能向上を示す各種オープンソースLCMとベンチマークデータセットについて,我々の戦略を評価した。
論文 参考訳(メタデータ) (2026-07-30T02:42:51Z) - Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning [51.563653495547335]
マルチモーダル推論は、マルチステップ生成中に視覚的証拠を再考することによって、視覚的接地を改善する。
再生不要な視覚的再考のためのキャッシュレベルフレームワークであるPlace Rebinding Cache Reuse (PRCR)を提案する。
PRCRはリプレイレベルまたはパフォーマンスの向上を実現し、平均精度を5%向上し、視覚的再考を最大数万倍削減する。
論文 参考訳(メタデータ) (2026-06-25T05:47:52Z) - Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing [29.913403615975174]
高いスループットでトランスフォーマー言語モデルを実行するには、冗長な計算を避けるためにキーバリュー(KV)をキャッシュする必要がある。
KVキャッシュのメモリフットプリントは著しく、サービスコストに大きな影響を与えます。
本稿では,ランダムな層間注意(ランダムな層間注意,ランダムな層間注意,ランダムな層間注意)を提案する。
論文 参考訳(メタデータ) (2026-04-03T14:56:17Z) - RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse [5.597099794399441]
RelayCachingはトレーニング不要な推論手法で、前のエージェントから復号フェーズKVキャッシュを直接再利用する。
RelayCachingは80%以上のKVキャッシュの再利用を実現し、TTFTを標準パイプラインと比較して最大4.7倍のコストで削減できることを示す。
論文 参考訳(メタデータ) (2026-02-28T04:46:28Z) - LRAgent: Efficient KV Cache Sharing for Multi-LoRA LLM Agents [9.162948089580143]
マルチLoRAエージェントのためのKVキャッシュ共有フレームワークであるLRAgentを提案する。
LRAgentはキャッシュを、事前訓練された重みから共有ベースコンポーネント、LoRA重みからアダプタ依存コンポーネントに分解する。
LRAgentは、完全に共有されたキャッシュに近いスループットとタイムツーファーストのレイテンシを実現する。
論文 参考訳(メタデータ) (2026-02-01T06:36:46Z) - CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing [54.34080239841088]
CommonKVは、隣接パラメータ共有による層間KVキャッシュ圧縮のトレーニング不要な方法である。
提案手法は,様々な圧縮比で既存の低ランクおよびクロスレイヤーの手法より一貫して優れていることを示す。
論文 参考訳(メタデータ) (2025-08-22T06:55:45Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - CORM: Cache Optimization with Recent Message for Large Language Model Inference [57.109354287786154]
メモリフットプリントを大幅に最小化するKVキャッシュを最適化する革新的な手法を提案する。
KVキャッシュ消去ポリシーであるCORMは、モデル微調整を必要とせずに、推論に必要なキーと値のペアを動的に保持する。
検証の結果,CORMはKVキャッシュの推論メモリ使用量を最大70%削減し,LongBenchの6つのタスクで性能劣化を無視できることがわかった。
論文 参考訳(メタデータ) (2024-04-24T16:11:54Z) - Accelerating Deep Learning Classification with Error-controlled
Approximate-key Caching [72.50506500576746]
我々は、近似キーキャッシングと名付けた新しいキャッシングパラダイムを提案する。
近似キャッシュはDL推論の負荷を軽減し、システムのスループットを向上するが、近似誤差を導入する。
我々は古典的なLRUと理想的なキャッシュのキャッシュシステム性能を解析的にモデル化し、期待される性能のトレース駆動評価を行い、提案手法の利点を最先端の類似キャッシュと比較した。
論文 参考訳(メタデータ) (2021-12-13T13:49:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。