論文の概要: Workload-Aware Caching for Multi-Agent Systems
- arxiv url: http://arxiv.org/abs/2607.20495v1
- Date: Sun, 14 Jun 2026 02:13:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.201836
- Title: Workload-Aware Caching for Multi-Agent Systems
- Title(参考訳): マルチエージェントシステムのためのワークロード対応キャッシング
- Abstract要約: キャッシュ消去ポリシーは、すべてのキャッシュされたエントリをアクセス履歴に基づいて一様に扱い、構造的およびワークロードの信号を無視します。
本稿では,再計算コスト,DAG依存性数,エージェント起動頻度という3つの信号を組み合わせた作業負荷対応の消去ポリシーを統一スコアリング関数として提案する。
我々のポリシーは、キャッシュされていないベースラインと比較してレイテンシを最大64.7%削減し、次のベストな有限容量ベースラインに対して平均31.1%のレイテンシ削減を達成する。
- 参考スコア(独自算出の注目度): 3.2309496907010384
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-agent systems decompose complex tasks into directed acyclic graphs (DAGs) of specialized agent executions, creating natural opportunities for caching intermediate results across queries. However, existing cache eviction policies treat all cached entries uniformly based on access history, ignoring structural and workload signals uniquely available in agentic execution environments. We present a workload-aware eviction policy that combines three signals, namely recomputation cost, DAG dependency count, and agent invocation frequency, into a unified scoring function that retains the most valuable entries under memory constraints. Evaluated across three multi-agent benchmarks spanning diverse reuse regimes, our policy reduces latency by up to 64.7% relative to the uncached baseline and achieves on average a 31.1% latency reduction over the next best finite-capacity baseline, while approaching the performance of an unbounded cache and maintaining accuracy on par with or exceeding all competing finite-capacity methods. We further show that workload-aware content caching is complementary to other agentic system optimization methods, including plan-level caching and parallel agent execution, with each technique targeting a distinct efficiency bottleneck in multi-agent pipelines.
- Abstract(参考訳): マルチエージェントシステムは複雑なタスクを特殊エージェントの実行の非巡回グラフ(DAG)に分解し、クエリ間で中間結果をキャッシュする自然な機会を生み出す。
しかし、既存のキャッシュ消去ポリシーは、すべてのキャッシュされたエントリをアクセス履歴に基づいて一様に扱い、エージェント実行環境で利用可能な構造的およびワークロード信号を無視します。
本稿では,再計算コスト,DAG依存性数,エージェント起動頻度の3つの信号を組み合わせて,メモリ制約下で最も価値のあるエントリを保持する統合スコアリング関数を提案する。
多様な再利用体制にまたがる3つのマルチエージェントベンチマークで評価され、当社のポリシは、アンキャッシュベースラインに対して最大64.7%のレイテンシ削減を実現し、次のベストな有限容量ベースラインに対して平均31.1%のレイテンシ削減を実現し、非バウンドキャッシュのパフォーマンスにアプローチし、競合するすべての有限容量メソッドに匹敵する精度を維持しながら、平均31.1%のレイテンシ削減を実現している。
さらに,作業負荷を考慮したコンテンツキャッシングは,計画レベルキャッシングや並列エージェント実行など,他のエージェントシステムの最適化手法と相補的であることを示す。
関連論文リスト
- Evaluating Temporal Semantic Caching and Workflow Optimization in Agentic Plan-Execute Pipelines [3.4989760172592264]
単一のユーザクエリは、センサデータ、作業順序、障害モード、予測ツール、ドメイン固有のエージェントの調整を必要とする可能性があるため、産業資産運用はレイテンシに敏感である。
AssetOpsBench (AOB) は, 計画実行パイプラインがツール発見, LLM計画, MCPツール実行, 最終的な要約から繰り返しオーバーヘッドを露呈する産業エージェントベンチマークである。
本稿では,AOB計画実行パイプラインのための2つの補完的な最適化レイヤを提案する。
論文 参考訳(メタデータ) (2026-05-20T02:30:07Z) - SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters [13.891522069967507]
本稿では,複合AIワークロードのプログラムレベルスケジューリングへのシフトを提案する。
本稿では,この抽象化を実現する分散スケジューラSAGAを提案する。
論文 参考訳(メタデータ) (2026-05-01T09:05:28Z) - Hive: A Multi-Agent Infrastructure for Algorithm- and Task-Level Scaling [4.857151634248649]
大規模言語モデルは、タスクの複雑さに合わせてスケールする複雑なエージェントシステムとして、ますます多くデプロイされている。
アルゴリズムレベルでは、追加の推論時間の割当はワークフローのキャパシティを向上させるが、パス間の冗長性を導入する。
タスクレベルでは、複雑なタスクはサブプロブレムに分解でき、スケーラビリティと並列性を改善するために複数のエージェントに委譲される。
アルゴリズムとタスクレベルのスケーリングを可能にするマルチエージェントインフラストラクチャであるHiveを提案する。
論文 参考訳(メタデータ) (2026-04-19T09:59:35Z) - Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs [62.17306142810532]
ヘテロジニアスLSMクラスタ上で動作するマルチエージェントワークフローの予測スケジューリングシステムであるChimeraを提案する。
Chimeは最高のレイテンシをトレースし、エンドツーエンドのレイテンシを1.2-2.4$times$で削減し、タスクパフォーマンスを平均8.0-9.5ポイント改善する。
論文 参考訳(メタデータ) (2026-03-23T17:01:42Z) - Efficient Multimodal Planning Agent for Visual Question-Answering [67.26245301307539]
本稿では,MRAGパイプラインを動的に分解してVQAタスクを解くマルチモーダル計画エージェントを訓練する手法を提案する。
本実験では, 従来の手法に比べて探索時間を60%以上削減し, 余剰計算の削減に役立てることができた。
論文 参考訳(メタデータ) (2026-01-28T14:58:59Z) - Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks [1.2292307778008844]
本稿では,3大言語モデル(LLM)プロバイダ間でのプロンプトキャッシュの総合評価について述べる。
以上の結果から,プロンプトキャッシングによりAPIコストが45~80%削減され,プロバイダ間で13~31%短縮された。
論文 参考訳(メタデータ) (2026-01-09T18:41:57Z) - SimpleMem: Efficient Lifelong Memory for LLM Agents [73.74399447715052]
セマンティックロスレス圧縮に基づく効率的なメモリフレームワークSimpleMemを紹介する。
本稿では,情報密度とトークン利用量の最大化を目的とした3段階パイプラインを提案する。
ベンチマークデータセットを用いた実験により,提案手法は精度,検索効率,推論コストにおいて,ベースラインアプローチを一貫して上回っていることがわかった。
論文 参考訳(メタデータ) (2026-01-05T21:02:49Z) - Cache Mechanism for Agent RAG Systems [32.587302983158274]
ARC(Agent RAG Cache Mechanism)は、各エージェントの小さな高価値コーパスを動的に管理する、新しい、アノテーションのないキャッシュフレームワークである。
その結果, ARC はRAG を用いた LLM エージェントの効率と有効性を大幅に向上させることができることがわかった。
論文 参考訳(メタデータ) (2025-11-04T19:02:29Z) - MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents [84.62985963113245]
我々は,長時間のマルチターンタスクに対して,エージェントが一定のメモリで動作可能な,エンドツーエンドの強化学習フレームワークMEM1を紹介する。
各ターンでMEM1は、メモリ統合と推論を共同でサポートするコンパクトな共有内部状態を更新する。
その結果,MEM1-7Bは16目的のマルチホップQAタスクにおいて,Qwen2.5-14B-Instructと比較してメモリ使用量を3.7倍削減し,3.5倍の性能向上を示す。
論文 参考訳(メタデータ) (2025-06-18T19:44:46Z) - Dynamic Multi-Robot Task Allocation under Uncertainty and Temporal
Constraints [52.58352707495122]
本稿では,不確実性およびマルチエージェント協調の下での逐次意思決定における重要な計算課題を分離するマルチロボット割当アルゴリズムを提案する。
都市におけるマルチアームコンベヤベルトピック・アンド・プレイスとマルチドローン配送ディスパッチの2つの異なる領域における広範囲なシミュレーション結果について検証を行った。
論文 参考訳(メタデータ) (2020-05-27T01:10:41Z) - A Non-Stationary Bandit-Learning Approach to Energy-Efficient
Femto-Caching with Rateless-Coded Transmission [98.47527781626161]
小セルネットワークにおける共同キャッシュと送信のためのリソース割り当て問題について検討する。
次に、各放送ラウンドの送信電力レベルとともに、キャッシュからファイルを選択するという問題を定式化する。
最先端の研究とは対照的に、提案手法は時変統計特性を持つネットワークに特に適している。
論文 参考訳(メタデータ) (2020-04-13T09:07:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。