論文の概要: SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving
- arxiv url: http://arxiv.org/abs/2607.23933v2
- Date: Wed, 05 Aug 2026 01:08:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 17:51:08.533758
- Title: SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving
- Title(参考訳): SpecBox: 効率的なLLMエージェント実行のための投機的サンドボックススケジューリング
- Authors: Yihui Zhang, Tianyu Wo, Jinghao Wang, Xiaoyang Sun, Menghao Zhang, Cangzhou Yuan, Li Li, Chunming Hu, Albert Y. Zomaya, Renyu Yang,
- Abstract要約: SpecBoxは、動的LLMエージェント実行パイプラインのための投機的なサンドボックスプリアロケーションを中心に構築されたランタイムである。
私たちのプロトタイプは、SpecBoxがオンデマンドのサンドボックスベースラインと比較して、P99のエンドツーエンドのレイテンシを最大29倍に削減したことを実証しています。
- 参考スコア(独自算出の注目度): 34.2973755081128
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As LLM agents increasingly rely on the Model Context Protocol (MCP) to invoke isolated external sandboxes, disaggregated sandbox deployment introduces a fundamental tension between resource utilization and interactive tail latency. Persistent long-lived sandbox reservations incur excessive memory overhead at scale, while lazy on-demand instantiation generates severe cold-start penalties that degrade response performance under multi-tenant, multi-turn agent workloads. To resolve this dilemma, we present SpecBox, a runtime built around speculative sandbox preallocation tailored for dynamic LLM agent execution pipelines. At its core, SpecBox implements keyword matching and streaming semantic embedding to enable intent-driven sandbox prewarming, which identifies pending tool execution demands mid-LLM token generation and fully overlaps sandbox bootstrapping with model inference. To extend prewarming windows across sequential agent steps, the framework leverages context-aware stochastic prefetching atop a sandbox dependency graph to probabilistically forecast future sandbox switches ahead of execution. We complement these speculative mechanisms with two orthogonal optimizations: a semantic result cache that prunes redundant repeated sandbox invocations, and a dedicated out-of-band shared-memory transport plane that bypasses conventional network serialization to deliver zero-copy artifact transfers. Evaluated on high-concurrency multi-turn agent traces, our prototype demonstrates that SpecBox cuts P99 end-to-end latency by up to $2.9\times$ relative to the on-demand sandbox baseline, while slashing peak memory consumption by $45.9\%$ compared to permanently reserved sandbox deployments.
- Abstract(参考訳): LLMエージェントは、分離された外部サンドボックスを呼び出すために、モデルコンテキストプロトコル(MCP)にますます依存しているため、非集約的なサンドボックスデプロイメントは、リソース利用と対話的なテールレイテンシーの間に根本的な緊張をもたらす。
一方、遅延オンデマンドインスタンス化は、マルチテナントなマルチターンエージェントワークロード下での応答性能を低下させる厳しいコールドスタートペナルティを発生させる。
このジレンマを解決するために、動的LLMエージェント実行パイプライン用に調整された投機的サンドボックスプリアロケーションを中心に構築されたランタイムであるSpecBoxを提案する。
SpecBoxの中核となるのは、キーワードマッチングとストリーミングセマンティック埋め込みを実装して、インテント駆動のサンドボックスプリウォーミングを可能にし、保留中のツール実行要求をLLMトークン生成として識別し、モデル推論とサンドボックスブートストラップを完全に重複させる。
このフレームワークは、シーケンシャルエージェントステップにまたがるプレワーウィンドウを拡張するために、サンドボックス依存グラフ上のコンテキスト認識の確率的プリフェッチを活用し、実行前に将来のサンドボックススイッチを確率的に予測する。
我々はこれらの投機的メカニズムを、2つの直交的最適化で補完する: 冗長なサンドボックス呼び出しを誘発するセマンティックな結果キャッシュと、従来のネットワークシリアライゼーションをバイパスしてゼロコピーのアーティファクト転送を提供する専用帯域外共有メモリトランスポートプレーンである。
高速なマルチターンエージェントトレースに基づいて、我々のプロトタイプは、SpecBoxがP99のエンドツーエンドのレイテンシをオンデマンドのサンドボックスベースラインと比較して最大2.9\times$に削減し、ピークメモリの消費を恒久的に予約されたサンドボックスデプロイメントと比較して45.9\%値下げすることを示した。
関連論文リスト
- DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation [69.8840101036735]
投機的復号化はLarge Language Model (LLM)推論を加速させる。
最近の並列起草者は、1つの前方通過で長いトークン列を効率的に提案するが、トークン間の依存関係が欠如しているため、急速に受け入れが低下する。
我々はDSparkという投機的復号化フレームワークを導入し、高いスループットの並列生成を適応的かつロードアウェアな検証と統合する。
論文 参考訳(メタデータ) (2026-07-06T14:28:06Z) - CoMem: Context Management with A Decoupled Long-Context Model [68.6597154502361]
CoMemは、プライマリエージェントワークフローからメモリ管理を分離するフレームワークである。
我々は、CoMemがバニラロングコンテキストソリューションで1.4倍のレイテンシ改善を実現していることを示す。
論文 参考訳(メタデータ) (2026-05-29T04:59:32Z) - Parallel Context Compaction for Long-Horizon LLM Agent Serving [6.751507343395701]
長距離エージェントフローに対するtextbfparallel のコンパクト化を提案する。
並列コンパクト化は、演算子を細粒度で予測可能な、要約ボリュームの制御を与える。
エンドツーエンドの壁時間を短縮し、シーケンシャルベースライン上での圧縮スループットを向上させる。
論文 参考訳(メタデータ) (2026-05-22T07:12:38Z) - ZeRO-Prefill: Zero Redundancy Overheads in MoE Prefill Serving [18.574823955774207]
本稿では,ZeRO-Prefillを提案する。ZeRO-Prefillはプリフィルのみのサービスシステムで,バックエンドはアクティベーションによってルーティングするのではなく,専門家を重みに集める。
Qwen3-235B-A22Bでは、4つのハードウェア/精度構成でZeRO-Prefillは1.35-1.37倍のスループットを提供する。
論文 参考訳(メタデータ) (2026-05-03T03:10:24Z) - SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning [104.01865949020304]
エージェント・マルチモーダル・大規模言語モデル(MLLM)は,反復的な視覚的ツールの実行によって顕著な推論能力を達成する。
しかし、カスケード認識、推論、ツール呼び出しループは、重要なシーケンシャルなオーバーヘッドをもたらす。
このオーバーヘッドはエージェントディープと呼ばれ、禁止されたレイテンシを発生させ、システムレベルのスループットを著しく制限します。
本稿では,エージェントレベルの投機的アクセラレーションフレームワークであるSpecEyesを提案する。
論文 参考訳(メタデータ) (2026-03-24T17:45:47Z) - Stacked from One: Multi-Scale Self-Injection for Context Window Extension [69.24689919827817]
Modelnameは、多粒度コンテキスト圧縮とクエリ対応情報取得に基づく新しいフレームワークである。
modelnameachievesパフォーマンスは、強いベースラインと同等か、優れている。
論文 参考訳(メタデータ) (2026-03-05T03:16:16Z) - Quantifying Frontier LLM Capabilities for Container Sandbox Escape [1.6245103041408155]
大規模言語モデル(LLM)は、コードの実行、ファイルの読み書き、ネットワークへのアクセスといったツールを使用して、自律的なエージェントとして機能するようになっている。
これらのリスクを軽減するため、エージェントは一般的にデプロイされ、独立した"サンドボックス"環境で評価される。
オープンベンチマークであるSANDBOXESCAPEBENCHを導入する。
論文 参考訳(メタデータ) (2026-03-01T22:47:39Z) - CSGO: Generalized Optimization for Cold Start in Wireless Collaborative Edge LLM Systems [62.24576366776727]
本稿では,全体の推論遅延を最小限に抑えるために,遅延を考慮したスケジューリングフレームワークを提案する。
提案手法は,ベースライン戦略と比較して,コールドスタート遅延を著しく低減することを示す。
論文 参考訳(メタデータ) (2025-08-15T07:49:22Z) - Flover: A Temporal Fusion Framework for Efficient Autoregressive Model
Parallel Inference [3.005912820808423]
自己回帰モデル上の推論は、現在のトークンの確率分布が前のトークンに条件付けられている時間依存性を利用する。
並列に複数のリクエストを効率的に推測するための時間融合フレームワークであるFloverを提案する。
トークンレベルの並列性のオーケストレーションによって、Floverはハードウェアの最適効率を示し、システムリソースを著しく節約する。
論文 参考訳(メタデータ) (2023-05-22T20:58:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。