論文の概要: GhostServe: A Lightweight Checkpointing System in the Shadow for Fault-Tolerant LLM Serving
- arxiv url: http://arxiv.org/abs/2605.00831v1
- Date: Thu, 26 Mar 2026 13:27:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 06:56:26.429831
- Title: GhostServe: A Lightweight Checkpointing System in the Shadow for Fault-Tolerant LLM Serving
- Title(参考訳): GhostServe:フォールトトレラント LLM サービング用軽量チェックポイントシステム
- Authors: Shakya Jayakody, Youpeng Zhao, Chinmay Dhanraj Nehate, Jun Wang,
- Abstract要約: 本稿では,GhostServeを提案する。GhostServeは,フォールトトレラントな大規模言語モデル(LLM)を実現するための新しいチェックポイントソリューションである。
GhostServeは、消去符号化を適用してホストメモリにパリティシャードを生成し保存することで、シャドー内のストリーミングKVキャッシュを保護する。
デバイス障害が発生した場合、GhostServeは失われたKVキャッシュの迅速な再構築を可能にし、推論プロセスがシームレスに再開できる。
- 参考スコア(独自算出の注目度): 6.713684426368857
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The rise of million-token, agent-based applications has placed unprecedented demands on large language model (LLM) inference services. The long-running nature of these tasks increases their susceptibility to hardware and software faults, leading to costly job failures, wasted resources, and degraded user experience. The stateful key-value (KV) cache, which grows with the sequence length, presents a central challenge as it is a critical and vulnerable component in distributed serving systems. In this work, we propose GhostServe, a novel checkpointing solution to facilitate fault-tolerant LLM serving. Specifically, GhostServe protects the streaming KV cache in the shadow by applying erasure coding to generate and store the parity shards in host memory. In the event of device failures, GhostServe enables fast reconstruction of the lost KV cache, allowing the inference process to resume seamlessly without costly full recomputation or state replication. Evaluations demonstrate that GhostServe reduces checkpointing latency by up to 2.7x and recovery latency by 2.1x for a single batch, and 1.2x median response latency compared to existing methods, in the presence of system failures, paving the way for high-availability and cost-effective LLM serving at scale.
- Abstract(参考訳): 数百万のエージェントベースのアプリケーションの台頭は、大規模言語モデル(LLM)推論サービスに前例のない要求を課している。
これらのタスクの長期的性質は、ハードウェアやソフトウェアの欠陥に対する感受性を高め、コストのかかるジョブの失敗、リソースの浪費、ユーザエクスペリエンスの低下につながります。
シーケンス長とともに成長するステートフルキー値(KV)キャッシュは、分散サービスシステムにおいて重要で脆弱なコンポーネントであるため、中心的な課題である。
本稿では,耐故障性LLM提供を容易にする新しいチェックポイントソリューションであるGhostServeを提案する。
具体的には、GhostServeは、消去符号化を適用して、シャドー内のストリーミングKVキャッシュを保護し、ホストメモリにパリティシャードを生成し保存する。
デバイス障害が発生した場合、GhostServeは失われたKVキャッシュの高速な再構築を可能にする。
評価の結果、GhostServeはチェックポイントのレイテンシを最大2.7倍削減し、リカバリのレイテンシを1バッチで2.1倍削減する。
関連論文リスト
- Harli: SLO-Aware Co-location of LLM Inference and PEFT-based Finetuning on Model-as-a-Service Platforms [33.64527903547734]
Harliは、(最先端のサービスシステムまで)平均46.2%の微調整スループットを向上する
Harliは、(最先端のサービスシステムまで)平均46.2%の微調整スループットを向上する
論文 参考訳(メタデータ) (2025-11-13T05:58:52Z) - TinyServe: Query-Aware Cache Selection for Efficient LLM Serving [5.216774377033164]
本稿では,大規模言語モデル(LLM)を効率的に提供するためのTinyServeを提案する。
TinyServeは、スポーシティ戦略ときめ細かいインスツルメンテーションでリアルタイムデコーディングを実行する。
我々の実験では、TinyServeがtextbf3.4x の高速化と textbf2x のメモリ節約を無視できる精度の低下で実現している。
論文 参考訳(メタデータ) (2025-08-28T16:17:18Z) - BucketServe: Bucket-Based Dynamic Batching for Smart and Efficient LLM Inference Serving [3.620158146761518]
BucketServeは、推論パフォーマンスを最適化するために設計されたバケットベースの動的フレームワークである。
UELLMと比較して1.93倍の要求負荷を達成でき、UELLMよりも1.975倍高いシステム負荷能力を示す。
論文 参考訳(メタデータ) (2025-07-23T01:51:48Z) - Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding [51.711605076319216]
拡散に基づく大規模言語モデル (Diffusion LLM) は、並列復号機能を持つ非自己回帰テキスト生成を約束している。
本稿では,双方向拡散モデルに適したブロック単位で近似したKVキャッシュ機構を提案する。
本稿では,信頼しきい値を超えるトークンを選択的に復号し,依存関係違反を軽減し,生成品質を維持できる信頼度対応並列復号方式を提案する。
論文 参考訳(メタデータ) (2025-05-28T17:39:15Z) - Apt-Serve: Adaptive Request Scheduling on Hybrid Cache for Scalable LLM Inference Serving [22.66354939370058]
Apt-Serveは、大規模言語モデル(LLM)推論サービスシステムにおける効果的なスループットを高めるために設計されたフレームワークである。
新たなハイブリッドキャッシュスキームでは、KVキャッシュとメモリ効率の高い隠れキャッシュを組み合わせることで、再利用可能な入力隠れ状態ベクタを実現し、バッチサイズを大きくし、要求を改善する。
Apt-Serveは,最先端の推論サービスシステムと比較して,スループットが最大8.8倍向上することを示す。
論文 参考訳(メタデータ) (2025-04-10T06:51:23Z) - ConServe: Fine-Grained GPU Harvesting for LLM Online and Offline Co-Serving [61.35068981176018]
ConServeは、高いスループットと強力なオンラインレイテンシ保証を実現する大規模言語モデル(LLM)サービスシステムである。
我々は,ConServeが平均2.2$times$高スループットを実現し,オンラインサービステールのレイテンシを最先端システムと比較して平均2.9$times$削減することを示した。
論文 参考訳(メタデータ) (2024-10-02T04:12:13Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z) - SpotServe: Serving Generative Large Language Models on Preemptible
Instances [64.18638174004151]
SpotServeは、プリエンプティブルインスタンスにシステムを提供する最初の分散大規模言語モデルである。
SpotServeは、既存のLLMサービスシステムと比較して、P99テールのレイテンシを2.4~9.1倍削減できることを示す。
また、SpotServeはプリエンプティブインスタンスの価格優位性を利用して、オンデマンドインスタンスのみを使用する場合と比較して54%の金銭的コストを節約できることも示しています。
論文 参考訳(メタデータ) (2023-11-27T06:31:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。