論文の概要: DeltaServe: Host-Agnostic Co-Serving of Inference and Fine-Tuning for LLMs
- arxiv url: http://arxiv.org/abs/2607.28848v1
- Date: Thu, 30 Jul 2026 21:20:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.489432
- Title: DeltaServe: Host-Agnostic Co-Serving of Inference and Fine-Tuning for LLMs
- Title(参考訳): DeltaServe: LLMのための推論と微調整のホスト非依存の共同開発
- Authors: Jiaxuan Chen, Jianshu She, Ye Yuan, Rajat Ghosh, Karan Gupta, Qirong Ho, Xue Liu, Oana Balmau,
- Abstract要約: LLMサービスシステムは、厳格なレイテンシターゲットを満たすためにピークロードのためにプロビジョニングされ、トラフィックがピーク以下に落ちると、かなりのGPU計算のアイドルが残る。
我々は、このアイドル推論能力をLoRA微調整スループットに変換するホスト非依存の協調型設計であるDeltaServeを提案する。
- 参考スコア(独自算出の注目度): 10.721488749478416
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM serving systems are provisioned for peak load to meet strict latency targets, leaving substantial GPU compute idle whenever traffic falls below peak. We present DeltaServe, a host-agnostic co-serving design that converts this idle inference capacity into LoRA fine-tuning throughput while preserving inference service-level objectives (SLOs). DeltaServe integrates with existing inference engines through a compact hook interface that requires only multi-LoRA batching support. It exploits the shared execution structure of inference prefill and LoRA fine-tuning forward passes, and uses an SLO-aware scheduler to admit and execute fine-tuning only when sufficient inference headroom is available. The scheduler is driven by a CUDA-graph-aware latency model calibrated offline and refined online. We integrate DeltaServe with vLLM, SGLang, and S-LoRA. On a production trace from Company X, DeltaServe on vLLM delivers 2.9x higher fine-tuning throughput than LLMStation at 100% inference SLO compliance, versus 85% for LLMStation. It also achieves 39% higher fine-tuning throughput than a baseline running vLLM+torchtune, using no additional hardware and maintaining full SLO compliance.
- Abstract(参考訳): LLMサービスシステムは、厳格なレイテンシターゲットを満たすためにピークロードのためにプロビジョニングされ、トラフィックがピーク以下に落ちると、かなりのGPU計算のアイドルが残る。
本稿では、このアイドル推論能力をLoRA微調整スループットに変換するとともに、SLO(Inference Service-level objectives)を保存したホスト非依存の協調型設計であるDeltaServeを提案する。
DeltaServeは,マルチLoRAバッチサポートのみを必要とする,コンパクトなフックインターフェースを通じて,既存の推論エンジンと統合されている。
推論プリフィルとLoRAファインチューニングのフォワードパスの共有実行構造を利用し、SLO対応スケジューラを使用して、十分な推論ヘッドルームが利用可能である場合にのみ、ファインチューニングを許可し実行する。
スケジューラはCUDAグラフ対応のレイテンシモデルによって駆動される。
DeltaServeをvLLM、SGLang、S-LoRAと統合します。
企業 X のプロダクショントレースでは、DeltaServe on vLLM は LLMStation より2.9倍高い微調整スループットを 100% の SLO 準拠で提供するが、LLMStation は 85% である。
また、vLLM+torchtuneを実行するベースラインよりも39%高い微調整スループットを実現し、追加ハードウェアを使用しず、完全なSLO準拠を維持している。
関連論文リスト
- SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips [13.816966749411037]
新興スーパーチップ(NVIDIA GH200など)向けに設計された高性能大型モデル(LLM)推論システムであるSuperInferを提案する。
SuperInferは、最初のプロアクティブなSLOawareロータリスケジューラであるRotaSchedを導入し、Superchipsの応答性を維持するためにリクエストをローテーションする。
SuperInfer は TTFT SLO 達成率を 74.7% まで改善し,TBT とスループットを最先端システムと比較した。
論文 参考訳(メタデータ) (2026-01-28T07:01:46Z) - Serving Heterogeneous LoRA Adapters in Distributed LLM Inference Systems [11.584593298674688]
Low-Rank Adaptation (LoRA)は,大規模言語モデル(LLM)のパラメータ効率向上のためのデファクト手法となった。
プロダクションでは、LoRAベースのモデルが大規模に提供され、数百のアダプタがベースモデルを共有するマルチテナント環境を生成する。
作業負荷を考慮した動的アダプタ配置とルーティングフレームワークであるLoRAServeについて述べる。
論文 参考訳(メタデータ) (2025-11-28T05:04:02Z) - BucketServe: Bucket-Based Dynamic Batching for Smart and Efficient LLM Inference Serving [3.620158146761518]
BucketServeは、推論パフォーマンスを最適化するために設計されたバケットベースの動的フレームワークである。
UELLMと比較して1.93倍の要求負荷を達成でき、UELLMよりも1.975倍高いシステム負荷能力を示す。
論文 参考訳(メタデータ) (2025-07-23T01:51:48Z) - Dynamic Low-Rank Sparse Adaptation for Large Language Models [54.1231638555233]
Low-rank Sparse Adaptation (LoSA)は、低ランク適応をsparse LLM sparsityにシームレスに統合する新しい手法である。
LoSAは、微調整中に対応するスパース重みに基づいてLoRA結果を動的に分散する。
LoSAは、追加の推論負荷を伴わずに、スパースLSMの有効性を数時間で効果的に向上させることができる。
論文 参考訳(メタデータ) (2025-02-20T18:37:32Z) - FedBiOT: LLM Local Fine-tuning in Federated Learning without Full Model [48.33280660752336]
大規模言語モデル(LLM)は、適切なデータで微調整した後、多くのドメイン固有のタスクで素晴らしいパフォーマンスを示す。
多くのドメイン固有のデータは、プライベートに複数の所有者に分散される。
我々は,フェデレート学習のための資源効率の高いLLM微調整手法であるFedBiOTを紹介する。
論文 参考訳(メタデータ) (2024-06-25T16:45:47Z) - S-LoRA: Serving Thousands of Concurrent LoRA Adapters [59.490751234925206]
パラメータ効率のよい微調整法であるLoRA(Lo-Rank Adaptation)は、ベースモデルを複数のタスクに適応させるためによく用いられる。
本稿では,多数のLoRAアダプタのスケーラブルな提供を目的としたシステムであるS-LoRAを提案する。
論文 参考訳(メタデータ) (2023-11-06T17:26:17Z) - LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning [56.88751562302793]
低ランク適応 (LoRA) が大型言語モデル (LLM) に登場した。
LoRAPruneは、高度にメモリ効率の良い正確な構造化プルーンドモデルを提供する新しいフレームワークである。
LoRAPruneはWikiText2では4.81、TBでは3.46、メモリ使用量は52.6%減少している。
論文 参考訳(メタデータ) (2023-05-28T15:15:48Z) - Fast Distributed Inference Serving for Large Language Models [12.703624317418237]
大規模言語モデル(LLM)のための分散推論サービスシステムであるFastServeについて述べる。
FastServeはLLM推論の自己回帰パターンを利用して、各出力トークンの粒度のプリエンプションを可能にする。
我々は,FastServeのシステムプロトタイプを構築し,最先端のソリューションであるvLLMと比較して,同じ平均および末尾遅延条件下でのスループットを最大31.4xと17.9xに改善したことを示す。
論文 参考訳(メタデータ) (2023-05-10T06:17:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。