論文の概要: Beyond Binary Priorities: Multi-Tier SLA Scheduling for Large Language Model Serving
- arxiv url: http://arxiv.org/abs/2608.16336v1
- Date: Mon, 17 Aug 2026 09:43:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.625142
- Title: Beyond Binary Priorities: Multi-Tier SLA Scheduling for Large Language Model Serving
- Title(参考訳): バイナリプライオリティを超えて - 大規模言語モデルの実行のためのマルチティアSLAスケジューリング
- Abstract要約: 任意の数のティアをサポートするために、Llumnixの優先度モデルを拡張します。
システムは、テール崩壊を伴わずに、これらの利得を10の優先度レベルで維持することを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern LLM serving deployments must simultaneously satisfy heterogeneous service-level objectives (SLOs) across a diverse population of user tiers, ranging from latency-critical API calls to background batch processing. Llumnix introduced a dynamic, migration-capable multi-instance scheduler for LLM inference that achieves load balancing, defragmentation, prioritization, and auto-scaling through a unified "freeness" metric. However, Llumnix's priority model is restricted to two levels (high and normal), an abstraction too coarse to express the richer SLA classes common in production deployments. In this work, we extend Llumnix's priority model to support an arbitrary number of tiers and evaluate the effects of this extension under three realistic priority distributions (uniform, Gaussian, enterprise) using Vidur, a high-fidelity LLM inference simulator. We implement per-tier headroom with exponential decay, tier-aware dispatch ordering, and the full Llumnix migration pipeline inside Vidur's hierarchical scheduling framework. We compare our extended scheduler against INFaaS (global routing baseline), vLLM, Orca, and Sarathi-Serve (per-replica baselines), sweeping priority levels from 1 to 10. Our experiments demonstrate that four priority tiers yields the best cost-effectiveness tradeoff, achieving prefill mean speedups of up to 8.3x and end-to-end P99 speedups of up to 3.1x over INFaaS with cost-per-latency improvements of 46 to 68%, while preserving strong SLO differentiation across tiers. We further show that the system sustains these gains at 10 priority levels without tail latency collapse, with overhead concentrated in the prefill phase.
- Abstract(参考訳): 現代的なLLMサービスデプロイメントは、レイテンシクリティカルなAPI呼び出しからバックグラウンドバッチ処理まで、さまざまなユーザ層にわたる異種サービスレベルの目的(SLO)を同時に満たさなければならない。
Llumnixは、ロードバランシング、デフラグメンテーション、優先順位付け、自動スケーリングを実現するLLM推論用の動的でマイグレーション可能なマルチインスタンススケジューラを導入した。
しかし、Llumnixの優先順位モデルは2つのレベル(ハイレベルとノーマル)に制限されている。
本研究では, Llumnix の優先度モデルを拡張し, 任意の階層数をサポートするとともに, 高忠実度 LLM 推論シミュレータ Vidur を用いて, 3 つの現実的優先度分布 (ユニフォーム, ガウス, エンタープライズ) 下での効果を評価する。
Vidurの階層的スケジューリングフレームワーク内では,指数関数的減衰,層認識型ディスパッチ順序付け,Llumnixマイグレーションパイプラインの完全な実装を行う。
拡張スケジューラをINFaaS(グローバルルーティングベースライン)、vLLM、Orca、Sarathi-Serve(レプリカベースライン毎)と比較し、優先度を1から10に引き上げました。
実験の結果,4つの優先度階層は,最大8.3倍,最大3.1倍のP99スピードアップをINFaaS上で達成し,46~68%のレイテンシ向上を実現した。
さらに,本システムは,プレフィルフェーズにオーバーヘッドを集中させて,テール遅延の崩壊を伴わずに,これらの利得を10の優先度レベルで維持することを示した。
関連論文リスト
- SpikeMLLM: Spike-based Multimodal Large Language Models via Modality-Specific Temporal Scales and Temporal Compression [46.709828328948724]
スパイキングニューラルネットワーク(SNN)は、ニューロモルフィックハードウェアに固有のエネルギー効率の利点を提供する。
MLLMの最初のスパイクベースフレームワークであるSpikeMLLMを提案する。
この結果から,SpikeMLLMはアグレッシブ・タイムステップ圧縮下でほぼ無作為な性能を維持していることがわかった。
論文 参考訳(メタデータ) (2026-04-13T15:32:44Z) - A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model [112.9420001646428]
VLA(Vision-Language-Action)モデルは、オープンワールドロボット操作の強力なパラダイムとして登場したが、実際の展開はコストに制約されることが多い。
我々は、低コストで高スループットな推論のために設計された、完全にオープンソースで透明なVLAフレームワークであるA1を提示する。
A1は最先端の成功率を達成すると同時に、推論コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-04-07T10:18:40Z) - SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning [104.01865949020304]
エージェント・マルチモーダル・大規模言語モデル(MLLM)は,反復的な視覚的ツールの実行によって顕著な推論能力を達成する。
しかし、カスケード認識、推論、ツール呼び出しループは、重要なシーケンシャルなオーバーヘッドをもたらす。
このオーバーヘッドはエージェントディープと呼ばれ、禁止されたレイテンシを発生させ、システムレベルのスループットを著しく制限します。
本稿では,エージェントレベルの投機的アクセラレーションフレームワークであるSpecEyesを提案する。
論文 参考訳(メタデータ) (2026-03-24T17:45:47Z) - Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs [62.17306142810532]
ヘテロジニアスLSMクラスタ上で動作するマルチエージェントワークフローの予測スケジューリングシステムであるChimeraを提案する。
Chimeは最高のレイテンシをトレースし、エンドツーエンドのレイテンシを1.2-2.4$times$で削減し、タスクパフォーマンスを平均8.0-9.5ポイント改善する。
論文 参考訳(メタデータ) (2026-03-23T17:01:42Z) - Priority-Aware Preemptive Scheduling for Mixed-Priority Workloads in MoE Inference [4.7730970530715835]
大規模言語モデルは自然言語処理に革命をもたらしたが、データセンターで効率的に処理するのは難しい。
我々は、Mixture of Experts(MoE)モデル用に設計された新しい推論システムQLLMを紹介する。
QLLMはエキスパートレベルのプリエンプションを可能にし、LS Time-to-First-Token(TTFT)を最小化しながらBEジョブの実行を遅延させる。
論文 参考訳(メタデータ) (2025-03-12T11:56:01Z) - ALISE: Accelerating Large Language Model Serving with Speculative Scheduling [7.367068885621016]
大規模言語モデル(LLM)は、現代の人工知能(AGI)の展望における革命的な進歩を表している。
本稿では, ALISE という新しい効率的な LLM 推論サービスフレームワークを提案する。
ALISEは,AlpacaデータセットとShareGPTデータセットと同じレイテンシ制約の下で,最大1.8xと2.1xの推論処理のスループットを向上することを示す。
論文 参考訳(メタデータ) (2024-10-31T00:58:11Z) - LiNeS: Post-training Layer Scaling Prevents Forgetting and Enhances Model Merging [80.17238673443127]
LiNeSは、微調整タスク性能を向上しつつ、事前訓練された一般化を維持するために設計されたポストトレーニング編集技術である。
LiNeSは、視覚と自然言語処理のさまざまなベンチマークにおいて、シングルタスクとマルチタスクの両方で大幅に改善されている。
論文 参考訳(メタデータ) (2024-10-22T16:26:05Z) - Understanding Forgetting in LLM Supervised Fine-Tuning and Preference Learning - A Convex Optimization Perspective [55.66517396157806]
オープンソースLLMのポストトレーニングにおいて広く採用されているアプローチは、SFTとRLHF/DPOのシーケンシャルな実行である。
これはSFTとRLHF/DPOのトレードオフの点において最適である。
本稿では,理論収束保証と逐次後学習フレームワークの性能を実証的に向上させる,実践的な後学習フレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-20T19:38:41Z) - Llumnix: Dynamic Scheduling for Large Language Model Serving [17.919408899409113]
大規模言語モデル(LLM)に対する推論は、その可能性を解き放つ鍵である。
Llumnixは、実行時再スケジューリングによって、不均一で予測不能な要求に応答するLLMサービスシステムである。
Llumnixはテールレイテンシを桁違いに改善し,高優先度要求を最大1.5倍高速化し,最大36%のコスト削減を実現している。
論文 参考訳(メタデータ) (2024-06-05T13:20:18Z) - Fast Distributed Inference Serving for Large Language Models [12.703624317418237]
大規模言語モデル(LLM)のための分散推論サービスシステムであるFastServeについて述べる。
FastServeはLLM推論の自己回帰パターンを利用して、各出力トークンの粒度のプリエンプションを可能にする。
我々は,FastServeのシステムプロトタイプを構築し,最先端のソリューションであるvLLMと比較して,同じ平均および末尾遅延条件下でのスループットを最大31.4xと17.9xに改善したことを示す。
論文 参考訳(メタデータ) (2023-05-10T06:17:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。