論文の概要: Beyond Prediction: Tail-Aware Scheduling for LLM Inference
- arxiv url: http://arxiv.org/abs/2606.18431v1
- Date: Tue, 16 Jun 2026 19:25:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-18 17:16:50.870945
- Title: Beyond Prediction: Tail-Aware Scheduling for LLM Inference
- Title(参考訳): 予測を超えて: LLM推論のためのタイルアウェアスケジューリング
- Authors: Yueying Li, Yuanfan Chen, Jiayang Chen, Esha Choukse, Haoran Qiu, G. Edward Suh, Rodrigo Fonseca, Ziv Scully, Udit Gupta,
- Abstract要約: LLM提供は、極端に長さのばらつきを示し、実際はサイズベースのスケジューリングを困難にしている。
最近のスケジューラは予測デコード長やランクを用いてSJF/SRPTを近似する。
これらの予測駆動ポリシは、分散シフト、バースト到着、GPUメモリプレッシャの下で脆弱であることを示す。
- 参考スコア(独自算出の注目度): 15.499732774491683
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM serving exhibits extreme length variability, making size-based scheduling difficult in practice. Recent LLM schedulers approximate SJF/SRPT using predicted decode lengths or ranks and primarily report mean-centric metrics such as TTFT and TBT. We show that these prediction-driven policies can be fragile under distribution shifts, bursty arrivals, and GPU memory pressure, while offering limited control over the tail latency (P90-P99) that dominates user experience, even with perfect decode-length knowledge. We introduce a distribution-aware, prediction-free scheduling framework that replaces explicit length prediction with soft priority boosting driven by lightweight statistical signals. Our design co-optimizes scheduling and cache-aware preemption to account for memory-coupled decode dynamics across workload mixes. Evaluated on production and open-source traces, our method reduces P99 TTLT by up to 35-50% relative to SRPT with perfect length knowledge and reduces TTFT by 34-47% across workloads, including reasoning-heavy and chat-heavy tasks. These results demonstrate a robust alternative for optimizing tail latency in online LLM serving.
- Abstract(参考訳): LLM提供は、極端に長さのばらつきを示し、実際はサイズベースのスケジューリングを困難にしている。
最近のLCMスケジューラは、予測デコード長やランクを用いてSJF/SRPTを近似し、TTFTやTBTといった平均中心メトリクスを主に報告している。
これらの予測駆動型ポリシは、分散シフト、バースト到着、GPUメモリプレッシャにおいて脆弱であると同時に、完全なデコード長の知識でもユーザエクスペリエンスを支配しているテールレイテンシ(P90-P99)を限定的に制御できることを示す。
本稿では,明示的な長さ予測を,軽量な統計信号によって駆動されるソフトプライオリティ向上に置き換える,分布対応で予測不要なスケジューリングフレームワークを提案する。
我々の設計では、スケジューリングとキャッシュ対応プリエンプションを共同で最適化し、ワークロードミックス間のメモリ結合型デコードダイナミクスを考慮に入れます。
実運用およびオープンソーストレースを評価した結果,P99 TTLTをSRPTと比較して最大35~50%削減し,推論重タスクやチャット重タスクを含むワークロード間のTTFTを34~47%削減した。
これらの結果は、オンラインLLMサービスにおいて、テールレイテンシーを最適化するための堅牢な代替手段を示す。
関連論文リスト
- Predicting LLM Output Length via Entropy-Guided Representations [13.351384070796747]
本稿では,本モデルの内部隠蔽状態を有効長予測のために再利用する軽量フレームワークを提案する。
1) オンザフライアクティベーションとトークンエントロピーを用いて高精度な静的予測を行うEGTP (Entropy-Guided Token Pooling) である。
論文 参考訳(メタデータ) (2026-02-12T10:49:04Z) - Intra-request branch orchestration for efficient LLM reasoning [52.68946975865865]
大規模言語モデル(LLM)は、複雑なタスクの正確性を改善するために、推論時推論アルゴリズムにますます依存している。
それまでの作業は、トークンの使用を減らすことを中心に、多くの場合、正確さを犠牲にしつつ、他のレイテンシ要因を見越すことに重点を置いていた。
本稿では,LLMサービスシステムであるDUCHESSについて,予測によって導かれるリクエスト内ブランチオーケストレーションにより,精度を犠牲にすることなく,コストとレイテンシを低減できるシステムを提案する。
論文 参考訳(メタデータ) (2025-09-29T15:52:08Z) - Block: Balancing Load in LLM Serving with Context, Knowledge and Predictive Scheduling [0.0]
Blockは分散スケジューリングフレームワークで、ロードバランシングとサービスフレームワークのインスタンス間の自動プロビジョニングを最適化するように設計されている。
低オーバーヘッド、信頼性、スケーラビリティを実現するために、完全に分散し、ステートレスで予測可能なスケジューリングシステムとして動作する。
論文 参考訳(メタデータ) (2025-08-05T16:27:10Z) - Optimal Scheduling Algorithms for LLM Inference: Theory and Practice [6.043830060363904]
本稿では,大規模言語モデル推論システムにおけるルーティングとスケジューリングをモデル化する理論的枠組みを開発する。
スループット向上に不可欠な設計原則として,最適化タイリングと動的リソース割り当ての2つがあげられる。
本稿では,リソース・アウェア・ダイナミック(RAD)スケジューラが軽度条件下でスループットの最適化を実現することを示す。
論文 参考訳(メタデータ) (2025-08-01T18:12:21Z) - $\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts [55.231201692232894]
$textttSPECS$は、投機的デコードにインスパイアされた遅延対応のテスト時間スケーリングメソッドである。
我々の結果は、$textttSPECS$matchはビームサーチの精度を上回り、最大$sim$19.1%のレイテンシを削減していることを示している。
論文 参考訳(メタデータ) (2025-06-15T05:50:05Z) - Length Controlled Generation for Black-box LLMs [70.57649832433451]
大規模言語モデル (LLM) は印象的な命令に従う能力を示しているが、生成したテキストの長さを正確に管理することは困難である。
本稿では,Metropolis-Hastingsアルゴリズムと重要なサンプリング高速化戦略を組み合わせた,テキスト長制御のための新しい反復サンプリングフレームワークを提案する。
このフレームワークは,Llama3.1における長さ制御の抽象的要約などのタスクに対して,ほぼ100%の成功率を達成する。
論文 参考訳(メタデータ) (2024-12-19T09:07:38Z) - Don't Stop Me Now: Embedding Based Scheduling for LLMs [22.099820814682513]
SRPT(Shortest Remaining Process Time)のようなサイズベースのスケジューリングアルゴリズムは、平均的な要求完了時間を削減することを目的としている。
LLMシステムにおけるメモリオーバーヘッドを考慮した予測型SRPT変種を提案する。
論文 参考訳(メタデータ) (2024-10-01T19:51:07Z) - Sparse Fine-tuning for Inference Acceleration of Large Language Models [48.285897264669984]
大規模言語モデル(LLM)の精密細粒度調整の問題点について考察する。
蒸留型損失の詳細な研究を行い,L2に基づく蒸留手法をSquareHeadと呼ぶ。
MPTテキスト生成では、細かな微調整が精度低下なしに75%の間隔に到達できることを初めて示す。
論文 参考訳(メタデータ) (2023-10-10T18:28:38Z) - LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning [56.88751562302793]
低ランク適応 (LoRA) が大型言語モデル (LLM) に登場した。
LoRAPruneは、高度にメモリ効率の良い正確な構造化プルーンドモデルを提供する新しいフレームワークである。
LoRAPruneはWikiText2では4.81、TBでは3.46、メモリ使用量は52.6%減少している。
論文 参考訳(メタデータ) (2023-05-28T15:15:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。