論文の概要: SMetric: Rethink LLM Scheduling for Serving Agents with Balanced Session-centric Scheduling
- arxiv url: http://arxiv.org/abs/2607.08565v1
- Date: Thu, 09 Jul 2026 14:55:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.572464
- Title: SMetric: Rethink LLM Scheduling for Serving Agents with Balanced Session-centric Scheduling
- Title(参考訳): Smetric: セッション中心スケジューリングのバランスをとるエージェントのためのLLMスケジューリングを再考する
- Authors: Jiahao Wang, Kaizhan Lin, Kaixi Zhang, Jinbo Han, Xingda Wei, Sijie Shen, Chenguang Fang, Wenyuan Yu, Rong Chen, Haibo Chen,
- Abstract要約: 本稿では,まず,実世界の2つのトレース上のエージェントに対する要求スケジューリングの体系的研究を行う。
KV再利用を増やすために、既存のスケジューラはKV$をキャッシュするインスタンスへのルーティングリクエストを過度に優先順位付けし、残りはアイドル状態のまま数回オーバーロードする。
負荷バランスは,(1)グローバルレベルのKV$ストアのおかげで,すべてのKV$再利用を犠牲にする必要はなく,(2)ワークロードのセッション内ローカリティを活用して,少数の要求のバランスをとる。
- 参考スコア(独自算出の注目度): 15.417560263956775
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM scheduling is critical to serving, yet it remains unclear how well existing designs fit agentic serving--with LLM requests issued by agents instead of humans. This shifts the workload in two ways: (1) agents act only on complete responses, making the cluster's tokens per second (TPS) the primary goal and relaxing--not eliminating--per-token latency requirements; and (2) requests share much of their KV\$-reuse exceeds 80% of request tokens in a production trace from BAILIAN, versus 54-62% in chat. This paper first contributes a systematic study of request scheduling for agents on two real-world traces. We find that to increase KV\$ reuse, existing schedulers overly prioritize routing requests to instances caching their KV\$, overloading a few while leaving the rest idle, capping TPS. We thus present two key insights: (1) load balance need not sacrifice all KV\$ reuse, thanks to the global-tier KV\$ store and (2) by utilizing the workload's intra-session locality, balancing a small fraction of requests--the first request in each agent session--suffices to balance the cluster without sacrificing most KV\$ reuse on local instances. SMETRIC realizes these insights with balanced session-centric scheduling: it routes each session's first request purely for load balance and its follow-up requests in a cache-aware manner, preserving load balance and local reuse while keeping demand on the global tier low. Using the session turn information as the scheduling metric is deliberate: it is derived efficiently and accurately from the user inputs alone, so the scheduler stays clean and stateless. SMETRIC improves cluster TPS by 10-16% under prefill-decode colocation with a global store and prefill TPS by 2-34% under disaggregation over state-of-the-art schedulers, also with a better per-token latency.
- Abstract(参考訳): LLMスケジューリングは役に立たないが、既存の設計が人間ではなくエージェントによって発行されるLLMリクエストにどの程度適合するかは明らかではない。(1)エージェントが完全なレスポンスのみに作用し、クラスタのトークンを秒間(TPS)で緩和し、緩和する。(2)リクエストの多くは、BAILIANからのプロダクショントレースで要求トークンの80%以上を共有できるが、チャットでは54-62%である。
本稿では,まず,実世界の2つのトレース上のエージェントに対する要求スケジューリングの体系的研究を行う。
KV\$の再利用を増やすために、既存のスケジューラは、KV\$をキャッシュするインスタンスへのルーティングリクエストを過度に優先順位付けし、残りをアイドルにしてTPSをカプセル化する。
その結果,(1)グローバル層であるKV\$ストアのおかげで,すべてのKV\$再利用を犠牲にする必要はなく,(2)ワークロードのセッション内ローカリティを活用して,リクエストのごく一部をバランスさせることで,各エージェントのセッションで最初のリクエストを,ローカルインスタンス上でほとんどのKV\$再利用を犠牲にすることなくクラスタのバランスをとることができる,という2つの重要な洞察が得られた。
SMETRICは、各セッションの最初の要求を純粋にロードバランシングとフォローアップリクエストにルーティングし、グローバル層への需要を低く保ちながら、ロードバランシングとローカルリユースを保存する。
セッションのターン情報をスケジューリング基準として、ユーザが入力しただけで効率的に正確に導き出すので、スケジューラはクリーンでステートレスである。
SMETRICは、グローバルストアとのプリフィル・デコード・コロケーションの下でクラスタTPSを10-16%改善し、ステート・オブ・ザ・アーティカルスケジューラを分解してTPSを2-34%改善する。
関連論文リスト
- PRISM: Fast Online LLM Serving via Scheduling-Memory Co-design [5.476189551376108]
本稿では、要求対応のラッドツリー(DART)とクエリ対応のスケジューラ(QAS)を共同設計し、要求の受け入れを正確なKV保持と整合させるPRISMを提案する。
評価の結果,最強のベースラインに対して,PRISMはQPS P99 TTFT平均を23.3%,P99 TTFT平均を37.1%削減し,KV-cacheの精度は4Bモデルと13Bモデルでそれぞれ5.9,12.2ポイント向上した。
論文 参考訳(メタデータ) (2026-05-09T00:48:25Z) - SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters [13.891522069967507]
本稿では,複合AIワークロードのプログラムレベルスケジューリングへのシフトを提案する。
本稿では,この抽象化を実現する分散スケジューラSAGAを提案する。
論文 参考訳(メタデータ) (2026-05-01T09:05:28Z) - Dual-Pool Token-Budget Routing for Cost-Efficient and Reliable LLM Serving [9.457255218406333]
プロダクションvLLMフリートは通常、最悪のコンテキスト長に対して各インスタンスをプロビジョニングする。
実際には、80-95%のリクエストは短いが、長いコンテキストに最適化された設定の下で提供される。
本稿では,同種艦隊を2つの専用プールに分割する軽量ディスパッチ機構であるデュアルプールトークン予算ルーティングを提案する。
論文 参考訳(メタデータ) (2026-04-09T10:47:20Z) - Duration Aware Scheduling for ASR Serving Under Workload Drift [1.371949194229761]
本稿では,Whisper などの ASR モデルにおいて,音声長がジョブ処理時間の正確なプロキシであることを示す。
我々は2つの古典的アルゴリズム、SJF(Shortest Job First)とHRRN(Highest Response Ratio Next)を統合する。
HRRNは、このトレードオフに対処する: 中央値のE2Eレイテンシを最大28%まで下げると同時に、テールレイテンシの劣化を24%以上に制限する。
論文 参考訳(メタデータ) (2026-03-11T20:06:32Z) - Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling [75.36692892951018]
トレーニング中のバッチサイズの増加は、大規模な言語モデルの事前トレーニングを加速するための有望な戦略である。
この研究はバッチサイズスケジューリングのための原則化されたフレームワークを開発する。
標準スケジューラが学習率を半減するたびに、Seesawは1/sqrt2$と倍増し、バッチサイズを倍増します。
論文 参考訳(メタデータ) (2025-10-16T14:17:38Z) - Intra-request branch orchestration for efficient LLM reasoning [52.68946975865865]
大規模言語モデル(LLM)は、複雑なタスクの正確性を改善するために、推論時推論アルゴリズムにますます依存している。
それまでの作業は、トークンの使用を減らすことを中心に、多くの場合、正確さを犠牲にしつつ、他のレイテンシ要因を見越すことに重点を置いていた。
本稿では,LLMサービスシステムであるDUCHESSについて,予測によって導かれるリクエスト内ブランチオーケストレーションにより,精度を犠牲にすることなく,コストとレイテンシを低減できるシステムを提案する。
論文 参考訳(メタデータ) (2025-09-29T15:52:08Z) - ConServe: Fine-Grained GPU Harvesting for LLM Online and Offline Co-Serving [61.35068981176018]
ConServeは、高いスループットと強力なオンラインレイテンシ保証を実現する大規模言語モデル(LLM)サービスシステムである。
我々は,ConServeが平均2.2$times$高スループットを実現し,オンラインサービステールのレイテンシを最先端システムと比較して平均2.9$times$削減することを示した。
論文 参考訳(メタデータ) (2024-10-02T04:12:13Z) - Preble: Efficient Distributed Prompt Scheduling for LLM Serving [8.706905652975554]
本稿では,プロンプト共有をターゲットとし最適化する最初の分散LLMサービスプラットフォームであるPrebleを提案する。
我々は,新しいスケジューリングアルゴリズムと階層的スケジューリング機構を用いて,KV状態の再利用と計算負荷分散を協調的に最適化する分散スケジューリングシステムを構築した。
2つのオープンソースLCM上での実際のワークロードと要求到着パターンによるPrebleの評価は、平均レイテンシで1.5倍から14.5倍、p99レイテンシで2倍から10倍のSOTAサービスシステムより優れていることを示している。
論文 参考訳(メタデータ) (2024-05-08T06:30:58Z) - DASA: Delay-Adaptive Multi-Agent Stochastic Approximation [64.32538247395627]
我々は,N$エージェントが並列に動作し,中央サーバと通信することで,一般的な近似問題を高速化することを目的とした設定を考える。
遅延とストラグラーの効果を軽減するために,マルチエージェント近似のための遅延適応アルゴリズムである textttDASA を提案する。
論文 参考訳(メタデータ) (2024-03-25T22:49:56Z) - SpotServe: Serving Generative Large Language Models on Preemptible
Instances [64.18638174004151]
SpotServeは、プリエンプティブルインスタンスにシステムを提供する最初の分散大規模言語モデルである。
SpotServeは、既存のLLMサービスシステムと比較して、P99テールのレイテンシを2.4~9.1倍削減できることを示す。
また、SpotServeはプリエンプティブインスタンスの価格優位性を利用して、オンデマンドインスタンスのみを使用する場合と比較して54%の金銭的コストを節約できることも示しています。
論文 参考訳(メタデータ) (2023-11-27T06:31:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。