論文の概要: Jumping the Line: Exploiting Length Predictions in LLM Scheduling
- arxiv url: http://arxiv.org/abs/2610.03430v1
- Date: Fri, 02 Oct 2026 15:12:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.437375
- Title: Jumping the Line: Exploiting Length Predictions in LLM Scheduling
- Title(参考訳): ラインジャンプ: LLMスケジューリングにおける長さ予測の爆発
- Abstract要約: JILは予測ベースの大規模言語モデル(LLM)スケジューラに対する攻撃である。
スケジューリング信号を操作して優先度を高め、完了時間を短縮する。
JIL を2つのデータセットと4つの LLM で評価し,要求プロファイルとデプロイメント設定を多用した。
- 参考スコア(独自算出の注目度): 6.588918521735523
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Efficient request scheduling is increasingly important for reducing completion time in large language model (LLM) serving. Size-based policies such as Shortest Job First prioritize shorter requests, but output lengths are unknown before generation, so practical schedulers rely on predicted lengths. We introduce JIL, an attack on prediction-based LLM schedulers that manipulates the scheduling signal to obtain higher priority and reduce completion time. Using TRAIL as a case study, JIL optimizes an adversarial suffix that causes a lightweight output-length probe to underestimate a request's length. We evaluate JIL on two datasets and four LLMs across varied request profiles and deployment configurations. JIL reduces predicted output lengths by up to 83.4 percent, and adversarial requests complete up to 1.53 times faster on average in end-to-end serving experiments. The reduction in predicted length is substantially larger than the change in actual output length, revealing a mismatch between the scheduler's estimate and the request's realized size. Response utility varies across models and tasks, exposing a trade-off between scheduling advantage and response quality. We also evaluate scheduler-side defenses and find that grouping length predictions into coarse intervals reduces JIL's scheduling advantage and mitigates delays to benign requests.
- Abstract(参考訳): 大規模言語モデル(LLM)サービスにおける完了時間を短縮するために、効率的な要求スケジューリングがますます重要になっている。
Shortest Job Firstのようなサイズベースのポリシーは、短いリクエストを優先するが、生成前に出力長が不明であるため、実用的なスケジューラは予測長に依存する。
本稿では,予測に基づくLLMスケジューラに対する攻撃であるJILを導入し,スケジューリング信号を操作して優先度を高め,完了時間を短縮する。
TRAILをケーススタディとして、JILは、軽量な出力長プローブが要求の長さを過小評価する敵の接尾辞を最適化する。
JIL を2つのデータセットと4つの LLM で評価し,要求プロファイルとデプロイメント設定を多用した。
JILは予測出力長を最大83.4%削減し、敵対的要求はエンドツーエンドのサービス実験で平均1.53倍速く完了する。
予測長の削減は実際の出力長の変化よりも大幅に大きく、スケジューラの推定値と要求の実現サイズとのミスマッチが明らかになる。
応答ユーティリティはモデルやタスクによって異なり、スケジューリングの利点とレスポンスの品質のトレードオフが露呈する。
また,スケジューラ側の防御も評価し,スケジューラ長予測を粗い間隔にグループ化することで,JILのスケジューリングの利点を低減し,良質な要求に対する遅延を軽減できることを示す。
関連論文リスト
- Predict, Don't Iterate: Efficient Adaptive-Length Infilling for Diffusion Language Models [78.02669593911784]
拡散言語モデル (DLMs) は自己回帰パラダイムに代わる有望な代替品として登場した。
本稿では,DLMの効率的な埋め込み法であるPILL(Probing-based InfiLling with preset-Length-free decoding)を提案する。
論文 参考訳(メタデータ) (2026-09-02T04:52:01Z) - Robust Length Prediction: A Perspective from Heavy-Tailed Prompt-Conditioned Distributions [61.56973419225008]
既存の出力長予測法は、プロンプトのみの予測では信頼性が低い。
本稿では,同じプロンプトからトレーニング対象を構成するプロンプト条件付き長さ分布法を提案する。
さまざまなシナリオにわたる実験では、予測品質が一貫した向上を示している。
論文 参考訳(メタデータ) (2026-04-09T07:49:52Z) - Scheduling LLM Inference with Uncertainty-Aware Output Length Predictions [16.877407702260243]
既存のメソッドは通常、スケジューリングを容易にするためにリクエスト毎に単一の出力長を予測する。
SJFスケジューリングにおける出力長の代替として,Tail Inflated expectation (TIE)を提案する。
TIEは、オンライン推論のために、トーケン毎のレイテンシを2.31ドル削減し、オフラインデータ生成のために、スループットを1.42ドル改善する。
論文 参考訳(メタデータ) (2026-04-01T05:31:21Z) - Adaptively Robust LLM Inference Optimization under Prediction Uncertainty [9.541681114575812]
本稿では,Large Language Model (LLM) 推論スケジューリングを最適化し,全遅延を最小化する問題について検討する。
LLM推論の鍵となる課題は、実行時の長さが分かる一方で、メモリ使用量や処理時間に重大な影響を及ぼす出力長が不明であることである。
本稿では,各要求に対して間隔分類(min-max range)を提供すると仮定して,機械学習を利用して出力長を予測するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-08-20T08:55:26Z) - ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning [68.02825465552779]
我々は、思考長を長く考えるLLMに対して、シンプルで効果的な方法であるThinkPruneを提案する。
AIME24データセットでは、DeepSeek-R1-Distill-Qwen-1.5Bの推論長は、パフォーマンスがわずか2%低下しただけで半分削減できる。
論文 参考訳(メタデータ) (2025-04-02T01:59:26Z) - Cost-Optimal Grouped-Query Attention for Long-Context Modeling [45.981681856747365]
Grouped-Query Attention(GQA)は、大規模言語モデルにおける注目層の計算コストを削減するための広く採用されている戦略である。
我々は,文脈長,モデルサイズ,GQA構成,モデル損失の関係を分析する。
コスト最適GQA構成の導出法を提案する。
論文 参考訳(メタデータ) (2025-03-12T17:50:42Z) - Don't Stop Me Now: Embedding Based Scheduling for LLMs [22.099820814682513]
SRPT(Shortest Remaining Process Time)のようなサイズベースのスケジューリングアルゴリズムは、平均的な要求完了時間を削減することを目的としている。
LLMシステムにおけるメモリオーバーヘッドを考慮した予測型SRPT変種を提案する。
論文 参考訳(メタデータ) (2024-10-01T19:51:07Z) - Efficient LLM Scheduling by Learning to Rank [19.33941579312897]
そこで本研究では,要求の集合における出力長の相対的なランクを,学習者によるランク付けによって予測可能であることを示す。
我々は,LLM推論のための新しいスケジューラを開発し,SJFスケジュールを既存手法よりも高速に近似する。
論文 参考訳(メタデータ) (2024-08-28T13:35:54Z) - Tree-Planner: Efficient Close-loop Task Planning with Large Language Models [63.06270302774049]
Tree-Plannerは、大きな言語モデルでタスクプランニングを3つの異なるフェーズに再構成する。
Tree-Plannerは高い効率を維持しながら最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-10-12T17:59:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。