論文の概要: Towards Load-Aware Prefill Deflection for Disaggregated LLM Serving
- arxiv url: http://arxiv.org/abs/2607.02043v1
- Date: Thu, 02 Jul 2026 11:10:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.800139
- Title: Towards Load-Aware Prefill Deflection for Disaggregated LLM Serving
- Title(参考訳): 降着型LCMサービングにおける負荷対応型プリフィルデフレクションの実現に向けて
- Abstract要約: P95 Time-to-First-Token (TTFT) の2-23%のプレフィル実行アカウント
そこで本研究では,プロアクティブなプリフィル定義スケジューラを提案する。このスケジューラにより,デコードノードは,要求のプリフィルフェーズを,飛行中のデコードバッチとインターリーブされたチャンクドプレフィルステップとして提供することができる。
- 参考スコア(独自算出の注目度): 3.5681110041631565
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Disaggregated LLM serving runs prefill and decode on separate GPU pools to keep the two phases from interfering. In practice, this creates a new asymmetry: under bursty, heavy-tailed workloads prefill nodes saturate while decode nodes have compute underutilized, and on a production-style A100 cluster with 2 prefill and 2 decode nodes (2P2D), we find that prefill execution accounts for only 2-23% of P95 Time-to-First-Token (TTFT). Queuing and inter-node GPU-GPU KV-cache transfer account for the rest. We present a proactive prefill-deflecting scheduler that lets decode nodes serve prefill phase of requests as chunked-prefill steps interleaved with their in-flight decode batches. For each queued request, we estimate the TTFT it would see on the prefill node, and on every decode node, search for the largest chunk schedule that keeps in-flight decodes within their Time-Between-Tokens (TBT) SLO and deflect when the decode path helps tail latency. Because the prefill phase of deflected requests runs in place on the decode node, the inter-node KV transfer is eliminated. Implemented on vLLM and evaluated on production-style traces with DeepSeek-V2-Lite, our approach reduces P95 TTFT by upto 81% and raises SLO attainment by upto 79% over state-of-the-art disaggregated schedulers, at sub-millisecond per-request routing cost.
- Abstract(参考訳): Disaggregated LLMはプリフィルを実行し、2つのフェーズの干渉を防ぐために、別々のGPUプールでデコードする。
2つのプリフィルノードと2つのデコードノード(2P2D)を持つプロダクションスタイルのA100クラスタでは、P95 Time-to-First-Token(TTFT)の2~23%のプレフィル実行アカウントしかありません。
ノード間GPU-GPU-KV-cache転送のキュー処理とノード間GPU-GPU-KV-cache転送は、残りの部分を占める。
そこで本研究では,プロアクティブなプリフィル定義スケジューラを提案する。このスケジューラにより,デコードノードは,要求のプリフィルフェーズを,飛行中のデコードバッチとインターリーブされたチャンクドプレフィルステップとして提供することができる。
各キューリクエストに対して、プリフィルノードで見られるTTFTを推定し、各デコードノードで最大のチャンクスケジュールを検索します。
偏向された要求のプリフィルフェーズはデコードノード上で実行されるため、ノード間KV転送は排除される。
提案手法は,vLLMに実装し,DeepSeek-V2-Liteを用いて実運用スタイルのトレースを評価した結果,P95 TTFTを最大81%削減し,最先端の非集約型スケジューラに対してSLOの達成率を最大79%向上させる。
関連論文リスト
- Communication-Efficient LLM Adaptation over Decentralized GPU Meshes [48.95736135870457]
本稿では,事前学習後適応のための非同期2回路システムを提案する。
高速圧縮トレーニング回路は、パイプライン並列転送と圧縮データ並列同期のためのマスキングアクティベーションを用いたスループットを駆動する。
マスクは,この方法で固定された場合,高い圧縮速度でプレトレーニング後の適応を支援する。
論文 参考訳(メタデータ) (2026-09-13T06:56:50Z) - Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata [57.27430779838529]
有限オートマトンとして表現可能な任意の制約の下で,制約付き平均場後部からサンプリングする,正確かつトラクタブルなアルゴリズムを提案する。
このアプローチは、構築による制約満足度を保証し、欲求とサンプリングベースのデコーディングの両方をサポートし、並列およびブロックワイドデコーディングと互換性がある。
Dream-7B と LLaDA-8 の実証的な評価は、様々なタスクにおいてかなりの精度の向上を示した。
論文 参考訳(メタデータ) (2026-07-08T05:48:57Z) - DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation [69.8840101036735]
投機的復号化はLarge Language Model (LLM)推論を加速させる。
最近の並列起草者は、1つの前方通過で長いトークン列を効率的に提案するが、トークン間の依存関係が欠如しているため、急速に受け入れが低下する。
我々はDSparkという投機的復号化フレームワークを導入し、高いスループットの並列生成を適応的かつロードアウェアな検証と統合する。
論文 参考訳(メタデータ) (2026-07-06T14:28:06Z) - NetKV: Network-Aware Decode Instance Selection for Disaggregated LLM Inference [0.0]
現在のスケジューラは、計算負荷とプレフィックスキャッシュのローカリティのみをルートする。
ネットワーク用語を無視した場合、コンテキスト長が増加するにつれてキャッシュのみのスケジューリングが任意に準最適であることを示す。
我々は、NetKVがラウンドロビンで平均TTFTを21.2%、調整されたキャッシュ+ロード対応スケジューラで17.6%削減することを示した。
論文 参考訳(メタデータ) (2026-06-02T17:06:57Z) - DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing [15.376910065679994]
DuetServeは、単一のGPU内で分散レベルの分離を実現する統一LLMサービスフレームワークである。
DuetServeは、最先端フレームワークと比較して、低ジェネレーションレイテンシを維持しながら、スループットを最大1.3倍改善する。
論文 参考訳(メタデータ) (2025-11-06T20:18:34Z) - From Tokens to Layers: Redefining Stall-Free Scheduling for LLM Serving with Layered Prefill [8.04085002818041]
大規模言語モデル(LLM)は、TTFT(Time-to-first-token)とTBT(Time-between-token)の両方に対して、厳密なサービスレベル目標を満たす必要がある。
現代のサービスシステムでは、チャンクプリフィルのようなストールフリーなスケジューリング技術を採用している。
本稿では,トランスフォーマ層群を主スケジューリング単位として扱う新しいスケジューリングパラダイムであるLayered Prefillを提案する。
論文 参考訳(メタデータ) (2025-10-09T10:41:35Z) - AsyncSpade: Efficient Test-Time Scaling with Asynchronous Sparse Decoding [35.10915929939651]
テストタイムスケーリング(TTS)は長いチェーン・オブ・シント(CoT)を介してLCM推論を促進する
KV-cache成長は、LLMデコーディングのメモリバウンドボトルネックを増幅する。
2つのコアコンポーネント上に構築された効率的なTSのための非同期フレームワークであるAsyncSpadeを提案する。
論文 参考訳(メタデータ) (2025-10-08T19:36:11Z) - Spiralformer: Low Latency Encoder for Streaming Speech Recognition with Circular Layer Skipping and Early Exiting [70.75913449565203]
Transformerベースのエンコーダはブロック処理に広く使われている。
本稿では,ブロック処理に適した新しいエンコーダSpralformerを提案する。
実験の結果,Librispeechにおける平均トークン放出遅延は21.6%減少した。
論文 参考訳(メタデータ) (2025-10-01T14:56:45Z) - dParallel: Learnable Parallel Decoding for dLLMs [77.24184219948337]
拡散大言語モデル(dLLM)は並列トークン予測と低推論遅延を提供する。
既存のオープンソースモデルは、パフォーマンスを確保するためにトークン長のデコードステップをほとんど必要としています。
高速サンプリングのためにdLLMs固有の並列性を解き放つシンプルで効果的な方法であるdParallelを導入する。
論文 参考訳(メタデータ) (2025-09-30T16:32:52Z) - Intra-request branch orchestration for efficient LLM reasoning [52.68946975865865]
大規模言語モデル(LLM)は、複雑なタスクの正確性を改善するために、推論時推論アルゴリズムにますます依存している。
それまでの作業は、トークンの使用を減らすことを中心に、多くの場合、正確さを犠牲にしつつ、他のレイテンシ要因を見越すことに重点を置いていた。
本稿では,LLMサービスシステムであるDUCHESSについて,予測によって導かれるリクエスト内ブランチオーケストレーションにより,精度を犠牲にすることなく,コストとレイテンシを低減できるシステムを提案する。
論文 参考訳(メタデータ) (2025-09-29T15:52:08Z) - Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving [4.309392302169281]
エンジンレベルのプリフィル・デコード(PD)デアグリゲーションは干渉を避けるが、高いハードウェアと調整オーバーヘッドを引き起こす。
PDは、最大2.2倍のスループット、20倍のTTFT、2.5倍のTBTを達成する。
論文 参考訳(メタデータ) (2025-07-09T07:27:18Z) - POD-Attention: Unlocking Full Prefill-Decode Overlap for Faster LLM Inference [9.164093249308419]
我々は、ハイブリッドバッチの注意を効率的に計算する最初のGPUカーネルであるPOD-Attentionを紹介する。
POD-Attentionは、GPUのリソースを慎重に割り当てることで、計算帯域とメモリ帯域の両方の利用を最大化することを目的としている。
論文 参考訳(メタデータ) (2024-10-23T17:06:56Z) - Let the Code LLM Edit Itself When You Edit the Code [50.46536185784169]
underlinetextbfPositional textbfIntegrity textbfEncoding (PIE)
PIEは、標準的な完全再計算手法に比べて計算オーバーヘッドを85%以上削減する。
その結果、PIEは計算オーバーヘッドを標準の完全再計算手法に比べて85%以上削減することを示した。
論文 参考訳(メタデータ) (2024-07-03T14:34:03Z) - Hardware-Aware Parallel Prompt Decoding for Memory-Efficient Acceleration of LLM Inference [23.633481089469836]
LLM(Large Language Models)の自動回帰デコーディングは、ハードウェアの性能に大きなオーバーヘッドをもたらす。
トレーニング可能なパラメータを0.0002$%しか必要とせず,A100-40GBのGPUをたった16時間で効率的にトレーニングできる並列プロンプトデコーディングを提案する。
我々のアプローチでは、最大2.49$times$ スピードアップを示し、最小のメモリオーバーヘッドは0.0004$%である。
論文 参考訳(メタデータ) (2024-05-28T22:19:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。