論文の概要: Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving
- arxiv url: http://arxiv.org/abs/2606.01839v1
- Date: Mon, 01 Jun 2026 07:51:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:31.579175
- Title: Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving
- Title(参考訳): 予測ではなく観察:エージェント・サービングのための会話レベル分解スケジューリング
- Authors: Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann,
- Abstract要約: LLMベースのエージェントは、多くの依存的推論とツールコールを通じてユーザータスクを解決します。
既存のマルチターンシステムはスケジューリングユニットとしてターンを保持し、プリフィルをデコードから切り離すかどうかをターンごとに決定する。
我々は、この予測への依存が、作業負荷ではなくスケジューリングユニットによって課されることを示す。
- 参考スコア(独自算出の注目度): 5.947045522037733
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based agents resolve a user task through many turns of dependent inference and tool calls, producing a workload whose total cost is unknown when the task arrives. Existing multi-turn systems keep the turn as the scheduling unit and decide, turn by turn, whether to disaggregate prefill from decode. That decision rests on the turn's decode length, tool behavior, and KV growth, quantities that are not observable when the scheduler must act, forcing the system to predict them. We show this dependence on prediction is imposed by the scheduling unit, not the workload. Raising the scheduling unit from the turn to the conversation converts turn-level irregularity into a stable, two-phase structure: 1) a compute-bound turn-1 prefill followed by 2) a long, memory-bound tail. Thus, with the conversation as the scheduling unit, placement reduces to reading the first-turn input length and per-decoder KV occupancy, both directly observable. We instantiate this principle in ConServe, which routes the first-turn prefill to a high-throughput prefiller, transfers the KV cache exactly once, and pins the conversation to a single decoder for its entire tail, with no learned model of decode-side cost. Against a per-turn prediction baseline, ConServe reduces p95 time-to-first-effective-token (the latency of a conversation's first user-visible output) by 51.08% and improves energy efficiency by 7.51% while preserving last-turn TBT and SLOs; mapping the two phases onto heterogeneous GPU tiers adds a further 22.75% in energy efficiency.
- Abstract(参考訳): LLMベースのエージェントは、多くの頼りの推論とツールコールを通じてユーザタスクを解決し、タスクが到着した時点で総コストが不明なワークロードを生成する。
既存のマルチターンシステムはスケジューリングユニットとしてターンを保持し、プリフィルをデコードから切り離すかどうかをターンごとに決定する。
この決定は、スケジューラが動作しなければならないときに観測不可能な量であるターンのデコードの長さ、ツールの動作、KV成長にかかっており、システムがそれらを予測せざるを得ない。
我々は、この予測への依存が、作業負荷ではなくスケジューリングユニットによって課されることを示す。
順番から会話までのスケジューリングユニットのレイアウトは、ターンレベルの不規則性を安定な2相構造に変換する。
1) 計算バウンドターン-1前処理後
2)長めのメモリバウンドテール。
これにより、会話をスケジューリング単位として、配置は、直接観察可能な第1ターンの入力長とデコーダ毎のKV占有率に還元される。
我々はこの原理をConServeでインスタンス化し、第1ターンプリフィルを高スループットプリフィルにルーティングし、KVキャッシュを正確に1回転送し、会話を1つのデコーダにピン留めする。
ターン毎の予測ベースラインに対して、ConServeはp95のタイム・ツー・ファースト・エフェクト・トケン(会話の最初のユーザ可視出力のレイテンシ)を51.08%削減し、最後のターンTBTとSLOを保存しながらエネルギー効率を7.51%改善する。
関連論文リスト
- Good to Go: The LOOP Skill Engine That Hits 99% Success and Slashes Token Usage by 99% via One-Shot Recording and Deterministic Replay [14.181844060152367]
99%の成功率と99%のトークン削減を実現するシステムである LOOP SKILL ENGINE を提案する。
決定論的実行計画は、時間依存変数と結果依存変数をパラメータ化しながら、タスクの機能的意図をキャプチャする。
周期的エージェントタスクのベンチマークが5分から24時間に及ぶ間、Loop Skill Engineは毎月のトークン消費を93.3%--99.98%削減し、実行遅延を8.7倍削減し、出力非決定性を排除している。
論文 参考訳(メタデータ) (2026-05-14T01:05:35Z) - Predictive Scheduling for Efficient Inference-Time Reasoning in Large Language Models [6.002670452103349]
大規模言語モデル(LLM)は複雑な推論タスクにおいて最先端の精度を達成する。
しかし、クエリ毎に固定されたトークン予算を使用することで、簡単な入力の過剰計算とハードな入力の過小計算につながる。
プラグイン・アンド・プレイのフレームワークであるPredictive Schedulingを導入する。このフレームワークは軽量な予測器を事前実行し、各クエリの最適な推論の長さや難易度を全世代前に推定する。
論文 参考訳(メタデータ) (2026-02-01T13:58:23Z) - Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap [0.8763937152756086]
より微細な計算通信の重複をFiCCOと呼ぶ。
我々は,FiCCOがシャードレベルでのみ実行スケジュールの広い設計空間をオープンにしていることを示す。
次に、これらの非効率損失の詳細な特徴を提示し、FiCCOスケジュールの設計空間を提示し、最終的に共用非効率シグネチャでスケジュールをオーバーレイする。
論文 参考訳(メタデータ) (2025-12-11T02:43:27Z) - Training-free Context-adaptive Attention for Efficient Long Context Modeling [57.703159205740185]
トレーニングフリーコンテキスト適応注意(TCA-Attention)は、学習不要なスパースアテンション機構であり、効率的な長文推論のための情報トークンのみに選択的に参画する。
TCA-Attentionは2.8$times$のスピードアップを実現し、128Kのコンテキスト長でKVキャッシュを61%削減し、フルアテンションに匹敵するパフォーマンスを維持している。
論文 参考訳(メタデータ) (2025-12-10T01:54:57Z) - AsyncSpade: Efficient Test-Time Scaling with Asynchronous Sparse Decoding [35.10915929939651]
テストタイムスケーリング(TTS)は長いチェーン・オブ・シント(CoT)を介してLCM推論を促進する
KV-cache成長は、LLMデコーディングのメモリバウンドボトルネックを増幅する。
2つのコアコンポーネント上に構築された効率的なTSのための非同期フレームワークであるAsyncSpadeを提案する。
論文 参考訳(メタデータ) (2025-10-08T19:36:11Z) - Intra-request branch orchestration for efficient LLM reasoning [52.68946975865865]
大規模言語モデル(LLM)は、複雑なタスクの正確性を改善するために、推論時推論アルゴリズムにますます依存している。
それまでの作業は、トークンの使用を減らすことを中心に、多くの場合、正確さを犠牲にしつつ、他のレイテンシ要因を見越すことに重点を置いていた。
本稿では,LLMサービスシステムであるDUCHESSについて,予測によって導かれるリクエスト内ブランチオーケストレーションにより,精度を犠牲にすることなく,コストとレイテンシを低減できるシステムを提案する。
論文 参考訳(メタデータ) (2025-09-29T15:52:08Z) - Open-Vocabulary Spatio-Temporal Scene Graph for Robot Perception and Teleoperation Planning [55.90805559207812]
動的リモートシーンでは、双方向通信における伝送遅延は、リモート認識状態とオペレータ意図の間のギャップを生じさせる。
本稿では,時間的ダイナミクスと軽量遅延アノテーションを用いて,オープン語彙認識を充実させる表現を提案する。
提案手法はReplicaベンチマークで74%のノード精度を実現し,Concept.Graphよりも優れていた。
論文 参考訳(メタデータ) (2025-09-27T04:31:24Z) - Equinox: Holistic Fair Scheduling in Serving Large Language Models [28.781202256075343]
本稿では,ユーザとオペレータの視点を分離したデュアルカウンタフレームワークを提案する。
ユーザフェアネスカウンタは、重み付きトークンとレイテンシによってサービスの品質を測定し、リソースフェアネスカウンタはスループットとGPU利用を通じて運用効率を測定する。
これらのメトリクスは実行後のみ利用可能であるため、ユーザ認識のレイテンシ、出力トークン、スループット、GPU使用率を予測するために、決定論的混合予測エキスパート(MoPE)フレームワークを導入します。
論文 参考訳(メタデータ) (2025-08-19T06:17:17Z) - Think Twice before Driving: Towards Scalable Decoders for End-to-End
Autonomous Driving [74.28510044056706]
既存のメソッドは通常、分離されたエンコーダ-デコーダパラダイムを採用する。
本研究は,この問題を2つの原則で緩和することを目的としている。
まず、エンコーダの特徴に基づいて、粗い将来の位置と行動を予測する。
そして、その位置と動作を条件に、将来のシーンを想像して、それに従って運転した場合にその影響を確認する。
論文 参考訳(メタデータ) (2023-05-10T15:22:02Z) - Decoder Tuning: Efficient Language Understanding as Decoding [84.68266271483022]
本稿では,タスク固有のデコーダネットワークを出力側で最適化するデコーダチューニング(DecT)を提案する。
勾配ベースの最適化により、DecTは数秒以内にトレーニングでき、サンプル毎に1つのPクエリしか必要としない。
我々は、広範囲にわたる自然言語理解実験を行い、DecTが200ドル以上のスピードアップで最先端のアルゴリズムを大幅に上回っていることを示す。
論文 参考訳(メタデータ) (2022-12-16T11:15:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。