論文の概要: SlackDrive: Reclaiming Runtime Slack for Adaptive Driving Inference
- arxiv url: http://arxiv.org/abs/2609.28064v1
- Date: Wed, 23 Sep 2026 13:13:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.026798
- Title: SlackDrive: Reclaiming Runtime Slack for Adaptive Driving Inference
- Title(参考訳): SlackDrive: 適応駆動推論のためのランタイムSlackの再利用
- Abstract要約: 我々は、ワールドアクションモデルを駆動するプリ推論計算アロケータである textbfSlackDrive を提案する。
SlackDriveは、モデル実行前の各コントロールステップの計算予算を選択するために、実行中のレイテンシを再利用する。
DriveDreamer-Policyを使用したNAVSIM v2では、SlackDriveはレイテンシ制約付きSを、強いレイテンシ体制の下で最強のベースラインに対して21.7%改善する。
- 参考スコア(独自算出の注目度): 63.65135278399311
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Driving world-action models improve planning by coupling multimodal reasoning with future prediction, but their growing inference cost increasingly conflicts with the real-time latency requirements of vehicle control. Existing acceleration methods reduce tokens, layers, or sampling steps with policies selected prior to deployment, yet leave residual runtime variation largely unexploited after offline profiling and static scheduling on shared onboard compute. We observe that the largest admissible compute budget varies systematically with the residual runtime state, while recent realized latency provides a direct signal of the available compute slack. Motivated by this observation, we propose \textbf{SlackDrive}, a pre-inference compute allocator that reuses realized latency to select the compute budget of each control step before model execution. SlackDrive profiles the latency and planning utility of a small discrete budget set once, estimates online compute state from completed forwards, and selects the highest-utility budget predicted to remain within the admissible latency envelope, complementing existing profiling and resource scheduling while preserving the driving backbone and its compute actuator. On NAVSIM v2 with DriveDreamer-Policy, SlackDrive improves latency-constrained EPDMS by $21.7\%$ over the strongest baseline under a stringent latency regime, while the full-budget model and preconfigured token-pruning baselines exceed the admissible latency envelope under runtime contention.
- Abstract(参考訳): 世界行動を駆動するモデルは、将来の予測とマルチモーダル推論を結合することで計画を改善するが、その増大する推論コストは、車両制御のリアルタイム遅延要求とますます矛盾する。
既存のアクセラレーションメソッドは、デプロイ前に選択されたポリシーでトークンやレイヤ、あるいはサンプリングステップを削減しますが、オフラインプロファイリングと共有オンボードコンピューティングでの静的スケジューリングの後に、残余ランタイムのばらつきは明らかにされていません。
我々は,最大許容可能な計算予算が残余のランタイム状態と体系的に異なるのに対して,最近実現された遅延は利用可能な計算スラックの直接信号を提供する。
そこで本研究では,モデル実行前の各制御ステップの計算予算を選択するために,実行遅延を再利用するプリ推論計算アロケータである‘textbf{SlackDrive}’を提案する。
SlackDriveは、小さな個別の予算セットのレイテンシと計画ユーティリティを一度にプロファイルし、完了したフォワードからオンライン計算状態を推定し、許容されるレイテンシエンベロープ内に留まると予測される最高ユーティリティ予算を選択し、運転バックボーンとその計算アクチュエータを保存しながら、既存のプロファイリングとリソーススケジューリングを補完する。
DriveDreamer-Policyを使用したNAVSIM v2では、SlackDriveは、厳格なレイテンシ体制の下で最強のベースラインに対して、レイテンシ制約付きPDMSを21.7セントで改善する。
関連論文リスト
- End-to-End Latency-Minimizing and Load-Balanced Request Scheduling for Edge LLM Inference in Agentic AI Services [13.04369901641143]
大規模言語モデル(LLM)を使用したエージェントAIサービスでは、低レイテンシ推論がますます求められている。
本研究では,各要求に対する送信,プリフィル,再分配レベル復号化,キー値キャッシュの進化をキャプチャするクロススロット推論モデルを開発した。
本稿では,Lyapunov最適化による長期負荷分散制約を変換するLYREO手法を提案する。
論文 参考訳(メタデータ) (2026-09-15T13:50:54Z) - Real-Time Rulebook-Aware Nonlinear MPC for Autonomous Driving with Priority-Biased Tiered Slacks [0.8363171780853939]
W-SQPは重み付きタイレッドスラック非線形モデル予測制御器(NMPC)である
We present W-SQP, a weighted tiered-slack non model predictive controller (NMPC)。
We present W-SQP, a weighted tiered-slack non model predictive controller (NMPC)。
論文 参考訳(メタデータ) (2026-07-13T00:40:27Z) - CLEAR: Cognition and Latent Evaluation for Adaptive Routing in End-to-End Autonomous Driving [19.474428775260034]
超高速な生成計画と深い意味的推論を組み合わせたフレームワークであるCLEARを提案する。
CLEARはDrive-JEPAをビジュアルエンコーダとして採用し、VAEラテント空間におけるマルチステップデノイングチェーンを単一ステップ条件ドリフトに置き換える。
NAVSIM v1ベンチマークでは、CLEARは93.7の最先端のPDMSを達成した。
論文 参考訳(メタデータ) (2026-06-04T14:32:10Z) - DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference [0.0]
大規模言語モデル(LLM)推論サービスは、効率的なマルチテナントGPUスケジューリングの需要を増大させている。
本稿では,マルチテナントGPUスケジューリングのための適応型スケジューリングフレームワークDriftSchedを提案する。
このフレームワークは、不均一なマルチテナントワークロードの下で、FIFO、プライオリティ、重み付け、最短ジョブファースト(SJF)、老化優先度スケジューリングポリシーを評価する。
論文 参考訳(メタデータ) (2026-06-02T00:39:31Z) - Algorithms for dynamic scheduling in manufacturing, towards digital factories Improving Deadline Feasibility and Responsiveness via Temporal Networks [0.0]
従来の決定論的スケジュールは、現実が名目上の計画から逸脱した時に崩壊する。
この論文は、オフラインの制約プログラミングとオンラインの時間的ネットワーク実行を組み合わせることで、最悪の不確実性の下で実現可能なスケジュールを作成する。
論文 参考訳(メタデータ) (2025-10-16T17:28:25Z) - Dynamic Speculative Agent Planning [57.630218933994534]
大規模な言語モデルベースのエージェントは、遅延の禁止と推論コストのために、重要なデプロイメント課題に直面している。
本稿では,オンライン強化学習フレームワークである動的投機計画(Dynamic Speculative Planning, DSP)を紹介する。
2つの標準エージェントベンチマークの実験では、DSPは高速加速法に匹敵する効率を達成し、総コストを30%削減し、不要コストを60%まで削減している。
論文 参考訳(メタデータ) (2025-09-02T03:34:36Z) - CSGO: Generalized Optimization for Cold Start in Wireless Collaborative Edge LLM Systems [62.24576366776727]
本稿では,全体の推論遅延を最小限に抑えるために,遅延を考慮したスケジューリングフレームワークを提案する。
提案手法は,ベースライン戦略と比較して,コールドスタート遅延を著しく低減することを示す。
論文 参考訳(メタデータ) (2025-08-15T07:49:22Z) - Guaranteed Dynamic Scheduling of Ultra-Reliable Low-Latency Traffic via
Conformal Prediction [72.59079526765487]
アップリンクにおける超信頼性・低遅延トラフィック(URLLC)の動的スケジューリングは、既存のサービスの効率を大幅に向上させることができる。
主な課題は、URLLCパケット生成のプロセスにおける不確実性である。
本稿では,URLLC トラフィック予測器の品質に関わらず,信頼性と遅延を保証した新しい URLLC パケットスケジューラを提案する。
論文 参考訳(メタデータ) (2023-02-15T14:09:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。