論文の概要: Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads
- arxiv url: http://arxiv.org/abs/2607.18253v1
- Date: Wed, 13 May 2026 20:29:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.089671
- Title: Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads
- Title(参考訳): 正確性とコストを超える - 動的ワークロードのためのレイテンシを意識したLLMクエリルーティング
- Abstract要約: 現代の言語クエリルータは、応答品質と金銭的コストのバランスをとるモデルに各クエリを割り当てることで、推論効率を向上させる。
現在のクエリルータは、主に遅延に耐性があり、モデルインスタンスでクエリが経験する生成遅延を考慮していない。
本稿では,サービスフレームワークのバッチ処理をシミュレートする軽量遅延推定器を提案し,クエリのタイム・ツー・ファースト・トケインを推定する。
- 参考スコア(独自算出の注目度): 14.56862716394492
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern language query routers improve inference efficiency by assigning each query to a model that balances response quality and monetary cost. However, current query routers are largely latency-agnostic and do not consider the generation latency experienced by queries at model instances. In practice, latency is often controlled by load-balancing policies such as round-robin or join-the-shortest-queue, which do not account for model accuracy or inference cost. Incorporating query latency into routing is challenging as it depends not only on the query's prompt length, but also on the current prefill and decode workload at the model instance and the scheduling and batching policy of the serving framework. We design a lightweight latency estimator that simulates autoregressive token batch processing in the serving framework and estimates the time-to-first-token (TTFT) of queries. We incorporate this latency estimator into a latency-aware router that jointly optimizes latency, accuracy, and cost when assigning queries to model instances. Our experimental results indicate that this joint optimization yields up to 40% improvement in accuracy--cost utility while maintaining the same latencies as standard load-balancing approaches.
- Abstract(参考訳): 現代の言語クエリルータは、応答品質と金銭的コストのバランスをとるモデルに各クエリを割り当てることで、推論効率を向上させる。
しかし、現在のクエリルータは遅延に依存しず、モデルインスタンスでクエリが経験する生成遅延を考慮していない。
実際にレイテンシは、モデル精度や推論コストを考慮せずに、ラウンドロビンやジョイン・ザ・ショーのようなロードバランシングポリシによって制御されることが多い。
クエリのレイテンシをルーティングに組み込むことは、クエリのプロンプト長だけでなく、モデルインスタンスの現在のプリフィルとデコード、およびサービスフレームワークのスケジューリングとバッチポリシにも依存するため、難しい。
我々は,サービスフレームワークにおける自動回帰トークンバッチ処理をシミュレートする軽量遅延推定器を設計し,クエリのTTFT(Time-to-first-token)を推定する。
このレイテンシ推定器をレイテンシ対応ルータに組み込み、モデルインスタンスにクエリを割り当てる際のレイテンシ、正確性、コストを共同で最適化する。
実験結果から, この共同最適化により, 標準負荷分散手法と同じレイテンシを維持しつつ, 精度を最大40%向上できることがわかった。
関連論文リスト
- End-to-End Latency-Minimizing and Load-Balanced Request Scheduling for Edge LLM Inference in Agentic AI Services [13.04369901641143]
大規模言語モデル(LLM)を使用したエージェントAIサービスでは、低レイテンシ推論がますます求められている。
本研究では,各要求に対する送信,プリフィル,再分配レベル復号化,キー値キャッシュの進化をキャプチャするクロススロット推論モデルを開発した。
本稿では,Lyapunov最適化による長期負荷分散制約を変換するLYREO手法を提案する。
論文 参考訳(メタデータ) (2026-09-15T13:50:54Z) - INFRAMIND: Infrastructure-Aware Multi-Agent Orchestration [18.376319491516266]
INFRAMINDは,マルチエージェントスタック全体のインフラストラクチャを意識するフレームワークである。
赤外線対応エグゼキュータは、各エージェントステップでモデルキュー毎の深さ、キャッシュ利用、レスポンス待ち時間を観察し、どのモデルを呼び出すかを決定する。
予算対応スケジューラは、各モデルのキューをさらにリオーダーして、緊急要求を先に提供する。
論文 参考訳(メタデータ) (2026-06-09T20:50:12Z) - ConsRoute:Consistency-Aware Adaptive Query Routing for Cloud-Edge-Device Large Language Models [7.869130026927]
ConsRouteは、大規模言語モデルのための軽量でセマンティックな、適応的なルーティングフレームワークである。
ConsRouteは、エンドツーエンドのレイテンシと推論コストを40%近く削減しながら、ほぼクラウドのパフォーマンス(=95%)を達成することを示す。
論文 参考訳(メタデータ) (2026-03-22T13:54:12Z) - RouteMoA: Dynamic Routing without Pre-Inference Boosts Efficient Mixture-of-Agents [91.0187958746262]
RouteMoAは動的ルーティングを備えた効率的な混合エージェントフレームワークである。
軽量スコアラを使用して、クエリから粗い粒度のパフォーマンスを予測することで、初期スクリーニングを行う。
既存のモデル出力に基づいて、軽量な自己評価とクロスアセスメントによってこれらのスコアを洗練し、追加の推論なしで後部修正を提供する。
論文 参考訳(メタデータ) (2026-01-26T04:22:22Z) - Learning to Route: A Rule-Driven Agent Framework for Hybrid-Source Retrieval-Augmented Generation [55.47971671635531]
大言語モデル(LLM)は、一般質問回答(QA)において顕著な性能を示した。
Retrieval-Augmented Generation (RAG)は、LLMを外部知識で強化することで、この制限に対処する。
既存のシステムは、主に構造化されていないドキュメントに依存しているが、主にリレーショナルデータベースを見下ろしている。
論文 参考訳(メタデータ) (2025-09-30T22:19:44Z) - Intra-request branch orchestration for efficient LLM reasoning [52.68946975865865]
大規模言語モデル(LLM)は、複雑なタスクの正確性を改善するために、推論時推論アルゴリズムにますます依存している。
それまでの作業は、トークンの使用を減らすことを中心に、多くの場合、正確さを犠牲にしつつ、他のレイテンシ要因を見越すことに重点を置いていた。
本稿では,LLMサービスシステムであるDUCHESSについて,予測によって導かれるリクエスト内ブランチオーケストレーションにより,精度を犠牲にすることなく,コストとレイテンシを低減できるシステムを提案する。
論文 参考訳(メタデータ) (2025-09-29T15:52:08Z) - Latency and Token-Aware Test-Time Compute [3.573250939705335]
推測時間スケーリングは、複数の候補応答を生成し、それらの中から選択することで、大きな言語モデル(LLM)の性能を向上させることができる。
動的計算アロケーションとメソッド選択の問題として,推論時間スケーリングを定式化する。
我々のフレームワークはトークンコストとウォールクロックのレイテンシの両方を明示的に組み込んでおり、後者はユーザエクスペリエンス、特にエージェントモデルにとって重要なものです。
論文 参考訳(メタデータ) (2025-09-11T21:35:19Z) - MixLLM: Dynamic Routing in Mixed Large Language Models [57.309520357563215]
大規模言語モデル(LLM)は、最近、人工知能の可能性を秘めている。
問合せ-LLM代入のための動的コンテキスト帯域ベースのルーティングシステムであるMixLLMを開発した。
論文 参考訳(メタデータ) (2025-02-09T02:26:15Z) - Budget-aware Query Tuning: An AutoML Perspective [14.561951257365953]
現代のデータベースシステムは、入力クエリの優れた実行計画を作成するために、コストベースのクエリに依存している。
コストユニットの値を変えることで、デフォルトのクエリプランを大幅に上回るクエリプランを得ることができることを示す。
論文 参考訳(メタデータ) (2024-03-29T20:19:36Z) - Keep Your Friends Close: Leveraging Affinity Groups to Accelerate AI Inference Workflows [0.1874930567916036]
本稿では,アプリケーション固有のデータアクセス相関を簡単に表現できるアフィニティグルーピング機構を提案する。
実験では標準手法の限界を確認するとともに,作業負荷の増加とスケールアウトの増加に伴い,提案機構が大幅に低レイテンシを維持可能であることを示す。
論文 参考訳(メタデータ) (2023-11-30T16:02:04Z) - Multi-mode Transformer Transducer with Stochastic Future Context [53.005638503544866]
マルチモード音声認識モデルは、より長期のコンテキストを処理して高い精度を達成することができ、遅延予算が柔軟でない場合には、モデルが信頼できる精度を達成することができる。
マルチモードのASRモデルに匹敵する競合が,異なるレイテンシ予算でトレーニングされた,競争力のあるストリーミングベースラインのセットであることを示す。
論文 参考訳(メタデータ) (2021-06-17T18:42:11Z) - Towards Streaming Perception [70.68520310095155]
本稿では、リアルタイムオンライン知覚のための単一のメトリクスにレイテンシと精度を協調的に統合するアプローチを提案する。
この指標の背後にある重要な洞察は、瞬間ごとに認識スタック全体の出力を共同で評価することである。
本稿では,都市ビデオストリームにおけるオブジェクト検出とインスタンスセグメンテーションの具体的タスクに注目し,高品質で時間依存的なアノテーションを備えた新しいデータセットを寄贈する。
論文 参考訳(メタデータ) (2020-05-21T01:51:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。