論文の概要: WISERouter: LLM Routing with Workload Budget Constraint
- arxiv url: http://arxiv.org/abs/2607.23765v1
- Date: Sun, 26 Jul 2026 17:20:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.221447
- Title: WISERouter: LLM Routing with Workload Budget Constraint
- Title(参考訳): WISERouter: ワークロード予算制約によるLLMルーティング
- Abstract要約: 大規模言語モデル(LLM)は、複数のドメインにまたがる優れたパフォーマンスを実現するが、クエリ毎に最も有能なモデルを使用することは、大規模では禁じられている。
歴史的相互作用からのオフライン学習と探索によるオンライン学習をサポートするフレームワークWISE(WR)を紹介した。
WR-Onlineはベースラインと同等のパフォーマンスを達成し、探索データはかなり少ない。
- 参考スコア(独自算出の注目度): 18.88807929206437
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large language models (LLMs) achieve impressive performance across multiple domains, but using the most capable model for every query is prohibitive at scale. LLM routing exploits diversity in model capability and cost by assigning each query to a suitable model to balance utility and budget. Current methods have two limitations: (i) they either use heuristics that do not always enforce the budget constraint or impose a fixed per-query budget that cannot adapt across the workload and leads to suboptimal performance; (ii) they require supervised learning on a dense dataset with statistics for every query-model pair, which is expensive to collect. To address these challenges, we formulate LLM routing as a constrained contextual multi-armed bandit problem and introduce WISERouter (WR for short), a framework that supports offline learning from historical interactions as well as online learning with exploration. We further prove that WR-Online achieves a sublinear regret bound of $O(\sqrt{T})$ over a time horizon $T$. Empirical results on RouterBench and SWE-Bench demonstrate that (i) WR-Offline surpasses existing baselines in performance under a fixed budget and adheres more closely to budget constraints, and (ii) WR-Online achieves comparable performance to the baselines, while using substantially less exploration data.
- Abstract(参考訳): 大規模言語モデル(LLM)は、複数のドメインにまたがる優れたパフォーマンスを実現するが、クエリ毎に最も有能なモデルを使用することは、大規模では禁じられている。
LLMルーティングは、実用性と予算のバランスをとるために、各クエリを適切なモデルに割り当てることで、モデル能力とコストの多様性を利用する。
現在の方法には2つの制限がある。
一 予算の制約を常に実施しないヒューリスティックを使用するか、又は当該ワークロードに適応できず、かつ、最適以下のパフォーマンスにつながるような定額の予算を課すか。
(II)各クエリモデルペアの統計値を持つ高密度データセットの教師あり学習が必要であり,収集に費用がかかる。
これらの課題に対処するために、LLMルーティングを制約付きコンテキスト多重武装バンディット問題として定式化し、歴史的相互作用からのオフライン学習と探索によるオンライン学習をサポートするWISERouter(略してWR)を導入する。
さらに、WR-オンラインは、時間的地平線上で$O(\sqrt{T})$のサブ線形後悔境界を達成することを証明している。
RouterBench と SWE-Bench の実証実験結果
(i)WR-Offlineは、固定予算の下で既存の性能基準を超越し、予算制約をより厳格に遵守する。
(ii)WR-Onlineは,探索データが少なく,ベースラインに匹敵する性能を実現している。
関連論文リスト
- CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs [1.3673052804154124]
CaRL-EMは、タスクの複雑さに基づいて、安価で高価な演算子の使用を動的に計画することを学ぶ。
強力なLCMベースのベースラインよりも優れた品質とコストのトレードオフを実現している。
論文 参考訳(メタデータ) (2026-09-01T13:05:47Z) - Robust Batch-Level Query Routing for Large Language Models under Cost and Capacity Constraints [18.52522897906341]
大規模言語モデル(LLM)へのクエリルーティングの問題について検討する。
本稿では,各バッチの割り当てを協調的に最適化する,バッチレベルのリソース対応ルーティングフレームワークを提案する。
2つのマルチタスクベンチマークの実験では、非ロバストなベンチマークでは精度が1-14%向上している。
論文 参考訳(メタデータ) (2026-03-25T22:24:11Z) - Efficient and Interpretable Multi-Agent LLM Routing via Ant Colony Optimization [58.59491516762626]
マルチエージェントシステム(MAS)のための効率的かつ解釈可能なルーティングフレームワークAMRO-Sを提案する。
AMRO-Sは、意味条件付き経路選択問題としてMASルーティングをモデル化し、3つのキーメカニズムを通してルーティング性能を向上させる。
5つの公開ベンチマークと高速ストレステストによる大規模な実験により、AMRO-Sは強いルーティングベースラインに対する品質-コストトレードオフを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-03-13T12:26:05Z) - MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing [41.77627136743721]
実際のデプロイメントでは、ワークロードは軽量なOCRから複雑なマルチモーダル推論にまたがる。
ルーティングは、モダリティの融合、モデル間での計算コストの変動、標準化された予算対応評価の欠如などにより、簡単ではない。
MMR-Benchは、マルチモーダルルーティング問題を分離し、固定された候補セットとコストモデルで比較できる統一ベンチマークである。
論文 参考訳(メタデータ) (2026-01-25T12:44:14Z) - xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning [104.63494870852894]
我々は,学習したルータが直接応答するか,あるいは1つ以上の外部モデルを呼び出すことができるツールコールベースのルーティングシステム x を提案する。
当社の実装には、報酬とコスト会計を含む、完全な強化学習フレームワークが含まれています。
さまざまなベンチマークで、xはコストパフォーマンスのトレードオフを強く達成します。
論文 参考訳(メタデータ) (2025-10-09T16:52:01Z) - Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs [69.2486294522259]
BaRPはBandit Routing-feedback with Preferencesアプローチであり、デプロイと同じ部分フィードバック制限の下でトレーニングされる。
提案手法は,学習中のオンラインフィードバック設定をシミュレートし,新たなプロンプトに適応する。
論文 参考訳(メタデータ) (2025-10-08T18:24:59Z) - RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs [51.88834210085435]
本稿では、軽量で解釈可能でスケーラブルなルーティングフレームワークRADAR(Reasoning-Ability and Difficulty-Aware Routing)を提案する。
心理測定にインスパイアされたRADARは、さまざまな予算を持つモデル応答から異なるクエリへのアイテム応答モデルを学ぶ。
我々は8つの広く使われている推論ベンチマークについて広範な実験を行い、最先端のルーティング手法と比較してRADARの優れた性能を実証した。
論文 参考訳(メタデータ) (2025-09-29T19:33:44Z) - Efficient Training-Free Online Routing for High-Volume Multi-LLM Serving [10.746325451673274]
LLMルーティングは、モデルとクエリ機能に基づいて、クエリを最適LLMに誘導することで、コスト効率のよいソリューションを提供する。
既存の作業は主にオフラインシナリオに重点を置いており、オンライン設定への適応に苦慮している。
オンラインルーティングシナリオのためのトレーニング不要な最初のアルゴリズムを紹介する。
論文 参考訳(メタデータ) (2025-09-02T18:15:03Z) - VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use [78.29315418819074]
VerlToolは、体系的な設計原則を通じて制限に対処する統一的でモジュール化されたフレームワークです。
我々のフレームワークはARLTをマルチターントラジェクトリとして定式化し、マルチモード観測トークン(テキスト/画像/ビデオ)を単一ターンRLVRパラダイムを超えて拡張する。
モジュール化されたプラグインアーキテクチャは、軽量Python定義のみを必要とする迅速なツール統合を可能にする。
論文 参考訳(メタデータ) (2025-09-01T01:45:18Z) - Cost-Aware Contrastive Routing for LLMs [57.30288453580456]
我々は、プロンプトとモデルの両方を共有埋め込み空間にマッピングする軽量フレームワークであるコストスペクトルコントラストルーティング(CSCR)を紹介します。
CSCRはベースラインを一貫して上回り、精度とコストのトレードオフを最大25%改善した。
論文 参考訳(メタデータ) (2025-08-17T20:16:44Z) - OmniRouter: Budget and Performance Controllable Multi-LLM Routing [31.60019342381251]
大規模言語モデル(LLM)は優れた性能を提供するが、かなりの計算資源を必要とし、比較的低効率で運用する。
マルチLLMサービスのための制御可能なルーティングフレームワークであるOmniを紹介する。
実験の結果、Omniは応答精度を最大6.30%改善し、同時に計算コストを少なくとも10.15%削減した。
論文 参考訳(メタデータ) (2025-02-27T22:35:31Z) - Cost-Effective Online Multi-LLM Selection with Versatile Reward Models [30.892090566736652]
大規模言語モデル (LLM) を選択・使用するためのオンラインモデルである textitC2MAB-V を導入する。
textitC2MAB-Vは、様々な報酬モデルを持つ様々な協調タスクタイプに特化している。
textitC2MAB-Vは,3つのアプリケーションシナリオに対して,性能とコスト効率を9つのLLMと効果的にバランスさせることを示す。
論文 参考訳(メタデータ) (2024-05-26T14:38:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。