論文の概要: Drift-Aware LLM Routing with Sparse Contexts and Shared Budgets
- arxiv url: http://arxiv.org/abs/2609.00662v1
- Date: Tue, 01 Sep 2026 03:39:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.272562
- Title: Drift-Aware LLM Routing with Sparse Contexts and Shared Budgets
- Title(参考訳): 疎コンテキストと共有予算を考慮したドリフト対応LCMルーティング
- Authors: Cheung Hao Lee, Patrick Wong,
- Abstract要約: マルチモデル言語サービスは、計算、レイテンシ、メモリ、あるいは金銭的コストのワークロードレベルの予算を維持しながら、各要求をルーティングする必要がある。
我々は、複数のknapsack制約とオプションのシャドウ・オーディットストリームで非定常スパースコンテキストルーティングを定式化する。
政策は、ロール監査窓から報酬とリソースの使用を推定し、悲観的な報酬と楽観的なコスト見積を使ったルートを推定し、リソースの影の価格をオンラインで更新し、コミットメントの前にハードメーターを適用する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A multi-model language service must route each request while preserving workload-level budgets for compute, latency, memory, or monetary cost. Two features make this problem materially harder than static model selection. Prompt representations are high dimensional, so only a small subset of embedding directions may predict the incremental value of a model, and both the request mix and the model frontier drift after launches, fine-tunes, quantization changes, and system updates. We formulate nonstationary sparse contextual routing with multiple knapsack constraints and an optional shadow-audit stream that evaluates a small fraction of prompts on several models. We propose Drift-Aware Sparse Routing (DRS). The policy estimates reward and resource use from a rolling audit window, routes using pessimistic reward and optimistic cost estimates, updates resource shadow prices online, and applies a hard meter before commitment. The analysis separates control from statistics. On any event with uniform prediction radii $\{β_t\}$, regret against a paced dynamic fluid benchmark is bounded by the sum of the radii, a capacity-buffer term, and an $O(\sqrt{T})$ pacing term. Under a sparse linear model and bounded drift $V_T$, rolling estimation gives \[ \widetilde O\left( T\sqrt{\frac{s}{ρW}}+WV_T+\sqrt{T} \right), \] where $s$ is sparsity, $ρ$ is the audit rate, and $W$ is the window length. Optimizing $W$ yields the usual stationary $O(\sqrt{sT/ρ})$ rate when $V_T=0$ and a $O(T^{2/3}(s/ρ)^{1/3}V_T^{1/3})$ adaptation term under drift.
- Abstract(参考訳): マルチモデル言語サービスは、計算、レイテンシ、メモリ、あるいは金銭的コストのワークロードレベルの予算を維持しながら、各要求をルーティングする必要がある。
2つの特徴により、この問題は静的モデル選択よりもかなり難しい。
プロンプト表現は高次元であるため、埋め込み方向の小さなサブセットだけがモデルのインクリメンタルな値を予測することができ、リクエストミックスとモデルフロンティアドリフトの両方が起動後に、微調整、量子化の変更、システム更新を行うことができる。
複数のknapsack制約とオプションのシャドウ・オーディット・ストリームで、複数のモデルで少数のプロンプトを評価できる非定常スパース・コンテクストルーティングを定式化する。
本稿では,Drift-Aware Sparse Routing (DRS)を提案する。
政策は、ロール監査窓から報酬とリソースの使用を推定し、悲観的な報酬と楽観的なコスト見積を使ったルートを推定し、リソースの影の価格をオンラインで更新し、コミットメントの前にハードメーターを適用する。
その分析は統計から制御を分離する。
均一な予測 radii $\{β_t\}$ の場合、ペーストされた動的流体ベンチマークに対する後悔は、ラジイの和、キャパシティバッファ項、および$O(\sqrt{T})$ペーシング項によって制限される。
スパース線形モデルと有界ドリフト$V_T$の下で、ローリング推定は \[ \widetilde O\left(T\sqrt{\frac{s}{ρW}}+WV_T+\sqrt{T} \right), \] を与える。
W$の最適化は、V_T=0$ と $O(T^{2/3}(s/ρ)^{1/3}V_T^{1/3}) がドリフト中の適応項であるとき、通常の固定式 $O(\sqrt{sT/ρ})$ のレートを得る。
関連論文リスト
- Adaptive Compute in Latent World Models: When Depth Helps, Hurts, or Doesn't Matter [0.0]
内在的,6/9タスク,rhoが8倍まで)、奥行きが活発に痛む(逆転,2/9,rhoが0.87倍まで)、あるいは奥行きがほとんど問題にならない(平ら)。
インバージョンは、トランスフォーマー予測子の下で再現されるが、そのマニフェストは構成に依存し、メトリック空間、水平線、エンコーダ、バックボーン、そして最も強い -- トレーニングデータでシフトする。
より多くの計算が世界モデルに役立つかどうかはタスクの特性ではない。
論文 参考訳(メタデータ) (2026-07-11T08:27:33Z) - Scaling Up Liquid-Resistance Liquid-Capacitance Networks for Efficient Sequence Modeling [50.994194925685434]
LrcSSMは$textitnon-linear$リカレントモデルで、現在の線形状態空間層と同じくらい高速に長いシーケンスを処理する。
ヤコビ行列を対角線に強制することにより、全列を並列に解くことができる。
LrcSSMは、Liquid-S4のような他の入力変化系が提供しないことを保証する形式的な勾配安定性を提供する。
論文 参考訳(メタデータ) (2025-05-27T20:02:59Z) - Regret-Optimal Federated Transfer Learning for Kernel Regression with Applications in American Option Pricing [8.723136784230906]
本稿では、中央プランナーがデータセットにアクセス可能なフェデレーショントランスファー学習のための最適反復スキームを提案する。
我々の目標は、生成されたパラメータの累積偏差を$thetai(t)_t=0T$で最小化することである。
後悔と最適化のアルゴリズム内で対称性を活用することで, $mathcalO(Np2)$少なめの初等演算を伴って動作する,ほぼ後悔のいく$_optimalを開発する。
論文 参考訳(メタデータ) (2023-09-08T19:17:03Z) - Near-Optimal Regret Bounds for Multi-batch Reinforcement Learning [54.806166861456035]
本研究では,有限水平マルコフ決定過程(MDP)によってモデル化されたエピソディック強化学習(RL)問題をバッチ数に制約を加えて検討する。
我々は,$tildeO(sqrtSAH3Kln (1/delta))$tildeO(cdot)をほぼ最適に後悔するアルゴリズムを設計し,$(S,A,H,K)$の対数項を$K$で隠蔽する。
技術的貢献は2つある: 1) 探索のためのほぼ最適設計スキーム
論文 参考訳(メタデータ) (2022-10-15T09:22:22Z) - Reward-Mixing MDPs with a Few Latent Contexts are Learnable [75.17357040707347]
報酬混合マルコフ決定過程(RMMDP)におけるエピソード強化学習の検討
我々のゴールは、そのようなモデルにおける時間段階の累積報酬をほぼ最大化する、ほぼ最適に近いポリシーを学ぶことである。
論文 参考訳(メタデータ) (2022-10-05T22:52:00Z) - Minimax Regret for Stochastic Shortest Path [63.45407095296692]
我々は、エージェントが最小の総予想コストで目標状態に達する必要がある最短パス(SSP)問題を研究します。
この設定に対するminimaxの後悔は、$widetilde O(B_star sqrt|S| |A|K)$であり、$B_star$は任意の状態から最適なポリシーの予想コストに拘束されることを示しています。
本アルゴリズムは, 有限水平MDPにおける強化学習の新たな削減を基礎として, エピソードごとのインタイム動作を行う。
論文 参考訳(メタデータ) (2021-03-24T10:11:49Z) - Naive Exploration is Optimal for Online LQR [49.681825576239355]
最適後悔尺度は$widetildeTheta(sqrtd_mathbfu2 d_mathbfx T)$で、$T$は時間ステップの数、$d_mathbfu$は入力空間の次元、$d_mathbfx$はシステム状態の次元である。
我々の下界は、かつての$mathrmpoly(logT)$-regretアルゴリズムの可能性を排除する。
論文 参考訳(メタデータ) (2020-01-27T03:44:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。