論文の概要: Prediction-Assisted Pricing and Admission for LLM APIs with Stochastic Token Consumption
- arxiv url: http://arxiv.org/abs/2609.00710v1
- Date: Tue, 01 Sep 2026 04:40:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.3236
- Title: Prediction-Assisted Pricing and Admission for LLM APIs with Stochastic Token Consumption
- Title(参考訳): 確率的トークン消費を考慮したLLM APIの予測支援価格と受付
- Authors: Patrick Wong,
- Abstract要約: LLMアプリケーションは、複数のサービス製品を販売したり、内部的に割り当てたりすることが多い。
価格が購入確率を変更し、トークンキャップがユーザ値とリソース消費のテールの両方を変更する。
オンラインの信頼区間とオフラインの予測区間を交差する予測クラッピング UCB を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: An LLM application often sells or internally allocates several service products: a small or premium model, a short or long token cap, and possibly multiple posted prices. The operational decision is not merely which model answers a prompt. A price changes purchase probability, a token cap changes both user value and the tail of resource consumption, and accepted requests compete for shared compute and premium-model capacity. Demand and output length are initially uncertain, while an offline model may provide useful but imperfect predictions. We formulate sequential pricing and admission with stochastic resource consumption. Each arriving request belongs to an observable segment. The platform chooses a product--price pair or makes no offer; purchase, revenue, and resource use are then random. An offline predictor supplies a uniform, validated error radius for every segment--product cell. We propose Prediction-Clipped UCB (PCUCB), which intersects the offline prediction interval with an online confidence interval, evaluates products using resource shadow prices, and reserves a sample-path envelope before commitment. The prior gives a fast start when accurate, while online learning protects the platform when predictions are coarse. The analysis is modular. On a simultaneous confidence event, regret against a buffered fluid benchmark is bounded by a pacing term plus the cumulative diameter of the intersected intervals. For $J$ segment-product cells and prediction radius $\varepsilon$, this yields \[ \widetilde O\left( \sqrt{T}+(1+\barΛ) \min\{T\varepsilon,\sqrt{JT}\} \right), \] where $\barΛ$ bounds operational shadow prices. Thus the algorithm smoothly interpolates between an almost full-information regime and learning from scratch. Hard feasibility holds on every sample path through reservation envelopes.
- Abstract(参考訳): LLMアプリケーションは、小さなまたはプレミアムモデル、短いまたは長いトークンキャップ、そしておそらく複数のポストされた価格など、いくつかのサービス製品を販売したり、内部的に割り当てたりすることが多い。
運用上の決定は、どのモデルがプロンプトに答えるかだけではない。
価格が購入確率を変更し、トークンキャップがユーザ値とリソース消費のテールの両方を変更し、受け入れられた要求が共有計算容量とプレミアムモデル容量に競合する。
当初、需要と出力長は不確実であり、オフラインモデルは有用だが不完全な予測を提供する。
我々は、確率的資源消費と逐次価格と入場率を定式化する。
それぞれのリクエストは観測可能なセグメントに属します。
プラットフォームは、製品価格対を選択したり、オファーをしない。購入、収益、リソース使用はランダムである。オフライン予測器は、各セグメント製品セルに対して均一で検証済みのエラー半径を提供する。
本稿では,オフライン予測間隔をオンライン信頼区間と交差させ,資源影価格を用いた製品評価を行い,コミット前にサンプルパスエンベロープを予約するPCUCBを提案する。
オンライン学習は、予測が粗いときにプラットフォームを保護する。
分析はモジュラです。
同時信頼イベントにおいて、緩衝流体ベンチマークに対する後悔は、交差する間隔の累積直径とペーシング項で束縛される。
J$ セグメント積セルと予測半径 $\varepsilon$ の場合、これは \[ \widetilde O\left( \sqrt{T}+(1+\bar)) \min\{T\varepsilon,\sqrt{JT}\} \right), \] となる。
このようにアルゴリズムは、ほぼ完全な情報構造とスクラッチからの学習をスムーズに補間する。
ハードファシビリティは、予約エンベロープを通じてすべてのサンプルパスを保持します。
関連論文リスト
- Online Conformal Prediction Beyond Feedback [28.843690637682915]
安全クリティカルなアプリケーションに機械学習モデルをデプロイする際には、不確実性定量化が不可欠である。
オンライン共形予測(OCP)は、任意のブラックボックス分類器と非i.d.データストリームに対して理論的に原理化された不確実性定量化を提供する。
我々は,Cesa-Bianchi,Lugosi,Stoltz (2004) のラベル効率予測器を用いて,クエリを用いたOCPQ(OCPQ)を開発した。
論文 参考訳(メタデータ) (2026-08-07T11:58:48Z) - CASP: Learning-Augmented Offline Approximation with Verifiable Certificates and Bounded-Loss PAC Guarantees [1.7545090618311434]
マシンが学習した予測は、オフラインNPハード最適化を高速化するが、予測者にその問題を解決するために何をすべきかを尋ねる。
CASP (Certificate-Augmented Solution Pruning) は代わりに、どの部分の検索空間を無視するかを尋ね、サウンドタイム検証器がチェックした後のみ、各回答を受け入れる。
トレーニングされた予測器では、未検証プルーニングは配布シフト時の最適値の最大26%を失うが、検証された同じ予測のデプロイでは、何も失われることはない。
論文 参考訳(メタデータ) (2026-07-16T04:02:15Z) - Online Pandora's Box for Contextual LLM Cascading [44.749686375953395]
LLM API を適応的にクエリし,選択するためのオンラインコンテキスト型 Pandora の Box モデルを提案する。
古典的なワイツマンの政策によって誘導される文脈予約指標関数にパラメトリック構造を課す。
正規性条件の下では、結果として得られるポリシーが次元依存の$widetilde O(sqrt T)$ cumulative regret を$T$周期の地平線上で達成することを証明する。
論文 参考訳(メタデータ) (2026-06-05T15:29:17Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - Catch Your Breath: Adaptive Computation for Self-Paced Sequence Production [55.76222360698305]
我々は,言語モデルが入力トークン毎に使用する計算ステップの数を動的かつ自律的に拡張できるような,教師付きトレーニング目標のクラスを探索する。
任意のトークンに対して、モデルは don't know> 出力を出力することで、追加の計算ステップを要求できる。
CYBモデルでは精度が向上し,トークンレベルの複雑性とコンテキストに処理時間を適用することができる。
論文 参考訳(メタデータ) (2025-10-13T21:07:05Z) - DISCO: Diversifying Sample Condensation for Efficient Model Evaluation [59.01400190971061]
コスト評価は傾向を低下させ、イノベーションのサイクルを遅くし、環境への影響を悪化させる。
モデル応答の多様性を最大化するサンプルを選択することが重要となる。
我々のメソッドである$textbfDiversifying Sample Condensation (DISCO)$は、最も大きなモデル不一致を持つトップkサンプルを選択します。
論文 参考訳(メタデータ) (2025-10-09T08:53:59Z) - Will My Robot Achieve My Goals? Predicting the Probability that an MDP Policy Reaches a User-Specified Behavior Target [56.99669411766284]
自律的なシステムがタスクを実行する場合、ユーザの目標を達成する確率のキャリブレーションされた見積もりを維持する必要がある。
本稿では,ユーザの目標が目標間隔として指定される設定について検討する。
我々は、共形予測を反転させて確率推定を計算する。
論文 参考訳(メタデータ) (2022-11-29T18:41:20Z) - Competition analysis on the over-the-counter credit default swap market [0.0]
両立関係の競合は, 相互の要求により検討する。
初期マージン要件をうまく見積もるモデルを提案する。
第2に、新しい半教師付き予測タスクを用いて、インターディーラー市場での選択肢をモデル化する。
論文 参考訳(メタデータ) (2020-12-03T13:02:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。