論文の概要: Learning the Cost of Reliable Inference
- arxiv url: http://arxiv.org/abs/2609.28322v2
- Date: Thu, 24 Sep 2026 09:44:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.36629
- Title: Learning the Cost of Reliable Inference
- Title(参考訳): 信頼できる推論のコストを学習する
- Abstract要約: 我々は、各タスクのトークン価格がプロバイダの競争によって駆動される調達プラットフォームを設計する。
我々は,Llama と Qwen ファミリーの複数の LLM を用いて,一般的な数学的推論と質問応答ベンチマーク実験を行った。
- 参考スコア(独自算出の注目度): 8.388020387599477
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Benchmarking and routing platforms increasingly act as intermediaries connecting large language model providers with end-users. However, providers on these platforms typically use a fixed price per token, preventing users from achieving the most competitive price for their tasks. In this work, we design a procurement platform where token prices for each task are driven by provider competition, enabling users to secure competitive pricing for guaranteed quality levels. To this end, the platform sequentially routes queries via a reverse second-price auction that incentivizes model providers to truthfully bid their best estimate of the average cost to serve a user's query. As it routes queries, the platform learns the quality offered by each provider and progressively routes queries to the most cost-competitive provider among those meeting a desired quality threshold. To validate our design, we conduct experiments with multiple LLMs from the Llama and Qwen families on popular mathematical reasoning and question-answering benchmarks. The results show that the pricing margin of the most cost-competitive provider on our platform varies significantly---from $10\%$ to $71\%$---depending on the task and quality threshold. This suggests a substantial inefficiency in the current fixed-price market, and it demonstrates that our platform may enable users to capture maximum savings whenever competitive market conditions permit.
- Abstract(参考訳): ベンチマークとルーティングプラットフォームは、大規模言語モデルプロバイダとエンドユーザを接続する仲介者としてますます機能します。
しかしながら、これらのプラットフォームのプロバイダは通常、トークン当たりの固定価格を使用するため、ユーザがタスクに対して最も競争力のある価格を達成できない。
本研究では,各タスクのトークン価格がプロバイダの競争によって引き起こされる調達プラットフォームを設計し,保証された品質レベルの競争価格を確保する。
この目的のために、このプラットフォームは、モデルのプロバイダに、ユーザーのクエリを提供するための平均コストの見積を真に入札させるインセンティブを与える、逆の第2価格オークションを通じて、クエリを順次ルーティングする。
クエリをルーティングすると、プラットフォームは各プロバイダが提供する品質を学習し、要求される品質のしきい値を満たす中で、クエリを最もコスト競争的なプロバイダに徐々にルーティングする。
この設計を検証するため、Llama と Qwen ファミリーの複数の LLM を用いて、一般的な数学的推論と質問応答ベンチマーク実験を行った。
その結果、当社のプラットフォーム上で最もコスト競争力のあるプロバイダの価格マージンは、タスクと品質のしきい値に依存する10\%から711\%まで、大きく異なります。
これは、現在の固定価格市場ではかなりの非効率性を示唆しており、競争の激しい市場条件が許されるたびに、当社のプラットフォームが最大節約を達成できることを実証している。
関連論文リスト
- Test-Time Compute Games [11.108199754300772]
テストタイム計算は、大規模言語モデルの推論能力を高めるための有望な戦略として登場した。
LLM-as-a-serviceの市場は、テストタイムの計算量を増やすための金銭的なインセンティブがあるため、社会的に非効率であることを示す。
提案する価格と(予想される)品質を,ユーザに提供する機会に入札する,リバースな第2価格オークション機構を導入する。
論文 参考訳(メタデータ) (2026-01-29T15:18:01Z) - Is Your LLM Overcharging You? Tokenization, Transparency, and Incentives [13.91198481393699]
我々は,疑念を抱くことなく,利用者を著しく過給できる効率的なアルゴリズムを開発した。
戦略化のための金銭的インセンティブをなくすためには、価格設定メカニズムは、文字数に応じてトークンを線形に価格設定する必要がある。
論文 参考訳(メタデータ) (2025-05-27T18:02:12Z) - CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing [74.14816777318033]
Token-lEvel Routing(CITER)との協調推論は、小規模および大規模言語モデルの効率的な協調を可能にするフレームワークである。
ルータの学習をポリシー最適化として定式化し、予測の質と生成の推論コストの両方に基づいて報酬を受け取る。
実験の結果,CITERは高品質な生成を保ちながら推論コストを低減し,リアルタイムおよびリソース制約のあるアプリケーションに対して有望なソリューションを提供することがわかった。
論文 参考訳(メタデータ) (2025-02-04T03:36:44Z) - Interpolating Item and User Fairness in Multi-Sided Recommendations [13.635310806431198]
我々は、新しいフェアレコメンデーションフレームワーク、問題(FAIR)を紹介します。
本稿では,リアルタイム学習とフェアレコメンデーションを同時に行う低レベルのアルゴリズム形式を提案する。
我々は,プラットフォーム収益を維持する上でのフレームワークと手法の有効性を実証するとともに,アイテムとユーザ双方に望ましい公平性を確保した。
論文 参考訳(メタデータ) (2023-06-12T15:00:58Z) - Competition, Alignment, and Equilibria in Digital Marketplaces [97.03797129675951]
プラットフォームアクションがバンディットアルゴリズムであり,両プラットフォームがユーザ参加を競うデュオポリー市場について検討する。
私たちの主な発見は、この市場における競争は、市場の結果をユーザーユーティリティと完全に一致させるものではないということです。
論文 参考訳(メタデータ) (2022-08-30T17:43:58Z) - An Opportunistic Bandit Approach for User Interface Experimentation [4.221317325134029]
実際のオンライン小売データを用いて,実験をできるだけ安価に行えるようにするために,オポチュニスティックな帯域幅が有効であることを示す。
我々は,コストのかかる探索を緩和し,余分な文脈情報を提供することで,重大な後悔の軽減を実現している。
論文 参考訳(メタデータ) (2020-06-21T18:43:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。