論文の概要: Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation
- arxiv url: http://arxiv.org/abs/2608.04333v1
- Date: Wed, 05 Aug 2026 01:21:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.683047
- Title: Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation
- Title(参考訳): 費用対効果を考慮した多目的帯域:予算LLM構成評価への理論と適用
- Authors: Bo Xue, Zhi Hong, Jiayi Li, Yuanyu Wan, Ji Cheng, Shuang Qiu,
- Abstract要約: 我々は,大規模言語モデル (LLM) の構成評価を,コストを意識した多目的バンディット問題として定式化する。
オンライン構成選択には,楽観的なハイパーボリューム・コスト・インデックスを最適化するハイパーベース UCB アルゴリズムを提案する。
LLM設定評価タスクの実験は,提案フレームワークが効率的なオンライン意思決定を可能にすることを示す。
- 参考スコア(独自算出の注目度): 23.566982511686096
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) configuration evaluation is challenging due to limited evaluation budgets, varying costs, and multiple competing objectives. In this paper, we formulate LLM configuration evaluation as a cost-aware multi-objective bandit problem, where each configuration evaluation incurs a configuration-dependent cost and yields a noisy vector-valued outcome. Under this framework, we study two fundamental problems: online configuration selection and Pareto configuration identification. For online configuration selection, we propose a hypervolume-based UCB algorithm that optimizes an optimistic hypervolume-per-cost index. We establish a budgeted regret bound of order $O\bigl(\sum_{i\ne i^\star}\frac{\log B}{Δ_i}\bigr)$, where $B$ is the evaluation budget, $i^\star$ is the optimal configuration in terms of hypervolume efficiency, and $Δ_i$ is the corresponding efficiency gap of configuration $i$. This bound retains the logarithmic budget dependence of classical single-objective budgeted bandits. For fixed-budget Pareto identification, we develop a cost-aware empirical gap elimination algorithm and prove that its error probability is of order $O\bigl(\exp(-\frac{B}{H_{μ,c}})\bigr)$, where $H_{μ,c}$ is a cost-aware Pareto identification complexity depending on configuration costs and Pareto classification gaps. This error probability decays exponentially with the evaluation budget and recovers the standard Pareto set identification guarantee when all configuration costs are identical. Experiments on LLM configuration evaluation tasks demonstrate that the proposed framework enables efficient online decision-making and accurate cost-aware Pareto identification under limited budgets.
- Abstract(参考訳): 大きな言語モデル(LLM)の構成評価は、限られた評価予算、様々なコスト、競合する複数の目的のために困難である。
本稿では,LCMの構成評価を,構成に依存したコストを発生させ,ノイズの多いベクトル値が得られるような,コストを考慮した多目的帯域幅問題として定式化する。
本フレームワークでは,オンライン構成選択とPareto設定識別という2つの基本的な問題について検討する。
オンライン構成選択のために,楽観的なハイパーボリューム・コスト・インデックスを最適化する超ボリュームベースUPBアルゴリズムを提案する。
ここで、$B$は評価予算、$i^\star$は超体積効率における最適構成、$Δ_i$は構成$i$の対応する効率ギャップである。
この境界は、古典的な単一目的の予算付き盗賊の対数的予算依存を保っている。
固定予算パレート同定において,コストを考慮した経験的ギャップ除去アルゴリズムを開発し,その誤差確率が$O\bigl(\exp(-\frac{B}{H_{μ,c}})\bigr)$であることを示す。
この誤差確率は評価予算とともに指数関数的に減衰し、すべての構成コストが同一である場合に標準パレートセット識別保証を回復する。
LLM構成評価タスクの実験により,提案フレームワークは,限られた予算下での効率的なオンライン意思決定と正確なコスト対応のPareto識別を可能にすることを示した。
関連論文リスト
- Instance-Optimal Estimation with Multiple LLM Judges on a Budget [84.31744861038106]
我々は、この問題を*予算付きヘテロスケダティックなマルチジャッジ推定*として定式化する。
K$のプロンプト-レスポンスペア、J$の既知のコストと未知のクエリ-ジャッジ分散が与えられた場合、目標は、$ell_p$-errorを最小化しながら、有界スコアベクトルを推定することである。
EST-IVWEは,予算の低次項までのオラクルIVWEレートと一致していることを示す。
論文 参考訳(メタデータ) (2026-05-22T08:26:08Z) - Model Compression with Exact Budget Constraints via Riemannian Manifolds [39.54576236079211]
トータルコスト予算の下で各NグループにKオプションの1つを割り当てることは、効率的なAIにおいて繰り返し発生する問題である。
我々は、ソフトマックス緩和の下で、予算制約がロジット空間における滑らかなリーマン多様体を異常に単純な幾何学で定義することを示す新しいアプローチを示す。
これらの特性に基づいて、接射影、二分探索リトラクション、運動量輸送を標準とするリーマン制約最適化(RCO)を提案する。
論文 参考訳(メタデータ) (2026-05-01T13:30:23Z) - Budget-Aware Routing for Long Clinical Text [8.474809035213118]
大きな言語モデルの大きな課題は、クエリ毎のトークンコストとデプロイメント全体のコストです。
文書単位のサブセットが厳格なトークン予算の下で選択される、予算付きコンテキスト選択について検討する。
関連性,カバレッジ,多様性のバランスをとるモノトンサブモジュラー目的のtextbfRCD を提案する。
論文 参考訳(メタデータ) (2026-05-01T01:34:53Z) - Cost-Aware Learning [72.31444819326795]
本稿では,異なるコンポーネント関数をサンプリングするコスト認識学習の問題点について考察する。
凸関数に対するコスト・アウェア・Descentアルゴリズムを提案し、そのコスト複雑性を導出し誤差を$$$とする。
本稿では,性能を保ちつつポリシー最適化のコストを削減するアルゴリズムであるCost-Aware GRPOを紹介する。
論文 参考訳(メタデータ) (2026-04-30T15:39:09Z) - Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory [56.0946692457838]
BudgetMemは、明示的でクエリ対応のパフォーマンスコスト管理のためのランタイムエージェントメモリフレームワークである。
軽量ルータは、タスク性能とメモリ構築コストのバランスをとるために、モジュール間の予算層ルーティングを実行する。
LoCoMo、LongMemEval、HotpotQAの他、BudgetMemはパフォーマンスが優先されるときに、強力なベースラインを超える。
論文 参考訳(メタデータ) (2026-02-05T18:57:09Z) - Controlling Performance and Budget of a Centralized Multi-agent LLM System with Reinforcement Learning [53.57360296655208]
大規模言語モデル(LLM)は、ドメイン間で補完的な強みを示し、様々な推論コストが伴う。
既存のアプローチは分散化されたフレームワークに依存しており、入力毎に複数のLSMを呼び出すため、実質的で制御されていない推論コストが発生する。
我々は,LLMコントローラが,コスト効率とコスト制御が可能な方法で,専門家モデルのプールを選択的にコーディネートする,集中型マルチLLMフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-04T17:35:17Z) - Scalable Neural Incentive Design with Parameterized Mean-Field Approximation [28.20524168049273]
力学と報酬がリプシッツであるとき、有限$N$ ID の目標は、PMFG によって $mathscrO(frac1sqrtN)$ で近似されることを示す。
さらに、反復平衡作用素の明示的な微分を利用して勾配を効率的に計算する、随伴平均集中設計(AMID)アルゴリズムを導入する。
論文 参考訳(メタデータ) (2025-10-24T13:18:54Z) - Cost-aware Stopping for Bayesian Optimization [46.95172329282389]
本稿では,様々な評価コストに適応し,チューニングが不要なベイズ最適化のためのコスト対応停止則を提案する。
我々は,最先端の取得関数と組み合わせた場合,停止規則によって得られる期待累積評価コストを拘束する理論的な保証を証明した。
論文 参考訳(メタデータ) (2025-07-16T17:54:14Z) - Achieving PAC Guarantees in Mechanism Design through Multi-Armed Bandits [8.013444110633223]
自動機構設計のための線形プログラム(LP)に最適解のクラスを解析的に導出する。
これらの解は、元の定式化における変数の総数よりも指数関数的に小さい基本変数の集合を用いて表すことができる。
本稿では,この用語の評価をマルチアーム・バンディット(MAB)問題に翻訳することでこの問題に対処する。
論文 参考訳(メタデータ) (2024-11-30T03:59:36Z) - Multi-task Learning of Order-Consistent Causal Graphs [59.9575145128345]
我々は、$K関連ガウス非巡回グラフ(DAG)の発見問題を考える。
マルチタスク学習環境下では, 線形構造方程式モデルを学習するためのMLE ($l_1/l$-regularized maximum chance estimator) を提案する。
理論的には、関係するタスクにまたがるデータを活用することで、因果順序を復元する際のサンプルの複雑さをより高めることができることを示す。
論文 参考訳(メタデータ) (2021-11-03T22:10:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。