論文の概要: Efficient Cost-Aware LLM Evaluation via Bayesian Bandit Gittins Indices
- arxiv url: http://arxiv.org/abs/2609.25645v1
- Date: Tue, 22 Sep 2026 03:56:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.200712
- Title: Efficient Cost-Aware LLM Evaluation via Bayesian Bandit Gittins Indices
- Title(参考訳): Bayesian Bandit Gittins Indicesによる低コストLCM評価
- Abstract要約: 構成選択をコストに配慮したベイズ帯域幅問題として定式化する。
ベイジアン最適Gittinsポリシーに基づいて、次にいつ停止するかを評価するGittinsEvalを提案する。
- 参考スコア(独自算出の注目度): 2.2662493312877294
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Exhaustively evaluating every candidate LLM configuration on every benchmark item to identify a high-performing one is costly. We formulate configuration selection as a cost-aware Bayesian bandit problem and propose GittinsEval, which draws on the Bayesian-optimal Gittins policy to determine which configuration to evaluate next and when to stop. We extend the policy with an anytime recommendation rule over both fully and partially evaluated configurations, using an LCB-style score to account for posterior uncertainty. GittinsEval is computationally efficient, requiring only lightweight online updates after offline precomputation. Across GSM8K, PIQA, AlpacaEval, and MMLU response matrices, GittinsEval is consistently competitive, with particularly strong gains over configuration-level Bayesian optimization on large-example benchmarks and over cost-unaware bandit baselines on large-candidate tasks. Crucially, GittinsEval often attains near-zero simple regret using only 1% to 2% of the exhaustive-evaluation cost; it also offers an adaptive stopping rule that typically triggers at 1% to 10%.
- Abstract(参考訳): 高い性能を示すものを特定するために、ベンチマーク項目ごとに全ての候補LLM構成を徹底的に評価することは、コストがかかる。
我々は,構成選択をコストを意識したベイジアンバンドイット問題として定式化し,ベイジアン最適Gittinsポリシーに基づいたGittinsEvalを提案する。
後続の不確実性を考慮した LCB-style score を用いて, 完全に評価された構成と部分的に評価された構成の双方に対して, 常に推奨ルールでポリシーを拡張した。
GittinsEvalは計算効率が良く、オフラインプリ計算後にのみ軽量なオンライン更新が必要になる。
GSM8K、PIQA、AlpacaEval、MMLUの応答行列全体において、GittinsEvalは一貫して競争力があり、特に大規模なベンチマークにおける構成レベルのベイズ最適化や、大規模タスクにおけるコスト非意識のバンディットベースラインよりも大きく向上している。
重要な点として、GittinsEvalは、徹底的な評価コストの1%から2%しか使用せず、ほとんどゼロに近い単純な後悔を経験することが多い。
関連論文リスト
- Regret-Based $(ε,δ)$-optimal Stopping Criteria for Bayesian Optimization [6.144270713077559]
GP上信頼度境界(GP-UCB)について,任意の繰り返しにおいて,より厳密な即時後悔境界を示す。
次に,この厳密な境界に基づいてGP-UCBの停止基準を提案する。
論文 参考訳(メタデータ) (2026-05-21T14:42:31Z) - Adaptive Regularization for Sparsity Control in Bregman-Based Optimizers [14.98763942493771]
本稿では,モデルの現在の空間とターゲット空間との差に基づいて$$を更新する適応正規化手法を提案する。
提案手法は,75%から99%の範囲の空間的目標を確実に達成する。
初期のトレーニングでは、オラクルで調整された非適応ベースラインよりも早く収束し、同じエラー率で最終的なパフォーマンスを達成または上回っている。
論文 参考訳(メタデータ) (2026-05-08T15:37:24Z) - Robust Bayesian Optimization via Tempered Posteriors [1.6042394978941517]
我々は,局所的不特定条件下での過信を軽減するために,後続更新による頑健なGPベースBOを開発した。
テンパリングが標準の$(=1)$よりも早く、最も好ましい保証は古典的なEI選択の近くで行われることを示す。
論文 参考訳(メタデータ) (2026-01-11T23:34:24Z) - Cost-aware Stopping for Bayesian Optimization [46.95172329282389]
本稿では,様々な評価コストに適応し,チューニングが不要なベイズ最適化のためのコスト対応停止則を提案する。
我々は,最先端の取得関数と組み合わせた場合,停止規則によって得られる期待累積評価コストを拘束する理論的な保証を証明した。
論文 参考訳(メタデータ) (2025-07-16T17:54:14Z) - Accelerating RL for LLM Reasoning with Optimal Advantage Regression [52.0792918455501]
本稿では,最適優位関数を直接近似する新しい2段階ポリシー最適化フレームワークを提案する。
A$*-POは、幅広い数学的推論ベンチマークで競合性能を達成する。
PPO、GRPO、REBELと比較して、トレーニング時間を最大2$times$、ピークメモリ使用率を30%以上削減する。
論文 参考訳(メタデータ) (2025-05-27T03:58:50Z) - Stopping Bayesian Optimization with Probabilistic Regret Bounds [1.4141453107129403]
我々は,ある点が与えられた条件を満たす確率に基づいて,事実上の停止規則を基準に置き換えることを検討する。
我々は,モンテカルロの停止規則を,サンプル効率が高く,推定誤差に頑健な方法で評価する実用的なアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-02-26T18:34:58Z) - Rate-Optimal Policy Optimization for Linear Markov Decision Processes [65.5958446762678]
最安値の$widetilde O (sqrt K)$ regret, $K$はエピソード数を表す。
我々の研究は、バンディットフィードバックのある設定において最適な収束率(w.r.t.$K$)を確立する最初のものである。
現在、最適なレート保証を持つアルゴリズムは知られていない。
論文 参考訳(メタデータ) (2023-08-28T15:16:09Z) - Self-Evaluation Guided Beam Search for Reasoning [61.523627290397556]
我々は,Large Language Model (LLM) の推論プロセスのガイドと校正を行うための段階的自己評価機構を導入する。
本稿では,ビームサーチによる自己評価ガイダンスを統合した復号アルゴリズムを提案する。
我々のアプローチは、GSM8K、AQuA、StrategyQAにおいて、対応するCodexバックボンドベースラインをわずかに精度6.34%、9.56%、および5.46%で上回る。
論文 参考訳(メタデータ) (2023-05-01T02:37:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。