論文の概要: Bandits in Prod: Hyperparameter Optimization at Inference Time
- arxiv url: http://arxiv.org/abs/2609.01335v1
- Date: Tue, 01 Sep 2026 14:48:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.773963
- Title: Bandits in Prod: Hyperparameter Optimization at Inference Time
- Title(参考訳): 仮説の帯域:推論時のハイパーパラメータ最適化
- Authors: Louis Abraham, Tuan-Anh Nguyen, Nicolas Devatine,
- Abstract要約: IMOSSは、アクティブなセットの成長を制御する再起動不要の時限ポリシーであり、$p_$は、提案された設定が検索空間の上位$$に該当する確率を低くする。
IMABOは、機械学習モデルのチューニングからLLMベースのエージェントの設定に至るまで、多様なOHPO設定の中で最も低い累積的後悔を得る。
- 参考スコア(独自算出の注目度): 2.575221263525409
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Many production systems can assess a configuration only by using it on live requests and observing noisy feedback. Modern agentic systems are a prominent example, with inference-time choices such as model selection, retrieval depth, prompting strategy, and decoding temperature, yet often with no representative validation data. We formalize this setting as Online Hyperparameter Optimization (OHPO) and cast it as an infinitely many-armed bandit over mixed and conditional search spaces. We introduce IMABO, a general framework that combines any bandit policy for choosing among already sampled configurations with any oracle for proposing new ones. We instantiate it with IMOSS, a restart-free anytime policy whose active set grows as $t^β$, and prove an expected cumulative quantile-regret bound of $O(p_ρ^{-1/β} + T^{(1+β)/2})$, where $β\in(0,1)$ controls active-set growth and $p_ρ$ lower-bounds the probability that a proposed configuration falls in the top-$ρ$ fraction of the search space. We combine IMOSS with three practical oracles: a Tree-structured Parzen Estimator, an incumbent-mutation oracle driven by a per-coordinate bandit, and a pretrained tabular foundation model, all three improving over the uniform random oracle baseline. IMABO obtains the lowest cumulative regret across diverse OHPO settings, from tuning classical machine-learning models to configuring LLM-based agents.
- Abstract(参考訳): 多くのプロダクションシステムは、ライブリクエストでそれを使用して、ノイズの多いフィードバックを観察することによってのみ、構成を評価することができる。
現代のエージェントシステムは、モデル選択、検索深度、プロンプト戦略、復号化温度などの推論時間選択があるが、代表的な検証データがない場合が多い。
我々は、この設定をオンラインハイパーパラメータ最適化(OHPO)として定式化し、混合および条件付き検索空間上で無限に多くの武器を持つ帯域としてキャストした。
IMABOは、既にサンプル化されている構成の中から選択した帯域幅ポリシーと、新しい構成を提案するオラクルを組み合わせた一般的なフレームワークである。
IMOSSは、活性集合が$t^β$として成長する再起動不要な任意の時限ポリシーでインスタンス化し、$O(p_ρ^{-1/β} + T^{(1+β)/2})$, ここで$β\in(0,1)$は活性集合の成長を制御し、$p_ρ$は、提案された構成が探索空間の最上位のρ$分数に該当する確率を低くする。
我々はIMOSSを3つの実用的なオラクルと組み合わせる:木構造パーゼンエミュレータ、コーディネート単位のバンディットによって駆動される既存変化オラクル、および事前訓練された表層基礎モデル。
IMABOは、古典的な機械学習モデルのチューニングからLLMベースのエージェントの設定に至るまで、多様なOHPO設定の中で最も低い累積的後悔を得る。
関連論文リスト
- ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models [14.64726819144383]
ZOMPは、クエリ効率が高く、完全にフォワードのみのプロンプトチューニング手法である。
BPフリーのプロンプトチューニング手法では、数ショットの精度とクエリ効率の両方で一貫して性能が向上する。
その結果,マルチモーダリティと低ランク構造を併用することで,実用的で実用的なBPフリープロンプトチューニングに有効な経路であることが示唆された。
論文 参考訳(メタデータ) (2026-08-08T10:55:58Z) - POETS: Uncertainty-Aware LLM Optimization via Compute-Efficient Policy Ensembles [35.88280776565273]
POETSは不確実性定量化と政策最適化を橋渡しする新しいフレームワークである。
我々のアプローチは、KL(Kulback-Leibler)正規化で訓練されたポリシーが、基礎となる報酬関数を暗黙的にエンコードするという知見に基づいている。
我々はPOETSが様々な科学的発見領域にまたがって最先端のサンプル効率を実現することを実証する。
論文 参考訳(メタデータ) (2026-05-08T14:16:32Z) - Multi-User Contextual Cascading Bandits for Personalized Recommendation [2.506355754272765]
Multi-User Contextual Cascading Banditモデルは、複数のユーザがシーケンシャルに表示されたアイテムと同時に対話するリアルなオンライン広告シナリオをキャプチャする。
我々はまず,UCBBP(Upper Confidence Bound with Backward Planning)を提案する。この設定に適したUCBスタイルのアルゴリズムで,$widetildeO(sqrtTHN)$が$T$以上,セッションステップが$H$,コンテキストが$N$以上となることを証明している。
多くのユーザが同時にシステムと対話するという事実に感銘を受けて、我々はActive Up Confidence Bound withという第2のアルゴリズムを導入しました。
論文 参考訳(メタデータ) (2025-08-19T16:14:33Z) - Adversarial Bandit over Bandits: Hierarchical Bandits for Online Configuration Management [37.696481970844054]
本研究は, 難解なリプシッツ逆数を持つ計量作用空間における非確率的マルチアーム・バンディット(MAB)問題を研究する。
我々は,現在最先端のフラットなアルゴリズムを利用できる階層型Adversarial Bandit over BanditsアルゴリズムであるABoBを提案する。
論文 参考訳(メタデータ) (2025-05-25T09:30:47Z) - Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning [55.15106182268834]
検証可能な報奨付き強化学習(RLVR)が,大規模言語モデルにおける推論能力向上のための主要なアプローチとして登場した。
ロールアウト生成は恥ずかしく並列であり、メモリライトであるのに対して、ポリシー更新は通信量が多く、メモリ集約的である。
PODS(Policy Optimization with Down-Sampling)を導入し、戦略的に選択されたロールアウトサブセットでのみトレーニングすることで、ポリシー更新からロールアウト生成を分離する。
論文 参考訳(メタデータ) (2025-04-18T17:49:55Z) - Federated Combinatorial Multi-Agent Multi-Armed Bandits [79.1700188160944]
本稿では,Banditを用いたオンライン最適化に適したフェデレーション学習フレームワークを提案する。
この設定では、エージェントのアームサブセットは、個々のアーム情報にアクセスせずにこれらのサブセットに対するノイズの多い報酬を観察し、特定の間隔で協力して情報を共有することができる。
論文 参考訳(メタデータ) (2024-05-09T17:40:09Z) - Combinatorial Stochastic-Greedy Bandit [79.1700188160944]
我々は,選択した$n$のアームセットのジョイント報酬以外の余分な情報が観測されない場合に,マルチアームのバンディット問題に対する新規グリーディ・バンディット(SGB)アルゴリズムを提案する。
SGBは最適化された拡張型コミットアプローチを採用しており、ベースアームの大きなセットを持つシナリオ用に特別に設計されている。
論文 参考訳(メタデータ) (2023-12-13T11:08:25Z) - Online Continuous Hyperparameter Optimization for Generalized Linear Contextual Bandits [55.03293214439741]
文脈的包帯では、エージェントは過去の経験に基づいた時間依存アクションセットから順次アクションを行う。
そこで本稿では,文脈的包帯のためのオンライン連続型ハイパーパラメータチューニングフレームワークを提案する。
理論上はサブ線形の後悔を達成でき、合成データと実データの両方において既存のすべての手法よりも一貫して優れた性能を発揮することを示す。
論文 参考訳(メタデータ) (2023-02-18T23:31:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。