論文の概要: Regime-Conditioned Evaluation in Multi-Context Bayesian Optimization
- arxiv url: http://arxiv.org/abs/2605.04895v1
- Date: Wed, 06 May 2026 13:27:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.836375
- Title: Regime-Conditioned Evaluation in Multi-Context Bayesian Optimization
- Title(参考訳): マルチコンテキストベイズ最適化における規則付き評価
- Authors: Noel Thomas,
- Abstract要約: NeurIPS, ICML, ICLR, AISTATS, UAI, TMLR, JMLR, AutoML-Conf (2022-2025) による40件の移動BO論文の監査の結果, 98%は制御軸としてB/|A|を決して変化しないことがわかった。
同じGDSC2ベンチマークでは、予算だけを変更すると、ランキングが逆転する。B=50では、GreedyがUCBを0.050 Hit@1で、B=100では、UCBが0.035で、Greedyを0.035で上回っている。
ポータブルレジームスコアPSS=(B/|A|)でこの遷移を捉える。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Published transfer-BO comparisons often estimate an average treatment effect of acquisition choice over hidden regime variables, while practitioners need the conditional effect for their specific prior quality, budget ratio, and metric. An audit of 40 transfer-BO papers from NeurIPS, ICML, ICLR, AISTATS, UAI, TMLR, JMLR, and AutoML-Conf (2022-2025) finds that 98% never vary B/|A| as a controlled axis. On the same GDSC2 benchmark, changing only the budget reverses the ranking: at B=50, Greedy outperforms UCB by 0.050 Hit@1, while at B=100, UCB outperforms Greedy by 0.035. We capture this transition with the Portable Regime Score PRS=(B/|A|)(1-rho), where rho is the prior rank correlation and can be estimated from pilot contexts before the main comparison. Across 79 conditions spanning chemistry, drug-response biology, and HPO, a hierarchical model gives beta=0.50 (p=1.1e-9), and 19% of conditions fall in an equivalence zone where |advantage|<0.01 Hit@1. In five published reversal cases, PRS predicts the winner from pre-comparison observables. A No-Free-Leaderboard proposition explains why unconditional rankings are unstable: when CATE changes sign across regimes, the reported ATE becomes a function of benchmark mixture. RegimePlanner, which estimates rho online and switches acquisition accordingly, wins all 16 HPO-B search spaces at B=100 and exceeds the matched {Greedy,UCB} per-context oracle on GDSC2 by 18%. Pre-registered predictions achieve 27/40=67.5% overall accuracy and above 90% within EMA prior families. The practical protocol is simple: report B/|A|, rho, K, and metric alongside any claimed acquisition advantage.
- Abstract(参考訳): 公表されたTransfer-BO比較は、隠れた状態変数よりも取得選択の平均的な処理効果を推定する一方、実践者は特定の事前品質、予算比率、メートル法に対する条件効果を必要とする。
NeurIPS, ICML, ICLR, AISTATS, UAI, TMLR, JMLR, AutoML-Conf (2022-2025) による40件の移動BO論文の監査の結果, 98%は制御軸としてB/|A|を決して変化しないことがわかった。
同じGDSC2ベンチマークでは、予算だけを変更するとランキングが逆転する: B=50では、Greedyは UCBを0.050 Hit@1で、B=100では、UCBはGreedyを0.035で上回っている。
この遷移を可搬性レジームスコアPSS=(B/|A|)(1-rho)で捉え、rhoは事前のランク相関であり、主比較の前にパイロットコンテキストから推定できる。
化学、薬物応答生物学、HPOにまたがる79の条件の中で、階層モデルはβ=0.50(p=1.1e-9)を与え、条件の19%は|advantage|<0.01 Hit@1の同値領域に該当する。
5つのリバーサルケースにおいて、PSSは、プレコンパゾンオブザーバブルから勝者を予測する。
No-Free-Leaderboardの提案は、なぜ非条件のランキングが不安定なのかを説明している。
RegimePlannerはオンライン上でrhoを推定し、それに従って買収を切り替え、B=100で全16のHPO-B検索スペースを獲得し、GDSC2上の一致した {Greedy,UCB} per-context oracleを18%上回る。
事前登録された予測は27/40=67.5%の精度で、EMA以前の家族では90%以上である。
実用的なプロトコルは単純である: 報告 B/|A|, rho, K, およびメートル法は、任意の主張された取得の利点と共に成り立つ。
関連論文リスト
- Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals [0.3384279376065155]
大きな言語モデルアンサンブルは、パフォーマンス境界までの推論精度を改善する。
DASE(Deliberative Adaptive Stopping Ensemble)は、真のコンセンサスを早期にコミットし、断片化された証拠にグローバル周波数のフォールバックを適用するアンサンブルである。
論文 参考訳(メタデータ) (2026-05-05T19:24:10Z) - An Integrated Framework for Explainable, Fair, and Observable Hospital Readmission Prediction: Development and Validation on MIMIC-IV [0.0]
MIMIC-IVデータベースから成人415231名を対象にコホートを構築した。
このフレームワークは、競争力のあるパフォーマンス、臨床的に実行可能な説明、強力な人口シェアを提供する。
論文 参考訳(メタデータ) (2026-04-24T13:21:44Z) - ContraPrompt: Contrastive Prompt Optimization via Dyadic Reasoning Trace Analysis [0.6372261626436676]
ContraPromptは、モデルが失敗してもフィードバックで再試行を成功させる場合、その差が最適化信号を構成するという観測に基づいて構築される。
従来のコントラスト法とは異なり、完全な中間的推論過程を比較する。
ContraPromptは11日にGEPAを41で破り、同じ予算で1で敗れた。
論文 参考訳(メタデータ) (2026-04-20T08:17:15Z) - Belief Propagation Convergence Prediction for Bivariate Bicycle Quantum Error Correction Codes [0.0]
コンバージェンスを1つのモジュロ演算で事前に予測できることが示される。
予測はBPスケジューリング戦略とRelay-BPを含むデコーダの変種の下で不変である。
論文 参考訳(メタデータ) (2026-04-09T09:03:34Z) - Don't Pass$\mathtt{@}k$: A Bayesian Framework for Large Language Model Evaluation [4.082208996639461]
Pass$@k$ は LLM の推論のパフォーマンスを報告するのに広く使われているが、不安定で誤解を招くようなランキングを得ることが多い。
本稿では、Pass$@k$をモデルの基本成功確率と信頼区間の後方推定に置き換える原理的ベイズ評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-05T16:14:03Z) - Regression-Based Estimation of Causal Effects in the Presence of Selection Bias and Confounding [52.1068936424622]
治療が介入によって設定された場合、対象変数$Y$に対して、予測因果効果$E[Y|do(X)]$を推定する問題を考える。
選択バイアスや欠点のない設定では、$E[Y|do(X)] = E[Y|X]$ となる。
選択バイアスとコンバウンディングの両方を組み込んだフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-26T13:43:37Z) - Conformal Prediction Sets with Improved Conditional Coverage using Trust Scores [52.92618442300405]
有限サンプルにおいて、正確に分布のない条件付きカバレッジを達成することは不可能である。
本稿では,最も重要となる範囲を対象とするコンフォメーション予測アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-01-17T12:01:56Z) - Mind the Gap: A Causal Perspective on Bias Amplification in Prediction & Decision-Making [58.06306331390586]
本稿では,閾値演算による予測値がS$変化の程度を測るマージン補数の概念を導入する。
適切な因果仮定の下では、予測スコア$S$に対する$X$の影響は、真の結果$Y$に対する$X$の影響に等しいことを示す。
論文 参考訳(メタデータ) (2024-05-24T11:22:19Z) - Will My Robot Achieve My Goals? Predicting the Probability that an MDP Policy Reaches a User-Specified Behavior Target [56.99669411766284]
自律的なシステムがタスクを実行する場合、ユーザの目標を達成する確率のキャリブレーションされた見積もりを維持する必要がある。
本稿では,ユーザの目標が目標間隔として指定される設定について検討する。
我々は、共形予測を反転させて確率推定を計算する。
論文 参考訳(メタデータ) (2022-11-29T18:41:20Z) - Certified Error Control of Candidate Set Pruning for Two-Stage Relevance
Ranking [57.42241521034744]
本稿では、妥当性ランキングのための候補セットプルーニングの認証エラー制御の概念を提案する。
提案手法は,第1段階から抽出した候補集合を抽出し,第2段階の復位速度を向上する。
論文 参考訳(メタデータ) (2022-05-19T16:00:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。