論文の概要: Safe Bayesian Optimization with Counterfactual Policies
- arxiv url: http://arxiv.org/abs/2607.05620v1
- Date: Mon, 06 Jul 2026 20:30:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.320052
- Title: Safe Bayesian Optimization with Counterfactual Policies
- Title(参考訳): 対物政策による安全ベイズ最適化
- Abstract要約: 臨床医学では、確立されたケア基準に対する結果が悪化しない場合にのみ、新しい治療が受け入れられることが多い。
本稿では, 正則予測を用いて, 有効不確実区間を構築する方法を示す。
安全証明、実験的証拠、感度分析を提供する。
- 参考スコア(独自算出の注目度): 2.1912083646106915
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In many decision-making settings, new interventions are acceptable only if they do not reduce outcomes below some established threshold. For example, in clinical medicine, new treatments are often acceptable only if they do not worsen outcomes relative to an established standard of care. Safe Bayesian optimization maximizes an objective subject to safety constraints. In the setting that we consider here, safety is defined relative to a known baseline policy whose outcomes are counterfactual and therefore unobserved. Thus, the counterfactual outcomes of the baseline policy must be estimated and those (uncertain) estimates must be used to safely optimize the objective. We address this estimation problem by using conformal prediction to construct valid uncertainty intervals for counterfactual baseline outcomes, and we show how these intervals can be integrated into safe Bayesian optimization to ensure that constraint violations occur at or below a user-specified rate. We also show how to adapt these conformal estimates to different kinds of covariate shift. We provide a safety proof, experimental evidence, and a sensitivity analysis.
- Abstract(参考訳): 多くの意思決定設定では、確立されたしきい値以下の結果を減らさない場合のみ、新しい介入が受け入れられる。
例えば、臨床医学では、確立されたケア基準に対する結果が悪化しない場合にのみ、新しい治療が受け入れられることが多い。
安全ベイズ最適化は、安全制約の対象を最適化する。
ここで考える場合、安全は、結果が非現実的であり、従って観測されていない既知の基本方針に対して定義される。
したがって、基本方針の反実的な結果は推定されなければならないし、その(不確実な)見積もりは、その目的を安全に最適化するために使用される必要がある。
この推定問題に対して, 正則予測を用いて, 正則な不確実区間を構築し, それらの区間を安全なベイズ最適化に統合し, ユーザ特定率以下での制約違反の発生を確実にする方法について述べる。
また、これらの共形推定を異なる種類の共変量シフトに適応する方法を示す。
安全証明、実験的証拠、感度分析を提供する。
関連論文リスト
- Prediction Sets for Counterfactual Decisions: Coverage, Optimality, and Conformal Prediction [7.899668963928307]
我々は、不確実性のある反事実決定のための意思決定理論の枠組みを開発する。
そこで,我々は,表現セット自体によって引き起こされる行動の下で実現された結果のカバレッジという,政治に結合した新たな概念を同定する。
論文 参考訳(メタデータ) (2026-07-02T14:13:08Z) - SConU: Selective Conformal Uncertainty in Large Language Models [59.25881667640868]
SconU(Selective Conformal Uncertainity)と呼ばれる新しいアプローチを提案する。
我々は,特定の管理可能なリスクレベルで設定されたキャリブレーションの不確実性分布から,与えられたサンプルが逸脱するかどうかを決定するのに役立つ2つの共形p値を開発する。
我々のアプローチは、単一ドメインと学際的コンテキストの両方にわたる誤発見率の厳密な管理を促進するだけでなく、予測の効率を高める。
論文 参考訳(メタデータ) (2025-04-19T03:01:45Z) - Rectifying Conformity Scores for Better Conditional Coverage [75.73184036344908]
本稿では,分割共形予測フレームワーク内で信頼セットを生成する新しい手法を提案する。
本手法は,任意の適合度スコアのトレーニング可能な変換を行い,条件付き範囲を正確に確保しつつ,条件付き範囲を改善する。
論文 参考訳(メタデータ) (2025-02-22T19:54:14Z) - Bin-Conditional Conformal Prediction of Fatalities from Armed Conflict [0.5312303275762104]
ユーザ定義サブセット間の一貫したカバレッジ率を確保することにより、標準コンフォメーション予測を強化するビン条件コンフォメーション予測(BCCP)を導入する。
標準共形予測と比較すると、BCCPは局所的カバレッジを改善するが、これはわずかに広い予測間隔のコストがかかる。
論文 参考訳(メタデータ) (2024-10-18T14:41:42Z) - Information-Theoretic Safe Bayesian Optimization [59.758009422067005]
そこでは、未知の(安全でない)制約に反するパラメータを評価することなく、未知の関数を最適化することを目的としている。
現在のほとんどのメソッドはドメインの離散化に依存しており、連続ケースに直接拡張することはできない。
本稿では,GP後部を直接利用して,最も情報に富む安全なパラメータを識別する情報理論的安全な探索基準を提案する。
論文 参考訳(メタデータ) (2024-02-23T14:31:10Z) - Hallucinated Adversarial Control for Conservative Offline Policy
Evaluation [64.94009515033984]
本研究では,環境相互作用のオフラインデータセットが与えられた場合,政策のパフォーマンスを低く抑えることを目的とした,保守的非政治評価(COPE)の課題について検討する。
本稿では,遷移力学の不確実性を考慮した学習モデルに基づくHAMBOを紹介する。
結果のCOPE推定値が妥当な下界であることを証明し、正則性条件下では、真に期待された戻り値への収束を示す。
論文 参考訳(メタデータ) (2023-03-02T08:57:35Z) - Conformal Off-Policy Prediction in Contextual Bandits [54.67508891852636]
コンフォーマルなオフ政治予測は、新しい目標ポリシーの下で、結果に対する信頼できる予測間隔を出力することができる。
理論上の有限サンプル保証は、標準的な文脈的バンディットの設定を超える追加の仮定をすることなく提供する。
論文 参考訳(メタデータ) (2022-06-09T10:39:33Z) - Post-Contextual-Bandit Inference [57.88785630755165]
コンテキストバンディットアルゴリズムは、電子商取引、医療、政策立案における非適応的なA/Bテストを置き換える傾向にある。
研究参加者の成果を改善することもでき、良い方針や最良の政策を特定できる可能性を高めることもできる。
研究の終盤における新規介入の信頼性推論を支援するため, 平均治療効果, サブグループ効果, あるいは新政策の価値について, 有効な信頼区間を構築したい。
論文 参考訳(メタデータ) (2021-06-01T12:01:51Z) - Accountable Off-Policy Evaluation With Kernel Bellman Statistics [29.14119984573459]
我々は,以前の実験から収集した観測データから,新たな政策の評価を行うオフ・ポリティクス評価(OPE)について考察する。
政治外のデータからの情報が少ないため、点推定だけでなく厳密な信頼区間を構築することが望ましい。
我々は,OPEにおける厳密な信頼境界を計算する問題を削減するための新しい変分フレームワークを提案する。
論文 参考訳(メタデータ) (2020-08-15T07:24:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。