論文の概要: Fixed-Confidence Best-Arm Identification for Causal Mediation Analysis
- arxiv url: http://arxiv.org/abs/2607.04315v1
- Date: Sun, 05 Jul 2026 14:02:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.889455
- Title: Fixed-Confidence Best-Arm Identification for Causal Mediation Analysis
- Title(参考訳): 因果治療分析のための固定信頼度ベストアーム同定
- Abstract要約: 本稿では,NDPO(Natural Direct potential outcome)を最大化する治療法の同定問題について検討する。
本研究では,Track-and-Stop (TaS) フレームワークに基づく固定信頼度ベストアーム識別(BAI)を開発する。
私たちはそれが$$-correctnessとOptimityを満たすことを証明します。
- 参考スコア(独自算出の注目度): 17.717927206311618
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper studies the problem of identifying the treatment that maximizes the expected natural direct potential outcome (NDPO), which captures the potential outcome of an intervention while excluding the pathway transmitted through a mediator that researchers may wish to remove from evaluation. We first establish population-level identification of the expected NDPO in a causal bandit setting using observable interventional distributions. We then develop a fixed-confidence best-arm identification (BAI) algorithm based on the Track-and-Stop (TaS) framework, employing a cutting-set method to solve the resulting semi-infinite optimization problem. The proposed algorithm achieves sample-efficient identification with a high-probability correctness guarantee. We prove that it satisfies $δ$-correctness and asymptotic optimality. Finally, we validate the approach through empirical evaluations on a large-scale real-world advertising dataset (IPinYou).
- Abstract(参考訳): 本稿では, 研究者が評価から排除したいと考えるメディエーターを通して伝達される経路を除外しながら, 介入の潜在的結果を捉え, 期待される自然電位結果(NDPO)を最大化する治療法の同定について検討する。
まず,観測可能な介入分布を用いた因果帯域設定において,期待されるNDPOの集団レベルでの同定を行う。
次に、トラック・アンド・ストップ(TaS)フレームワークに基づく固定信頼ベストアーム識別(BAI)アルゴリズムを開発し、半無限最適化問題の解法としてカットセット法を用いる。
提案アルゴリズムは,高確率正当性保証付きサンプル効率同定を実現する。
我々は、$δ$-correctness と漸近的最適性を満たすことを証明した。
最後に,大規模な実世界の広告データセット (IPinYou) を用いた実証的評価により,提案手法の検証を行った。
関連論文リスト
- Non-Asymptotic Best Policy Identification Guarantees in Online Reinforcement Learning [27.12987353045116]
これは、学習者の目的が、信頼性の高い意思決定プロセス(MDP)における最適なポリシーを特定することにある、活発なシーケンシャルな仮説テスト問題である。
決定論的報酬を伴うオンライン・セッティングについて検討し、エージェントは効果的に探索するためにMDPをナビゲートする必要がある。
論文 参考訳(メタデータ) (2026-07-19T11:48:09Z) - Learning Optimal Distributionally Robust Individualized Treatment Rules Integrating Multi-Source Data [3.821271508420626]
共依存分布不確実性集合に対する最悪の政策値を最大化する情報ベース分散堅牢ITR(PDRO-ITR)を提案する。
PDRO-ITR推定器のリスクバウンダリを確立し、最悪の場合の堅牢な性能を保証する。
論文 参考訳(メタデータ) (2026-03-05T14:33:52Z) - Towards Anytime-Valid Statistical Watermarking [63.02116925616554]
我々は、任意の時間価推論で最適なサンプリングを統一する、最初のe-value-based watermarking frameworkであるAnchored E-Watermarkingを開発した。
本フレームワークはサンプル効率を大幅に向上させ,最先端のベースラインに対して,検出に必要な平均トークン予算を13~15%削減する。
論文 参考訳(メタデータ) (2026-02-19T18:32:26Z) - Asymptotically Optimal Linear Best Feasible Arm Identification with Fixed Budget [55.938644481736446]
本稿では,誤差確率の指数的減衰を保証し,最適な腕識別のための新しいアルゴリズムを提案する。
我々は,複雑性のレベルが異なる様々な問題インスタンスに対する包括的経験的評価を通じて,アルゴリズムの有効性を検証する。
論文 参考訳(メタデータ) (2025-06-03T02:56:26Z) - Sound Heuristic Search Value Iteration for Undiscounted POMDPs with Reachability Objectives [16.101435842520473]
本稿では,POMDPにおける最大到達可能性確率問題(indefinite-horizon)と呼ばれる問題について検討する。
割引問題に対するポイントベース手法の成功に触発され,MRPPへの拡張について検討した。
本稿では,これらの手法の強みを有効活用し,信念空間を効率的に探索するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-06-05T02:33:50Z) - Soft Dice Confidence: A Near-Optimal Confidence Estimator for Selective Prediction in Semantic Segmentation [1.2903829793534267]
本稿では,画像全体の信頼度を1つに見積もるイメージレベルの棄損に焦点をあてて,この問題に対処する。
画像サイズを推定する最適な信頼度推定器を導出する。
次に、線形時間で計算可能な近似であるSoft Dice Confidence (SDC)を提案し、最適推定器に密接なバインドがあることを証明した。
論文 参考訳(メタデータ) (2024-02-16T13:14:12Z) - Likelihood Ratio Confidence Sets for Sequential Decision Making [51.66638486226482]
確率に基づく推論の原理を再検討し、確率比を用いて妥当な信頼シーケンスを構築することを提案する。
本手法は, 精度の高い問題に特に適している。
提案手法は,オンライン凸最適化への接続に光を当てることにより,推定器の最適シーケンスを確実に選択する方法を示す。
論文 参考訳(メタデータ) (2023-11-08T00:10:21Z) - Online POMDP Planning with Anytime Deterministic Optimality Guarantees [13.824288326240927]
近似解と最適解の間の離散POMDPに対する決定論的関係を導出する。
我々の導出は、新しいアルゴリズムセットの道を提供し、既存のアルゴリズムにアタッチできることを示します。
論文 参考訳(メタデータ) (2023-10-03T04:40:38Z) - Mean-based Best Arm Identification in Stochastic Bandits under Reward
Contamination [80.53485617514707]
本稿では,ギャップベースアルゴリズムと逐次除去に基づく2つのアルゴリズムを提案する。
具体的には、ギャップベースのアルゴリズムでは、サンプルの複雑さは定数要素まで最適であり、連続的な除去では対数因子まで最適である。
論文 参考訳(メタデータ) (2021-11-14T21:49:58Z) - CoinDICE: Off-Policy Confidence Interval Estimation [107.86876722777535]
強化学習における高信頼行動非依存のオフ政治評価について検討する。
様々なベンチマークにおいて、信頼区間推定が既存の手法よりも厳密で精度が高いことが示されている。
論文 参考訳(メタデータ) (2020-10-22T12:39:11Z) - Adaptive Sampling for Best Policy Identification in Markov Decision
Processes [79.4957965474334]
本稿では,学習者が生成モデルにアクセスできる場合の,割引マルコフ決定(MDP)における最良の政治的識別の問題について検討する。
最先端アルゴリズムの利点を論じ、解説する。
論文 参考訳(メタデータ) (2020-09-28T15:22:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。