論文の概要: Where Does the Union Bound Go? Best-Arm Identification and Strong FWER Control
- arxiv url: http://arxiv.org/abs/2608.19903v1
- Date: Thu, 20 Aug 2026 11:14:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.55208
- Title: Where Does the Union Bound Go? Best-Arm Identification and Strong FWER Control
- Title(参考訳): ユニオン・バウンドはどこへ行くのか? ベスト・アーム同定と強いFWER制御
- Authors: Rianne de Heide,
- Abstract要約: ある方向では、ベストアームの識別は文字通り、$K-1$ true nullsの家庭的にエラー率の強い問題である。
反対の方向では、ちょうど1つのnullが真であるが、ペアワイズ実装は、$K-1$の比較で1つのnullを誤って拒否することができる。
このメモは、両共同体の用語において同値性を明確にしている。
- 参考スコア(独自算出の注目度): 2.099945352848429
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In fixed-confidence best-arm identification, proofs often use a union bound across the competing arms. From a multiple-testing point of view this can look puzzling: if the best arm is unique, only one hypothesis of the form ``arm $i$ is best'' can be true. Why then should there be a Bonferroni-type factor of $K-1$? The answer is that there are two natural ways to orient the hypotheses. In one orientation, best-arm identification is literally a strong familywise-error-rate (FWER) problem with $K-1$ true nulls. In the opposite orientation, exactly one null is true, but a pairwise implementation can falsely reject that one null through any of $K-1$ comparisons. Thus the multiplicity has not disappeared; it just pops up in different places. This note makes the equivalence explicit in the terminology of both communities.
- Abstract(参考訳): 固定自信のベストアーム識別では、証明はしばしば競合する腕に束縛されたユニオンを使用する。
ベストアームがユニークであれば、 ``arm $i$ is best'' という形の1つの仮説だけが真実である。
なぜBonferroni型係数が$K-1$となるのか?
答えは、仮説をオリエントする自然な方法が2つあるということだ。
ある方向では、ベストアームの識別は文字通り、$K-1$ true nullsのファミリーワイズエラーレート(FWER)問題である。
反対の方向では、ちょうど1つのnullが真であるが、ペアワイズ実装は、$K-1$の比較によって1つのnullを誤って拒否することができる。
したがって、多重性は消えてはいない。
このメモは、両共同体の用語において同値性を明確にしている。
関連論文リスト
- Does 1/2-Tsallis-INF Also Work Well for Best-Arm Identification? [11.223878908981725]
1/2$-Tsallis-INFは、標準的なFTRLアルゴリズムである。
盗賊の対数的擬似回帰を達成しつつ、敵の盗賊の最小限の後悔を保ちながら達成する。
これは自然な疑問を提起する:同じアルゴリズムは、追加の探索なしに、最高の腕を確実に特定できるのか?
論文 参考訳(メタデータ) (2026-08-15T18:38:36Z) - Multi-Armed Sequential Hypothesis Testing by Betting [44.29651618521598]
我々は、グローバル null 仮説 $mathscrP$ と合成代替 $mathscrQ$ を考える。
いくつかの腕がnullではないとしても、我々は$e$プロセスとシーケンシャルテストを求め、そのパフォーマンスは、どの腕が$mathscrP$に対して最もエビデンスを生成するかというオラクル知識を持つものと同じくらいである。
この最適性分析における重要な技術的装置は、観測不能だが十分に「推定可能」な報酬に対して、上信任性バウンドのようなアルゴリズムを改良したものである。
論文 参考訳(メタデータ) (2026-03-18T17:01:34Z) - Closing the Gap on the Sample Complexity of 1-Identification [8.450904497835262]
1-恒等化(1-identification)は、純粋探索における基本的な多重武装バンドイットの定式化である。
我々は、少なくとも1つの有資格腕が存在する場合、$mathbbE$の新たな下限を導出する。
我々の結果は、複数の資格を持つ腕がある場合の$mathbbE$の分析を補完する。
論文 参考訳(メタデータ) (2026-01-22T03:50:31Z) - Burau representation, Squier's form, and non-Abelian anyons [53.92822954974537]
ブレイド群 $B_3$ のブラウ表現から構築した周波数可変2次元非アベリア的演算順序制御を導入する。
Squier 陽性ウィンドウの向こう側にある$Delta(omega)$の符号変更は、因果順序の交互に構成的かつ破壊的干渉を示す。
数値シミュレーションにより、拡張と抑制の両方が確認され、最小の$B_3$ブレイド制御が確立される。
論文 参考訳(メタデータ) (2025-10-21T00:25:21Z) - Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits [49.96531901205305]
我々は$f$-divergence-regularized offline policy learningを分析する。
逆Kullback-Leibler (KL) の発散に対して、単極集中性の下での最初の$tildeO(epsilon-1)$サンプル複雑性を与える。
これらの結果は,$f$-divergence-regularized policy learningの包括的理解に向けて大きな一歩を踏み出したものと考えられる。
論文 参考訳(メタデータ) (2025-02-09T22:14:45Z) - Theoretical guarantees on the best-of-n alignment policy [110.21094183592358]
我々は、KLの最良のn$ポリシーと参照ポリシーのKL分岐が、実際のKL分岐の上限であることを示す。
そこで本研究では,KLの発散に対する新しい推定器を提案し,その近似が厳密であることを実証的に示す。
我々は、利益率とKLの最良のn$アライメントポリシーの相違点を分析することで締めくくった。
論文 参考訳(メタデータ) (2024-01-03T18:39:13Z) - Revisiting Simple Regret Minimization in Multi-Armed Bandits [33.88679679593314]
単純な後悔は、最高の腕や$epsilon$-good腕を欠く確率よりもあまり一般的ではない。
本稿では,データ豊かさ (Tge n$) とデータ貧弱さ (T le n$) の両面において,単純な後悔の上限を改良した。
より困難なデータ・ポーア・レシエーションのために、少なくとも1回は各腕をサンプリングすることなく、同じ改善を享受できるブラッケティングSH(BSH)を提案する。
論文 参考訳(メタデータ) (2022-10-30T18:31:03Z) - Best-Arm Identification in Correlated Multi-Armed Bandits [9.180690233707645]
本稿では,武器間の相関に関するドメイン知識を捉えた新しい相関バンディットフレームワークを提案する。
C-LUCBで得られた全サンプルは$mathcalOleft(sum_k in MathcalC logleft(frac1deltaright)$であり、通常の$mathcalOleft(sum_k in MathcalC logleft(frac1deltaright)$とは対照的である。
論文 参考訳(メタデータ) (2021-09-10T15:41:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。