論文の概要: Dominant Arm Identification with Mixing and Recycling Observed Samples
- arxiv url: http://arxiv.org/abs/2608.01545v1
- Date: Sun, 02 Aug 2026 23:58:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.272096
- Title: Dominant Arm Identification with Mixing and Recycling Observed Samples
- Title(参考訳): 混合・再資源化試料を用いた支配的武器識別
- Abstract要約: マルチアームバンディットにおける支配的腕の同定問題について検討する。
目的は、他のすべてのアクションの現実的な報酬を超える最も高い確率でアクションを見つけることである。
我々は,理論的保証を伴う新しい支配的腕の基準と効率的な推定器を導入する。
- 参考スコア(独自算出の注目度): 3.7384509727711923
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We study the problem of identifying the dominant arm in multi-armed bandits, where the objective is to find the action with the highest probability of exceeding the realized rewards of all other actions. Conventional mean-based and pairwise comparison-based algorithms often fail to identify the arm with the highest realized reward. To address this challenge, we introduce a novel dominant arm criterion and an efficient estimator with theoretical guarantees. Our approach relies on two key technical innovations: (i) a dominance score criterion that an arm beats the locally dominant over the partitioned reward space and (ii) a joint mixing and recycling mechanism coupled with a doubly robust estimator that guarantees simultaneous convergence of the empirical distribution functions for all arms. These key innovations pave a way to efficient computation of global arm dominance. Our proposed elimination algorithm identifies the best dominant arm with nearly optimal rate of sample complexity. Numerical experiments demonstrate that our algorithm consistently achieves exact recovery of the true dominant arm, outperforming existing baselines.
- Abstract(参考訳): 本研究は,多腕包帯における支配的腕の特定の問題について検討し,その目的は,他のすべての行動の現実的な報酬を超える確率の高い行動を見つけることである。
従来の平均に基づくアルゴリズムとペア比較に基づくアルゴリズムは、しばしば最も実現された報酬で腕を特定するのに失敗する。
この課題に対処するために,理論的保証を伴う新しい支配的腕の基準と効率的な推定器を導入する。
私たちのアプローチは2つの重要な技術革新に依存しています。
一 分割した報酬空間において、腕が地方支配者を打ち負かすという支配スコア基準
二 両腕の実験的分布関数の同時収束を保証する二重頑健な推定器を併用した混合再生機構
これらの重要な革新は、グローバルアーム支配の効率的な計算方法である。
提案する除去アルゴリズムは, サンプルの複雑さのほぼ最適な速度で, 最上位のアームを同定する。
数値実験により,本アルゴリズムは真の支配的アームの正確な回復を一貫して達成し,既存のベースラインを上回っていることが示された。
関連論文リスト
- Progressive Content Refinement with Decaying Reward Joint LinUCB [2.1290878226779877]
本稿では,報酬減衰モデリングを明示的に組み込んだ新しい文脈帯域幅アルゴリズムを提案する。
提案手法は,強いベースラインよりも高い性能向上を達成できることを示す。
以上の結果から,バンディット・フレームワークにおける報酬崩壊モデルの統合が過剰な露光を緩和するために重要であることが確認された。
論文 参考訳(メタデータ) (2026-08-07T03:17:22Z) - Best Arm Identification in Generalized Linear Bandits via Hybrid Feedback [23.37199172197756]
一般化線形包帯における固定信頼度最適腕同定をハイブリッドフィードバックモデルにより検討した。
不均一な一般化線形観測を統一する確率比に基づく信頼シーケンスを導入する。
アームとペアの共同動作空間上での最小最適設計を追跡することで,クエリを適応的に割り当てるハイブリッドトラック・アンド・ストップアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-05-07T06:40:42Z) - Semi-Parametric Batched Global Multi-Armed Bandits with Covariates [0.48342038441006807]
マルチアームバンディット(MAB)フレームワークは、シーケンシャルな意思決定に広く使われているアプローチである。
本稿では,コパラメトリックと腕間の共有パラメータを持つバッチバンドの半パラメトリックフレームワークを提案する。
Batched Single-Index Dynamic binning and Successive arm elimination (BIDS) というアルゴリズムでは、バッチ化された逐次アームの除去戦略を採用している。
論文 参考訳(メタデータ) (2025-03-01T17:23:55Z) - Reward Maximization for Pure Exploration: Minimax Optimal Good Arm Identification for Nonparametric Multi-Armed Bandits [35.35226227009685]
グッドアーム識別(グッドアームアイソレーション、英: Good Arm Identification、IGA)は、腕をできるだけ早くしきい値以上の手段でラベル付けすることを目的とした、実用的なバンドイット推論の目的である。
本稿では,報奨最大化サンプリングアルゴリズムと新たな非有意シーケンシャルテストを組み合わせることで,GAを効率よく解くことができることを示す。
我々の実験結果は、ミニマックス設定を超えるアプローチを検証し、すべての停止時間におけるサンプルの期待数を、合成および実世界の設定で少なくとも50%削減する。
論文 参考訳(メタデータ) (2024-10-21T01:19:23Z) - Best Arm Identification with Minimal Regret [55.831935724659175]
最高の腕識別問題 優雅にアマルガメートは、最小化とBAIを後悔している。
エージェントの目標は、所定の信頼度で最高の腕を特定することである。
二重KL-UCBアルゴリズムは、信頼度がゼロになる傾向があるため、最適性を達成する。
論文 参考訳(メタデータ) (2024-09-27T16:46:02Z) - Optimal Multi-Fidelity Best-Arm Identification [65.23078799972188]
バンディットのベストアーム識別において、アルゴリズムは、できるだけ早く特定の精度で、最高平均報酬の腕を見つけることを任務とする。
マルチフィデリティのベストアーム識別について検討し、低コストで低いフィデリティ(正確な平均推定値を持たない)で腕をサンプリングすることを選択できる。
この問題に対処するためのいくつかの方法が提案されているが、その最適性は、特に最適な腕を特定するのに必要な総コストのゆるやかな下限のため、未解決のままである。
論文 参考訳(メタデータ) (2024-06-05T08:02:40Z) - Best Arm Identification with Fixed Budget: A Large Deviation Perspective [54.305323903582845]
我々は、様々な武器の報酬間の経験的ギャップに基づいて、あらゆるラウンドで腕を拒絶できる真に適応的なアルゴリズムであるsredを提示する。
特に、様々な武器の報酬の間の経験的ギャップに基づいて、あらゆるラウンドで腕を拒絶できる真に適応的なアルゴリズムであるsredを提示する。
論文 参考訳(メタデータ) (2023-12-19T13:17:43Z) - Pure Exploration under Mediators' Feedback [63.56002444692792]
マルチアームバンディット(Multi-armed bandits)は、各インタラクションステップにおいて、学習者が腕を選択し、報酬を観察する、シーケンシャルな意思決定フレームワークである。
本稿では,学習者が仲介者の集合にアクセスできるシナリオについて考察する。
本稿では,学習者には仲介者の方針が知られていると仮定して,最適な腕を発見するための逐次的意思決定戦略を提案する。
論文 参考訳(メタデータ) (2023-08-29T18:18:21Z) - Covariance Adaptive Best Arm Identification [0.0]
ゴールは、腕のプル数を最小化しながら、最低でも1-$delta$の確率で腕を最も平均的な報酬で識別することである。
武器を頼りにでき、報酬を同時にサンプリングできる、より柔軟なシナリオを提案する。
この枠組みは、患者と薬物の類似性から根底にある相関関係が示唆される臨床試験など、様々な応用に関係している。
論文 参考訳(メタデータ) (2023-06-05T06:57:09Z) - Mean-based Best Arm Identification in Stochastic Bandits under Reward
Contamination [80.53485617514707]
本稿では,ギャップベースアルゴリズムと逐次除去に基づく2つのアルゴリズムを提案する。
具体的には、ギャップベースのアルゴリズムでは、サンプルの複雑さは定数要素まで最適であり、連続的な除去では対数因子まで最適である。
論文 参考訳(メタデータ) (2021-11-14T21:49:58Z) - Optimal Best-arm Identification in Linear Bandits [79.3239137440876]
サンプルの複雑さが既知のインスタンス固有の下界と一致する単純なアルゴリズムを考案する。
既存のベストアーム識別戦略とは異なり、我々のアルゴリズムは武器の数に依存しない停止規則を用いる。
論文 参考訳(メタデータ) (2020-06-29T14:25:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。