論文の概要: Best Arm Identification under Additive Transfer Bandits
- arxiv url: http://arxiv.org/abs/2112.04083v1
- Date: Wed, 8 Dec 2021 02:20:18 GMT
- ステータス: 処理完了
- システム内更新日: 2021-12-09 14:36:33.875720
- Title: Best Arm Identification under Additive Transfer Bandits
- Title(参考訳): 加算移動帯域におけるベストアーム識別
- Authors: Ojash Neopane, Aaditya Ramdas, Aarti Singh
- Abstract要約: 提案手法は, 未知であるにもかかわらず, ソースとターゲットMABインスタンスの間には, 付加的な関係があることが知られている。
本稿では,LUCBスタイルのアルゴリズムを理論的に解析し,高い確率で$epsilon$-optimal target armを同定する。
- 参考スコア(独自算出の注目度): 49.69203462561861
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We consider a variant of the best arm identification (BAI) problem in
multi-armed bandits (MAB) in which there are two sets of arms (source and
target), and the objective is to determine the best target arm while only
pulling source arms. In this paper, we study the setting when, despite the
means being unknown, there is a known additive relationship between the source
and target MAB instances. We show how our framework covers a range of
previously studied pure exploration problems and additionally captures new
problems. We propose and theoretically analyze an LUCB-style algorithm to
identify an $\epsilon$-optimal target arm with high probability. Our
theoretical analysis highlights aspects of this transfer learning problem that
do not arise in the typical BAI setup, and yet recover the LUCB algorithm for
single domain BAI as a special case.
- Abstract(参考訳): 多腕包帯(MAB)には2組のアーム(ソースとターゲット)が存在するため、最適なアーム識別(BAI)問題の変種を考察し、ソースアームのみを引っ張りながら最適なターゲットアームを決定することを目的とする。
本稿では,その手法が未知であるにも関わらず,ソースとターゲットのmabインスタンスの間に既知の付加的な関係がある場合について検討する。
我々のフレームワークは、これまで研究されてきた純粋探索問題をどのようにカバーし、さらに新しい問題を捉えるかを示す。
我々は,高確率で$\epsilon$-optimalターゲットアームを同定するlucb型アルゴリズムを提案し,理論的に解析する。
理論解析では,典型的な bai では発生しないトランスファー学習問題の側面を強調すると同時に,単一領域 bai に対して lucb アルゴリズムを特殊ケースとして復元する。
関連論文リスト
- Best Arm Identification with Resource Constraints [6.236743421605786]
資源制約付きベストアーム識別(BAIwRC)問題について検討する。
エージェントは、各アームプルにリソースが消費されるリソース制約の下で、最適なアームを特定することを目的としている。
資源集約アルゴリズム(SH-RR)を設計・解析する。
論文 参考訳(メタデータ) (2024-02-29T12:17:54Z) - Best Arm Identification with Fixed Budget: A Large Deviation Perspective [54.305323903582845]
我々は、様々な武器の報酬間の経験的ギャップに基づいて、あらゆるラウンドで腕を拒絶できる真に適応的なアルゴリズムであるsredを提示する。
特に、様々な武器の報酬の間の経験的ギャップに基づいて、あらゆるラウンドで腕を拒絶できる真に適応的なアルゴリズムであるsredを提示する。
論文 参考訳(メタデータ) (2023-12-19T13:17:43Z) - Pure Exploration under Mediators' Feedback [63.56002444692792]
マルチアームバンディット(Multi-armed bandits)は、各インタラクションステップにおいて、学習者が腕を選択し、報酬を観察する、シーケンシャルな意思決定フレームワークである。
本稿では,学習者が仲介者の集合にアクセスできるシナリオについて考察する。
本稿では,学習者には仲介者の方針が知られていると仮定して,最適な腕を発見するための逐次的意思決定戦略を提案する。
論文 参考訳(メタデータ) (2023-08-29T18:18:21Z) - Differential Good Arm Identification [4.666048091337632]
本稿では,GAI(Good Arm Identification)と呼ばれる多腕バンディット問題の変種を対象とする。
GAIは純粋な探索用バンディット問題であり、できるだけ少ないサンプルで優れた腕を出力することを目的としている。
本稿では,DGAI - 優れた腕識別アルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-03-13T14:28:21Z) - Best Arm Identification in Restless Markov Multi-Armed Bandits [85.55466536537293]
マルチアームバンディット環境における最適な腕を特定することの問題点について検討する。
決定エンティティは、上限誤差確率を条件として、ベストアームのインデックスをできるだけ早く見つけることを希望する。
このポリシーは、$R$に依存する上限を達成し、$Rtoinfty$として単調に増加しないことを示す。
論文 参考訳(メタデータ) (2022-03-29T04:58:04Z) - Achieving the Pareto Frontier of Regret Minimization and Best Arm
Identification in Multi-Armed Bandits [91.8283876874947]
本稿では,BoBW-lil'UCB$(gamma)$アルゴリズムの設計と解析を行う。
i) RMとBAIの両方の目的に対して最適なアルゴリズムを同時に実行できないことを示す。
また、BoBW-lil'UCB$(gamma)$は、時間複雑性と後悔の点で競合よりも優れていることを示す。
論文 参考訳(メタデータ) (2021-10-16T17:52:32Z) - Quantile Bandits for Best Arms Identification [10.294977861990203]
多腕バンディットにおける最適な腕識別タスクの変種について検討する。
リスクと逆の意思決定の問題によって動機づけられた当社の目標は、固定予算内で最高の$tau$-quantileの値を持つ、$m$の武器のセットを特定することです。
論文 参考訳(メタデータ) (2020-10-22T09:58:54Z) - Multi-Armed Bandits with Dependent Arms [18.81667618369821]
我々は,従来のマルチアーマド・バンドイット問題(MABP)の変種について検討し,これを従属アームを持つマルチアーマド・バンドイット(Multi-Armed Bandits)と呼ぶ。
複数のアームをまとめてクラスタを形成し、同じクラスタに属するアームの報酬分布は、クラスタの特徴である未知のパラメータの既知の関数である。
UCBの原理に基づく学習アルゴリズムを開発し、これらの追加の側面観測を適切に活用し、探索・探索トレードオフを行う。
論文 参考訳(メタデータ) (2020-10-13T14:00:19Z) - Statistically Robust, Risk-Averse Best Arm Identification in Multi-Armed
Bandits [4.760079434948198]
このようなパラメトリック情報を利用する特殊なアルゴリズムは、パラメータが誤って特定された場合、不整合学習性能が高いことを示す。
主な貢献は, (i) 固定予算純探索条件下で統計的に堅牢なMABアルゴリズムの基本的な性能限界を確立すること, (ii) 二つの近似アルゴリズムのクラスを提案することである。
論文 参考訳(メタデータ) (2020-08-28T13:43:12Z) - Optimal Best-arm Identification in Linear Bandits [79.3239137440876]
サンプルの複雑さが既知のインスタンス固有の下界と一致する単純なアルゴリズムを考案する。
既存のベストアーム識別戦略とは異なり、我々のアルゴリズムは武器の数に依存しない停止規則を用いる。
論文 参考訳(メタデータ) (2020-06-29T14:25:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。