論文の概要: Learning to Bet for Horizon-Aware Anytime-Valid Testing
- arxiv url: http://arxiv.org/abs/2603.19551v1
- Date: Fri, 20 Mar 2026 01:22:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:38.933743
- Title: Learning to Bet for Horizon-Aware Anytime-Valid Testing
- Title(参考訳): 水平型随時テストのためのBetの学習
- Authors: Ege Onur Taga, Samet Oymak, Shubhanshu Shekhar,
- Abstract要約: 地平線対応ベッティングは状態空間$(t, log W_t)$の有限水平最適制御問題である。
状態空間の特定の内部領域において、ケリーの賭けから著しく逸脱する政策は、証明可能な準最適であることを示す。
本稿では,総合的なQ-Network (DQN) エージェントをベースとしたディープ強化学習手法を提案する。
- 参考スコア(独自算出の注目度): 35.417212184352934
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We develop horizon-aware anytime-valid tests and confidence sequences for bounded means under a strict deadline $N$. Using the betting/e-process framework, we cast horizon-aware betting as a finite-horizon optimal control problem with state space $(t, \log W_t)$, where $t$ is the time and $W_t$ is the test martingale value. We first show that in certain interior regions of the state space, policies that deviate significantly from Kelly betting are provably suboptimal, while Kelly betting reaches the threshold with high probability. We then identify sufficient conditions showing that outside this region, more aggressive betting than Kelly can be better if the bettor is behind schedule, and less aggressive can be better if the bettor is ahead. Taken together these results suggest a simple phase diagram in the $(t, \log W_t)$ plane, delineating regions where Kelly, fractional Kelly, and aggressive betting may be preferable. Guided by this phase diagram, we introduce a Deep Reinforcement Learning approach based on a universal Deep Q-Network (DQN) agent that learns a single policy from synthetic experience and maps simple statistics of past observations to bets across horizons and null values. In limited-horizon experiments, the learned DQN policy yields state-of-the-art results.
- Abstract(参考訳): 我々は、厳密な期限$N$で、有界な手段に対する地平線対応テストと信頼シーケンスを開発する。
ベッティング/プロセスのフレームワークを用いて、状態空間$(t, \log W_t)$で有限水平最適制御問題として地平線対応ベッティングを論じ、$t$は時間、$W_t$はテストマーチンゲール値である。
まず、状態空間の特定の内部領域において、ケリーの賭けから著しく逸脱する政策は証明可能な準最適であり、ケリーの賭けは高い確率でしきい値に達することを示す。
次に、この領域の外では、ベクターがスケジュールに遅れている場合、ケリーよりも攻撃的なベットがより良くなり、ベクターが前方にいる場合、攻撃的でないベットがより良くなることを示す十分な条件を特定する。
これらの結果をまとめると、$(t, \log W_t)$平面の単純な位相図式が示され、ケリー、分数ケリー、アグレッシブベッティングが好まれる領域を記述できる。
このフェーズダイアグラムで導かれたDQN(Deep Q-Network)エージェントに基づくDeep Reinforcement Learningアプローチを導入し、合成経験から単一ポリシーを学び、過去の観測統計を地平線とヌル値の賭けにマッピングする。
限定水平実験では、学習されたDQNポリシーは最先端の結果をもたらす。
関連論文リスト
- Post-Training with Policy Gradients: Optimality and the Base Model Barrier [27.674563695368665]
結果とプロセス報酬を伴う線形自己回帰モデルの訓練後評価について検討する。
我々は、ポリシー勾配(PG)の変種が、本質的に最小限の報酬クエリ数を持つ1-varepsilon$を実現できることを証明した。
論文 参考訳(メタデータ) (2026-03-07T00:25:53Z) - Provably Efficient and Agile Randomized Q-Learning [35.14581235983678]
我々は、サンプリングベースの探索をアジャイル、ステップワイド、ポリシー更新と統合した新しいQ-ラーニングアルゴリズムをRandomizedQと呼ぶ。
経験的に、RandomizedQは、ボーナスベースとベイズベースで標準ベンチマークを探索する既存のQラーニングモデルと比較して、優れたパフォーマンスを示している。
論文 参考訳(メタデータ) (2025-06-30T16:08:29Z) - Learning to Cover: Online Learning and Optimization with Irreversible Decisions [50.5775508521174]
我々は,個別かつ不可逆な意思決定を対象とするオンライン学習と最適化の問題を定義した。
各期間において、意思決定者は、オープンする施設を選択し、それぞれの成功に関する情報を受け取り、将来の決定を導くために分類モデルを更新する。
目的は,多数の施設を対象とする地平線を特徴とし,カバー対象を反映するチャンス制約の下で施設開口を最小化することである。
論文 参考訳(メタデータ) (2024-06-20T23:00:25Z) - Autoregressive Bandits [58.46584210388307]
本稿では,オンライン学習環境であるAutoregressive Banditsを提案する。
報酬プロセスの軽微な仮定の下では、最適ポリシーを便利に計算できることが示される。
次に、新しい楽観的後悔最小化アルゴリズム、すなわちAutoRegressive Upper Confidence Bound (AR-UCB)を考案し、$widetildemathcalO left( frac(k+1)3/2sqrtnT (1-G)のサブ線形後悔を被る。
論文 参考訳(メタデータ) (2022-12-12T21:37:36Z) - Minimal Expected Regret in Linear Quadratic Control [79.81807680370677]
オンライン学習アルゴリズムを考案し、その期待された後悔を保証します。
当時のこの後悔は、$A$と$B$が未知の場合、$widetildeO((d_u+d_x)sqrtd_xT)$によって上界(i)となる。
論文 参考訳(メタデータ) (2021-09-29T14:07:21Z) - A Bayesian Learning Algorithm for Unknown Zero-sum Stochastic Games with
an Arbitrary Opponent [9.094186120476174]
ゼロサムゲームのための後サンプリング強化学習(PSRL-ZSG)
ゼロサムゲームのための後サンプリング強化学習(PSRL-ZSG)を提案する。
論文 参考訳(メタデータ) (2021-09-08T02:05:40Z) - Minimax Regret for Stochastic Shortest Path [63.45407095296692]
我々は、エージェントが最小の総予想コストで目標状態に達する必要がある最短パス(SSP)問題を研究します。
この設定に対するminimaxの後悔は、$widetilde O(B_star sqrt|S| |A|K)$であり、$B_star$は任意の状態から最適なポリシーの予想コストに拘束されることを示しています。
本アルゴリズムは, 有限水平MDPにおける強化学習の新たな削減を基礎として, エピソードごとのインタイム動作を行う。
論文 参考訳(メタデータ) (2021-03-24T10:11:49Z) - Preference-based Reinforcement Learning with Finite-Time Guarantees [76.88632321436472]
嗜好に基づく強化学習(PbRL)は、従来の強化学習における報酬価値を代替し、目標とする目的に対する人間の意見をよりよく提示する。
応用の有望な結果にもかかわらず、PbRLの理論的理解はまだ初期段階にある。
一般PbRL問題に対する最初の有限時間解析を提案する。
論文 参考訳(メタデータ) (2020-06-16T03:52:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。