論文の概要: Scale-free adaptive planning for deterministic dynamics & discounted rewards
- arxiv url: http://arxiv.org/abs/2604.18312v1
- Date: Mon, 20 Apr 2026 14:17:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.92918
- Title: Scale-free adaptive planning for deterministic dynamics & discounted rewards
- Title(参考訳): 決定論的力学と割引報酬に対するスケールフリー適応計画法
- Authors: Peter L. Bartlett, Victor Gabillon, Jennifer Healey, Michal Valko,
- Abstract要約: Platypoosは、未知のスケールと報酬関数の滑らかさに適応する単純なスケールフリー計画アルゴリズムである。
本研究では,先行作業を改善するとともに,幅広い割引要因と報酬尺度を同時に保持するPlatypoosの複雑性分析を行う。
- 参考スコア(独自算出の注目度): 37.44685349093297
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We address the problem of planning in an environment with deterministic dynamics and stochastic rewards with discounted returns. The optimal value function is not known, nor are the rewards bounded. We propose Platypoos, a simple scale-free planning algorithm that adapts to the unknown scale and smoothness of the reward function. We provide a sample complexity analysis for Platypoos that improves upon prior work and holds simultaneously over a broad range of discount factors and reward scales, without the algorithm knowing them. We also establish a matching lower bound showing our analysis is optimal up to constants.
- Abstract(参考訳): 決定論的力学と確率的報酬と割引リターンの環境におけるプランニングの問題に対処する。
最適値関数は未知であり、報酬も有界ではない。
報奨関数の未知のスケールと滑らかさに適応する単純なスケールフリー計画アルゴリズムであるPlatypoosを提案する。
本研究では,Platypoosのサンプル複雑性解析を行い,事前の作業を改善するとともに,アルゴリズムを知らずに,幅広い割引係数と報酬尺度を同時に保持する。
また、解析が定数まで最適であることを示す、一致した下界を確立する。
関連論文リスト
- Explore-then-Commit for Nonstationary Linear Bandits with Latent Dynamics [21.224078346005655]
報酬が行動と潜伏状態の両方に依存する非定常バンドイット問題について検討する。
有限地平線$T$に対する探索列コミットアルゴリズムを提案する。
提案アルゴリズムは, $tildemathcalO(T2/3)$ regret を実現する。
論文 参考訳(メタデータ) (2025-10-17T20:41:14Z) - DreamSmooth: Improving Model-based Reinforcement Learning via Reward
Smoothing [60.21269454707625]
DreamSmoothは、与えられたタイミングでの正確な報酬ではなく、時間的に滑らかな報酬を予測することを学ぶ。
本研究では,DreamSmoothが長時間のスパース・リワードタスクにおいて最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2023-11-02T17:57:38Z) - Optimal Horizon-Free Reward-Free Exploration for Linear Mixture MDPs [60.40452803295326]
線形マルコフ決定過程(MDP)を学習するための新たな報酬なしアルゴリズムを提案する。
我々のアルゴリズムの核心は、探索駆動の擬似回帰を用いた不確実性重み付き値目標回帰である。
我々のアルゴリズムは$tilde O(d2varepsilon-2)$ episodesを探索するだけで、$varepsilon$-optimal policyを見つけることができる。
論文 参考訳(メタデータ) (2023-03-17T17:53:28Z) - Maximum-Likelihood Inverse Reinforcement Learning with Finite-Time
Guarantees [56.848265937921354]
逆強化学習(IRL)は報酬関数と関連する最適ポリシーを回復することを目的としている。
IRLの多くのアルゴリズムは本質的にネスト構造を持つ。
我々は、報酬推定精度を損なわないIRLのための新しいシングルループアルゴリズムを開発した。
論文 参考訳(メタデータ) (2022-10-04T17:13:45Z) - Adaptive Information Belief Space Planning [9.365993173260316]
我々は、不確実性に明示的に対処する報酬関数を使用して、情報決定を効率的に行うことに重点を置いている。
期待される情報理論の報奨関数と結果の値関数のバウンダリを導出する。
そこで我々は,計算時間のごく一部で同一の動作選択を実現するために集約を洗練させる手法を提案する。
論文 参考訳(メタデータ) (2022-01-14T21:12:00Z) - Safe-Planner: A Single-Outcome Replanner for Computing Strong Cyclic
Policies in Fully Observable Non-Deterministic Domains [0.22940141855172028]
我々は、古典的ドメインの集合に非決定論的ドメインをコンパイルするために、単一出力決定に依存する、Safe-Plannerと呼ばれるオフラインのリプランナーを導入する。
実験により,この手法により,SPは誤った計画の生成を回避できるが,強い解に直結する弱い計画を生成することができることを示した。
論文 参考訳(メタデータ) (2021-09-23T16:20:35Z) - Adapting to Misspecification in Contextual Bandits [82.55565343668246]
我々は、$varepsilon$-misspecified contextual banditsに対して、新しいオラクル効率アルゴリズム群を導入する。
我々は、未知の不特定値に対して最適な$O(dsqrtT + varepsilonsqrtdT)$ regret boundを達成する最初のアルゴリズムを得る。
論文 参考訳(メタデータ) (2021-07-12T21:30:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。