論文の概要: Efficient Bayes-Adaptive Reinforcement Learning with Temporal Logic Specifications
- arxiv url: http://arxiv.org/abs/2609.20954v2
- Date: Mon, 21 Sep 2026 15:18:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 03:38:27.359545
- Title: Efficient Bayes-Adaptive Reinforcement Learning with Temporal Logic Specifications
- Title(参考訳): 時間論理仕様を用いた効率よいベイズ適応強化学習
- Abstract要約: 本稿では,線形時間論理(LTL)仕様の下での効率的なポリシー合成のための,エンドツーエンドのモデルベース強化学習(RL)アルゴリズムを提案する。
- 参考スコア(独自算出の注目度): 57.81129114459065
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present a novel end-to-end model-based Reinforcement Learning (RL) algorithm for efficient policy synthesis under given Linear Temporal Logic (LTL) specifications (e.g., safety or reachability) in unknown environments. To do so, a Limit-Deterministic B{ü}chi Automaton (LDBA) representation of the LTL task is synchronised with a Bayes-Adaptive Markov Decision Process (BAMDP) representation of the environment, which allows us to leverage an enhanced exploration-exploitation trade-off that is achieved via Bayesian RL, as opposed to traditional non-Bayesian approaches. We further propose a novel Bayes-Adaptive Monte-Carlo Planning (BAMCP) algorithm to allow for approximate Bayes-optimal strategy synthesis in the synchronised BAMDP construct. A range of finite- and infinite-horizon task experiments demonstrate the effectiveness of our approach in terms of both property satisfaction and sample efficiency, when compared to traditional model-free approaches. Additional ablation studies also successfully highlight the value of the novel BAMCP algorithm in comparison to classical BAMCP for LTL task satisfaction. Finally, we also showcase a successful application of our approach for \textit{cautious} RL, namely to reduce the number of task violations incurred during policy training.
- Abstract(参考訳): 本稿では,LTL(Linear Temporal Logic)仕様(例えば,安全性や到達可能性)を未知の環境下で,効率的なポリシー合成を行うための,新しいエンドツーエンドモデルベース強化学習(RL)アルゴリズムを提案する。
そのため, LTLタスクの極限決定論的B{ü}chi Automaton (LDBA) 表現は, ベイズ適応マルコフ決定過程 (BAMDP) の環境表現と同期し, 従来の非ベイズ的アプローチとは対照的に, ベイズ的RLによる探索・探索トレードオフの強化を活用することができる。
さらに,BAMDP 構造におけるベイズ最適戦略合成を近似するための,新しいベイズ適応モンテカルロ計画法を提案する。
有限および無限水平タスク実験の範囲は、従来のモデルフリー手法と比較して、特性満足度とサンプル効率の両方の観点から、我々のアプローチの有効性を実証する。
追加のアブレーション研究は、LTLタスク満足度のための古典的BAMCPと比較して、新しいBAMCPアルゴリズムの価値を強調した。
最後に、ポリシトレーニング中に発生するタスク違反の数を減らすために、アプローチをtextit{cautious} RLにうまく適用することについても紹介する。
関連論文リスト
- Continuous-Time Reinforcement Learning for Asset-Liability Management [0.0]
本稿では,連続時間強化学習(RL)を用いたアセット・リバビリティ・マネジメント(ALM)の新しいアプローチを提案する。
本研究では,アセットと負債を動的に同期する ALM に適した,モデルフリーでポリシー勾配に基づくソフトアクター批判アルゴリズムを開発した。
本研究は,従来の2つの金融戦略,モデルベース連続時間RL法,最先端RLアルゴリズムに対するアプローチを実証的に評価する。
論文 参考訳(メタデータ) (2025-09-27T12:36:51Z) - Attribute Controlled Fine-tuning for Large Language Models: A Case Study on Detoxification [76.14641982122696]
本稿では,属性制御付き大規模言語モデル(LLM)の制約学習スキーマを提案する。
提案手法は, ベンチマーク上での競合性能と毒性検出タスクを達成しながら, 不適切な応答を少ないLCMに導出することを示す。
論文 参考訳(メタデータ) (2024-10-07T23:38:58Z) - Directed Exploration in Reinforcement Learning from Linear Temporal Logic [59.707408697394534]
リニア時間論理(LTL)は強化学習におけるタスク仕様のための強力な言語である。
合成された報酬信号は基本的に疎結合であり,探索が困難であることを示す。
我々は、仕様をさらに活用し、それに対応するリミット決定性B"uchi Automaton(LDBA)をマルコフ報酬プロセスとしてキャストすることで、よりよい探索を実現することができることを示す。
論文 参考訳(メタデータ) (2024-08-18T14:25:44Z) - TS-RSR: A provably efficient approach for batch Bayesian Optimization [4.622871908358325]
本稿では,Phompson Smpling-Regret to Sigma Ratio Direct sampleという,バッチベイズ最適化(BO)の新しい手法を提案する。
我々のサンプリング目的は、各バッチで選択されたアクションを、ポイント間の冗長性を最小化する方法で調整することができる。
提案手法は, 難解な合成および現実的なテスト機能において, 最先端の性能を達成できることを実証する。
論文 参考訳(メタデータ) (2024-03-07T18:58:26Z) - Maximize to Explore: One Objective Function Fusing Estimation, Planning,
and Exploration [87.53543137162488]
我々はtextttMEX というオンライン強化学習(オンラインRL)フレームワークを提案する。
textttMEXは、自動的に探索エクスプロイトのバランスをとりながら、見積もりと計画コンポーネントを統合する。
様々な MuJoCo 環境では,ベースラインを安定的なマージンで上回り,十分な報酬を得られる。
論文 参考訳(メタデータ) (2023-05-29T17:25:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。