論文の概要: Reward Machines for Signal Temporal Logic
- arxiv url: http://arxiv.org/abs/2608.13625v1
- Date: Thu, 13 Aug 2026 04:25:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.17026
- Title: Reward Machines for Signal Temporal Logic
- Title(参考訳): 信号時間論理用リワード機械
- Abstract要約: 信号時相論理(STL)は、実数値観測のリアルタイム特性を特定するための形式言語を提供する。
事前の作業では、強化学習(RL)の報酬としてSTLロバストネススコアを使用して、与えられた仕様を満たす制御ポリシーを取得する。
この研究は、RLフレームワークに適した効率的なメモリ機構と関連するマルコフ報酬を提供する、新しいオートマタベースのアプローチを導入している。
- 参考スコア(独自算出の注目度): 17.49671322104596
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Signal temporal logic (STL) provides a formal language for specifying real-time properties of real-valued observations, along with a quantitative robustness score for monitoring satisfaction. Control synthesis from STL specifications is of interest since manual controller design becomes infeasible as real-world systems grow in complexity. Moreover, many modern autonomous and AI-enabled systems lack accurate and complete system models, which makes optimization-based synthesis approaches unsuitable and motivates learning-based control. Prior work uses STL robustness scores as rewards in reinforcement learning (RL) to obtain control policies satisfying given specifications; however, robustness depends on execution history, leading to intractable state space expansion for general long-horizon specifications with arbitrarily nested temporal operators. This work introduces a novel automata-based approach that provides an efficient memory mechanism and associated Markovian rewards suitable for RL frameworks. Our approach constructs a timed alternating automaton from the given STL specifications, augments the state space with automaton locations and clock valuations, and derives rewards from the automaton acceptance condition. We empirically demonstrate that our approach learns policies that achieve higher robustness scores and satisfaction rates than those learned by existing approaches using robustness-based rewards.
- Abstract(参考訳): 信号時相論理(STL)は、実測値のリアルタイム特性を特定するための形式言語と、満足度を監視するための定量的ロバスト性スコアを提供する。
STL仕様からの制御合成は、現実のシステムが複雑化するにつれて手動の制御設計が不可能になるため、興味深い。
さらに、現代の自律型およびAI対応システムでは、正確で完全なシステムモデルが欠如しており、最適化ベースの合成アプローチは不適切であり、学習ベースの制御を動機付けている。
従来の作業では、強化学習(RL)の報酬としてSTLロバストネススコアを使用して、与えられた仕様を満たす制御ポリシーを得るが、ロバストネスは実行履歴に依存するため、任意にネストされたテンポラル演算子を持つ一般的なロングホライゾン仕様に対する引き込み可能な状態空間拡張をもたらす。
この研究は、RLフレームワークに適した効率的なメモリ機構と関連するマルコフ報酬を提供する、新しいオートマタベースのアプローチを導入している。
提案手法は,与えられたSTL仕様から時刻交替オートマトンを構築し,オートマトン位置とクロック評価で状態空間を拡張し,オートマトン受け入れ条件から報酬を導出する。
我々は、ロバストネスに基づく報酬を用いて既存のアプローチで学んだものよりも高いロバストネススコアと満足度を達成するポリシーを経験的に学習していることを実証した。
関連論文リスト
- Specification-Aware Distribution Shaping for Robotics Foundation Models [0.0]
本稿では,事前訓練されたロボット基盤モデルの実行において,パラメータを変更することなく,信号時間論理(STL)の幅広い制約を適用可能な,仕様対応の行動分布最適化フレームワークを提案する。
複数の環境と複雑な仕様をまたいだ最先端のロボティクス基盤モデルを用いてシミュレーションの枠組みを検証した。
論文 参考訳(メタデータ) (2026-03-18T17:36:46Z) - HIPO: Instruction Hierarchy via Constrained Reinforcement Learning [57.40686733111483]
textscHIPOは、制約付きマルコフ決定プロセスとしてHIFを定式化する新しいアライメントフレームワークである。
textscHIPOはシステムプロンプトを単に入力コンテキストから厳密なアルゴリズム境界まで高める。
論文 参考訳(メタデータ) (2026-03-17T06:12:41Z) - Beyond Short-Horizon: VQ-Memory for Robust Long-Horizon Manipulation in Non-Markovian Simulation Benchmarks [96.60530830276281]
RuleSafeは、スケーラブルなLLM支援シミュレーションフレームワーク上に構築された、新しいオペレーティングベンチマークである。
VQ-Memoryはベクトル量子化変分オートエンコーダを用いたコンパクトで構造化された時間表現である。
論文 参考訳(メタデータ) (2026-03-10T11:13:54Z) - Semantically Labelled Automata for Multi-Task Reinforcement Learning with LTL Instructions [61.479946958462754]
エージェントが単一のユニバーサルポリシーを学習する環境であるマルチタスク強化学習(RL)について検討する。
本稿では,新世代の意味翻訳を利用したタスク埋め込み手法を提案する。
論文 参考訳(メタデータ) (2026-02-06T14:46:27Z) - Reinforcement learning with timed constraints for robotics motion planning [0.5436465344481877]
本稿では,マルコフ決定プロセス (MDP) と部分観測可能なマルコフ決定プロセス (POMDP) の両方でポリシーを合成するための統一されたオートマトンベースのフレームワークを提案する。
単純だが表現力のある報酬構造は、時間的正しさを強制し、さらなるパフォーマンス目標を許容する。
その結果、提案フレームワークは、遷移条件下で厳密な時間制約を満たすポリシーを一貫して学習し、より大きな状態空間にスケールし、部分的に観測可能な環境において有効であることを実証した。
論文 参考訳(メタデータ) (2025-12-31T19:43:44Z) - Directed Exploration in Reinforcement Learning from Linear Temporal Logic [59.707408697394534]
リニア時間論理(LTL)は強化学習におけるタスク仕様のための強力な言語である。
合成された報酬信号は基本的に疎結合であり,探索が困難であることを示す。
我々は、仕様をさらに活用し、それに対応するリミット決定性B"uchi Automaton(LDBA)をマルコフ報酬プロセスとしてキャストすることで、よりよい探索を実現することができることを示す。
論文 参考訳(メタデータ) (2024-08-18T14:25:44Z) - Large Language Models as General Pattern Machines [64.75501424160748]
我々は,事前訓練された大規模言語モデル (LLM) が,複雑なトークンシーケンスを自動回帰的に完了することを示す。
驚いたことに、語彙からランダムにサンプリングされたトークンを用いてシーケンスが表現された場合でも、パターン完了の習熟度を部分的に保持することができる。
本研究では,ロボット工学における問題に対して,これらのゼロショット機能がどのように適用されるかを検討する。
論文 参考訳(メタデータ) (2023-07-10T17:32:13Z) - STL-Based Synthesis of Feedback Controllers Using Reinforcement Learning [8.680676599607125]
深層強化学習(DRL)は、未知の力学を持つ様々な複雑なシステムに対するフィードバックコントローラ(エージェント)の合成に使用される可能性がある。
RLでは、報酬関数はこれらのエージェントの望ましい振る舞いを特定する上で重要な役割を果たす。
信号時間論理(STL)の量的意味論を用いて,リアルタイムに報酬を生成する体系的な方法を提案する。
我々は,STLに基づく強化学習機構をいくつかの複雑な連続制御ベンチマーク上で評価し,STLのセマンティクスと文献で利用可能なセマンティクスを,制御エージェントの合成における有効性の観点から比較した。
論文 参考訳(メタデータ) (2022-12-02T08:31:46Z) - Funnel-based Reward Shaping for Signal Temporal Logic Tasks in
Reinforcement Learning [0.0]
本稿では,STL(Signal Temporal Logic)仕様を適用した制御器を学習するために,抽出可能な強化学習アルゴリズムを提案する。
異なる環境を用いた複数のSTLタスクに対して,本手法の有効性を実証する。
論文 参考訳(メタデータ) (2022-11-30T19:38:21Z) - Modular Deep Reinforcement Learning for Continuous Motion Planning with
Temporal Logic [59.94347858883343]
本稿では,マルコフ決定過程(MDP)をモデルとした自律動的システムの運動計画について検討する。
LDGBA と MDP の間に組込み製品 MDP (EP-MDP) を設計することである。
モデルフリー強化学習(RL)のためのLDGBAベースの報酬形成と割引スキームは、EP-MDP状態にのみ依存する。
論文 参考訳(メタデータ) (2021-02-24T01:11:25Z) - Model-based Reinforcement Learning from Signal Temporal Logic
Specifications [0.17205106391379021]
本稿では,報酬/コスト関数の代替として,STL(Signal Temporal Logic)と呼ばれる形式仕様言語を用いて,望まれるハイレベルロボット動作を表現することを提案する。
提案アルゴリズムは、ピック・アンド・プレース・ロボットアームなどのロボットシステムのシミュレーションと、自律走行車に対する適応的なクルーズ制御を実証的に評価する。
論文 参考訳(メタデータ) (2020-11-10T07:31:47Z) - Certified Reinforcement Learning with Logic Guidance [78.2286146954051]
線形時間論理(LTL)を用いて未知の連続状態/動作マルコフ決定過程(MDP)のゴールを定式化できるモデルフリーなRLアルゴリズムを提案する。
このアルゴリズムは、トレースが仕様を最大確率で満たす制御ポリシーを合成することが保証される。
論文 参考訳(メタデータ) (2019-02-02T20:09:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。