論文の概要: Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes
- arxiv url: http://arxiv.org/abs/2607.12924v2
- Date: Wed, 15 Jul 2026 08:26:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 12:21:59.650753
- Title: Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes
- Title(参考訳): パラメタライズされた行動マルコフ決定プロセスのための知識と勾配誘導強化学習
- Abstract要約: パラメタライズドアクションマルコフ決定過程(PAMDP)における強化学習について検討した。
このような設定では、強化学習アルゴリズムは典型的に一発推定器でパラメータを決定するため、トレーニングサンプルは非効率である。
我々はこのギャップに踏み込み、新しいニューロシンボリック知識とグラディエントガイド強化学習(KGRL)アルゴリズムを提案する。
- 参考スコア(独自算出の注目度): 0.6308539010172308
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: In this paper, we study Reinforcement Learning in Parametrized Action Markov Decision Processes (PAMDP), where each decision consists of a symbolic action and numerical parameters. In such settings Reinforcement Learning algorithms typically determine parameters with one-shot estimators, which makes their training sample inefficient. Though in most PAMDP environments explicit but incomplete knowledge (e.g., rules, safety constraints, or expert heuristics) is available, it is rarely directly used to increase the sample-efficiency of training Reinforcement Learning agents. We step into this gap and propose our novel Neuro-Symbolic Knowledge- and Gradient-Guided Reinforcement Learning (KGRL) algorithm. KGRL uses domain knowledge in a Datalog knowledge base to derive the set of applicable actions and feasible parameters for a given state. This allows it to prune non-applicable actions from the decision-space and constrain the parameter spaces of the remaining actions. We then use a gradient-based parameter refinement loop to estimate the optimal parameters during training and deployment of the agent. By recording activated rules along the trajectory, KGRL additionally provides local procedural explanations on the pruning of actions and constraining of parameters. Overall, KGRL guides the agent's exploration and deployment toward feasible and constraint-aware decisions, while increasing sample efficiency during training. KGRL outperforms state-of-the-art RL baselines for PAMDPs in both, sample efficiency and episodic return.
- Abstract(参考訳): 本稿では,パラメタライズドアクションマルコフ決定過程(PAMDP)における強化学習について検討する。
このような設定では、強化学習アルゴリズムは典型的に一発推定器でパラメータを決定するため、トレーニングサンプルは非効率である。
ほとんどのPAMDP環境では、明示的だが不完全な知識(例えば、規則、安全制約、専門家のヒューリスティックス)が利用可能であるが、強化学習エージェントの訓練のサンプル効率を高めるために直接使用されることは稀である。
我々はこのギャップに踏み込み、新しいニューロシンボリック知識とグラディエントガイド強化学習(KGRL)アルゴリズムを提案する。
KGRLは、データログの知識ベースにおけるドメイン知識を使用して、ある状態に対して適用可能なアクションと実行可能なパラメータのセットを導出する。
これにより、決定空間から適用不可能なアクションを抽出し、残りのアクションのパラメータ空間を制約することができる。
次に、勾配に基づくパラメータリファインメントループを用いて、エージェントのトレーニングおよびデプロイ中に最適なパラメータを推定する。
軌道に沿って活性化された規則を記録することで、KGRLはアクションのプルーニングとパラメータの制約に関する局所的な手続き的な説明を提供する。
全体として、KGRLはエージェントの探索と展開を、トレーニング中のサンプル効率を高めながら、実行可能で制約対応の意思決定に向けてガイドする。
KGRLは、サンプル効率とエピソードリターンの両方において、PAMDPの最先端のRLベースラインを上回っている。
関連論文リスト
- Local Reinforcement Learning with Action-Conditioned Root Mean Squared Q-Functions [10.407094497818436]
フォワードフォワード(フォワードフォワード、英: Forward-Forward、FF)は、従来のフォワードパスとバックプロパゲーションで使用されるバックパスの代わりに、2つのフォワードパスを使用するニューラルネットワークの学習手順である。
本稿では,局所的なRLに良さ関数と動作条件を適用した新しい値推定法である,アクション条件付きルート平均2乗Q-Functions (ARQ)を提案する。
提案手法は,MinAtar および DeepMind Control Suite ベンチマークにおける最先端のローカルバックプロップフリー RL 手法と比較して,優れた性能を実現する。
論文 参考訳(メタデータ) (2025-10-08T05:06:09Z) - A Sensitivity-Driven Expert Allocation Method in LoRA-MoE for Efficient Fine-Tuning [0.6906005491572401]
パラメータ感度のLoRA-SMoEに基づいて専門家数を割当てる手法を提案する。
実験の結果,LoRA-SMoE手法はトレーニング可能なパラメータの数を減らしながらモデル性能を向上させることができることがわかった。
論文 参考訳(メタデータ) (2025-05-06T13:22:46Z) - Learning Optimal Deterministic Policies with Stochastic Policy Gradients [62.81324245896716]
政策勾配法(PG法)は連続強化学習(RL法)問題に対処する手法として成功している。
一般的には、収束(ハイパー)政治は、決定論的バージョンをデプロイするためにのみ学習される。
本稿では,サンプルの複雑性とデプロイされた決定論的ポリシのパフォーマンスのトレードオフを最適化するために,学習に使用する探索レベルの調整方法を示す。
論文 参考訳(メタデータ) (2024-05-03T16:45:15Z) - Prompt-Tuning Decision Transformer with Preference Ranking [83.76329715043205]
本稿では,環境情報取得におけるRLエージェントの誘導手法としてトラジェクトリセグメントを用いたPrompt-Tuning DTアルゴリズムを提案する。
提案手法では,ガウス分布をランダムにサンプリングしてプロンプト軌道の要素を微調整し,選好ランク関数を用いて最適化方向を求める。
我々の研究は、RLにおける迅速な調整手法の進歩に寄与し、特定の選好タスクに対して大規模RLエージェントを最適化するための有望な方向性を提供する。
論文 参考訳(メタデータ) (2023-05-16T17:49:04Z) - Assessment of Reinforcement Learning Algorithms for Nuclear Power Plant
Fuel Optimization [0.0]
この研究は、深いRLを用いてロードパターンの問題を解決するための第一種アプローチを示し、任意のエンジニアリング設計最適化に利用することができる。
論文 参考訳(メタデータ) (2023-05-09T23:51:24Z) - Deep Black-Box Reinforcement Learning with Movement Primitives [15.184283143878488]
深部強化学習のための新しいアルゴリズムを提案する。
これは、政治的に成功したディープRLアルゴリズムである、微分可能な信頼領域層に基づいている。
複雑なロボット制御タスクにおいて,ERLアルゴリズムと最先端のステップベースアルゴリズムを比較した。
論文 参考訳(メタデータ) (2022-10-18T06:34:52Z) - A new soft computing method for integration of expert's knowledge in
reinforcement learn-ing problems [1.11412540857944]
提案したファジィ非線形写像は、次のステップで選択される確率に設定されたアクションの各メンバをアサインする。
エージェントの欲張り行動を決定するアクション選択ポリシーを制御するために、ユーザチューニング可能なパラメータを導入する。
シミュレーションの結果,提案手法による強化学習にファジィ論理を組み込むことで,学習アルゴリズムの収束率を向上させることが示唆された。
論文 参考訳(メタデータ) (2021-06-13T20:41:29Z) - A Kernel-Based Approach to Non-Stationary Reinforcement Learning in
Metric Spaces [53.47210316424326]
KeRNSは、非定常マルコフ決定過程におけるエピソード強化学習のためのアルゴリズムである。
我々は、状態-作用空間の被覆次元と時間とともにMDPの総変動にスケールする後悔境界を証明した。
論文 参考訳(メタデータ) (2020-07-09T21:37:13Z) - AdaS: Adaptive Scheduling of Stochastic Gradients [50.80697760166045]
我々は、textit "knowledge gain" と textit "mapping condition" の概念を導入し、Adaptive Scheduling (AdaS) と呼ばれる新しいアルゴリズムを提案する。
実験によると、AdaSは派生した指標を用いて、既存の適応学習手法よりも高速な収束と優れた一般化、そして(b)いつトレーニングを中止するかを決定するための検証セットへの依存の欠如を示す。
論文 参考訳(メタデータ) (2020-06-11T16:36:31Z) - Kalman meets Bellman: Improving Policy Evaluation through Value Tracking [59.691919635037216]
政策評価は強化学習(RL)における重要なプロセスである
我々はKalman Optimization for Value Approximation (KOVA)と呼ばれる最適化手法を考案した。
KOVAはパラメータとノイズリターンの不確実性の両方に関する正規化対象関数を最小化する。
論文 参考訳(メタデータ) (2020-02-17T13:30:43Z) - Discrete Action On-Policy Learning with Action-Value Critic [72.20609919995086]
離散的な行動空間における強化学習(RL)は、実世界の応用では至るところで行われているが、その複雑さは行動空間次元とともに指数関数的に増大する。
我々は,行動値関数を推定し,相関行動に適用し,これらの評価値を組み合わせて勾配推定の分散を制御する。
これらの取り組みにより、分散制御技術に頼って、関連するRLアルゴリズムを実証的に上回る、新たな離散的なRLアルゴリズムが実現される。
論文 参考訳(メタデータ) (2020-02-10T04:23:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。