論文の概要: From Black Box to Executable Logic: Explainable Reinforcement Learning through Prolog Expert Systems
- arxiv url: http://arxiv.org/abs/2607.15459v1
- Date: Thu, 16 Jul 2026 21:10:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.707244
- Title: From Black Box to Executable Logic: Explainable Reinforcement Learning through Prolog Expert Systems
- Title(参考訳): ブラックボックスから実行可能論理へ:プロログエキスパートシステムによる説明可能な強化学習
- Authors: Eduardo C. Garrido-Merchán,
- Abstract要約: 訓練された深層強化学習ポリシーはブラックボックスであり、実行可能な論理プログラムとして書き換えることで説明できるかどうかを問う。
本稿では、凍結政策最適化教師を抽出し、その決定から規則リストを誘導し、Prologプログラムとして結果を出力する3段階のポストホック変換を提案する。
リターンロスバウンダリは、蒸留プログラムを有限決定過程において機械チェック可能な証明書とし、膨張ループは単調に改善して終了する。
- 参考スコア(独自算出の注目度): 1.5736899098702974
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A trained deep reinforcement learning policy is a black box, and we ask whether it can be made explainable by rewriting it as an executable logic program that reproduces its behaviour and that a person can read, a logic engine can run, and an optimizer can edit. We present a three-stage post-hoc transformation that extracts a frozen proximal policy optimization teacher, induces an ordered rule list from its decisions in the manner of classical relational learning, and emits the result as a Prolog program whose every decision is executed by an off-the-shelf logic engine; a subsequent expansion stage edits the rule base and accepts an edit only when policy evaluation certifies a return increase. We prove four guarantees. A return-loss bound makes the distilled program a machine-checkable certificate in a finite Markov decision process, and the expansion loop improves monotonically and terminates. For the continuous-observation setting we answer whether the conversion is possible at all: the propositional threshold instantiation converts the network to arbitrary fidelity as the resolution B grows, with disagreement O(1/B) and a return gap that closes at the same rate, and a matching lower bound shows the cost is exponential in the observation dimension for an oblique decision boundary. Empirically, on a two-room key-and-door task with 16,944 reachable states the expanded Prolog program attains exact optimal return in every seed and, in a budget-capped regime, exceeds the stochastic teacher on exact return in ten of ten seeds. On three continuous-control tasks the emitted program substitutes the network, matching the neural teacher within noise on Acrobot with eleven clauses and recovering about 97% of its return on CartPole, while on the finer-control LunarLander it recovers only partially, exactly the ceiling the exponential lower bound predicts.
- Abstract(参考訳): 訓練された深層強化学習ポリシーはブラックボックスであり、動作を再現する実行可能な論理プログラムとして書き直すことで説明できるかどうかを問うとともに、その動作を再現し、読み取ることができ、論理エンジンが実行でき、オプティマイザが編集できるかどうかを問う。
本稿では、凍結した近位政策最適化教師を抽出し、古典的なリレーショナルラーニングの方法で決定から順序付きルールリストを誘導し、すべての決定がオフザシェルフ論理エンジンによって実行されるPrologプログラムとして結果を出力する3段階のポストホック変換について述べる。
保証は4つある。
還元損失境界により、蒸留プログラムは有限マルコフ決定過程において機械チェック可能な証明となり、膨張ループは単調に改善され終了する。
提案しきい値インスタンス化は、解像度Bが大きくなるにつれてネットワークを任意の忠実度に変換し、O(1/B)と同じ速度で閉じるリターンギャップとを一致させ、一致する下限は、斜め決定境界の観測次元においてコストが指数関数的であることを示す。
実証的には、16,944個の到達可能な状態の2部屋のキー・アンド・ドアタスクにおいて、拡張されたPrologプログラムは、各シードにおいて正確な最適リターンを達成し、予算が制限された状態では、10のシードのうち10の正確なリターンで確率的な教師を上回る。
3つの連続制御タスクでは、出力されたプログラムがネットワークを代用し、Acrobotのノイズ内のニューラルネットワーク教師を11の節でマッチングし、CartPoleでのリターンの約97%を回復する。
関連論文リスト
- RecRec: Latent Interests Recursive Reasoning for Sequential Recommendation [52.23179023639867]
逐次リコメンデータシステムは、ユーザインタラクションをエンコードし、次の項目を予測するために、1つのフォワードパスに依存している。
シーケンシャルなレコメンデーションのための推論プロセスをどのように構成するかは、未解決の問題である。
既存のアプローチでは、推論と予測を単一の$d$次元の状態に分割し、推論の深さを制限する。
本稿ではRLフリーフレームワークRecRec(Recursive Reasoning for Recommendation)を提案する。
論文 参考訳(メタデータ) (2026-07-14T16:28:28Z) - Stabilizing Extrapolation in Looped Transformers via Learned Stochastic Stopping [56.14767235650558]
共有トランスブロックを繰り返し適用するLooped Transformerは、可変長の計算タスクに自然に適合するアーキテクチャである。
この差分を、列長とループ数の間の単純なアルゴリズムタスクにおける突発的相関に追従する。
私たちの研究は、"停止する時"は単なる推論時間割当ルールではなく、トレーニング設計の選択として扱われるべきであることを示唆しています。
論文 参考訳(メタデータ) (2026-06-29T08:58:09Z) - Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation [60.55792673956761]
我々は, ルブリックを構造化, きめ細かいフィードバックとして組み込んだフレームワークであるtextbfRubric-Conditioned Self-Distillationを提案する。
その結果, ルーリック条件の自己蒸留は, ルーリックレベルの基準をトークンレベルのガイダンスに効果的に変換することを示した。
論文 参考訳(メタデータ) (2026-06-17T17:54:04Z) - Repair Before Veto, When Repair Is Hidden: Quantum-Accessible Features for Repair-Augmented Constraint Learning [6.016090674751934]
本稿ではQ-RACL(Quantum repair-Augmented Constraint Learning)について紹介する。
シーケンシャルな修復計画が実現可能性と嗜好を回復した時に候補を受け入れ、そうでなければ構造化された拒絶債権を返す。
6つの素数と10の種、有界な原文の古典的ポリシー、間違った原文のエンコーディングは、近い将来に残る。
Q-DLPポリシーは偽拒否率を1.1%以下に抑え、すべてのペアの種を勝ち取り、QNI_cond = 0.9777 から 0.9972 となる。
論文 参考訳(メタデータ) (2026-06-06T07:17:38Z) - The Deterministic Horizon: Impossibility Results as Design Specifications for Trustworthy AI Systems [0.0]
この論文は、好奇心から不合理性の結果を設計規則に変える。
そのフラッグシップとなる結果は、アーキテクチャだけで設定された精度の高い天井を証明している。
同じ引数がサブフィールドにまたがって再キャストされる。
論文 参考訳(メタデータ) (2026-05-21T20:48:35Z) - Restarted contractive operators to learn at equilibrium [0.0]
我々は、再起動戦略とADによって計算されたJFBを組み合わせるアルゴリズムを導入し、学習手順を最適なDECフレームワークに任意に近づけることができることを示す。
本稿では,重み付きノルムの重み付け,プラグイン・アンド・プレイスキームの段階化と正規化レベル,フォワード・バックワード・イテレートに埋め込まれたDRUNetデノイザの訓練に有効であることを示す。
論文 参考訳(メタデータ) (2025-06-16T08:38:56Z) - Maximum-Likelihood Inverse Reinforcement Learning with Finite-Time
Guarantees [56.848265937921354]
逆強化学習(IRL)は報酬関数と関連する最適ポリシーを回復することを目的としている。
IRLの多くのアルゴリズムは本質的にネスト構造を持つ。
我々は、報酬推定精度を損なわないIRLのための新しいシングルループアルゴリズムを開発した。
論文 参考訳(メタデータ) (2022-10-04T17:13:45Z) - Improving the Efficiency of Off-Policy Reinforcement Learning by
Accounting for Past Decisions [20.531576904743282]
オフ政治推定バイアスは、決定ごとに補正される。
Tree BackupやRetraceといったオフポリティクスアルゴリズムはこのメカニズムに依存している。
任意の過去のトレースを許可するマルチステップ演算子を提案する。
論文 参考訳(メタデータ) (2021-12-23T00:07:28Z) - Improper Learning with Gradient-based Policy Optimization [62.50997487685586]
未知のマルコフ決定過程に対して学習者がmベースコントローラを与えられる不適切な強化学習設定を考える。
制御器の不適切な混合のクラス上で動作する勾配に基づくアプローチを提案する。
論文 参考訳(メタデータ) (2021-02-16T14:53:55Z) - Upper Confidence Primal-Dual Reinforcement Learning for CMDP with
Adversarial Loss [145.54544979467872]
マルコフ決定過程(CMDP)に対するオンライン学習の検討
本稿では,遷移モデルから標本化した軌跡のみを必要とする,新しいEmphupper confidence primal-dualアルゴリズムを提案する。
我々の分析では、ラグランジュ乗算過程の新たな高確率ドリフト解析を、高信頼強化学習の記念後悔解析に組み入れている。
論文 参考訳(メタデータ) (2020-03-02T05:02:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。