論文の概要: Explaining Reinforcement Learning Agents via Inductive Logic Programming
- arxiv url: http://arxiv.org/abs/2607.13655v1
- Date: Wed, 15 Jul 2026 10:02:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.738798
- Title: Explaining Reinforcement Learning Agents via Inductive Logic Programming
- Title(参考訳): 帰納論理プログラミングによる強化学習エージェントの解説
- Abstract要約: 本研究の目的は、RL設定における政策説明可能性のための客観的かつ計画指向の指標を導入することにより、説明可能な強化学習(XRL)の最先端化である。
我々は、帰納的論理プログラミング(ILP)を用いて、RLポリシーのシンボル表現を抽出し、新しい説明可能性メトリクスセットを定義する。
これらのメトリクスは、シンボリックルールとエージェントの振る舞い、意思決定における特徴の役割、トレーニング中のポリシーの進化、およびシングルエージェントとマルチエージェントのRLにおけるエージェント間のアライメントを定量化する。
- 参考スコア(独自算出の注目度): 47.152170696893826
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Explainable Reinforcement Learning (XRL) seeks to make Reinforcement Learning (RL) policies more transparent and interpretable, a key requirement in safety-critical and human-centric scenarios. However, it is mostly based on user studies, thus targeting the needs of a specific audience and lacking shared evaluation metrics. On the other hand, logic-based approaches within eXplainable Artificial Intelligence (XAI) provide compact, human-readable abstractions of decision-making. However, the systematic quantification of the explainability degree of logical representations remains an open problem. This work aims to advance the state of the art in XRL by introducing objective and planning-oriented metrics for policy explainability in RL settings. At the same time, it contributes to the field of logic for XAI by providing a principled way to quantify the explainability of logical rules, moving beyond common-sense assessments and simple propositional fragments. We employ Inductive Logic Programming (ILP) to extract symbolic representations of RL policies and define a novel set of explainability metrics, including activation rate, feature coverage, syntactic distance and semantic distance. These metrics quantify alignment between symbolic rules and agent behavior, the role of features in decision-making, and the evolution of policies during training and across agents in single and multi-agent RL. Experiments across different RL domains show that the proposed metrics highlight action-specific learning dynamics beyond global return, provide fine-grained insights into domain features beyond classical approaches for global feature importance estimation, and uncover coordination, specialization, and adaptation patterns in MARL. Moreover, they provide crucial insights for the transfer and generalization of action-specific policies.
- Abstract(参考訳): 説明可能な強化学習(XRL)は、安全クリティカルで人間中心のシナリオにおいて重要な要件である強化学習(RL)ポリシーをより透明で解釈可能なものにすることを目指している。
しかし、主にユーザスタディに基づいており、特定のオーディエンスのニーズをターゲットとしており、評価基準の共有が欠如している。
一方、eXplainable Artificial Intelligence (XAI) における論理ベースのアプローチは、意思決定のコンパクトで人間可読な抽象化を提供する。
しかし、論理表現の説明可能性次数の体系的な定量化は、依然として未解決の問題である。
本研究は、RL設定における政策説明可能性のための客観的かつ計画指向の指標を導入することにより、XRLの最先端化を図ることを目的としている。
同時に、XAIの論理学の分野にも貢献し、論理規則の説明可能性の定量化を原則とした方法を提供し、常識的評価や単純な命題的断片を超えていく。
Inductive Logic Programming (ILP) を用いて、RLポリシーのシンボル表現を抽出し、アクティベーション率、特徴カバレッジ、構文距離、意味距離などの新しい説明可能性指標を定義する。
これらのメトリクスは、シンボリックルールとエージェントの振る舞い、意思決定における特徴の役割、トレーニング中のポリシーの進化、およびシングルエージェントとマルチエージェントのRLにおけるエージェント間のアライメントを定量化する。
異なるRL領域にわたる実験により、提案された指標は、グローバルリターンを超えるアクション固有の学習ダイナミクスを強調し、グローバルな特徴重要度推定のための古典的なアプローチを超えて、ドメインの特徴を詳細に把握し、MARLにおけるコーディネーション、特殊化、適応パターンを明らかにする。
さらに、アクション固有のポリシーの転送と一般化に関する重要な洞察を提供する。
関連論文リスト
- The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning [65.67266333751569]
現在のLRM(Large Reasoning Models)は、空間推論タスクにおいて顕著な汎用性を示すが、性能は著しく劣る。
本研究では,内的推論プロセスを対象とした自己指導型強化学習フレームワークを提案する。
このラベルのない整合性トレーニングは,地道的な監督によって訓練されたモデルの精度にアプローチし,多様なタスクやデータ領域にまたがる同様の一般化を実現することを示す。
論文 参考訳(メタデータ) (2026-06-10T10:50:06Z) - AIPO: Learning to Reason from Active Interaction [54.10819421625103]
AIPOは、ポリシーモデルが、推論ボトルネックに遭遇するときに、3つの機能的協調エージェントを積極的に相談することを可能にする。
AIPOは推論性能を継続的に改善し、異なるポリシーモデルとRLVRアルゴリズムをまたいで堅牢に一般化し、ポリシーモデルの推論能力境界を効果的に拡張する。
論文 参考訳(メタデータ) (2026-05-08T19:06:55Z) - A Brief Overview: Agentic Reinforcement Learning In Large Language Models [8.378143675399143]
大規模言語モデル(LLM)と、ますます複雑でオープンなタスクは、強化学習(RL)内のエージェントパラダイムへのパラダイムシフトを引き起こした。
この新たなフレームワークは、ゴール設定、長期計画、動的戦略適応、そして不確実な現実世界環境における対話的推論が可能な自律エージェントの開発を強調することで、従来のRLを超えて拡張される。
静的な目的やエピソード的相互作用に大きく依存する従来のアプローチとは異なり、LLMベースのAgentic RLはメタ推論、自己回帰、多段階決定といった認知的な機能を学習ループに直接組み込む。
論文 参考訳(メタデータ) (2026-04-30T13:43:25Z) - Sample-Efficient Neurosymbolic Deep Reinforcement Learning [49.60927398960061]
本稿では,背景記号知識を統合し,サンプル効率を向上させるニューロシンボリックディープRL手法を提案する。
オンライン推論は2つのメカニズムを通じてトレーニングプロセスのガイドを行う。
我々は、最先端の報奨機ベースラインよりも優れた性能を示す。
論文 参考訳(メタデータ) (2026-01-06T09:28:53Z) - Balancing Interpretability and Performance in Reinforcement Learning: An Adaptive Spectral Based Linear Approach [15.065437093352054]
強化学習(RL)はシーケンシャルな意思決定に広く応用されている。
現在のアプローチは一般的にパフォーマンスに重点を置いており、解釈可能性を考慮したポストホックな説明に依存している。
スペクトルフィルタ関数を用いてリッジ回帰に基づくアプローチを拡張するスペクトルベース線形RL法を提案する。
論文 参考訳(メタデータ) (2025-10-04T07:53:43Z) - Revisiting LLM Reasoning via Information Bottleneck [57.519119962528166]
大規模言語モデル(LLM)は、最近、検証可能な報酬付き強化学習(RLVR)を通じて推論能力の顕著な進歩を示した。
本稿では,情報ボトルネック(IB)の原理に基づくLLM推論の理論的特徴について述べる。
IB対応推論最適化(IBRO)を提案する。
論文 参考訳(メタデータ) (2025-07-24T13:14:25Z) - Deep Inductive Logic Programming meets Reinforcement Learning [0.0]
微分可能なニューラルロジック(dNL)ネットワークは、そのニューラルアーキテクチャがシンボリック推論を含むため、関数を学習することができる。
動的連続環境に対処するための強化学習(RRL)分野におけるdNLの適用を提案する。
論文 参考訳(メタデータ) (2023-08-30T09:08:46Z) - Explaining RL Decisions with Trajectories [28.261758841898697]
説明は、実世界の意思決定問題における強化学習(RL)導入の鍵となる要素である。
本稿では、これらの説明に対する補完的アプローチ、特にオフラインRLについて、トレーニング中に遭遇した軌跡に、訓練されたRLエージェントの政策決定を関連付けることを提案する。
論文 参考訳(メタデータ) (2023-05-06T15:26:22Z) - Explainable Reinforcement Learning for Broad-XAI: A Conceptual Framework
and Survey [0.7366405857677226]
強化学習(Reinforcement Learning, RL)法は、ブロードXAIの開発に必要な認知モデルのための潜在的なバックボーンを提供する。
RLは、さまざまなシーケンシャルな意思決定問題の解決に成功している一連のアプローチである。
本稿では,現在のXRL研究を統一し,Broad-XAI開発のバックボーンとしてRLを用いるCausal XRL Framework (CXF) という概念的フレームワークを導入することを目的とする。
論文 参考訳(メタデータ) (2021-08-20T05:18:50Z) - Variational Empowerment as Representation Learning for Goal-Based
Reinforcement Learning [114.07623388322048]
本稿では,標準目標条件付きRL (GCRL) を目的変動エンパワーメントによってカプセル化する方法について論じる。
我々の研究は、ゴールベースRLで表現学習技術を評価し、分析し、開発する新しい基礎を築いた。
論文 参考訳(メタデータ) (2021-06-02T18:12:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。