論文の概要: Interpretable reinforcement learning with decision-tree pruning
- arxiv url: http://arxiv.org/abs/2608.07151v1
- Date: Fri, 07 Aug 2026 12:14:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.492901
- Title: Interpretable reinforcement learning with decision-tree pruning
- Title(参考訳): 決定木刈り込みによる解釈型強化学習
- Abstract要約: 強化学習政策は検査が難しいが、それらを解釈することは信頼性の前提条件である。
本稿では,タスク性能を保ちながらルールベースのポリシーを簡素化するプルーニングプロセスを提案する。
古典的制御と MuJoCo ベンチマークにおいて, プルーニングトレースが一貫した解釈可能性の向上を示す手法について検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning policies are difficult to inspect, but interpreting them is a prerequisite for trustworthiness. Converting a trained policy into explicit decision-tree rules improves transparency and the resulting artifacts often remain too complex for human understanding. We present a pruning process that simplifies such rule-based policies while preserving task performance and making edits to the policy auditable. The process defines a small set of structural and usage-aware operators and evaluates candidate edits by re-executing the policy to measure return and interpretability proxies. This exposes an transformation process from complex to compact policy structures. We investigate this approach on classic control and MuJoCo benchmarks, where pruning traces reveal consistent interpretability improvements while maintaining high performance.
- Abstract(参考訳): 強化学習政策は検査が難しいが、それらを解釈することは信頼性の前提条件である。
トレーニングされたポリシーを明示的な決定木ルールに変換することで透明性が向上し、その結果の成果物は人間の理解には複雑すぎることが多い。
タスク性能を保ち、監査可能なポリシーに編集を施しながら、そのようなルールベースのポリシーを簡素化するプルーニングプロセスを提案する。
このプロセスは、構造的および使用性に配慮したオペレータの小さなセットを定義し、リターンと解釈可能性のプロキシを測定するポリシーを再実行することによって、候補編集を評価する。
これは、複雑なポリシー構造からコンパクトなポリシー構造への変換プロセスを公開する。
古典的制御と MuJoCo ベンチマークのアプローチについて検討し,高い性能を維持しながら一貫した解釈可能性の向上を示す。
関連論文リスト
- A Methodology for Auditable Trustworthiness Levels in AI Lifecycle Governance [0.3384279376065155]
我々は、AIガバナンスにおける監査可能な信頼性レベルのための軽量な方法論を提案する。
この方法論には、信頼性レベルを表現および学習するための正式なフレームワークと、軽量なAIライフサイクルガバナンス手順の2つのコンポーネントがある。
我々の手法は法的または他の専門家の判断に取って代わらない。
論文 参考訳(メタデータ) (2026-07-17T17:11:22Z) - Kintsugi: Learning Policies by Repairing Executable Knowledge Bases [31.289004484222847]
Kintsugiは、タスクレベルのポリシー知識を、構成可能な型付きエントリとして表現する。
ロールアウトの間、ツールに制約のある編集ループが軌道障害を診断し、編集可能なKB層にローカライズし、候補編集を提案する。
決定論的検証ゲートは、候補の型チェックが実行され、KBが実行された場合にのみ編集を許可し、保護された回帰チェックに違反することなく、集中した検証成功またはトラジェクトリヘルスメトリクスが改善される。
論文 参考訳(メタデータ) (2026-05-10T11:51:18Z) - PolicyBank: Evolving Policy Understanding for LLM Agents [51.86716874651299]
PolicyBankは構造化されたツールレベルの政策洞察を維持し、それらを反復的に洗練する。
PolicyBankは、人間の神託に対するギャップの最大82%を閉じている。
論文 参考訳(メタデータ) (2026-04-16T20:29:30Z) - Polaris: A Gödel Agent Framework for Small Language Models through Experience-Abstracted Policy Repair [0.9780193377233132]
経験抽象化によるポリシー修復を行うコンパクトモデルのためのGdelエージェントであるPolarisを紹介する。
応答レベルの自己修正やパラメータチューニングとは異なり、Polarisはポリシーに持続する小さな監査可能なパッチでポリシーレベルの変更を行う。
ループの一部として、エージェントはメタ推論を行い、エラーを説明し、独自のポリシーを具体的に修正し、ポリシーを更新する。
論文 参考訳(メタデータ) (2026-03-24T12:25:32Z) - Verification of Robust Properties for Access Control Policies [51.736723807086385]
既存のアクセス制御ポリシーの検証方法は、検証が進む前に、ポリシーを完全かつ完全に決定する必要がある。
本稿では,政策構造がどのような決定を下すか,どのような決定を下すか,あるいはその後の拡張に拘わらず,その決定を行うかという課題について,ロバストなプロパティ検証を導入する。
可能なすべてのポリシー拡張を普遍的に定量化しているにもかかわらず、判断は二階述語論理プログラミング言語における探索の証明に還元されることを示す。
論文 参考訳(メタデータ) (2026-03-13T17:14:38Z) - Scaling Policy Compliance Assessment in Language Models with Policy Reasoning Traces [12.671657542087624]
ポリシー推論トレース(英: Policy Reasoning Traces、PRT)は、LLMのポリシーコンプライアンスアセスメント能力を改善するための推論ブリッジとして機能する、特殊化された推論チェーンの一形態である。
実験により, PRTを推論時間とトレーニング時間の両方のシナリオに使用することにより, オープンウェイトモデルと商用モデルの性能が著しく向上することが示された。
論文 参考訳(メタデータ) (2025-09-27T13:10:21Z) - Bounded Robustness in Reinforcement Learning via Lexicographic
Objectives [54.00072722686121]
強化学習における政策の堅牢性は、いかなるコストでも望ましいものではないかもしれない。
本研究では,任意の観測ノイズに対して,政策が最大限に頑健になる方法について検討する。
本稿では,どのような政策アルゴリズムにも適用可能なロバストネス誘導方式を提案する。
論文 参考訳(メタデータ) (2022-09-30T08:53:18Z) - Policy Regularization for Legible Behavior [0.0]
強化学習では、一般的に、エージェントのメカニズムに関する洞察を提供することを意味する。
本論文は,エージェントの正当性に着目した説明可能な計画文献手法から借用する。
我々の定式化において、正当性によって導入された決定境界は、エージェントのポリシーが他のポリシーでも高い可能性を持つアクションを返す州に影響を与える。
論文 参考訳(メタデータ) (2022-03-08T10:55:46Z) - Constructing a Good Behavior Basis for Transfer using Generalized Policy
Updates [63.58053355357644]
そこで我々は,優れた政策集合を学習する問題を考察し,組み合わせることで,目に見えない多種多様な強化学習タスクを解くことができることを示した。
理論的には、独立したポリシーのセットと呼ぶ、特定の多様なポリシーのセットにアクセスできることによって、ハイレベルなパフォーマンスを即時に達成できることが示される。
論文 参考訳(メタデータ) (2021-12-30T12:20:46Z) - DDPG++: Striving for Simplicity in Continuous-control Off-Policy
Reinforcement Learning [95.60782037764928]
過大評価バイアスが制御される限り、単純な決定論的政策勾配は著しく機能することを示す。
第二に、非政治的なアルゴリズムの典型であるトレーニングの不安定性を、欲張りのポリシー更新ステップに向ける。
第3に、確率推定文学におけるアイデアは、リプレイバッファからの重要サンプル遷移や、性能劣化を防ぐためのポリシー更新に利用できることを示す。
論文 参考訳(メタデータ) (2020-06-26T20:21:12Z) - Tree-Structured Policy based Progressive Reinforcement Learning for
Temporally Language Grounding in Video [128.08590291947544]
非トリミングビデオにおける一時的言語接地は、ビデオ理解における新たな課題である。
ヒトの粗大な意思決定パラダイムにインスパイアされた我々は、新しい木構造政策に基づくプログレッシブ強化学習フレームワークを定式化した。
論文 参考訳(メタデータ) (2020-01-18T15:08:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。