論文の概要: A Survey on the Verification of Reinforcement Learning Policies
- arxiv url: http://arxiv.org/abs/2607.16210v1
- Date: Thu, 14 May 2026 12:32:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.033747
- Title: A Survey on the Verification of Reinforcement Learning Policies
- Title(参考訳): 強化学習政策の検証に関する調査研究
- Abstract要約: 強化学習は、複雑で安全クリティカルな領域にますます適用されている。
ニューラルネットワークベースのポリシに対する厳格な行動保証の欠如は、デプロイメントの大きな障壁である。
この調査は、RL検証方法に関する統一的な視点を提供する。
- 参考スコア(独自算出の注目度): 7.245989727730095
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) is increasingly applied in complex, safety-critical domains, yet the lack of rigorous behavioral guarantees for neural network-based policies remains a major barrier to deployment. Recent advances in policy expressiveness and scale have intensified this challenge, leading to a rapidly growing but conceptually fragmented body of work on RL policy verification. This survey provides a unifying perspective on RL verification methods. We introduce a taxonomy that clarifies relationships among existing approaches along three axes: verification paradigm (formal versus probabilistic), temporal scope (step-wise versus multi-step), and guarantees strength. Beyond taxonomy, we unify underlying theoretical foundations, make implicit assumptions and limitations explicit, and identify emerging directions.
- Abstract(参考訳): 強化学習(RL)は、複雑な安全クリティカルなドメインにますます適用されていますが、ニューラルネットワークベースのポリシに対する厳格な行動保証の欠如は、デプロイメントの大きな障壁のままです。
政策表現性とスケールの最近の進歩は、この課題を激化させ、RL政策検証に関する急速に成長するが概念的に断片化された作業へと繋がった。
この調査は、RL検証方法に関する統一的な視点を提供する。
検証パラダイム(形式的対確率的)、時間的スコープ(ステップワイド対マルチステップ)、強さを保証する3つの軸に沿った既存アプローチ間の関係を明らかにする分類法を導入する。
分類学以外にも、基礎となる理論基盤を統一し、暗黙の仮定と制限を明示し、新たな方向性を特定する。
関連論文リスト
- AIPO: Learning to Reason from Active Interaction [54.10819421625103]
AIPOは、ポリシーモデルが、推論ボトルネックに遭遇するときに、3つの機能的協調エージェントを積極的に相談することを可能にする。
AIPOは推論性能を継続的に改善し、異なるポリシーモデルとRLVRアルゴリズムをまたいで堅牢に一般化し、ポリシーモデルの推論能力境界を効果的に拡張する。
論文 参考訳(メタデータ) (2026-05-08T19:06:55Z) - BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search [72.87861928940929]
バウンダリ・アウェア・ポリシー・オプティマイゼーション(BAPO)は、信頼性の高い境界認識を精度を損なうことなく育成する新しいRLフレームワークである。
BAPOは2つの重要な要素を導入する: (i) グループベースの境界対応報酬(i) 推論が限界に達したときのみIDK応答を促進させる) 適応報酬変調器(ii) 早期探索中にこの報酬を戦略的に停止させ、モデルがIDKをショートカットとして利用するのを防ぐ。
論文 参考訳(メタデータ) (2026-01-16T07:06:58Z) - Unifying Causal Reinforcement Learning: Survey, Taxonomy, Algorithms and Applications [35.74838344207327]
因果強化学習(CRL)は、因果関係を明示的にモデル化することによって、課題に対する有望な解決策を提供する。
我々は既存のアプローチを因果表現学習、反ファクトポリシー最適化、オフライン因果RL、因果伝達学習、因果説明可能性に分類する。
我々は、堅牢で、一般化可能で、解釈可能な人工知能システムを開発するためのCRLの可能性について、今後の研究指針を提供する。
論文 参考訳(メタデータ) (2025-12-19T23:37:22Z) - Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends [64.71326476563213]
大規模言語モデル(LLM)の非政治強化学習が注目されている。
本稿では,特定のトレーニングデータ分布を仮定することなく,グループ化型REINFORCEの第一原理導出について述べる。
この観点は、REINFORCEを非政治的な設定に適応するための2つの一般的な原則をもたらす。
論文 参考訳(メタデータ) (2025-09-29T02:34:54Z) - From Explainability to Interpretability: Interpretable Policies in Reinforcement Learning Via Model Explanation [2.08099858257632]
本稿では,複雑な深いRLポリシーを透過的な表現に変換するためのモデルに依存しない新しいアプローチを提案する。
提案手法を既存の3つの深部RLアルゴリズムを用いて評価し,その性能を2つの古典的制御環境で検証した。
論文 参考訳(メタデータ) (2025-01-16T22:11:03Z) - A Comprehensive Survey on Evidential Deep Learning and Its Applications [64.83473301188138]
Evidential Deep Learning (EDL)は、単一のフォワードパスで最小限の追加計算で信頼性の高い不確実性推定を提供する。
まず、主観的論理理論であるEDLの理論的基礎を掘り下げ、他の不確実性推定フレームワークとの区別について議論する。
さまざまな機械学習パラダイムや下流タスクにまたがる広範な応用について詳しく述べる。
論文 参考訳(メタデータ) (2024-09-07T05:55:06Z) - Rethinking State Disentanglement in Causal Reinforcement Learning [78.12976579620165]
因果性は、根底にある状態が識別可能性によって一意に回復できることを保証するための厳密な理論的支援を提供する。
我々はこの研究ラインを再考し、RL固有のコンテキストを取り入れることで、潜在状態に対する以前の識別可能性分析における不要な仮定を低減できることを示した。
本稿では, 従来手法の複雑な構造制約を, 遷移と報酬保存の2つの簡単な制約に置き換えることにより, 一般に部分的に観測可能なマルコフ決定過程(POMDP)を提案する。
論文 参考訳(メタデータ) (2024-08-24T06:49:13Z) - A Survey of Constraint Formulations in Safe Reinforcement Learning [15.593999581562203]
現実世界の問題に強化学習を適用する場合、安全性は重要です。
一般的な安全なRLアプローチは、期待される累積報酬を最大化する制約付き基準に基づいている。
近年のRLの安全性向上努力にもかかわらず、この分野の体系的な理解は依然として困難である。
論文 参考訳(メタデータ) (2024-02-03T04:40:31Z) - False Correlation Reduction for Offline Reinforcement Learning [115.11954432080749]
本稿では,実効的かつ理論的に証明可能なアルゴリズムであるオフラインRLに対するfalSe Correlation Reduction (SCORE)を提案する。
SCOREは、標準ベンチマーク(D4RL)において、様々なタスクにおいて3.1倍の高速化でSoTA性能を達成することを実証的に示す。
論文 参考訳(メタデータ) (2021-10-24T15:34:03Z) - Neurosymbolic Reinforcement Learning with Formally Verified Exploration [21.23874800091344]
本稿では,連続した状態と行動空間を確実に安全に探索するためのフレームワークであるRevelを紹介する。
確実に安全な深層RLの鍵となる課題は、学習ループ内のニューラルネットワークの繰り返し検証が計算不可能であることだ。
この課題は、近似勾配を持つ一般のニューロシンボリッククラスと、効率的な検証を可能にするシンボリックポリシーのより制限されたクラスという2つのポリシークラスを用いて解決する。
論文 参考訳(メタデータ) (2020-09-26T14:51:04Z) - Deep Reinforcement Learning with Robust and Smooth Policy [90.78795857181727]
我々は、国家に対して円滑に振る舞う円滑な政策を学ぶことを提案する。
textbfSmooth textbfRegularized textbfReinforcement textbfLearning(textbfSR2textbfL$)という新しいフレームワークを開発し、スムーズな正規化によってポリシーを訓練する。
このような正規化は、探索空間を効果的に制限し、学習ポリシーの滑らかさを強制する。
論文 参考訳(メタデータ) (2020-03-21T00:10:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。