論文の概要: Stabilized neural Hamilton--Jacobi--Bellman solvers: Error analysis and applications in model-based reinforcement learning
- arxiv url: http://arxiv.org/abs/2605.07116v1
- Date: Fri, 08 May 2026 01:48:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 19:43:38.728537
- Title: Stabilized neural Hamilton--Jacobi--Bellman solvers: Error analysis and applications in model-based reinforcement learning
- Title(参考訳): 安定化ニューラルハミルトン-ヤコビ-ベルマン解法:モデルに基づく強化学習における誤差解析と応用
- Authors: Minseok Kim, Yeongjong Kim, Namkyeong Cho, Yeoneung Kim,
- Abstract要約: ハミルトン-ヤコビ-ベルマン方程式の理論はモデルに基づく強化学習に適用できる。
我々は、グリッドベースの値未知を回避しつつ、安定化された有限差分ポリシー評価構造を保存するハイブリッドシステムを開発する。
64次元までのコンパクト制御LQRの実験、アレン・カーン制御、振り子、ホッパー、および3Dクアロータのベンチマークは、代表的なモデルベースとモデルフリーのRLベースラインと比較する。
- 参考スコア(独自算出の注目度): 3.8280665730760366
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Physics-informed neural solvers offer a promising route to model-based reinforcement learning in continuous time, where optimal feedback synthesis is governed by Hamilton--Jacobi--Bellman (HJB) equations. Practical implementations often occupy a regime that is neither a classical grid method nor a continuous-PDE PINN: the value function is represented by a neural network, finite-difference HJB policy-evaluation operators are evaluated by network queries at shifted points, and residuals are minimized by random continuous collocation. This regime preserves the stabilized finite-difference policy-evaluation structure while avoiding grid-based value unknowns. We develop an error theory for this hybrid regime. Interpreting finite differences as shift operators acting on neural networks, we prove a population $L^2$ stability estimate for one policy-evaluation step with learned dynamics. The bound separates residual error, initial and exterior-collar mismatch, policy mismatch, and model-identification error, with an explicit gradient amplification factor for learned dynamics, while the underlying linear evaluation stability remains free of hidden inverse-viscosity blow-up. We further give a finite-sample collocation certificate and a conditional multi-step propagation result through greedy policy improvement. Experiments on compact-control LQR upto 64 dimensions, Allen--Cahn control, pendulum, Hopper, and 3D quadrotor benchmarks compare against representative model-based and model-free RL baselines, demonstrating the predicted residual, policy-mismatch, and learned-model error trends.
- Abstract(参考訳): 物理インフォームドニューラルネットワークは、ハミルトン-ヤコビ-ベルマン方程式(HJB)によって最適フィードバック合成が制御されるモデルベースの強化学習を連続的に実現する。
数値関数はニューラルネットワークで表現され、有限差分HJBポリシー評価演算子はシフトポイントでのネットワーククエリによって評価され、残余はランダムな連続コロケーションによって最小化される。
この状態は、グリッドベースの値未知を避けながら、安定化された有限差分ポリシー評価構造を保存する。
我々はこのハイブリッド体制の誤り理論を開発する。
ニューラルネットワークに作用するシフト演算子として有限差分を解釈し、学習力学を用いた政策評価の1ステップに対して、集団$L^2$の安定性推定を証明した。
境界は、残差誤差、初期および外色ミスマッチ、ポリシーミスマッチ、モデル同定エラーを、学習力学に対する明示的な勾配増幅係数で分離する。
さらに、グリーディポリシーの改善により、有限サンプルのコロケーション証明書と条件付き多段階伝搬結果を与える。
64次元までのコンパクト制御LQRの実験では、Allen-Cahn制御、振り子、ホッパー、および3Dクアロータのベンチマークが、モデルベースおよびモデルフリーのRLベースラインと比較され、予測された残差、ポリシーミスマッチ、学習モデルエラー傾向が示された。
関連論文リスト
- Hybrid Iterative Neural Low-Regularity Integrator for Nonlinear Dispersive Equations [0.0]
HIN-LRIは、古典的な数値解法をニューラルネットワークで拡張し、解法の構造化トランケーション誤差を補正するハイブリッドフレームワークである。
低次元の潜在多様体上で動作する軽量ニューラルネットワークは、分析手法が閉じられない残留欠陥を学習する。
実験により、HIN-LRIは解析的、分割的手法、神経的PDEサロゲートよりも精度を向上し、安定した空間的精細化、効果的なアウト・オブ・ディストリビューション転送、オンラインオーバーヘッドを緩和することが示された。
論文 参考訳(メタデータ) (2026-05-06T12:50:36Z) - $V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts [81.48669089692189]
一般値モデル(例えば$V_0.5$)は、コンテキスト内のモデル機能を明示的にエンコードすることで、事前訓練された値推定を実現する。
本稿では,このような値モデルにより予測されるベースラインと,スパースロールアウトから導出される経験的平均とを適応的に融合する$V_0.5$を提案する。
V_0.5$はGRPOとDAPOを大きく上回り、より高速な収束と約10%のパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2026-03-11T14:57:41Z) - Neural Policy Iteration for Stochastic Optimal Control: A Physics-Informed Approach [2.8988658640181826]
物理インフォームドニューラルネットワークポリシー反復フレームワーク(PINN-PI)を提案する。
各イテレーションにおいて、ニューラルネットワークは、固定ポリシーによって誘導される線形PDEの残余を最小限にして、値関数を近似するように訓練される。
提案手法は,最大10次元の勾配カートポール,振り子高次元線形二次規則(LQR)問題など,いくつかのベンチマーク問題に対する有効性を示す。
論文 参考訳(メタデータ) (2025-08-03T11:02:25Z) - Imitation Learning of MPC with Neural Networks: Error Guarantees and Sparsification [5.260346080244568]
本稿では,ニューラルネットワークを用いた模倣モデル予測制御系における近似誤差の有界化のためのフレームワークを提案する。
本稿では,この手法を用いて,性能保証付き安定型ニューラルネットワークコントローラを設計する方法について論じる。
論文 参考訳(メタデータ) (2025-01-07T10:18:37Z) - Value-Distributional Model-Based Reinforcement Learning [59.758009422067]
政策の長期的業績に関する不確実性の定量化は、シーケンシャルな意思決定タスクを解決するために重要である。
モデルに基づくベイズ強化学習の観点から問題を考察する。
本稿では,値分布関数を学習するモデルに基づくアルゴリズムであるEpicemic Quantile-Regression(EQR)を提案する。
論文 参考訳(メタデータ) (2023-08-12T14:59:19Z) - Regularizing with Pseudo-Negatives for Continual Self-Supervised Learning [62.40718385934608]
効果的な継続型自己教師型学習(CSSL)のためのPNR(Pseudo-Negative Regularization)フレームワークを提案する。
我々のPNRは,新たに学習した表現が過去の学習と矛盾しないように,モデルに基づく拡張によって得られた擬陰性情報を活用する。
論文 参考訳(メタデータ) (2023-06-08T10:59:35Z) - Robust and Adaptive Temporal-Difference Learning Using An Ensemble of
Gaussian Processes [70.80716221080118]
本稿では、時間差学習(TD)による政策評価の世代的視点について考察する。
OS-GPTDアプローチは、状態-逆ペアのシーケンスを観測することにより、与えられたポリシーの値関数を推定するために開発された。
1つの固定カーネルに関連する限られた表現性を緩和するために、GP前の重み付けアンサンブル(E)を用いて代替のスキームを生成する。
論文 参考訳(メタデータ) (2021-12-01T23:15:09Z) - DROMO: Distributionally Robust Offline Model-based Policy Optimization [0.0]
モデルベース制御によるオフライン強化学習の問題点を考察する。
分散ロバストなオフラインモデルベースポリシー最適化(DROMO)を提案する。
論文 参考訳(メタデータ) (2021-09-15T13:25:14Z) - Robust Implicit Networks via Non-Euclidean Contractions [63.91638306025768]
暗黙のニューラルネットワークは、精度の向上とメモリ消費の大幅な削減を示す。
彼らは不利な姿勢と収束の不安定さに悩まされる。
本論文は,ニューラルネットワークを高機能かつ頑健に設計するための新しい枠組みを提供する。
論文 参考訳(メタデータ) (2021-06-06T18:05:02Z) - COMBO: Conservative Offline Model-Based Policy Optimization [120.55713363569845]
ディープニューラルネットワークのような複雑なモデルによる不確実性推定は困難であり、信頼性が低い。
我々は,サポート外状態動作の値関数を正規化するモデルベースオフラインRLアルゴリズムCOMBOを開発した。
従来のオフラインモデルフリーメソッドやモデルベースメソッドと比べて、comboは一貫してパフォーマンスが良いことが分かりました。
論文 参考訳(メタデータ) (2021-02-16T18:50:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。