論文の概要: Amortized Score-Hamiltonian Policy Iteration: A Grid-Free Scheme for Relaxed Stochastic Control Problems
- arxiv url: http://arxiv.org/abs/2610.04285v1
- Date: Sat, 03 Oct 2026 04:28:25 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:06:25.492141
- Title: Amortized Score-Hamiltonian Policy Iteration: A Grid-Free Scheme for Relaxed Stochastic Control Problems
- Title(参考訳): Amortized Score-Hamiltonian Policy Iteration: A Grid-free Scheme for Relaxed Stochastic Control Problems
- Abstract要約: 本研究では,連続的ランゲヴィンダイナミクスに基づくポリシー値反復のアモータイズ・グリッドフリーな実装を開発する。
我々は,高次元空間におけるアクター-批判的学習の結合を実証するための一般モデルの実験を行った。
- 参考スコア(独自算出の注目度): 12.372723206832214
- License:
- Abstract: We develop an amortized, grid-free implementation of continuous Langevin dynamics based policy-value iteration for entropy-regularized, infinite-horizon relaxed stochastic control problems. The improvement rate of the exact iteration is a discounted aggregate of relative Fisher information between the policy and the Gibbs law of its Hamiltonian. The associated score residual is the velocity with which the control's Langevin dynamics transport its law. We project this velocity onto a conditional sampler shared across states, instead of one Langevin dynamics per state, and the value dynamics onto a parametric critic, estimating both projections at sampled states to obtain coupled actor--critic flows. The score loss measures the actor's agreement with the current critic, while the policy-evaluation residual measures the critic's agreement with the actor. We also derive gradient and Hessian residuals, including a Feynman--Kac representation for the gradient equation, to control errors not detected by the projected value iteration. An exact decomposition of the HJB residual combines these errors into a policy-suboptimality bound under verification and logarithmic Sobolev assumptions. In the linear-quadratic class, both projections are exact and recover the pointwise iteration, and we provide numerical experiments on general models to demonstrate the coupled actor--critic learning in high-dimensions.
- Abstract(参考訳): 我々は、エントロピー規則化無限水平緩和確率制御問題に対して、連続ランゲヴィンダイナミクスに基づくポリシー値反復を補正・グリッドフリーで実装する。
正確なイテレーションの改善率は、ポリシーとハミルトンのギブズ法の間の相対的なフィッシャー情報の割引された集計である。
関連するスコア残差は、制御のランゲヴィン力学がその法則を輸送する速度である。
我々はこの速度をランゲヴィンの1状態当たりのダイナミックスではなく状態間で共有される条件付きサンプルに投影し、パラメトリックな批評家に値のダイナミクスを与え、サンプル状態における両方のプロジェクションを推定してアクター-クリティカルフローを得る。
スコアロスは俳優の現在の批評家との合意を測り、政策評価は批評家の俳優との合意を測る。
また、勾配方程式に対するファインマン-カック表現を含む勾配とヘッセン残差を導出し、投影された値反復によって検出されない誤差を制御する。
HJB残差の正確な分解は、これらの誤差を検証と対数的ソボレフ仮定の下での政策-最適性に結合する。
線形四分法クラスでは、どちらの射影も正確であり、点反復を復元し、一般モデル上で数値実験を行い、高次元におけるアクター-批判的学習の結合を実証する。
関連論文リスト
- Fast Regularized Policy Mirror Descent with One-Step TD Updates [3.4173456717058084]
政策ミラー降下(PMD)は、正規化マルコフ決定過程(MDP)における高速収束を享受する
時間差 (TD) を1回更新し, 持続的批判を伴ってPMDを解析した。
我々のサンプル複雑度保証は、軌道リセット、生成モデルアクセス、ネストされたポリシー評価ループなしで保持できる。
論文 参考訳(メタデータ) (2026-09-30T14:33:51Z) - Offline Policy Evaluation via Mixed Bellman Residuals and Adaptive Critic Representations [3.7331041006330494]
固定混合重量の1段残差と2段残差の凸結合を考える。
理想的な設定では、この混合ベルマン定式化は、制限値関数クラスの下で近似誤差の間の自然なバイアス-分散トレードオフを与えることができる。
固定関数クラスに依存する標準的なアプローチとは異なり、予測される将来の特徴方向を用いてデータ依存の批判表現を構築する。
オーバーフィッティングを制御するために、我々はサンプル分割を用いて批評家を構築し、別のデータサブセットで値関数を推定する。
論文 参考訳(メタデータ) (2026-09-27T04:09:38Z) - Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening [59.760642080660695]
大規模言語モデルの強化学習において、PPO(Proximal Policy Optimization)は一般に、状態値の見積とポリシー更新のばらつきの軽減に批判を用いる。
PPO批判者には,バリューフラットニング(Value Flattening)と呼ばれる,系統的な障害モードが発見されました。
応答毎に3つの状態しか管理していないSP$3$Oは、バリューフレッテニングを緩和し、モデルのサイズや評価スイートをまたいだ学習ポリシーを一貫して改善できることを示す。
論文 参考訳(メタデータ) (2026-09-16T14:15:24Z) - Variance Reduction for Stochastic Gradient Generalized Non-reversible Langevin Monte Carlo Algorithms [7.336637417508747]
非可逆ランゲヴィン力学に対する勾配丸山推定器の序列変動について検討する。
我々は、逆二乗階段の水平方向上の経験的平均が、消滅段数状態における中心極限定理を満たすことを証明した。
論文 参考訳(メタデータ) (2026-06-27T08:25:48Z) - When Do Autoregressive Sequence Models Forecast Physical Wavefields? A Controlled Study on Synthetic Seismograms [43.8784307709823]
物理信号の長距離自己回帰予測は誤差蓄積によって制限される。
物理的に構造化されたテストベッドとして,合成3成分地震計を用いて,このようなロールアウトが安定であるかどうかを問う。
論文 参考訳(メタデータ) (2026-06-09T13:46:14Z) - Stabilized neural Hamilton--Jacobi--Bellman solvers: Error analysis and applications in model-based reinforcement learning [3.8280665730760366]
ハミルトン-ヤコビ-ベルマン方程式の理論はモデルに基づく強化学習に適用できる。
我々は、グリッドベースの値未知を回避しつつ、安定化された有限差分ポリシー評価構造を保存するハイブリッドシステムを開発する。
64次元までのコンパクト制御LQRの実験、アレン・カーン制御、振り子、ホッパー、および3Dクアロータのベンチマークは、代表的なモデルベースとモデルフリーのRLベースラインと比較する。
論文 参考訳(メタデータ) (2026-05-08T01:48:02Z) - Beyond Bellman: High-Order Generator Regression for Continuous-Time Policy Evaluation [28.490321270040727]
離散閉ループ軌道からの連続時間政策評価を時間的不均一な力学の下で検討する。
我々は,低次乱数項をキャンセルするモーメントマッチング係数を用いて,多段階遷移から時間依存ジェネレータを推定する。
論文 参考訳(メタデータ) (2026-04-21T01:53:11Z) - Regret Analysis of Average-Reward Unichain MDPs via an Actor-Critic Approach [46.80389197344682]
無限逆平均逆決定過程における$tildeO(sqrtT)$の順序最適後悔を伴う自然アクター批判を提案する。
NACBはアクターと批評家の両方に関数近似を用いており、大きな状態の潜在的周期性と行動空間への拡張を可能にしている。
論文 参考訳(メタデータ) (2025-05-26T13:43:02Z) - Efficient and Sharp Off-Policy Evaluation in Robust Markov Decision Processes [44.974100402600165]
意思決定プロセス(MDP)に対する最良パラメトリックかつ最悪の摂動の評価について検討する。
我々は、元のMDPからの遷移観測を用いて、それらが同一または異なるポリシーの下で生成されるかのどちらかを判断する。
我々の推定器はウォルドの信頼区間を用いた統計的推測も行う。
論文 参考訳(メタデータ) (2024-03-29T18:11:49Z) - Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement
Learning [70.01650994156797]
教育医療などのバッチ強化学習において、観察データからのシーケンシャルな意思決定方針のオフ・アセスメントが必要である。
我々は、ある政策の境界を推定するアプローチを開発する。
より凝縮したデータを集めることで、シャープな境界への収束を証明します。
論文 参考訳(メタデータ) (2020-02-11T16:18:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。