論文の概要: Entropy-Regularized Reinforcement Learning for Linear-Quadratic Stackelberg Differential Games in Regime-Switching Diffusion Models
- arxiv url: http://arxiv.org/abs/2606.28671v1
- Date: Sat, 27 Jun 2026 01:17:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.637809
- Title: Entropy-Regularized Reinforcement Learning for Linear-Quadratic Stackelberg Differential Games in Regime-Switching Diffusion Models
- Title(参考訳): 正規交替拡散モデルにおける線形量子スタックルバーグ微分ゲームに対するエントロピー正規化強化学習
- Authors: Congde Hu, Danping Li, Lin Xu, Wenying Xu,
- Abstract要約: 本稿では,スタックディファレンシャルゲームに対するエントロピー規則化強化学習手法を提案する。
鍵となる革新は、エントロピー正則化を伴う弱結合 HJBI 方程式の導出である。
ニューラルネットワークは、近似状態依存値関数に統合され、高次元偏微分方程式を解く。
- 参考スコア(独自算出の注目度): 5.600703864320554
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Stackelberg differential games (SDGs) provide a powerful framework for hierarchical decision-making in stochastic and continuous-time environments, yet their solution remains computationally challenging due to the complexity of traditional dynamic programming and Hamilton-Jacobi-Bellman-Isaacs (HJBI) methods, especially in high-dimensional systems. This paper proposes an entropy-regularized reinforcement learning (ERRL) approach for linear-quadratic SDGs (LQ-SDGs) within a continuous-time diffusion framework governed by Markovian regime switching. The key innovation lies in deriving exploratory weakly-coupled HJBI equations with entropy regularization, which promotes stochastic policies that actively avoid suboptimal equilibria -- a limitation of classical SDG methods. Neural networks are integrated to approximate regime-dependent value functions and solve high-dimensional partial differential equations (PDEs) efficiently, while a novel sampling technique enhances computational tractability. Numerical results demonstrate the effectiveness of the framework compared to conventional approaches, particularly in escaping suboptimal traps through exploratory policies. The study highlights the critical role of entropy regularization and neural network approximations in achieving robust solutions for hierarchical decision-making problems under abrupt environmental shifts.
- Abstract(参考訳): Stackelberg差分ゲーム(SDG)は、確率的および連続的な環境における階層的決定のための強力なフレームワークを提供するが、従来の動的プログラミングの複雑さやハミルトン・ヤコビ・ベルマン・イザック法(英語版)(HJBI)の手法、特に高次元システムにおいて、その解は計算的に難しいままである。
本稿では,マルコフ政権交代が支配する連続拡散フレームワークにおいて,線形2次SDG(LQ-SDG)に対するエントロピー規則化強化学習(ERRL)アプローチを提案する。
鍵となる革新は、探索的に弱結合されたHJBI方程式をエントロピー正則化で導出することであり、古典的なSDG法の制限である準最適均衡を積極的に回避する確率的政策を促進する。
ニューラルネットワークは、近似状態依存値関数に統合され、高次元偏微分方程式(PDE)を効率的に解くとともに、新しいサンプリング手法により計算的トラクタビリティが向上する。
数値的な結果は,従来の手法と比較して,特に探索的政策による最適下層トラップのエスケープにおいて,フレームワークの有効性を示す。
この研究は、急激な環境変化の下で階層的な意思決定問題に対する堅牢な解決策を達成する上で、エントロピー正則化とニューラルネットワーク近似の重要性を強調している。
関連論文リスト
- HGAN-SDEs: Learning Neural Stochastic Differential Equations with Hermite-Guided Adversarial Training [3.4515388499147654]
HGAN-SDEは,ニューラルエルマイト関数を利用して,構造化された効率的な識別器を構築する新しいGANベースのフレームワークである。
HGAN-SDEは,既存のSDE生成モデルと比較して,サンプル品質と学習効率が優れている。
論文 参考訳(メタデータ) (2025-12-23T11:25:22Z) - A joint optimization approach to identifying sparse dynamics using least squares kernel collocation [70.13783231186183]
本研究では,通常の微分方程式(ODE)の学習システムを,状態の不足,部分的,ノイズの多い観測から学習するためのオール・アット・オンス・モデリング・フレームワークを開発する。
提案手法は,関数ライブラリ上でのODEのスパースリカバリ戦略とカーネルヒルベルト空間(RKHS)理論による状態推定とODEの離散化の手法を組み合わせたものである。
論文 参考訳(メタデータ) (2025-11-23T18:04:15Z) - Hard constraint learning approaches with trainable influence functions for evolutionary equations [8.812375888020398]
本稿では進化方程式を解くための新しい深層学習手法を開発する。
逐次学習戦略は、大きな時間領域を複数のサブインターバルに分割し、時系列順に1つずつ解決する。
改良されたハード制約戦略は、時間間隔ノードにおけるPINNソリューションの連続性と滑らかさを厳密に保証する。
論文 参考訳(メタデータ) (2025-02-21T07:54:01Z) - An Efficient On-Policy Deep Learning Framework for Stochastic Optimal Control [14.832859803172846]
本稿では、最適制御(SOC)問題を解決するための新しいオン政治アルゴリズムを提案する。
ギルサノフの定理を利用することで、微分方程式や随伴問題解による高価なバックプロパゲーションを伴わずに、SOC対象の政治的勾配を直接計算する。
実験により,従来の手法に比べて計算速度とメモリ効率が大幅に向上した。
論文 参考訳(メタデータ) (2024-10-07T16:16:53Z) - Efficiently Training Deep-Learning Parametric Policies using Lagrangian Duality [55.06411438416805]
制約付きマルコフ決定プロセス(CMDP)は、多くの高度な応用において重要である。
本稿では,パラメトリックアクターポリシーを効率的に訓練するための2段階深度決定規則(TS-DDR)を提案する。
現状の手法と比較して, 解の質を高め, 数桁の計算時間を削減できることが示されている。
論文 参考訳(メタデータ) (2024-05-23T18:19:47Z) - Ensemble Kalman Filtering Meets Gaussian Process SSM for Non-Mean-Field and Online Inference [47.460898983429374]
我々は,非平均場(NMF)変動推定フレームワークにアンサンブルカルマンフィルタ(EnKF)を導入し,潜在状態の後方分布を近似する。
EnKFとGPSSMのこの新しい結婚は、変分分布の学習における広範なパラメータ化の必要性をなくすだけでなく、エビデンスの下限(ELBO)の解釈可能でクローズドな近似を可能にする。
得られたEnKF支援オンラインアルゴリズムは、データ適合精度を確保しつつ、モデル正規化を組み込んで過度適合を緩和し、目的関数を具現化する。
論文 参考訳(メタデータ) (2023-12-10T15:22:30Z) - Distributionally Robust Model-based Reinforcement Learning with Large
State Spaces [55.14361269378122]
強化学習における3つの大きな課題は、大きな状態空間を持つ複雑な力学系、コストのかかるデータ取得プロセス、トレーニング環境の展開から現実の力学を逸脱させることである。
広範に用いられているKullback-Leibler, chi-square, および全変分不確実性集合の下で, 連続状態空間を持つ分布ロバストなマルコフ決定過程について検討した。
本稿では,ガウス過程と最大分散削減アルゴリズムを用いて,多出力名目遷移力学を効率的に学習するモデルベースアプローチを提案する。
論文 参考訳(メタデータ) (2023-09-05T13:42:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。