論文の概要: An Actor-Critic Framework for Continuous-Time Jump-Diffusion Controls with Normalizing Flows
- arxiv url: http://arxiv.org/abs/2604.05398v1
- Date: Tue, 07 Apr 2026 03:49:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.612877
- Title: An Actor-Critic Framework for Continuous-Time Jump-Diffusion Controls with Normalizing Flows
- Title(参考訳): 流れの正規化を伴う連続時間跳躍拡散制御のためのアクタ・クリティカル・フレームワーク
- Authors: Liya Guo, Ruimeng Hu, Xu Yang, Yi Zhu,
- Abstract要約: 時間的不均一なジャンプ拡散ダイナミクスによる連続的な時間制御は、金融と経済の中心である。
エントロピー規則化制御問題やジャンプを伴うゲームに対して,メッシュフリーな解法として機能するアクタ批判フレームワークを提案する。
本稿では,時間不均一な線形四元数制御,メルトンポートフォリオ最適化,マルチエージェントポートフォリオゲームについて検証する。
- 参考スコア(独自算出の注目度): 10.996737071400004
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Continuous-time stochastic control with time-inhomogeneous jump-diffusion dynamics is central in finance and economics, but computing optimal policies is difficult under explicit time dependence, discontinuous shocks, and high dimensionality. We propose an actor-critic framework that serves as a mesh-free solver for entropy-regularized control problems and stochastic games with jumps. The approach is built on a time-inhomogeneous little q-function and an appropriate occupation measure, yielding a policy-gradient representation that accommodates time-dependent drift, volatility, and jump terms. To represent expressive stochastic policies in continuous-action spaces, we parameterize the actor using conditional normalizing flows, enabling flexible non-Gaussian policies while retaining exact likelihood evaluation for entropy regularization and policy optimization. We validate the method on time-inhomogeneous linear-quadratic control, Merton portfolio optimization, and a multi-agent portfolio game, using explicit solutions or high-accuracy benchmarks. Numerical results demonstrate stable learning under jump discontinuities, accurate approximation of optimal stochastic policies, and favorable scaling with respect to dimension and number of agents.
- Abstract(参考訳): 時間的不均質な跳躍拡散力学による連続時間確率制御は金融と経済学の中心であるが、明示的な時間依存、不連続な衝撃、高次元性の下では最適政策の計算は困難である。
エントロピー規則化制御問題やジャンプを伴う確率ゲームに対して,メッシュフリーな解法として機能するアクタ批判フレームワークを提案する。
このアプローチは、時間に依存しない小さなq-関数と適切な職業尺度に基づいて構築され、時間依存のドリフト、ボラティリティ、ジャンプ項に対応する政策段階の表現をもたらす。
連続作用空間における表現的確率的ポリシーを表現するため、条件付き正規化フローを用いてアクターをパラメータ化し、エントロピー正規化とポリシー最適化の正確な精度評価を維持しつつ、柔軟な非ガウス的ポリシーを可能にする。
本稿では,時間不均一な線形四元数制御,メルトンポートフォリオ最適化,マルチエージェントポートフォリオゲームにおいて,明示的な解や高精度ベンチマークを用いて検証を行う。
数値的な結果から,ジャンプ不連続条件下での安定学習,最適確率ポリシーの正確な近似,次元およびエージェント数に対する良好なスケーリングが示された。
関連論文リスト
- Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models [52.48582333951919]
ポリシー更新の信号対雑音比を最大化することにより、アライメントの信頼性を高めるために設計された動的フレームワークを提案する。
SAGE(Stability-Aware Gradient Efficiency)は、モデル能力に基づいて候補プールをリフレッシュする粗いきめ細かいカリキュラムメカニズムを統合する。
複数の数学的推論ベンチマークの実験により、SAGEは収束を著しく加速し、静的ベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-01T12:56:10Z) - Kinematic Tokenization: Optimization-Based Continuous-Time Tokens for Learnable Decision Policies in Noisy Time Series [0.2538209532048867]
トランスフォーマーは離散トークン用に設計されているが、多くの実世界の信号はノイズサンプリングによって観測される連続的なプロセスである。
最適化に基づく連続時間表現であるKinematic Tokenizationを導入する。
本研究では,明示的な連続時間トークンにより,雑音を伴う時系列における選択的決定ポリシーの学習性と校正性を向上できることを示す。
論文 参考訳(メタデータ) (2026-01-15T00:21:02Z) - Relative Entropy Pathwise Policy Optimization [66.03329137921949]
そこで本稿では,Q値モデルをオンライントラジェクトリから純粋に訓練するオンラインアルゴリズムを提案する。
安定トレーニングのための制約付き更新と探索のためのポリシを組み合わせる方法を示し、価値関数学習を安定化させる重要なアーキテクチャコンポーネントを評価する。
論文 参考訳(メタデータ) (2025-07-15T06:24:07Z) - Accuracy of Discretely Sampled Stochastic Policies in Continuous-time Reinforcement Learning [3.973277434105709]
我々は、個別の時点におけるポリシーからアクションをサンプリングするポリシー実行フレームワークを厳格に分析し、それらを断片的に一定の制御として実装する。
サンプリングメッシュのサイズがゼロになる傾向にあるため、制御された状態過程は、ポリシーに従って係数で動的に弱く収束する。
これらの結果に基づいて、離散時間観測に基づいて、様々な政策勾配推定器のバイアスとばらつきを分析した。
論文 参考訳(メタデータ) (2025-03-13T02:35:23Z) - Learning Optimal Deterministic Policies with Stochastic Policy Gradients [62.81324245896716]
政策勾配法(PG法)は連続強化学習(RL法)問題に対処する手法として成功している。
一般的には、収束(ハイパー)政治は、決定論的バージョンをデプロイするためにのみ学習される。
本稿では,サンプルの複雑性とデプロイされた決定論的ポリシのパフォーマンスのトレードオフを最適化するために,学習に使用する探索レベルの調整方法を示す。
論文 参考訳(メタデータ) (2024-05-03T16:45:15Z) - Optimal scheduling of entropy regulariser for continuous-time
linear-quadratic reinforcement learning [9.779769486156631]
ここで、エージェントは最適な緩和ポリシーに従って分散されたノイズ制御を生成することで環境と相互作用する。
この探索-探索トレードオフはエントロピー正則化の強さによって決定される。
どちらの学習アルゴリズムも、$mathcalO(sqrtN)$(対数係数まで)を$N$のエピソードよりも高く、文献から最もよく知られた結果と一致することを証明している。
論文 参考訳(メタデータ) (2022-08-08T23:36:40Z) - On the Sample Complexity and Metastability of Heavy-tailed Policy Search
in Continuous Control [47.71156648737803]
強化学習(Reinforcement learning)は、システムダイナミクスモデルなしで、時間をかけてインセンティブを順次明らかにする、インタラクティブな意思決定のためのフレームワークである。
定義された連鎖を特徴付け、テールインデックスのレヴィプロセスに関連するポリシーがより広いピークに収まることを識別する。
論文 参考訳(メタデータ) (2021-06-15T20:12:44Z) - Improper Learning with Gradient-based Policy Optimization [62.50997487685586]
未知のマルコフ決定過程に対して学習者がmベースコントローラを与えられる不適切な強化学習設定を考える。
制御器の不適切な混合のクラス上で動作する勾配に基づくアプローチを提案する。
論文 参考訳(メタデータ) (2021-02-16T14:53:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。