論文の概要: Continuous-Time Reinforcement Learning for Controlled Hawkes Jump-Diffusions
- arxiv url: http://arxiv.org/abs/2608.19151v1
- Date: Wed, 19 Aug 2026 17:40:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.480123
- Title: Continuous-Time Reinforcement Learning for Controlled Hawkes Jump-Diffusions
- Title(参考訳): 制御されたホークジャンプ拡散に対する連続時間強化学習
- Abstract要約: 非マルコフ的条件下で,機械学習アルゴリズムを用いた多変量ホークス駆動微分方程式の制御について検討した。
まず,有限次元マルコビアン化法とアルゴリズムを用いて,Hawkesプロセスと指数核の混合を近似する。
次に,Hawkes-CT DDPGと呼ばれるマルコフ近似を用いた連続時間決定的政策勾配学習を定式化する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study stochastic control of multivariate Hawkes-driven stochastic differential equations with machine learning algorithms in a non-Markovian setting. Due to the path dependence of the memory of the Hawkes intensity, this problem does not fall within classical stochastic control theory outside particular Markovian kernels. We first develop a finite-dimensional Markovianization procedure and algorithm to approximate multivariate Hawkes processes with mixtures of exponential kernels. We prove the convergence of the Markovianized approximation of the Hawkes process, its intensity, and the value of the problem to the original non-Markovian processes and the value of the primal problem. We then formulate continuous-time deterministic policy gradient learning on the Markovianized approximation of the problem, called Hawkes-CT DDPG. We propose a model-free algorithm to solve the non-Markovian Hawkes-driven optimization by observing only the event times of the process, the realization of the solution to the SDE, and a chosen set of decay filters, while the Hawkes kernel coefficients remain unknown. We compare our continuous time reinforcement learning Hawkes-CT DDPG method with discrete time reinforcement learning techniques under three different types of kernels: simple exponential, Erlang, and power-law kernels.
- Abstract(参考訳): 非マルコフ的条件下で,多変量ホークス駆動確率微分方程式と機械学習アルゴリズムの確率制御について検討した。
ホークス強度の記憶の経路依存のため、この問題は特定のマルコフ核の外側の古典的確率制御理論には属さない。
まず,有限次元マルコビアン化法とアルゴリズムを開発し,指数核の混合による多変量ホークス過程を近似する。
我々は、ホークス過程のマルコフ化近似の収束、その強度、問題の値が元の非マルコフ過程と原始問題の値に収束していることを証明する。
次に,Hawkes-CT DDPGと呼ばれるマルコフ近似を用いた連続時間決定的政策勾配学習を定式化する。
我々は,プロセスの事象時間,SDEへの解の実現,および選択された崩壊フィルタの集合を観測し,非マルコフ的ホークス駆動最適化の解法を提案する。
我々は,Hawkes-CT DDPG法と離散時間強化学習法を,単純指数,Erlang,パワーローカーネルの3種類のカーネルで比較した。
関連論文リスト
- Learning Ergodic Dynamical Systems from a Finite Trajectory [10.59816347247158]
時間均質マルコフ過程を定義する離散時間自律システムについて検討する。
まず、非線形最小二乗による最適一段階予測関数の推定に焦点をあてる。
フレームワークを高階システムや有限状態空間に拡張する。
論文 参考訳(メタデータ) (2026-07-24T15:21:51Z) - Regret and Sample Complexity of Online Q-Learning via Concentration of Stochastic Approximation with Time-Inhomogeneous Markov Chains [23.565936864449636]
無限水平割引マルコフ決定過程における古典的オンラインQ-ラーニングに対する最初の高い確率的後悔を示す。
十分な大きなギャップでは、後悔はサブリニアであり、小さなギャップでは劣化し、線形成長に近づく。
論文 参考訳(メタデータ) (2026-02-18T08:47:07Z) - Better LMO-based Momentum Methods with Second-Order Information [48.580700968416444]
Hessian-Corrected Momentum (HCM) は運動量収束率の向上を目的としている。
Hessian-Corrected Momentum は問題の幾何学に適応し、従来の運動量よりも速い速度を達成することができる。
我々はHCMを統合することでLinear Minimization Oracleフレームワークを拡張し、緩和された滑らかさと任意の規範設定の下で収束保証を提供する。
論文 参考訳(メタデータ) (2025-12-15T11:43:09Z) - Quartic quantum speedups for community detection [84.14713515477784]
我々は,準量子スピードアップを実現するハイパーグラフコミュニティ検出のための量子アルゴリズムを開発した。
提案アルゴリズムは,従来検討されていた PCA や $p$XORSAT といった問題を超えて拡張した Kikuchi 法に基づいている。
論文 参考訳(メタデータ) (2025-10-09T17:35:17Z) - Variational Quantum Optimization with Continuous Bandits [1.6686882054452727]
本稿では,連続バンディットによる変分量子アルゴリズム(VQA)の新たなアプローチを提案する。
VQAは、量子回路のパラメータを古典的なアルゴリズムで最適化するハイブリッド量子古典アルゴリズムのクラスである。
論文 参考訳(メタデータ) (2025-02-06T12:24:30Z) - The ODE Method for Stochastic Approximation and Reinforcement Learning with Markovian Noise [23.71604056844816]
近似アルゴリズムを解析する根本的な課題は、その安定性を確立することである。
我々は、マルティンゲール差分雑音設定からマルコフ雑音設定へ有界な安定性に対するボルカール・メインの定理を拡張した。
論文 参考訳(メタデータ) (2024-01-15T17:20:17Z) - Stochastic-Constrained Stochastic Optimization with Markovian Data [2.1756081703276]
マルコフ連鎖からデータサンプルが引き出され、したがって独立性がなく、同一に分布しないような環境について検討する。
ドリフト・プラス・ペナルティの2つの変種を提案する。ひとつは、基礎となるマルコフ鎖の混合時間を知る場合である。
我々のアルゴリズムは、制約関数列がマルコフ連鎖に従うような制約付きオンライン凸最適化のより一般的な設定に適用できる。
論文 参考訳(メタデータ) (2023-12-07T14:09:27Z) - First Order Methods with Markovian Noise: from Acceleration to Variational Inequalities [91.46841922915418]
本稿では,一階変分法の理論解析のための統一的アプローチを提案する。
提案手法は非線形勾配問題とモンテカルロの強い問題の両方をカバーする。
凸法最適化問題の場合、オラクルに強く一致するような境界を与える。
論文 参考訳(メタデータ) (2023-05-25T11:11:31Z) - Learning to Optimize with Stochastic Dominance Constraints [103.26714928625582]
本稿では,不確実量を比較する問題に対して,単純かつ効率的なアプローチを開発する。
我々はラグランジアンの内部最適化をサロゲート近似の学習問題として再考した。
提案したライト-SDは、ファイナンスからサプライチェーン管理に至るまで、いくつかの代表的な問題において優れた性能を示す。
論文 参考訳(メタデータ) (2022-11-14T21:54:31Z) - A Dynamical System View of Langevin-Based Non-Convex Sampling [44.002384711340966]
非サンプリングは機械学習における重要な課題であり、ディープラーニングにおける非レート最適化の中心であり、その重要性を近似する。
既存の保証は通常、より望ましい最終段階の反復よりも平均距離のみを保持する。
我々は、理論システムからいくつかのツールを活用することにより、上記の問題を解消する新しいフレームワークを開発する。
論文 参考訳(メタデータ) (2022-10-25T09:43:36Z) - ARISE: ApeRIodic SEmi-parametric Process for Efficient Markets without
Periodogram and Gaussianity Assumptions [91.3755431537592]
我々は、効率的な市場を調査するためのApeRI-miodic(ARISE)プロセスを提案する。
ARISEプロセスは、いくつかの既知のプロセスの無限サムとして定式化され、周期スペクトル推定を用いる。
実際に,実世界の市場の効率性を明らかにするために,ARISE関数を適用した。
論文 参考訳(メタデータ) (2021-11-08T03:36:06Z) - Finite-Time Convergence Rates of Nonlinear Two-Time-Scale Stochastic
Approximation under Markovian Noise [2.0305676256390934]
2つの連結非線形作用素の根を探すためのシミュレーションベースアプローチである,いわゆる2時間スケール近似について検討する。
特に、マルコフプロセスによってメソッド内のデータが生成されるシナリオを考える。
演算子とマルコフ過程に関するかなり標準的な仮定の下で、この方法によって生成される平均二乗誤差の収束率を 0 に特徴づける公式を提供する。
論文 参考訳(メタデータ) (2021-04-04T15:19:19Z) - Momentum Q-learning with Finite-Sample Convergence Guarantee [49.38471009162477]
本稿では,有限サンプル保証を用いたモーメントに基づくQ-ラーニングアルゴリズムのクラスを解析する。
線形関数近似とマルコフサンプリングによるMomentumQの収束保証を確立する。
提案したMomentumQが他のモーメントベースのQ-ラーニングアルゴリズムより優れていることを示す。
論文 参考訳(メタデータ) (2020-07-30T12:27:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。