論文の概要: Generalized Kalman filter based temporal difference reinforcement learning
- arxiv url: http://arxiv.org/abs/2607.20010v2
- Date: Thu, 23 Jul 2026 08:57:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 16:18:54.643422
- Title: Generalized Kalman filter based temporal difference reinforcement learning
- Title(参考訳): 一般化カルマンフィルタを用いた時間差強化学習
- Abstract要約: 本稿では,条件付き予測理論に基づく時間差強化学習フレームワークを提案する。
線形ガウスの仮定に依存する古典的なカルマンに基づく時間差分学習とは異なり、提案された定式化は条件付き予測フレームワークから直接導かれる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this paper, we present a generalized temporal-difference (TD) reinforcement learning framework based on the theory of conditional expectations. The value and action-value (Q-value) functions are treated as uncertain quantities, and their estimation is formulated as a stochastic inference problem. Unlike classical Kalman-based temporal-difference learning, which relies on linear-Gaussian assumptions, the proposed formulation is derived directly from the conditional expectation framework and naturally extends to nonlinear models and non-Gaussian probability distributions. The proposed method recursively estimates not only the conditional expectation of the value function but also its second probabilistic moment, thereby quantifying the uncertainty associated with the learned value function throughout the learning process. To obtain a computationally tractable algorithm, the stochastic problem is discretized using either polynomial chaos expansions or ensemble-based approximations, providing efficient representations of the underlying random variables. The proposed framework is demonstrated on two optimal control problems: a linear mass--spring--damper system and a nonlinear heat conduction problem in a closed cavity. The numerical examples illustrate the capability of the proposed method to accurately estimate both the value function and its associated uncertainty, while extending classical Kalman-based temporal-difference learning to a broader class of stochastic systems.
- Abstract(参考訳): 本稿では,条件付き予測理論に基づく時間差強化学習フレームワークを提案する。
値と作用値(Q値)関数は不確実量として扱われ、その推定は確率的推論問題として定式化される。
古典カルマンに基づく時間差分学習とは違い、提案された定式化は条件付き予測フレームワークから直接導出され、非線形モデルや非ガウス確率分布に自然に拡張される。
提案手法は,値関数の条件付き期待だけでなく,その第2の確率モーメントも再帰的に推定し,学習過程を通じて学習値関数に関連する不確実性を定量化する。
多項式カオス展開またはアンサンブルに基づく近似を用いて確率問題を離散化し、基礎となる確率変数の効率的な表現を提供する。
提案手法は, 閉空洞内における非線形熱伝導問題と線形質量-ばね-ダッパー系と非線形熱伝導問題という2つの最適制御問題について実証した。
この数値的な例は,古典カルマンに基づく時間差分学習をより広い確率体系に拡張しつつ,値関数と関連する不確かさの両方を正確に推定する手法の能力を示している。
関連論文リスト
- Non-Parametric Rehearsal Learning via Conditional Mean Embeddings [88.89267783967263]
本研究では,不必要な未来(AUF)問題をテキスト化するための非パラメトリックリハーサル学習手法を提案する。
具体的には、カーネル機械を用いてAUFの目的を、動作誘起分布変化から所望性モデリングを遠ざける統一表現に再構成する。
論文 参考訳(メタデータ) (2026-05-09T15:30:52Z) - Extraction of informative statistical features in the problem of forecasting time series generated by It{ô}-type processes [65.01025489527173]
時系列の振舞いの観測正則性の統計的に調整された混合型モデルのパラメータを用いる。
付加的な統計的特徴を用いることで予測が向上することを示す。
論文 参考訳(メタデータ) (2026-04-18T06:31:21Z) - Malliavin Calculus with Weak Derivatives for Counterfactual Stochastic Optimization [16.179901221618156]
本研究では,不特定雑音勾配情報に基づく条件損失関数の対実的最適化について検討する。
拡散過程の条件損失函数は、スコロホッド積分として正確に表現され、古典的モンテカルロに匹敵する分散をもたらすことを示す。
論文 参考訳(メタデータ) (2025-09-30T21:37:54Z) - A Functional Model Method for Nonconvex Nonsmooth Conditional Stochastic Optimization [0.0]
本稿では, 基底乱ベクトルの非線形関数の期待値と, 基底乱ベクトルに依存する他の関数の条件付き期待値を含む最適化問題を考察する。
本研究では, 外部関数が滑らかで, 内部関数が異なる非制約学習問題に対して, 特殊な単一スケール法を提案する。
論文 参考訳(メタデータ) (2024-05-17T14:35:50Z) - Selective Nonparametric Regression via Testing [54.20569354303575]
本研究では,所定の点における条件分散の値に関する仮説を検証し,留置手順を開発する。
既存の手法とは異なり、提案手法は分散自体の値だけでなく、対応する分散予測器の不確実性についても考慮することができる。
論文 参考訳(メタデータ) (2023-09-28T13:04:11Z) - Semi-Parametric Inference for Doubly Stochastic Spatial Point Processes: An Approximate Penalized Poisson Likelihood Approach [3.085995273374333]
二重確率点過程は、ランダム強度関数の実現を前提とした不均一過程として空間領域上の事象の発生をモデル化する。
既存の二重確率空間モデルの実装は、計算的に要求され、しばしば理論的な保証が制限され、または制限的な仮定に依存している。
論文 参考訳(メタデータ) (2023-06-11T19:48:39Z) - Non-Parametric Learning of Stochastic Differential Equations with Non-asymptotic Fast Rates of Convergence [65.63201894457404]
非線形微分方程式のドリフトと拡散係数の同定のための新しい非パラメトリック学習パラダイムを提案する。
鍵となる考え方は、基本的には、対応するフォッカー・プランク方程式のRKHSに基づく近似をそのような観測に適合させることである。
論文 参考訳(メタデータ) (2023-05-24T20:43:47Z) - The Implicit Delta Method [61.36121543728134]
本稿では,不確実性のトレーニング損失を無限に正規化することで機能する,暗黙のデルタ法を提案する。
有限差分により無限小変化が近似された場合でも, 正則化による評価の変化は評価推定器の分散に一定であることを示す。
論文 参考訳(メタデータ) (2022-11-11T19:34:17Z) - Data-Driven Influence Functions for Optimization-Based Causal Inference [105.5385525290466]
統計的汎関数に対するガトー微分を有限差分法で近似する構成的アルゴリズムについて検討する。
本研究では,確率分布を事前知識がないが,データから推定する必要がある場合について検討する。
論文 参考訳(メタデータ) (2022-08-29T16:16:22Z) - Uncertainty Quantification for Traffic Forecasting: A Unified Approach [21.556559649467328]
不確実性は時系列予測タスクに不可欠な考慮事項である。
本研究では,交通予測の不確かさの定量化に焦点をあてる。
STUQ(Deep S-Temporal Uncertainity Quantification)を開発した。
論文 参考訳(メタデータ) (2022-08-11T15:21:53Z) - Probabilistic learning inference of boundary value problem with
uncertainties based on Kullback-Leibler divergence under implicit constraints [0.0]
本稿では,境界値問題に対する後続確率モデルを事前確率モデルから推定できる確率論的学習推定法を提案する。
制約を表す暗黙マッピングの統計的代理モデルを導入する。
第2部では、提案した理論を説明するために応用を提示し、また、不均一な線形弾性媒体の3次元均質化への寄与も示している。
論文 参考訳(メタデータ) (2022-02-10T16:00:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。