論文の概要: Provable Offline Reinforcement Learning for Structured Cyclic MDPs
- arxiv url: http://arxiv.org/abs/2602.11679v1
- Date: Thu, 12 Feb 2026 07:53:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-13 21:07:25.707236
- Title: Provable Offline Reinforcement Learning for Structured Cyclic MDPs
- Title(参考訳): 構造化周期型MDPの確率的オフライン強化学習
- Abstract要約: 多段階決定問題に対する新しい循環マルコフ決定プロセス(MDP)フレームワークを提案する。
我々はこの原理を、理論解析と解釈を可能にする適合Qイテレーションの拡張であるCycleFQIとしてインスタンス化する。
シミュレーションおよび実世界の1型糖尿病データセットの実験は、CycleFQIの有効性を示す。
- 参考スコア(独自算出の注目度): 4.217526873611589
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce a novel cyclic Markov decision process (MDP) framework for multi-step decision problems with heterogeneous stage-specific dynamics, transitions, and discount factors across the cycle. In this setting, offline learning is challenging: optimizing a policy at any stage shifts the state distributions of subsequent stages, propagating mismatch across the cycle. To address this, we propose a modular structural framework that decomposes the cyclic process into stage-wise sub-problems. While generally applicable, we instantiate this principle as CycleFQI, an extension of fitted Q-iteration enabling theoretical analysis and interpretation. It uses a vector of stage-specific Q-functions, tailored to each stage, to capture within-stage sequences and transitions between stages. This modular design enables partial control, allowing some stages to be optimized while others follow predefined policies. We establish finite-sample suboptimality error bounds and derive global convergence rates under Besov regularity, demonstrating that CycleFQI mitigates the curse of dimensionality compared to monolithic baselines. Additionally, we propose a sieve-based method for asymptotic inference of optimal policy values under a margin condition. Experiments on simulated and real-world Type 1 Diabetes data sets demonstrate CycleFQI's effectiveness.
- Abstract(参考訳): 循環型マルコフ決定プロセス (MDP) フレームワークを導入し, サイクル全体にわたる異種ステージ固有力学, 遷移, 割引係数を用いた多段階決定問題を提案する。
この設定では、オフライン学習は難しい。任意の段階でポリシーを最適化することは、その後のステージの状態分布をシフトさせ、サイクル全体にわたってミスマッチを伝播させる。
これを解決するために,循環過程を段階的にサブプロブレムに分解するモジュラー構造フレームワークを提案する。
一般に応用されるが、この原理を理論解析と解釈を可能にする適合Q-イテレーションの拡張であるCycleFQIとしてインスタンス化する。
ステージごとに調整された、ステージ固有のQ-関数のベクトルを使用して、ステージ内のシーケンスとステージ間の遷移をキャプチャする。
このモジュール設計は部分的な制御を可能にし、いくつかのステージを最適化し、他のステージは事前に定義されたポリシーに従うことができる。
有限サンプル準最適誤差境界を確立し、ベソフ正則の下で大域収束率を導出し、CycleFQIがモノリシックベースラインと比較して次元の呪いを緩和することを示した。
さらに,マージン条件下での最適政策値の漸近的推定法を提案する。
シミュレーションおよび実世界の1型糖尿病データセットの実験は、CycleFQIの有効性を示す。
関連論文リスト
- From Noise to Control: Parameterized Diffusion Policies [54.941343992110426]
本研究では,学習行動多様体に埋め込まれた連続パラメータに条件付き拡散ポリシーを学習するためのフレームワークを提案する。
政策重みを更新することなく、既知の戦略間の円滑な距離と、新しい制約への効率的な適応を可能にする。
論文 参考訳(メタデータ) (2026-05-29T20:21:50Z) - Towards Efficient LLMs Annealing with Principled Sample Selection [8.369375549294046]
最適収束は、異なる固有方向にわたる不均一な制約を満たすために勾配更新を必要とする。
本稿では,アニーリング段階におけるサンプル選択を制約付き最適化問題として再構成する新しいフレームワークであるDiReCTを提案する。
論文 参考訳(メタデータ) (2026-05-29T11:42:55Z) - Revitalizing the Beginning: Avoiding Storage Dependency for Model Merging in Continual Learning [57.10440766103372]
Trajectory Regularized Merging (TRM) は、拡張されたトラジェクトリ部分空間内の最適化プロセスとしてマージフェーズを再構成するフレームワークである。
本フレームワークは,タスクアライメント,予測整合性,勾配応答性といった3つの相乗的目標を統合し,統合モデルの履歴安定性と再活性化最適化のダイナミクスを同時に保存する。
論文 参考訳(メタデータ) (2026-05-08T14:07:32Z) - Truncated Rectified Flow Policy for Reinforcement Learning with One-Step Sampling [3.6266846456338695]
最大エントロピー強化学習(MaxEnt RL)がシーケンシャル意思決定の標準フレームワークとなっている。
本稿では,ハイブリッド決定論的確率論的アーキテクチャに基づくフレームワークであるTrncated Rectified Flow Policyを提案する。
論文 参考訳(メタデータ) (2026-04-10T09:44:28Z) - An Optimal Control Approach To Transformer Training [7.136933021609078]
重要な構造的制約を尊重するトランスフォーマートレーニングに対する厳密な最適制御理論アプローチを開発する。
確率測度に引き上げることによって、完全に観測されたマルコフ決定過程(MDP)が生成されることを示す。
トランスフォーマーを訓練するために,状態空間,確率測度,行動空間を定量化することにより,昇降型MDPの3次元量子化訓練手順を提案する。
論文 参考訳(メタデータ) (2026-03-10T12:17:48Z) - Avoiding Premature Collapse: Adaptive Annealing for Entropy-Regularized Structural Inference [1.7523718031184992]
この障害の基本的なメカニズムは、 textbf Premature Mode Collapseである。
提案手法は,適応型スケジューリングアルゴリズムであるtextbfEfficient Piecewise Hybrid Adaptive Stability Control (EPH-ASC) で,推論過程の安定性をモニタする。
論文 参考訳(メタデータ) (2026-01-30T14:47:18Z) - Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning [56.47948583452555]
固定ステップのEulerスキームによるフローマッチング推論プロセスの離散化は,最適輸送から変化するJordan-Kinderlehrer-Otto原理と整合する,というキーインサイトに基づいて,SWFP(Stepwise Flow Policy)フレームワークを紹介した。
SWFPは、大域的な流れを、プロキシメート分布間の小さな漸進的な変換の列に分解する。
この分解は、小さな流れブロックのカスケードを介して事前訓練された流れを微調整する効率的なアルゴリズムを導き、大きな利点をもたらす。
論文 参考訳(メタデータ) (2025-10-17T07:43:51Z) - On the System Theoretic Offline Learning of Continuous-Time LQR with Exogenous Disturbances [3.701656361145375]
線形二次規制 (LQR) 戦略のオフライン設計を不確実な乱れを伴う解析を行う。
我々のアプローチは、適応動的プログラミングの基本的な学習ベースのフレームワークの上に構築されている。
論文 参考訳(メタデータ) (2025-09-20T17:14:27Z) - Learning Discrete Bayesian Networks with Hierarchical Dirichlet Shrinkage [52.914168158222765]
我々はDBNを学習するための包括的なベイズ的フレームワークについて詳述する。
我々は、並列ランゲヴィン提案を用いてマルコフ連鎖モンテカルロ(MCMC)アルゴリズムを新たに提案し、正確な後続サンプルを生成する。
原発性乳癌検体から予後ネットワーク構造を明らかにするために本手法を適用した。
論文 参考訳(メタデータ) (2025-09-16T17:24:35Z) - A Cycle-Consistency Constrained Framework for Dynamic Solution Space Reduction in Noninjective Regression [4.04042026249306]
本稿では,サイクル一貫性に基づくデータ駆動トレーニングフレームワークを提案する。
正規化合成およびシミュレーションデータセットの実験により,提案手法が0.003未満のサイクル再構成誤差を達成することを示した。
このフレームワークは手動による介入への依存を著しく減らし、非インジェクティブ回帰タスクの潜在的な利点を示す。
論文 参考訳(メタデータ) (2025-07-07T04:28:01Z) - Q-function Decomposition with Intervention Semantics with Factored Action Spaces [51.01244229483353]
元の作用空間の低次元射影部分空間上で定義されるQ-函数を考察し、分解されたQ-函数の不偏性について考察する。
これにより、標準モデルフリー強化学習アルゴリズムにおいて、予測Q関数を用いてQ関数を近似する動作分解強化学習と呼ばれる一般的なスキームが導かれる。
論文 参考訳(メタデータ) (2025-04-30T05:26:51Z) - Learning Dynamic Representations via An Optimally-Weighted Maximum Mean Discrepancy Optimization Framework for Continual Learning [16.10753846850319]
継続的な学習は、モデルを永続的に取得し、保持することを可能にする。
悲惨な忘れ物は モデルパフォーマンスを著しく損なう
本稿では,表現変更に対する罰則を課す,OPMMD(Optimally-Weighted Mean Discrepancy)と呼ばれる新しいフレームワークを紹介する。
論文 参考訳(メタデータ) (2025-01-21T13:33:45Z) - Performative Reinforcement Learning with Linear Markov Decision Process [14.75815792682734]
提案手法がマルコフ決定過程の報酬と遷移の両方に影響を及ぼすような表現的強化学習の設定について検討する。
大規模MDPの主要な理論モデルであるEmphlinear Markov決定過程を一般化する。
論文 参考訳(メタデータ) (2024-11-07T23:04:48Z) - Ensemble Kalman Filtering Meets Gaussian Process SSM for Non-Mean-Field and Online Inference [47.460898983429374]
我々は,非平均場(NMF)変動推定フレームワークにアンサンブルカルマンフィルタ(EnKF)を導入し,潜在状態の後方分布を近似する。
EnKFとGPSSMのこの新しい結婚は、変分分布の学習における広範なパラメータ化の必要性をなくすだけでなく、エビデンスの下限(ELBO)の解釈可能でクローズドな近似を可能にする。
得られたEnKF支援オンラインアルゴリズムは、データ適合精度を確保しつつ、モデル正規化を組み込んで過度適合を緩和し、目的関数を具現化する。
論文 参考訳(メタデータ) (2023-12-10T15:22:30Z) - Provable Guarantees for Generative Behavior Cloning: Bridging Low-Level
Stability and High-Level Behavior [51.60683890503293]
生成モデルを用いた複雑な専門家による実演の行動クローニングに関する理論的枠組みを提案する。
任意の専門的軌跡の時間ごとのステップ分布に一致するトラジェクトリを生成することができることを示す。
論文 参考訳(メタデータ) (2023-07-27T04:27:26Z) - Multi-Objective Policy Gradients with Topological Constraints [108.10241442630289]
本稿では, PPOアルゴリズムの簡単な拡張により, TMDPにおけるポリシー勾配に対する新しいアルゴリズムを提案する。
シミュレーションと実ロボットの両方の目的を任意に並べた実世界の多目的ナビゲーション問題に対して,これを実証する。
論文 参考訳(メタデータ) (2022-09-15T07:22:58Z) - Revisiting GANs by Best-Response Constraint: Perspective, Methodology,
and Application [49.66088514485446]
ベストレスポンス制約(Best-Response Constraint、BRC)は、ジェネレータのディスクリミネータへの依存性を明示的に定式化する一般的な学習フレームワークである。
モチベーションや定式化の相違があっても, フレキシブルBRC法により, 様々なGANが一様に改善できることが示される。
論文 参考訳(メタデータ) (2022-05-20T12:42:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。