論文の概要: Trajectory-Regularized Stochastic Optimal Control via KL Divergence
- arxiv url: http://arxiv.org/abs/2607.22201v1
- Date: Fri, 24 Jul 2026 11:15:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.117063
- Title: Trajectory-Regularized Stochastic Optimal Control via KL Divergence
- Title(参考訳): KL分割による軌道規則化確率最適制御
- Abstract要約: トラジェクトリ規則化最適制御(TRSOC)を導入し、標準最適制御(SOC)を強化した。
対応するハミルトン・ヤコビ・ベルマン方程式を導出し、最適ポリシーを特徴づける。
実験により、正規化パラメータは性能駆動型と参照保存型の間のトレードオフを誘導することが示された。
- 参考スコア(独自算出の注目度): 8.729531978655737
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce trajectory-regularized stochastic optimal control (TRSOC), which augments standard stochastic optimal control (SOC) with a Kullback--Leibler (KL) divergence between controlled and reference trajectory distributions. Using Girsanov's theorem, the trajectory KL reduces to a quadratic drift mismatch penalty, yielding a modified running cost that preserves the dynamic programming (DP) structure. We derive the corresponding Hamilton--Jacobi--Bellman (HJB) equation and characterize the optimal policy. In the linear-quadratic (LQ) setting, the formulation admits a closed-form solution with an augmented control cost. Experiments show that the regularization parameter induces a trade-off between performance-driven and reference-preserving behavior, including cases with reference dynamics learned from offline data.
- Abstract(参考訳): 我々は,標準確率的最適制御(SOC)をKullback-Leibler (KL) で拡張したトラジェクティブ正規化確率論的最適制御(TRSOC)を導入する。Girsanovの定理を用いて,トラジェクティブKLは2次ドリフトミスマッチペナルティに還元され,動的プログラミング(DP)構造を保った修正ランニングコストが得られ,対応するハミルトン・ヤコビ・ベルマン方程式(HJB)が導出され,最適ポリシーが特徴づけられる。
リニアクワッドラティック(LQ)設定では、定式化は制御コストの増大を伴う閉形式解を許容する。
実験によると、正規化パラメータは、オフラインデータから学んだ参照ダイナミクスを持つケースを含む、パフォーマンス駆動と参照保存の動作のトレードオフを誘導する。
関連論文リスト
- Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning [58.088509347353465]
強化学習(Reinforcement Learning, RL)は、言語モデルトレーニングにおいて広く使われている。
我々は,このトレードオフに明確な統計的解釈を与えるゲーム理論の枠組みを提案する。
論文 参考訳(メタデータ) (2026-07-29T00:19:09Z) - Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space [99.30250506439678]
本研究は,言語生成を最適制御問題として再検討する。
自己回帰モデルと拡散モデルを分析するための統一された理論的な視点を提供する。
論文 参考訳(メタデータ) (2026-05-14T08:13:43Z) - Conservative Continuous-Time Treatment Optimization [9.553261527696067]
不規則な患者軌道から治療を最適化するための保守的連続時間制御フレームワークを開発した。
ベンチマークデータセットの実験では、非保守的なベースラインに比べて堅牢性とパフォーマンスが向上した。
論文 参考訳(メタデータ) (2026-03-17T17:01:23Z) - Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - Terminally constrained flow-based generative models from an optimal control perspective [32.87833798690545]
フローベースモデルを用いた端末最適制御(TOCFlow)は,事前学習したフローに対する幾何対応のサンプリング時間誘導手法である。
制御ペナルティが増加するにつれて、制御されたプロセスは基準分布を回復するが、ペナルティが消えるにつれて、終端法則は制約多様体への一般化されたワッサーシュタイン射影に収束する。
等式,不等式,大域的統計的制約にまたがる3つの高次元科学的課題におけるTOCFlowの評価を行った。
論文 参考訳(メタデータ) (2026-01-14T13:32:15Z) - Unifying Entropy Regularization in Optimal Control: From and Back to Classical Objectives via Iterated Soft Policies and Path Integral Solutions [4.934817254755008]
本稿では,Kulback-Leibler正則化のレンズによる最適制御の定式化について統一的な視点で検討する。
我々は、政策と移行に対するKLの罰則を分離し、それらを独立重み付けする中心的な問題を提案する。
これらのソフト・ポリティクスの定式化は、元の SOC と RSOC の問題を大きくし、これは、正規化された解を反復して元の解を回収できることを意味する。
論文 参考訳(メタデータ) (2025-12-05T19:31:39Z) - Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning [56.47948583452555]
固定ステップのEulerスキームによるフローマッチング推論プロセスの離散化は,最適輸送から変化するJordan-Kinderlehrer-Otto原理と整合する,というキーインサイトに基づいて,SWFP(Stepwise Flow Policy)フレームワークを紹介した。
SWFPは、大域的な流れを、プロキシメート分布間の小さな漸進的な変換の列に分解する。
この分解は、小さな流れブロックのカスケードを介して事前訓練された流れを微調整する効率的なアルゴリズムを導き、大きな利点をもたらす。
論文 参考訳(メタデータ) (2025-10-17T07:43:51Z) - Stochastic Optimal Control Matching [53.156277491861985]
最適制御のための新しい反復拡散最適化(IDO)技術である最適制御マッチング(SOCM)を導入する。
この制御は、一致するベクトル場に適合しようとすることで、最小二乗問題を通じて学習される。
実験により,本アルゴリズムは最適制御のための既存のすべての IDO 手法よりも低い誤差を実現する。
論文 参考訳(メタデータ) (2023-12-04T16:49:43Z) - Gaussian Process-based Min-norm Stabilizing Controller for
Control-Affine Systems with Uncertain Input Effects and Dynamics [90.81186513537777]
本稿では,この問題の制御・アフィン特性を捉えた新しい化合物カーネルを提案する。
この結果の最適化問題は凸であることを示し、ガウス過程に基づく制御リャプノフ関数第二次コーンプログラム(GP-CLF-SOCP)と呼ぶ。
論文 参考訳(メタデータ) (2020-11-14T01:27:32Z) - Adaptive Control and Regret Minimization in Linear Quadratic Gaussian
(LQG) Setting [91.43582419264763]
我々は不確実性に直面した楽観主義の原理に基づく新しい強化学習アルゴリズムLqgOptを提案する。
LqgOptはシステムのダイナミクスを効率的に探索し、モデルのパラメータを信頼区間まで推定し、最も楽観的なモデルのコントローラをデプロイする。
論文 参考訳(メタデータ) (2020-03-12T19:56:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。