論文の概要: Guided Riemannian Optimization (GuRO): Bridging Model Predictive Control and Decision Transformers
- arxiv url: http://arxiv.org/abs/2608.23204v2
- Date: Tue, 25 Aug 2026 10:14:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.243616
- Title: Guided Riemannian Optimization (GuRO): Bridging Model Predictive Control and Decision Transformers
- Title(参考訳): ガイド付きリーマン最適化(GuRO):ブリッジングモデル予測制御と決定変換器
- Authors: Hossein Abdi, Satya Prakash Dash, Mingfei Sun,
- Abstract要約: 高次元非線形システムの意思決定は、ロボット工学における中心的な課題である。
モデル予測制御(MPC)のようなモデルベースの手法は、サンプル効率と解釈可能性を提供するが、高いサンプル不安定な最適化に悩まされている。
本稿では,MPCをシーケンス決定フレームワークに統合する新しいフレームワークを提案する。
- 参考スコア(独自算出の注目度): 2.3133509474600964
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Decision-making in high-dimensional, nonlinear systems remains a central challenge in robotics. While model-based methods like Model Predictive Control (MPC) offer sample efficiency and interpretability, their performance degrades when the dynamics model is inaccurate or long-horizon predictions are required. Conversely, model-free reinforcement learning (RL) learns policies directly from interaction but suffers from high sample complexity and unstable optimization. Recent advances in sequence modeling have inspired transformer-based decision-making frameworks that can unify MPC and RL, but their training typically faces significant optimization challenges due to highly non-convex loss landscapes. In this work, we propose a novel framework that integrates MPC with RL in a sequence decision-making framework and leverages a curvature-aware optimization to efficiently tackle non-convex loss landscapes. MPC provides predictions of locally optimal trajectories that guide the decision transformer, removing the need for extensive offline pretraining. To address the slow and unstable convergence of traditional optimizers, we train the policy in a Riemannian parameter space using an efficient Riemannian (curvature-aware) method, leading to faster and more robust optimization. We evaluate our framework on high-dimensional quadruped control tasks and demonstrate consistent improvements over strong baselines, including TRPO, SAC, and Online Decision Transformer, achieving higher returns and faster convergence.
- Abstract(参考訳): 高次元非線形システムの意思決定は、ロボット工学における中心的な課題である。
モデル予測制御(MPC)のようなモデルベースの手法は、サンプル効率と解釈可能性を提供するが、その性能は、力学モデルが不正確な場合や長距離予測が必要な場合に低下する。
逆に、モデルフリー強化学習(RL)は、相互作用から直接ポリシーを学ぶが、高いサンプルの複雑さと不安定な最適化に悩まされる。
シーケンスモデリングの最近の進歩は、MPCとRLを統一できるトランスフォーマーベースの意思決定フレームワークにインスピレーションを与えたが、そのトレーニングは通常、非凸なロスランドスケープのために大きな最適化課題に直面している。
本研究では,MPC と RL を逐次決定フレームワークに統合する新たなフレームワークを提案する。
MPCは、決定変換器を誘導する局所最適軌道の予測を提供し、広範囲なオフライン事前訓練の必要性を取り除く。
従来のオプティマイザの緩やかで不安定な収束に対処するために、効率的なリーマン(曲率認識)法を用いてリーマンパラメータ空間でポリシーを訓練し、より速くより堅牢な最適化をもたらす。
我々は,高次元2次制御タスクの枠組みを評価し,TRPO, SAC, Online Decision Transformerなどの強力なベースラインに対する一貫した改善を示し,高いリターンと高速収束を実現した。
関連論文リスト
- Deep Learning-Accelerated Surrogate Optimization for High-Dimensional Well Control in Stress-Sensitive Reservoirs [0.0]
応力に敏感な非伝統的な貯水池における生産最適化は, 圧力駆動流と破壊導電率低下とマトリックス透水率の非線形トレードオフによって制御される。
本研究では,高次元ウェルコントロールのためのディープラーニングに基づくサロゲート最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-01T01:04:08Z) - Multi-Objective Reward and Preference Optimization: Theory and Algorithms [3.316593788543852]
この論文は、制御、嗜好学習、大規模言語モデルのアライメントを越えて制約付き強化学習(RL)を進める理論的枠組みとアルゴリズムを開発する。
ACPO, e-COP, warmPref-PS, PSPL, MOPOは, 平均コスト, エピソード, 嗜好駆動のパラダイムでRLを推し進める。
集合的に、論文はRLを平均的コスト、エピソード、および嗜好駆動のパラダイムで統一し、理論的な進歩と、安全で整合した意思決定のための実践的なツールを提供する。
論文 参考訳(メタデータ) (2025-12-11T12:51:21Z) - A General and Streamlined Differentiable Optimization Framework [10.851559133306196]
本稿では,Julia最適化フレームワークのためのDiffOptlインタフェースを提案する。
ファーストクラスのJuMPネイティブAPIでは、ユーザが名前付きパラメータのデリバティブを直接取得することができる。
その結果、ルーチンの区別は、標準のJuMPモデリングプラクティスから逸脱することなく、実験、学習、設計を行うためのトレーニングツールになり得ることが示される。
論文 参考訳(メタデータ) (2025-10-29T21:42:36Z) - TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making [75.29820290660065]
本稿では,効果的な具体的意思決定のための思考中心推論最適化(TCPO)を提案する。
モデルの中間的推論プロセスの整合性を強調し、モデル劣化の問題を緩和する。
ALFWorld環境での実験では、平均成功率は26.67%であり、RL4VLMよりも6%向上している。
論文 参考訳(メタデータ) (2025-09-10T11:16:21Z) - Intersection of Reinforcement Learning and Bayesian Optimization for Intelligent Control of Industrial Processes: A Safe MPC-based DPG using Multi-Objective BO [0.0]
Model Predictive Control (MPC)ベースのReinforcement Learning (RL)は、Deep Neural Network (DNN)ベースのRL手法の、構造化された解釈可能な代替手段を提供する。
標準MPC-RLアプローチは、収束の遅さ、パラメータ化の制限による最適条件学習、オンライン適応時の安全性の問題に悩まされることが多い。
MPC-RLと多目的ベイズ最適化(MOBO)を統合した新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-14T02:31:52Z) - Preference Optimization for Combinatorial Optimization Problems [54.87466279363487]
強化学習(Reinforcement Learning, RL)は、ニューラルネットワーク最適化のための強力なツールとして登場した。
大幅な進歩にもかかわらず、既存のRLアプローチは報酬信号の減少や大規模な行動空間における非効率な探索といった課題に直面している。
統計的比較モデルを用いて定量的報酬信号を定性的選好信号に変換する新しい手法であるPreference Optimizationを提案する。
論文 参考訳(メタデータ) (2025-05-13T16:47:00Z) - Transformer-based Model Predictive Control: Trajectory Optimization via Sequence Modeling [16.112708478263745]
本稿では,最適化に基づく学習手法の主な強みを組み合わせた統合フレームワークを提案する。
我々のアプローチでは、最適化プロセス内に高容量、トランスフォーマーベースのニューラルネットワークモデルを組み込む必要がある。
純粋に最適化に基づくアプローチと比較すると,提案手法では最大75%の性能向上が期待できる。
論文 参考訳(メタデータ) (2024-10-31T13:23:10Z) - Introduction to Online Control [31.67032731719622]
オンラインの非確率制御では、コスト関数と仮定された力学モデルからの摂動の両方が敵によって選択される。
目標は、ベンチマーククラスの政策から見て、最高の政策に対して低い後悔を得ることだ。
論文 参考訳(メタデータ) (2022-11-17T16:12:45Z) - Modeling the Second Player in Distributionally Robust Optimization [90.25995710696425]
我々は、最悪のケース分布を特徴付けるために神経生成モデルを使うことを議論する。
このアプローチは多くの実装と最適化の課題をもたらします。
提案されたアプローチは、同等のベースラインよりも堅牢なモデルを生み出す。
論文 参考訳(メタデータ) (2021-03-18T14:26:26Z) - Guided Constrained Policy Optimization for Dynamic Quadrupedal Robot
Locomotion [78.46388769788405]
我々は,制約付きポリシー最適化(CPPO)の実装に基づくRLフレームワークであるGCPOを紹介する。
誘導制約付きRLは所望の最適値に近い高速収束を実現し,正確な報酬関数チューニングを必要とせず,最適かつ物理的に実現可能なロボット制御動作を実現することを示す。
論文 参考訳(メタデータ) (2020-02-22T10:15:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。