論文の概要: Continual Robot Policy Learning via Variational Neural Dynamics
- arxiv url: http://arxiv.org/abs/2606.27353v1
- Date: Thu, 25 Jun 2026 17:56:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.394613
- Title: Continual Robot Policy Learning via Variational Neural Dynamics
- Title(参考訳): 変分ニューラルダイナミクスを用いた連続ロボット政策学習
- Abstract要約: ほとんどの学習ベースのコントローラは一度トレーニングされ、学習が完了したかのようにデプロイされる。
これにより、ロボットはデプロイメントエクスペリエンスを使用してタスクパフォーマンスをさらに向上することができない。
本研究では,隠れた動作と反復する動作下でのロボットポリシーを改善するために,実体験を用いた連続学習フレームワークを提案する。
- 参考スコア(独自算出の注目度): 20.3323041710497
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robots deployed in the real world rarely operate under a single fixed dynamics model: wind changes, payloads vary, batteries drain, contacts shift, and hardware wears. Yet most learning-based controllers are trained once and deployed as if learning were complete. This prevents the robot from using deployment experience to further improve task performance. In this work, we propose a continual learning framework that uses real-world experience to improve robot policies under hidden and recurring dynamics. Our method learns a condition-aware dynamics model from real state-action trajectories by combining an analytical physics prior with a neural residual for unmodeled effects. A recurrent encoder infers the current hidden condition from recent interaction, and this estimate conditions both the residual model and the policy. Policy learning is performed via differentiable simulation using diverse learned dynamics sampled from the latent model. At deployment, these sampled conditions are replaced by conditions inferred online from recent real interaction, allowing the policy to recover recurring dynamics by recognition rather than residual re-fitting. Through extensive simulation studies and real-world experiments, we demonstrate that the framework improves policy performance under diverse unobserved disturbances. On real quadrotor trajectory tracking under changing wind, the policy recovers from recurring disturbances in roughly 1s, about 5x faster than online residual re-fitting. It also reduces large-disturbance hover and tracking errors by 65.7% and 53.3% over the state-of-the-art online adaptation approaches
- Abstract(参考訳): 実際の世界で展開されるロボットは、風の変化、ペイロードの変化、バッテリーのドレイン、コンタクトシフト、ハードウェアの着用など、単一の固定力学モデルの下で運用されることはめったにない。
しかし、ほとんどの学習ベースのコントローラは一度トレーニングされ、学習が完了したかのようにデプロイされる。
これにより、ロボットはデプロイメントエクスペリエンスを使用してタスクパフォーマンスをさらに向上することができない。
本研究では,隠蔽・繰り返し動作下でのロボットポリシーを改善するために,実体験を用いた連続学習フレームワークを提案する。
本手法は, 解析物理学とニューラル残差とを組み合わせることで, 実状態運動軌道から状態認識力学モデルを学習する。
繰り返しエンコーダは、最近の相互作用から現在の隠蔽条件を推定し、この推定条件は残留モデルとポリシーの両方である。
政策学習は、潜在モデルからサンプリングされた多様な学習力学を用いて微分可能シミュレーションによって行われる。
デプロイ時に、これらのサンプルされた条件は、最近の実際の相互作用からオンラインに推測された条件に置き換えられるため、ポリシーは残留再適合ではなく、認識によって再帰的なダイナミクスを回復することができる。
大規模なシミュレーション研究と実世界の実験を通じて、このフレームワークは様々な観測不能な外乱下での政策性能を向上させることを実証する。
風が変わる中での実際の四角形軌道追跡では、このポリシーはオンラインの残留再適合の約5倍の約1秒の乱れから回復する。
また、最先端のオンライン適応アプローチに対して、大きなゆるやかなホバーとトラッキングエラーを65.7%、53.3%削減する。
関連論文リスト
- Learning Context-Aware Neural ODE Dynamics for Adaptive Robotic Control [55.01272784312405]
本稿では,ニューラル常微分方程式に基づく文脈認識力学モデルを提案する。
Sphero BOLTロボットとFanucマニピュレータを実世界の実験で使用した。
論文 参考訳(メタデータ) (2026-06-13T20:55:46Z) - Physics-Informed Policy Optimization via Analytic Dynamics Regularization [5.537513058221965]
強化学習(RL)はロボット制御において高い性能を発揮している。
アクター批判法のような最先端の政策学習法は、依然として高いサンプルの複雑さに悩まされている。
我々は、物理制約を直接ニューラルネットワークの最適化にシームレスに統合する、PIPERと呼ばれる新しい物理インフォームドRLフレームワークを導入する。
論文 参考訳(メタデータ) (2026-03-15T16:20:45Z) - Offline Robotic World Model: Learning Robotic Policies without a Physics Simulator [50.191655141020505]
強化学習(Reinforcement Learning, RL)は、ロボット制御において目覚ましい能力を示してきたが、高いサンプルの複雑さ、安全性の懸念、そしてシム・トゥ・リアルのギャップのため、依然として困難である。
物理シミュレータに頼らずに政策学習を改善するために不確実性を明示的に推定するモデルベースアプローチであるオフラインロボット世界モデル(RWM-O)を導入する。
論文 参考訳(メタデータ) (2025-04-23T12:58:15Z) - Mitigating Covariate Shift in Imitation Learning for Autonomous Vehicles Using Latent Space Generative World Models [60.87795376541144]
World Model(ワールドモデル)は、エージェントの次の状態を予測できるニューラルネットワークである。
エンド・ツー・エンドのトレーニングでは、人間のデモで観察された状態と整合してエラーから回復する方法を学ぶ。
クローズドループ試験における先行技術に有意な改善がみられた定性的,定量的な結果を示す。
論文 参考訳(メタデータ) (2024-09-25T06:48:25Z) - DiAReL: Reinforcement Learning with Disturbance Awareness for Robust
Sim2Real Policy Transfer in Robot Control [0.0]
遅延マルコフ決定プロセスは、最近コミットされたアクションの有限時間ウィンドウでエージェントの状態空間を拡大することでマルコフ特性を満たす。
本稿では,遅延した環境下での乱れ増進型マルコフ決定プロセスを導入し,政治強化学習アルゴリズムのトレーニングにおける乱れ推定を取り入れた新しい表現法を提案する。
論文 参考訳(メタデータ) (2023-06-15T10:11:38Z) - Residual Physics Learning and System Identification for Sim-to-real
Transfer of Policies on Buoyancy Assisted Legged Robots [14.760426243769308]
本研究では,BALLUロボットのシステム識別による制御ポリシのロバストなシミュレートを実演する。
標準的な教師あり学習の定式化に頼るのではなく、深層強化学習を利用して外部力政策を訓練する。
シミュレーショントラジェクトリと実世界のトラジェクトリを比較することで,改良されたシミュレーション忠実度を解析する。
論文 参考訳(メタデータ) (2023-03-16T18:49:05Z) - Active Learning of Discrete-Time Dynamics for Uncertainty-Aware Model Predictive Control [46.81433026280051]
本稿では,非線形ロボットシステムの力学を積極的にモデル化する自己教師型学習手法を提案する。
我々のアプローチは、目に見えない飛行条件に一貫して適応することで、高いレジリエンスと一般化能力を示す。
論文 参考訳(メタデータ) (2022-10-23T00:45:05Z) - Real-to-Sim: Predicting Residual Errors of Robotic Systems with Sparse
Data using a Learning-based Unscented Kalman Filter [65.93205328894608]
我々は,動的・シミュレータモデルと実ロボット間の残差を学習する。
学習した残差誤差により、動的モデル、シミュレーション、および実際のハードウェア間の現実的ギャップをさらに埋めることができることを示す。
論文 参考訳(メタデータ) (2022-09-07T15:15:12Z) - Learning Reactive and Predictive Differentiable Controllers for
Switching Linear Dynamical Models [7.653542219337937]
専門家による実証から複合ダイナミクス行動を学習するためのフレームワークを提示する。
システムダイナミクスの近接近似としてスイッチング条件にエンコードされた接点を持つスイッチング線形ダイナミクスモデルを学ぶ。
次に、データ効率のよい制御学習のための微分可能なポリシークラスとして離散時間LQRを使用し、制御戦略を開発する。
論文 参考訳(メタデータ) (2021-03-26T04:40:24Z) - Neural Dynamic Policies for End-to-End Sensorimotor Learning [51.24542903398335]
感覚運動制御における現在の主流パラダイムは、模倣であれ強化学習であれ、生の行動空間で政策を直接訓練することである。
軌道分布空間の予測を行うニューラル・ダイナミック・ポリシー(NDP)を提案する。
NDPは、いくつかのロボット制御タスクにおいて、効率と性能の両面で、これまでの最先端よりも優れている。
論文 参考訳(メタデータ) (2020-12-04T18:59:32Z) - Never Stop Learning: The Effectiveness of Fine-Tuning in Robotic
Reinforcement Learning [109.77163932886413]
本稿では,ロボットによるロボット操作ポリシーを,政治以外の強化学習を通じて微調整することで,新たなバリエーションに適応する方法を示す。
この適応は、タスクをゼロから学習するために必要なデータの0.2%未満を使用する。
事前訓練されたポリシーを適用するという私たちのアプローチは、微調整の過程で大きなパフォーマンス向上につながります。
論文 参考訳(メタデータ) (2020-04-21T17:57:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。