論文の概要: SKooP: Symmetric Koopman Predictions for Faster and More Generalizable Legged Robot Locomotion with Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.11624v2
- Date: Tue, 14 Jul 2026 10:55:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 12:51:44.70448
- Title: SKooP: Symmetric Koopman Predictions for Faster and More Generalizable Legged Robot Locomotion with Reinforcement Learning
- Title(参考訳): SkooP: 強化学習によるより高速でより一般化可能な脚ロボットロコモーションのためのシンメトリ・クープマン予測
- Abstract要約: 強化学習アルゴリズムは古典的にはサンプル効率の低下に悩まされている。
textitSKooP (Symmetric Koopman Predictions, Symmetric Koopman Predictions, Symmetric Koopman Predictions) を導入する。
- 参考スコア(独自算出の注目度): 11.354407122562806
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) algorithms classically suffer from poor sample efficiency. In robotics, a recent line of work has emerged addressing this problem by encoding physics priors in the learning process. However, most of these approaches are validated on well-defined, low-dimensional benchmark systems rather than high-dimensional robots with complex nonlinear dynamics. In this paper, we introduce \textit{SKooP (Symmetric Koopman Predictions)}, an approach combining the advantages of morphological symmetries with those of a Koopman model learned via autoencoder to enhance policy learning. SKooP learns a Koopman model of the system dynamics alongside the policy. The resulting Koopman predictions are used as privileged observations for the critic, allowing the agent to learn based on smoother, more informative features. We also incorporate group symmetries into the actor, critic, encoder and decoder networks to produce a highly equivariant policy. The SKooP approach is validated via in-depth analysis of the learned Koopman models and symmetric policies to showcase how each of these influences the agent's performance. We also show that the learned policies are transferable to different simulation environments. Our results show that SKooP consistently reduces convergence time and increases the learned reward for multiple challenging bipedal locomotion tasks on a quadruped robot. Project page: https://evelyd.github.io/SymmetricKoopmanPredictions
- Abstract(参考訳): 強化学習(RL)アルゴリズムは、古典的にはサンプル効率の低下に悩まされている。
ロボティクスにおける最近の研究は、学習プロセスにおいて物理の先行を符号化することでこの問題に対処している。
しかし、これらのアプローチのほとんどは、複雑な非線形力学を持つ高次元ロボットではなく、明確に定義された低次元のベンチマークシステムで検証されている。
本稿では、形態的対称性の利点と、オートエンコーダを用いて学習したクープマンモデルの利点を組み合わせてポリシー学習を強化するアプローチである「textit{SKooP (Symmetric Koopman Predictions)」を紹介する。
SKooPはポリシーとともにシステムダイナミクスのクープマンモデルを学ぶ。
結果のクープマン予想は批評家の特権的な観察として使用され、エージェントはよりスムーズでより情報的な特徴に基づいて学習することができる。
また、アクター、批評家、エンコーダ、デコーダネットワークにグループ対称性を組み込んで、高度に不変なポリシーを作成する。
SKooPアプローチは、学習したクープマンモデルと対称ポリシーの詳細な分析を通じて検証され、これらがエージェントのパフォーマンスにどのように影響するかを示す。
また、学習したポリシーは異なるシミュレーション環境に転送可能であることを示す。
以上の結果から,SKooPはコンバージェンス時間を連続的に短縮し,四足歩行ロボットにおける複数の挑戦的二足歩行タスクに対する学習報酬を増大させることがわかった。
プロジェクトページ: https://evelyd.github.io/SymmetricKoopmanPredictions
関連論文リスト
- On the Generalisation of Koopman Representations for Chaotic System Control [1.338174941551702]
本稿ではカオス力学系に対するクープマンに基づく表現の一般化可能性について検討する。
テストベッドとしてLorenzシステムを用いて,自動符号化によるクープマン埋め込みの学習,次状態予測におけるトランスフォーマーの事前学習,安全クリティカル制御のための微調整という3段階の手法を提案する。
論文 参考訳(メタデータ) (2025-08-26T11:49:50Z) - REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback [61.54791065013767]
報酬関数と人間の嗜好の相違は、現実世界で破滅的な結果をもたらす可能性がある。
近年の手法は、人間の嗜好から報酬関数を学習することで、不適応を緩和することを目的としている。
本稿では,ロボットRLHFフレームワークにおける報酬正規化の新たな概念を提案する。
論文 参考訳(メタデータ) (2023-12-22T04:56:37Z) - Nash Learning from Human Feedback [86.09617990412941]
ペアワイズフィードバックを用いた大規模言語モデルの微調整のための代替パイプラインを提案する。
我々はこのアプローチを人間のフィードバックからナッシュラーニング(NLHF)と呼ぶ。
ミラー降下原理に基づく新しいアルゴリズム解であるNash-MDを提案する。
論文 参考訳(メタデータ) (2023-12-01T19:26:23Z) - Koopman Kernel Regression [6.116741319526748]
クープマン作用素理論は線形時間不変(LTI)ODEによる予測のキャラクタリゼーションに有効なパラダイムであることを示す。
我々は、LTI力学系への変換のみにまたがる、普遍的なクープマン不変核再生ヒルベルト空間(RKHS)を導出する。
実験では、Koopman演算子やシーケンシャルデータ予測器と比較して予測性能が優れていることを示した。
論文 参考訳(メタデータ) (2023-05-25T16:22:22Z) - DLKoopman: A deep learning software package for Koopman theory [0.0]
我々は、Koopman理論のためのソフトウェアパッケージであるDLKoopmanを紹介する。
ディープラーニングを用いて非線形力学系の線形空間への符号化を学習し、同時に線形力学を学習する。
DLKoopmanは"dlkoopman"としてPython Package Index(PyPI)で利用可能である。
論文 参考訳(メタデータ) (2022-11-15T18:45:51Z) - Online Weighted Q-Ensembles for Reduced Hyperparameter Tuning in
Reinforcement Learning [0.38073142980732994]
強化学習はロボット制御を学ぶための有望なパラダイムであり、ダイナミックスモデルを必要とせずに複雑な制御ポリシーを学習することができる。
本稿では,複数の強化学習エージェントのアンサンブルを用いて,それぞれ異なるパラメータの集合と,最適な演奏セットを選択するメカニズムを提案する。
オンライン重み付きQ-アンサンブルは,q平均アンサンブルと比較した場合,全体の低分散と優れた結果を示した。
論文 参考訳(メタデータ) (2022-09-29T19:57:43Z) - Efficient Model-based Multi-agent Reinforcement Learning via Optimistic
Equilibrium Computation [93.52573037053449]
H-MARL (Hallucinated Multi-Agent Reinforcement Learning) は,環境と数回交流した後の平衡政策を学習する。
自律運転シミュレーションベンチマークにおいて,本手法を実験的に実証した。
論文 参考訳(メタデータ) (2022-03-14T17:24:03Z) - Stochastic Adversarial Koopman Model for Dynamical Systems [0.4061135251278187]
本稿では、最近開発された逆コオプマンモデルを拡張し、コオプマンがエンコーダの潜在符号化の確率に適用する。
クープマンモデルの有効性はカオス, 流体力学, 燃焼, 反応拡散モデルにおいて異なる試験問題で示される。
論文 参考訳(メタデータ) (2021-09-10T20:17:44Z) - Neural Dynamic Policies for End-to-End Sensorimotor Learning [51.24542903398335]
感覚運動制御における現在の主流パラダイムは、模倣であれ強化学習であれ、生の行動空間で政策を直接訓練することである。
軌道分布空間の予測を行うニューラル・ダイナミック・ポリシー(NDP)を提案する。
NDPは、いくつかのロボット制御タスクにおいて、効率と性能の両面で、これまでの最先端よりも優れている。
論文 参考訳(メタデータ) (2020-12-04T18:59:32Z) - Deep Imitation Learning for Bimanual Robotic Manipulation [70.56142804957187]
本稿では,ロボットによるバイマニュアル操作のための深層模倣学習フレームワークを提案する。
中心となる課題は、操作スキルを異なる場所にあるオブジェクトに一般化することである。
i)マルチモーダルダイナミクスを要素運動プリミティブに分解し、(ii)リカレントグラフニューラルネットワークを用いて各プリミティブをパラメータ化して相互作用を捕捉し、(iii)プリミティブを逐次的に構成する高レベルプランナと、プリミティブダイナミクスと逆運動学制御を組み合わせた低レベルコントローラを統合することを提案する。
論文 参考訳(メタデータ) (2020-10-11T01:40:03Z) - Forecasting Sequential Data using Consistent Koopman Autoencoders [52.209416711500005]
クープマン理論に関連する新しい物理学に基づく手法が導入された。
本稿では,既存の作業の多くと異なり,前方・後方のダイナミクスを生かした新しいコンシスタント・クープマン・オートエンコーダモデルを提案する。
このアプローチの鍵となるのは、一貫性のある力学と関連するクープマン作用素との相互作用を探索する新しい解析である。
論文 参考訳(メタデータ) (2020-03-04T18:24:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。