論文の概要: Reinforcement Learning on Cost-Constrained Quadrupedal Hardware
- arxiv url: http://arxiv.org/abs/2607.26434v2
- Date: Thu, 30 Jul 2026 01:30:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.267621
- Title: Reinforcement Learning on Cost-Constrained Quadrupedal Hardware
- Title(参考訳): コスト制約付き四足歩行ハードウェアの強化学習
- Authors: Javier C. Weddington, Bence P. Ölveczky, Stephen A. Baccus,
- Abstract要約: 低コストのロボットプラットフォームに学習された制御ポリシをデプロイすると、輸送レイテンシとノイズの多いモータフィードバックが導入される。
我々は、ノイズや遅延したフィードバックを扱う生物学的にインスパイアされたアプローチで、sim-to-realギャップを埋める。
低コストの四面体ハードウェアプラットフォームを用いて、平均アクチュエータ遅延のフォワードモデルを用いて、時間認識ニューラルネットワークと組み合わせることで、ロコモーションが堅牢であることが判明した。
- 参考スコア(独自算出の注目度): 0.040782474409194726
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying learned control policies on low-cost robotic platforms introduces transport latencies and noisy motor feedback that systematically widens the sim-to-real gap. The chasm of simulation to deployment in hardware lies in the delay of the actuator reaching the commanded position. On platforms such as the Mini Pupper 2, a measured >50 ms transport delay transforms the locomotion task from a standard Markov decision process into a partially observable one. In this paper, we take a biologically inspired approach of handling noisy and delayed feedback to close the sim-to-real gap, thereby expanding the capability of reinforcement learning on cost-constrained hardware. Using a low-cost quadrupedal hardware platform, we find that using a forward model of the average actuator delay, paired with a time-aware neural network results in robust locomotion. Additionally, our time-aware neural network learned a central pattern generator (CPG): a self-sustaining rhythmic gait that is robust to +320 ms latency perturbations, mirroring the CPGs found in the spinal cords of vertebrates. We posit that temporal self-organization may be a general strategy for cost-constrained locomotion.
- Abstract(参考訳): 低コストのロボットプラットフォームに学習された制御ポリシーをデプロイすると、輸送のレイテンシとノイズの多いモータフィードバックが導入され、シモン・トゥ・リアルのギャップを体系的に拡大する。
ハードウェアへの展開のシミュレーションのカオスは、アクチュエータが指示された位置に到達するのを遅らせることにある。
Mini Pupper 2のようなプラットフォームでは、50msのトランスポート遅延が標準マルコフ決定プロセスから部分的に観測可能なものに変換される。
本稿では,ノイズやフィードバックの遅れを生かして実空間を埋めることにより,コスト制約のあるハードウェア上での強化学習の能力を拡大する。
低コストの四面体ハードウェアプラットフォームを用いて、平均アクチュエータ遅延のフォワードモデルを用いて、時間認識ニューラルネットワークと組み合わせることで、ロコモーションが堅牢であることが判明した。
さらに、我々の時間認識ニューラルネットワークは中央パターン生成(CPG)を学習し、脊椎動物の脊髄にあるCPGを反映して、+320msの遅延摂動に頑健な自給自足歩行を学習した。
時間的自己組織化はコスト制約による移動の一般的な戦略であると仮定する。
関連論文リスト
- Real-Time sEMG-Based Telecontrol of an Assistive Robotic Arm Using a 1D Convolutional Neural Network [0.30786914102688595]
本研究は、ロボットアームの遠隔操作のためのリアルタイムsEMGベースのインタフェースを提案する。
このシステムは4チャンネルのsEMG取得、信号前処理、スライディングウィンドウへのセグメント化、一次元畳み込みニューラルネットワーク(CNN)を用いた分類に依存している。
システムは安定したリアルタイム動作を示し、平均遅延は約0.32秒であり、選択したウィンドウング戦略と一致している。
論文 参考訳(メタデータ) (2026-07-14T15:34:28Z) - MOSAIC: Bridging the Sim-to-Real Gap in Generalist Humanoid Motion Tracking and Teleoperation with Rapid Residual Adaptation [50.643488406438514]
一般のヒューマノイドモーショントラッカーは、データをスケーリングしてトレーニングすることで、強力なシミュレーション指標を達成したが、持続的な遠隔操作の間、ハードウェア上では不安定なままであることが多い。
複数のインタフェースをまたいだヒューマノイドモーショントラッキングと全身遠隔操作のためのオープンソースのフルスタックシステムMOSAICを提案する。
論文 参考訳(メタデータ) (2026-02-09T12:35:01Z) - Control of Microrobots with Reinforcement Learning under On-Device Compute Constraints [5.456154853270863]
自律型ロボットの重要な機能は、地形上で堅牢な移動を行う能力である。
本稿では,マイクロロボットのローコモーションに対するエッジMLアプローチについて検討し,デバイス上での計算,メモリ,電力制約による低レイテンシ制御を実現する。
論文 参考訳(メタデータ) (2025-12-31T09:18:36Z) - Hybrid Neural-MPM for Interactive Fluid Simulations in Real-Time [57.30651532625017]
本稿では,数値シミュレーション,神経物理,生成制御を統合した新しいハイブリッド手法を提案する。
本システムでは, 多様な2D/3Dシナリオ, 材料タイプ, 障害物相互作用における堅牢な性能を示す。
受け入れ次第、モデルとデータの両方をリリースすることを約束します。
論文 参考訳(メタデータ) (2025-05-25T01:27:18Z) - PALo: Learning Posture-Aware Locomotion for Quadruped Robots [29.582249837902427]
本稿では,姿勢認識型移動ロボットPALoのエンド・ツー・エンド深部強化学習フレームワークを提案する。
PALoは、直線速度と角速度の同時追跡と、体高、ピッチ、ロール角度のリアルタイム調整を行う。
PALoは、シミュレートされた環境でアジャイルな姿勢認識ロコモーションコントロールを実現し、微調整なしで実世界の設定に転送することに成功した。
論文 参考訳(メタデータ) (2025-03-06T14:13:59Z) - Offline Adaptation of Quadruped Locomotion using Diffusion Models [59.882275766745295]
本稿では,複数のスキル間の相互補間と学習の限界に同時に対処する,四足歩行への拡散に基づくアプローチを提案する。
これらの機能は、マルチスキルポリシーと互換性があり、ほとんど変更することなく、最小限の計算オーバーヘッドで適用可能であることを示す。
ANYmal四重奏プラットフォーム上でのハードウェア実験によるアプローチの有効性を検証する。
論文 参考訳(メタデータ) (2024-11-13T18:12:15Z) - Learning Low-Frequency Motion Control for Robust and Dynamic Robot
Locomotion [10.838285018473725]
実ANYmal C四重極上で8Hzの低速動作を行う学習モーションコントローラを用いて,ロバストでダイナミックな移動を実演する。
このロボットは、1.5m/sの高速度を頑健かつ反復的に達成し、不均一な地形を横切ることができ、予期せぬ外乱に抵抗することができる。
論文 参考訳(メタデータ) (2022-09-29T15:55:33Z) - Reinforcement Learning for Robust Parameterized Locomotion Control of
Bipedal Robots [121.42930679076574]
シミュレーションにおけるロコモーションポリシをトレーニングするためのモデルフリー強化学習フレームワークを提案する。
ドメインランダム化は、システムダイナミクスのバリエーションにまたがる堅牢な振る舞いを学ぶためのポリシーを奨励するために使用されます。
本研究では、目標歩行速度、歩行高さ、旋回ヨーなどの多目的歩行行動について示す。
論文 参考訳(メタデータ) (2021-03-26T07:14:01Z) - RLOC: Terrain-Aware Legged Locomotion using Reinforcement Learning and
Optimal Control [6.669503016190925]
四元計画と制御のためのモデルベースとデータ駆動の統一的アプローチを提案する。
センサ情報と所望のベース速度コマンドを、強化学習ポリシーを用いて足踏み計画にマッピングする。
我々は、複雑な四足歩行システムであるANYmal Bの枠組みを訓練し、再訓練を必要とせず、より大きく重いロボットであるANYmal Cへの移動性を示す。
論文 参考訳(メタデータ) (2020-12-05T18:30:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。