論文の概要: Learning a Speed-adaptive Hip Exoskeleton Control Policy Via Sim-to-real Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.28027v1
- Date: Wed, 23 Sep 2026 12:53:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.020781
- Title: Learning a Speed-adaptive Hip Exoskeleton Control Policy Via Sim-to-real Reinforcement Learning
- Title(参考訳): Sim-to-real Reinforcement Learningによる高速適応型ヒップエクソスケルトン制御ポリシーの学習
- Abstract要約: 既存のオンライン最適化手法では、補助トルクプロファイル全体を最適化するために、ループ内人間の広範な評価が必要である。
本稿では,シム・トゥ・リアルRLとオンライン嗜好学習を統合した,個人化された外骨格支援のためのフレームワークを提案する。
- 参考スコア(独自算出の注目度): 14.526924541784238
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Providing personalized exoskeleton assistance across varying walking speeds remains challenging. Existing online optimization methods are sample-inefficient, requiring extensive human-in-the-loop (HIL) evaluations to optimize the entire assistive torque profile. Sim-to-real reinforcement learning (RL) offers a promising alternative but cannot directly account for individual user preferences. We propose a framework integrating sim-to-real RL with online preference learning for personalized exoskeleton assistance. Specifically, assistance timing is learned in simulation by training RL policies with human musculoskeletal models across varying walking speeds. The learned policies are then distilled and deployed on a physical hip exoskeleton using onboard sensory observations. Gaussian-process-based preference learning further personalizes the assistance magnitude through pairwise user comparisons. By decoupling assistance timing learning in simulation from magnitude optimization in real-world experiments, our framework substantially reduces the online optimization space. Human-subject experiments demonstrate efficient identification of personalized assistive torque profiles across varying walking speeds with fewer real-world evaluations.
- Abstract(参考訳): 様々な歩行速度でパーソナライズされた外骨格補助を提供することは、依然として困難である。
既存のオンライン最適化手法は、サンプル非効率であり、補助トルクプロファイル全体を最適化するために、広範囲なHIL(Human-in-the-loop)評価を必要とする。
Sim-to-real reinforcement learning (RL) は有望な代替手段を提供するが、個々のユーザの好みを直接説明できない。
本稿では,シム・トゥ・リアルRLとオンライン嗜好学習を統合した,個人化された外骨格支援のためのフレームワークを提案する。
具体的には、歩行速度の異なるヒト筋骨格モデルを用いてRLポリシーを訓練することにより、シミュレーションで補助タイミングを学習する。
学習したポリシーは蒸留され、搭載されたセンサーによる観察を用いて、身体的な股関節外骨格に展開される。
ガウス的プロセスに基づく嗜好学習は、ペアワイズユーザ比較によって補助の規模をさらにパーソナライズする。
実世界の実験における等級最適化からシミュレーションにおける支援タイミング学習を分離することにより、我々のフレームワークはオンライン最適化空間を大幅に削減する。
人体実験は、実際の評価を少なくして、様々な歩行速度におけるパーソナライズされた補助トルクプロファイルの効率的な同定を実証する。
関連論文リスト
- AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining [12.630306478872043]
オンライン最適学習率探索を行うプラグイン・アンド・プレイ適応学習率探索アルゴリズムである textbfAdaLRS を提案する。
実験により,AdaLRSは最適近傍の最適学習率を顕著な効率と有効性で調整することが示された。
論文 参考訳(メタデータ) (2025-06-16T09:14:01Z) - MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning [99.09906827676748]
我々は、テキスト・ツー・モーション生成タスクを最適化するために、Multi-Reward Reinforcement Learning(RL)を利用する最初のアプローチであるMotionRLを紹介する。
我々の新しいアプローチは、人間の知覚モデルに関する知識以前の人間の嗜好に基づいて、強化学習を用いて運動生成体を微調整する。
さらに、MotionRLは、テキストのアテンデンス、モーションクオリティ、人間の好みの最適性を近似する、新しい多目的最適化戦略を導入している。
論文 参考訳(メタデータ) (2024-10-09T03:27:14Z) - Autonomous Vehicle Controllers From End-to-End Differentiable Simulation [57.278726604424556]
そこで我々は,AVコントローラのトレーニングにAPG(analytic Policy gradients)アプローチを適用可能なシミュレータを提案し,その設計を行う。
提案するフレームワークは, エージェントがより根底的なポリシーを学ぶのを助けるために, 環境力学の勾配を役立てる, エンド・ツー・エンドの訓練ループに, 微分可能シミュレータを組み込む。
ダイナミクスにおけるパフォーマンスとノイズに対する堅牢性の大幅な改善と、全体としてより直感的なヒューマンライクな処理が見られます。
論文 参考訳(メタデータ) (2024-09-12T11:50:06Z) - OPTune: Efficient Online Preference Tuning [107.44836901099]
オンライン嗜好調整(OPTune)のためのより効率的なデータ探索手法を提案する。
OPTuneは、オン・プライオリティアライメントのための情報応答を動的にサンプリングする。
評価では, 効率的なデータ探索戦略により, OPTune の LLM は 1.27-1.56 倍高速なトレーニング速度を達成している。
論文 参考訳(メタデータ) (2024-06-11T18:55:04Z) - FedLALR: Client-Specific Adaptive Learning Rates Achieve Linear Speedup
for Non-IID Data [54.81695390763957]
フェデレートラーニング(Federated Learning)は、分散機械学習の手法である。
我々は,AMSGradの異種局所変種であるFedLALRを提案し,各クライアントが学習率を調整する。
クライアントが指定した自動調整型学習率スケジューリングが,クライアント数に対して収束し,線形高速化を実現することを示す。
論文 参考訳(メタデータ) (2023-09-18T12:35:05Z) - Hyperparameter Auto-tuning in Self-Supervised Robotic Learning [12.193817049957733]
不十分な学習(局所最適収束による)は、冗長な学習が時間と資源を浪費する一方で、低パフォーマンスの政策をもたらす。
自己教師付き強化学習のためのエビデンス下界(ELBO)に基づく自動チューニング手法を提案する。
本手法は,オンラインで自動チューニングが可能であり,計算資源のごく一部で最高の性能が得られる。
論文 参考訳(メタデータ) (2020-10-16T08:58:24Z) - AWAC: Accelerating Online Reinforcement Learning with Offline Datasets [84.94748183816547]
提案手法は,従来の実演データとオンライン体験を組み合わせることで,スキルの素早い学習を可能にする。
以上の結果から,事前データを組み込むことで,ロボット工学を実践的な時間スケールまで学習するのに要する時間を短縮できることが示唆された。
論文 参考訳(メタデータ) (2020-06-16T17:54:41Z) - FOAL: Fast Online Adaptive Learning for Cardiac Motion Estimation [20.642769236234848]
心臓MRIビデオの運動推定は、ヒトの心臓解剖学と機能の評価に不可欠である。
近年の研究では、ディープラーニングベースの手法による有望な結果が示されているが、トレーニングとテストデータセットのミスマッチによる劇的なパフォーマンス低下に悩まされている。
本稿では,メタラーナーによって最適化されたオンライン勾配勾配勾配に基づく,新しい高速オンライン適応学習フレームワークを提案する。
論文 参考訳(メタデータ) (2020-03-10T01:51:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。