論文の概要: Learning Reusable Hybrid Motion Priors for Humanoid Locomotion from Motion Imitation
- arxiv url: http://arxiv.org/abs/2607.24083v1
- Date: Mon, 27 Jul 2026 07:25:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.345374
- Title: Learning Reusable Hybrid Motion Priors for Humanoid Locomotion from Motion Imitation
- Title(参考訳): 動作模倣によるヒューマノイドロコモーションのための再利用可能なハイブリッド運動の学習
- Abstract要約: 本稿では,3段階のパイプラインを提案する。
シミュレーションにおいて,速度トラッキング,ポイントゴールナビゲーション,フォール-リカバリ速度トラッキングの手法の評価を行った。
学習したHMPは、アクティブなRVQステージの数が利用可能なパターンを変調する解釈可能なコードブック構造を明らかにする。
- 参考スコア(独自算出の注目度): 2.8733935930169228
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning can produce robust humanoid controllers, but each new task is typically trained as a separate policy with its own reward design and training process. Motion imitation provides an alternative source of motor competence by training policies to track retargeted human motions, yet the resulting controllers remain reference trackers and are not directly usable as task policies. We propose a three-stage pipeline that turns motion-imitation skills into a reusable hybrid motion prior (HMP) for humanoid locomotion. First, an expert policy is trained to imitate retargeted human motion-capture clips. Second, the expert is distilled into a frozen architecture composed of a proprioceptive encoder, a residual vector-quantized (RVQ) codebook, and an action decoder. Third, task-level policies are trained to solve locomotion tasks by selecting discrete codebook entries while the HMP remains frozen. We evaluate the method on velocity tracking, point-goal navigation, and fall-recovery velocity tracking in simulation, and deploy the velocity-tracking policy on a real Unitree G1 robot. The distillation process preserves the tracking behavior of the expert, while the resulting HMP can be reused without retraining as the action interface for different downstream locomotion policies. The learned HMP reveals an interpretable codebook structure in which the number of active RVQ stages modulates the available gait patterns. We further show that training the codebook with the rotation trick improves latent organization and reduces downstream falls compared with a standard straight-through estimator.
- Abstract(参考訳): 強化学習は、堅牢なヒューマノイドコントローラを生成することができるが、新しいタスクは、通常、独自の報酬設計とトレーニングプロセスで、独立したポリシーとして訓練される。
モーション模倣は、リターゲティングされた人間の動きを追跡するためのトレーニングポリシーによって運動能力の代替源を提供するが、結果として得られるコントローラは参照トラッカーのままであり、タスクポリシーとして直接使用することはできない。
そこで本研究では,3段階のパイプラインを用いて,モーション・アニメーションのスキルをヒューマノイド・ロコモーションのための再利用可能なハイブリッド・モーション(HMP)に変換することを提案する。
第一に、専門家のポリシーは、再ターゲットされた人間のモーションキャプチャークリップを模倣するように訓練されている。
第二に、専門家は、主受容エンコーダ、残留ベクトル量子化(RVQ)コードブック、アクションデコーダからなる凍結したアーキテクチャに蒸留される。
第三に、タスクレベルのポリシーは、HMPが凍結している間に個別のコードブックエントリを選択することで、移動タスクを解決するために訓練される。
本手法をシミュレーションで評価し,実際のUnitree G1ロボットに速度追跡ポリシーを展開させる。
蒸留プロセスは、専門家の追跡挙動を保ち、その結果のHMPは、異なる下流移動ポリシーのためのアクションインターフェースとして再トレーニングすることなく再利用することができる。
学習したHMPは、アクティブなRVQステージの数が利用可能な歩行パターンを変調する解釈可能なコードブック構造を明らかにする。
さらに、回転トリックによるコードブックのトレーニングは、標準のストレートスルー推定器と比較して遅延組織を改善し、下流の転倒を低減することを示す。
関連論文リスト
- Morphology-Aware Human Motion Retargeting for Wheeled-Humanoid Loco-Manipulation [3.1041072702135213]
本稿では,マルチデータセット動作をガラクサR1車輪型ヒューマノイドのロコ操作動作に変換するパイプラインを提案する。
ロボットは平面式3輪ベースとシリアル胴体と2本の腕を持つが、脚の関節は持たない。
基準ツイスト駆動の計画層は、平面ベースの動きを連続した3輪ステアリングとローリングコマンドにデコードする。
論文 参考訳(メタデータ) (2026-09-10T10:40:31Z) - Flow Policy Gradients for Robot Control [67.61978635211048]
フローマッチングポリシ勾配は、より表現力のあるポリシのトレーニングと微調整に有効である。
我々は、スクラッチからトレーニングを行う際に、フロー表現をどのように活用するかを示し、ベースラインよりもきめ細やかな堅牢性を改善する。
論文 参考訳(メタデータ) (2026-02-02T18:56:49Z) - CHIP: Adaptive Compliance for Humanoid Control through Hindsight Perturbation [70.5382178207975]
hIsight Perturbation (CHIP)は、制御可能なエンドエフェクタ剛性を実現するプラグイン・アンド・プレイモジュールである。
CHIPの実装は簡単で、データ拡張も追加の報酬チューニングも必要ありません。
そこで本研究では,CHIPでトレーニングした汎用モーショントラッキングコントローラが,多種多様な操作タスクを実行できることを示す。
論文 参考訳(メタデータ) (2025-12-16T18:56:04Z) - SMP: Reusable Score-Matching Motion Priors for Physics-Based Character Control [20.779031780374115]
自然主義的行動を生み出すためのエージェントを導く行動は、人生のような仮想キャラクタを作成する上で重要な役割を担っている。
本稿では、事前学習した運動拡散モデルとスコア蒸留サンプリング(SDS)を利用して、再利用可能なタスク非依存動作前処理を生成するスコアマッチング動作優先処理(SMP)を提案する。
本手法は, 再利用可能な, モジュラーな動作前処理により, 最先端の対向的模倣学習手法に匹敵する高品質な動作を生成する。
論文 参考訳(メタデータ) (2025-12-02T18:54:12Z) - ResMimic: From General Motion Tracking to Humanoid Whole-body Loco-Manipulation via Residual Learning [59.64325421657381]
ヒューマノイド全体のロコ操作は、日々のサービスや倉庫のタスクにトランスフォーメーション機能を約束する。
ResMimicは、人間の動作データから正確に表現力のあるヒューマノイド制御のための2段階の残差学習フレームワークである。
結果は、強いベースラインよりもタスク成功、トレーニング効率、堅牢性が大幅に向上したことを示している。
論文 参考訳(メタデータ) (2025-10-06T17:47:02Z) - Implicit Kinodynamic Motion Retargeting for Human-to-humanoid Imitation Learning [35.8296790596745]
Implicit Kinodynamic Motion Retargeting (IKMR)は、キネマティクスとダイナミックスの両方を考慮した、効率的でスケーラブルなフレームワークである。
IKMRは、モーション領域マッピングを学ぶために、モーショントポロジ表現とデュアルエンコーダデコーダアーキテクチャを事前訓練する。
実物大のヒューマノイドロボットでシミュレータと実物ロボットの両方で実験を行う。
論文 参考訳(メタデータ) (2025-09-18T21:34:02Z) - KungfuBot: Physics-Based Humanoid Whole-Body Control for Learning Highly-Dynamic Skills [58.73043119128804]
そこで本研究では,Kungfuやダンスなどの人体動作を高度に制御することを目的とした,物理学に基づくヒューマノイド制御フレームワークを提案する。
動作処理では,運動の抽出,フィルタリング,修正,再ターゲティングを行うパイプラインを設計し,物理的制約の遵守を確実にする。
動作模倣では、二段階最適化問題を定式化し、追従精度の許容度を動的に調整する。
実験では,高ダイナミックな動作のセットを模倣するために全身制御ポリシーを訓練する。
論文 参考訳(メタデータ) (2025-06-15T13:58:53Z) - Autonomous Vehicle Controllers From End-to-End Differentiable Simulation [57.278726604424556]
そこで我々は,AVコントローラのトレーニングにAPG(analytic Policy gradients)アプローチを適用可能なシミュレータを提案し,その設計を行う。
提案するフレームワークは, エージェントがより根底的なポリシーを学ぶのを助けるために, 環境力学の勾配を役立てる, エンド・ツー・エンドの訓練ループに, 微分可能シミュレータを組み込む。
ダイナミクスにおけるパフォーマンスとノイズに対する堅牢性の大幅な改善と、全体としてより直感的なヒューマンライクな処理が見られます。
論文 参考訳(メタデータ) (2024-09-12T11:50:06Z) - Human-AI Shared Control via Frequency-based Policy Dissection [34.0399894373716]
人間-AI共有制御は、複雑な環境で制御タスクを達成するために、人間がAIと対話し、協力することを可能にする。
従来の強化学習(RL)手法は、人間の制御可能なポリシーを達成するために目標条件付き設計を試みる。
我々は、学習したニューラルコントローラの中間表現とエージェント動作の運動特性を整合させる、TextitPolicy Dissectionと呼ばれるシンプルで効果的な周波数ベースのアプローチを開発した。
論文 参考訳(メタデータ) (2022-05-31T23:57:55Z) - Reinforcement Learning for Robust Parameterized Locomotion Control of
Bipedal Robots [121.42930679076574]
シミュレーションにおけるロコモーションポリシをトレーニングするためのモデルフリー強化学習フレームワークを提案する。
ドメインランダム化は、システムダイナミクスのバリエーションにまたがる堅牢な振る舞いを学ぶためのポリシーを奨励するために使用されます。
本研究では、目標歩行速度、歩行高さ、旋回ヨーなどの多目的歩行行動について示す。
論文 参考訳(メタデータ) (2021-03-26T07:14:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。