論文の概要: Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors
- arxiv url: http://arxiv.org/abs/2606.28237v1
- Date: Fri, 26 Jun 2026 16:23:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.540303
- Title: Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors
- Title(参考訳): 無限運動の解き放つ:生成ビデオによる表現的四足歩行のスケーリング
- Abstract要約: 私たちは、アクロバティックな動作とパフォーマンス的な動作にまたがる7,488個の四足歩行のオープンソースデータセットであるQuad-Imaginariumをリリースした。
生成問題として対応するデータをフレーミングすることで、動物をループから除去する、完全に自動化されたパイプラインであるUni-Moをリリースする。
実Unitree Go2上の392個のランダムサンプリング動作を96.7%の成功率で検証し,97.6%の成功率で補完した。
- 参考スコア(独自算出の注目度): 16.885943699439377
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Quadruped robots have achieved remarkable locomotion, yet their behavioral repertoire remains confined to a few gaits--far from the expressive, companion-like presence long envisioned for them. Attempts to import the humanoid recipe of large-scale motion data have inherited one tacit assumption: that robot motion must first pass through an animal body, making data collection dependent on cooperative animals, reconstruction fragile across species, and retargeting ill-posed across incompatible morphologies. We propose Uni-Mo, a fully automated pipeline that removes the animal from the loop by reframing data scarcity as a generation problem: an LLM proposes motion prompts, a video diffusion model synthesizes the corresponding robot behaviors, and the generated videos are lifted into 3D reference trajectories used to train tracking policies deployed on a real Unitree Go2. To make naively-drifting generations reliably extractable, we introduce an Identity Consistency Loss that enforces appearance coherence across frames. We release Quad-Imaginarium at https://github.com/GaoLii/Quad-Imaginarium.git, the resulting open-source dataset of 7,488 language-annotated quadruped motions (18.5 hours) spanning acrobatic and performative behaviors. We validate 392 randomly sampled motions on a real Unitree Go2 with a 96.7% deployment success rate, complemented by a 97.6% success rate across the full dataset in simulation.
- Abstract(参考訳): 四足歩行ロボットは目覚ましい動きを遂げているが、その行動レパートリーは、表現力のある仲間のような存在が長い間想定されていたものから、ほんの数歩しか離れていない。
大規模な運動データからヒューマノイドのレシピを輸入しようとする試みは、1つの暗黙の仮定を継承している: ロボットの動きはまずまず動物体を通り抜ける必要があり、データの収集は協力動物に依存し、種間の脆弱を再構築し、不整合な形態にまたがって不整合を狙う。
LLMは動作プロンプトを提案し、ビデオ拡散モデルは対応するロボットの動作を合成し、生成されたビデオは実際のUnitree Go2にデプロイされたトラッキングポリシーをトレーニングするために使用される3D参照軌道にリフトされる。
ナリードリフト世代を確実に抽出できるようにするために,フレーム間の外観コヒーレンスを強制するアイデンティティ一貫性損失を導入する。
我々は7,488の言語で注釈付けされた四足歩行(18.5時間)のオープンソースデータセットであるQuad-Imaginariumをhttps://github.com/GaoLii/Quad-Imaginarium.gitでリリースした。
我々は、実際のUnitree Go2上でランダムにサンプリングされた392の動作を96.7%のデプロイメント成功率で検証し、シミュレーションの全データセットで97.6%の成功率で補完する。
関連論文リスト
- UniMo: Unifying Human and Animal Motion Generation [11.84736182625855]
パラメトリックスケルトンを非パラメトリック表現に変換することにより、トポロジ的不一致を回避できる統合ポイントクラウドベースのモーション生成フレームワークを提案する。
我々は人間と動物の両方にまたがる大規模動き言語データセットUniML3Dを提案する。
提案手法は,UniML3DとHumanML3D,KIT-ML,AnimalML3Dの3つの公開ベンチマークに対して,最先端の結果を得る。
論文 参考訳(メタデータ) (2026-09-11T02:08:54Z) - Behavior Foundations for Quadruped Robots: ABot-C0 Technical Report [25.18747802029395]
本稿では,四足歩行ロボットの汎用動作制御システムであるABot-C0を提案する。
我々は、条件付きビデオ生成、注釈付きモーションキャプチャ、ヒューマンデザインを通じてデータピラミッドを構築し、16,074個の物理的に実現可能なモーションクリップを生成した。
そして、3段階の特権と知覚の枠組みを採用することで、ロバストな全地球移動に向けて一歩前進します。
論文 参考訳(メタデータ) (2026-07-08T13:04:07Z) - TopoCap: Learning Topology-Agnostic Motion Priors for Monocular Video-to-Animation [44.79819257609757]
TopoCapはモノクロビデオから動きを抽出し、任意の骨格トポロジで文字に書き込むことができる最初の統合フレームワークである。
我々の重要な洞察は、骨格構造は離散的であるが、運動の基盤となる物理学は連続的で低次元の多様体を占有しているということである。
この洞察を、2段階の生成パイプラインを通じて実現します。
論文 参考訳(メタデータ) (2026-06-10T14:41:19Z) - GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors [113.71148915419246]
GRAILは3Dアセット、シミュレーター対応シーン、およびビデオファンデーションモデル(VFM)の先行データで構成され、物理的環境を再構築したりロボットを遠隔操作したりすることなく対話を合成するデジタル生成パイプラインである。
GRAILは、オブジェクト形状、カメラパラメータ、メートル法スケール、環境深度、ロボットが提案する文字がビデオ生成の前に知られ、再構成中に再利用される、完全に定義された3D構成から始まる。
我々は、回復した動作をヒューマノイドロボットに再ターゲティングし、補完的なタスク・ジェネラル・モルフォロジー・トラッカーを訓練する。
GRAILは、ピックアップ、オブジェクト操作、着座にまたがる2万以上のシーケンスを生成する
論文 参考訳(メタデータ) (2026-06-03T17:57:45Z) - Learning Reactive Human Motion Generation from Paired Interaction Data Using Transformer-Based Models [0.0]
本研究は,対話シナリオにおける他者の動作に基づいて,ある人物の動作を生成する問題に対処する。
簡単なTransformer、iTransformer、Crossformerの3つのモデルを実装し比較する。
実験結果から, 簡易トランスフォーマーは姿勢崩壊に悩まされることなく, 可塑性相互作用を意識した動作を生成できることが示唆された。
論文 参考訳(メタデータ) (2026-04-24T02:27:13Z) - QuadFM: Foundational Text-Driven Quadruped Motion Dataset for Generation and Control [18.78068897227934]
テキスト・トゥ・モーション・ジェネラル・モーション・ジェネラル・モーション・コントロールのための大規模な超高忠実度データセットQuadFMを紹介した。
QuadFMには、ロコモーション、インタラクティブ、感情表現行動にまたがる11,784のキュレートされたモーションクリップが含まれている。
汎用モーションコントローラとテキスト・ツー・モーション・ジェネレータを共同でトレーニングする統合フレームワークであるGen2Control RLを提案する。
論文 参考訳(メタデータ) (2026-03-25T07:30:25Z) - RoboCurate: Harnessing Diversity with Action-Verified Neural Trajectory for Robot Learning [47.25770917635344]
本稿では,アノテートされた動作の質を評価し,フィルタする新しい合成ロボットデータ生成フレームワークであるRoboCurateを紹介する。
具体的には、RoboCurateはシミュレータで予測されたアクションをリプレイし、動作の一貫性を測定してアクション品質を評価する。
我々は,RoboCurateが生成したデータに対して,実データのみを使用する場合と比較して,成功率を大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-02-21T07:33:24Z) - Robot See Robot Do: Imitating Articulated Object Manipulation with Monocular 4D Reconstruction [51.49400490437258]
本研究は,1つの単分子RGB人間の実演から音声による物体操作を模倣する手法を開発した。
まず,モノクロ映像から3次元部分運動を復元する4次元微分可能部品モデル(4D-DPM)を提案する。
この4D再構成を前提として、ロボットは物体の軌道を再現し、両腕の動きを計画し、実証された物体部分の動きを誘導する。
両用するYuMiロボットを用いて,4D-DPMの3D追跡精度を実写3D部分軌跡に基づいて評価し,9つのオブジェクトに対してRSRDの物理的実行性能を評価した。
論文 参考訳(メタデータ) (2024-09-26T17:57:16Z) - OmniMotionGPT: Animal Motion Generation with Limited Data [70.35662376853163]
最初のテキストアニマルモーションデータセットであるAnimalML3Dを紹介した。
我々は,動物データに基づくヒトの動き生成ベースラインのトレーニング結果よりも定量的かつ質的に,高い多様性と忠実さで動物の動きを生成することができる。
論文 参考訳(メタデータ) (2023-11-30T07:14:00Z) - Universal Humanoid Motion Representations for Physics-Based Control [71.46142106079292]
物理学に基づくヒューマノイド制御のための総合的な運動スキルを含む普遍的な運動表現を提案する。
まず、大きな非構造運動データセットから人間の動きをすべて模倣できる動き模倣機を学習する。
次に、模倣者から直接スキルを蒸留することで、動作表現を作成します。
論文 参考訳(メタデータ) (2023-10-06T20:48:43Z) - Learning Motion Priors for 4D Human Body Capture in 3D Scenes [81.54377747405812]
LEMO: LEMO: LEARING Human Motion priors for 4D human body capture。
提案手法では, 連続して復元されたポーズによって現れるジッタを減少させる新規な動きを事前に導入する。
また, 接触摩擦項と, 物体ごとの自己監督訓練により得られる接触認識運動充填剤を設計した。
パイプラインでは、高品質な4D人体撮影、スムーズな動きの再構築、身体とシーンの相互作用を実演しています。
論文 参考訳(メタデータ) (2021-08-23T20:47:09Z) - High-Fidelity Neural Human Motion Transfer from Monocular Video [71.75576402562247]
ビデオベースの人間のモーション転送は、ソースモーションに従って人間のビデオアニメーションを作成します。
自然なポーズ依存非剛性変形を伴う高忠実で時間的に一貫性のある人の動き伝達を行う新しい枠組みを提案する。
実験結果では,映像リアリズムの点で最先端を著しく上回っている。
論文 参考訳(メタデータ) (2020-12-20T16:54:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。