論文の概要: EgoHTR: Egocentric 4D Demonstrations of Human Terrain Traversal
- arxiv url: http://arxiv.org/abs/2607.13472v1
- Date: Wed, 15 Jul 2026 06:02:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.666733
- Title: EgoHTR: Egocentric 4D Demonstrations of Human Terrain Traversal
- Title(参考訳): EgoHTR:Egocentric 4D Demonations of Human Terrain Traversal
- Abstract要約: 我々は,55のシーンアラインな4次元人間の動作シーケンスを,多様な複雑な環境下で収集する再構築パイプラインをオープンソースとして公開した。
得られたデータセットは150k以上のフレームから構成される。
私たちのパイプラインは、コミュニティ主導のデータセット拡張を可能にし、研究者がコンテキスト認識ロボットを構築するのに役立つ問題を要因にします。
- 参考スコア(独自算出の注目度): 63.906929035961134
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deploying humanoid robots in unstructured terrain remains an open problem. While classic reinforcement learning struggles with the sheer complexity of real-world interactions, more promising methods leveraging human priors remain limited to models lacking contextual awareness. The restricted motion synthesis is a direct consequence of existing dataset pipelines failing to capture human-scene sequences in challenging environments. To bridge this gap between humanoid learning and scene reconstruction, we introduce the Egocentric Human-Terrain Reconstruction (EgoHTR) dataset. We develop and open-source a reconstruction pipeline capturing 55 scene-aligned 4D human motion sequences in diverse, complex environments using a multi-sensor setup of egocentric wearables and a portable 3D scanner. The resulting dataset comprises over 150k frames, which we evaluate against motion-capture ground truth, demonstrating state-of-the-art accuracy and establishing a rigorous benchmark for human motion analysis and synthesis. Further, we leverage this data to train perceptive locomotion policies, demonstrating hardware deployment on a Unitree G1 for reconstructed reference motions. Our pipeline enables community-driven dataset extensions and factors the problem to help researchers build foundational, context-aware robots that reliably traverse uneven terrain.
- Abstract(参考訳): 非構造地形にヒューマノイドロボットを配置することは、まだ未解決の問題だ。
古典的な強化学習は現実世界の相互作用の複雑さに苦しむが、より有望な手法は、文脈認識の欠如したモデルに限られる。
制限されたモーション合成は、既存のデータセットパイプラインが挑戦的な環境で人間のシーンシーケンスをキャプチャできないことによる直接的な結果である。
ヒューマノイド学習とシーン再構築のギャップを埋めるために,エゴセントリック・ヒューマン・テライン・コンストラクション(EgoHTR)データセットを導入する。
我々は,エゴセントリックなウェアラブルとポータブルな3Dスキャナーのマルチセンサ構成を用いて,55のシーンアラインな4Dモーションシーケンスを多種多様な環境下でキャプチャする再構築パイプラインを開発し,オープンソース化した。
得られたデータセットは150k以上のフレームから構成されており,人間の動作解析と合成のための厳密なベンチマークを確立し,その精度を実証する。
さらに、このデータを利用して知覚的移動ポリシーを訓練し、Unitree G1上にハードウェアを配置し、参照動作を再構築する。
私たちのパイプラインは、コミュニティ主導のデータセット拡張を可能にし、研究者たちが不均一な地形を確実に横断する、基本的なコンテキスト対応ロボットを構築するのに役立ちます。
関連論文リスト
- AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning [2.0979009566413946]
我々はAgenticFocusを紹介した。AgenticFocusは、通常の1対1の映像をロボット訓練可能なデモに変換する複合現実感合成パイプラインである。
得られたデータセットペアは、同期されたロボットアクションと状態による視覚的な観察に焦点を当てた。
AgenticFocus は -5.18 対 -5.56 と -6.05 のスコアで、クロスエボディメントベースラインよりも軌道誤差とスムーズな手首の動きを実現している。
論文 参考訳(メタデータ) (2026-07-09T18:27:41Z) - GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors [113.71148915419246]
GRAILは3Dアセット、シミュレーター対応シーン、およびビデオファンデーションモデル(VFM)の先行データで構成され、物理的環境を再構築したりロボットを遠隔操作したりすることなく対話を合成するデジタル生成パイプラインである。
GRAILは、オブジェクト形状、カメラパラメータ、メートル法スケール、環境深度、ロボットが提案する文字がビデオ生成の前に知られ、再構成中に再利用される、完全に定義された3D構成から始まる。
我々は、回復した動作をヒューマノイドロボットに再ターゲティングし、補完的なタスク・ジェネラル・モルフォロジー・トラッカーを訓練する。
GRAILは、ピックアップ、オブジェクト操作、着座にまたがる2万以上のシーケンスを生成する
論文 参考訳(メタデータ) (2026-06-03T17:57:45Z) - EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents [85.77432303199176]
EmbodMocapは2つの動くiPhoneを使ったポータブルで安価なデータ収集パイプラインである。
私たちのキーとなるアイデアは、二重RGB-Dシーケンスを共同で校正し、人間とシーンの両方を再構築することです。
収集したデータに基づいて、我々は3つの具体的AIタスクを強化した: モノクラーヒューマン・シーン・リコンストラクション(モノクラーヒューマン・シーン・リコンストラクション)、メトリックスケールで世界空間に整合した人間とシーンを出力するフィードフォワードモデル、物理ベースのキャラクターアニメーション。
論文 参考訳(メタデータ) (2026-02-26T16:53:41Z) - MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction [54.36564144414704]
MeshMimicは、3Dシーンの再構築とインテリジェンスを組み込んだ革新的なフレームワークで、ヒューマノイドロボットがビデオから直接「モーション・テライン」インタラクションを学習できるようにする。
現状の3次元視覚モデルを活用することで、我々のフレームワークは、人間の軌跡と基礎となる地形や物体の3次元幾何学の両方を正確にセグメント化し再構築する。
論文 参考訳(メタデータ) (2026-02-17T17:09:45Z) - EgoHumanoid: Unlocking In-the-Wild Loco-Manipulation with Robot-Free Egocentric Demonstration [67.13034606664333]
EgoHumanoidは、エゴセントリックな人間のデモを使って視覚言語アクションポリシーを共同訓練する最初のフレームワークである。
スケーラブルな人的データ収集のためのポータブルシステムを開発した。
論文 参考訳(メタデータ) (2026-02-10T18:59:03Z) - CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives [65.89192712575797]
本研究では,モノクロ映像から再現可能な人物の動きとシーン形状を復元するCRISPを紹介する。
我々の手法は、人中心のビデオベンチマークにおいて、モーショントラッキングの失敗率を55.2%から6.9%に下げる。
このことは、CRISPが物理的に有意な人間の動きと対話環境を大規模に生成する能力を示している。
論文 参考訳(メタデータ) (2025-12-16T18:59:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。