論文の概要: IronMind: Scaling Humanoid Dexterous Manipulation via Camera-Space Ego-Centric Pretraining
- arxiv url: http://arxiv.org/abs/2609.39403v1
- Date: Wed, 30 Sep 2026 09:45:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.528521
- Title: IronMind: Scaling Humanoid Dexterous Manipulation via Camera-Space Ego-Centric Pretraining
- Title(参考訳): IronMind:カメラ空間Ego-Centric Pretrainingによるヒューマノイドデキスタラスマニピュレーションのスケーリング
- Abstract要約: エゴセントリックなヒューマンビデオは、巧妙な操作のためのスケーラブルなデータソースを提供する。
しかし、人間型ロボットの訓練には2つの課題がある。
自己中心型人間ビデオと異種ロボットデータを用いた視覚言語アクションモデルであるIronMindを紹介する。
- 参考スコア(独自算出の注目度): 17.85786524101901
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Egocentric human video offers a scalable data source for dexterous manipulation, yet using it to train humanoid robots presents two challenges: (1) an embodiment gap, as human hands differ structurally from robot end-effectors and low-cost egocentric recordings lack the torso kinematics required by conventional retargeting; and (2) heterogeneous data quality, including noisy hand-pose tracking and weakly aligned text annotations. We introduce IronMind, a vision-language-action (VLA) model that uses egocentric human video and heterogeneous robot data to pretrain policies for humanoid dexterous manipulation. To bridge the embodiment gap, IronMind bypasses explicit body-retargeting by using a camera-space action representation, the native reference space of egocentric video, and semantically aligning robot and human action dimensions. Across total pretraining budgets from 250 to 10,000 hours, validation loss decreases approximately log-linearly with data scale. Larger pretraining budgets also improve out-of-distribution real-robot manipulation after post-training: across six challenging tasks with unseen objects, affordances, and reasoning prompts, the 10,000-hour model achieves a 55.0% success rate, compared with at most 11.7% for every pretraining budget up to 5,000 hours and 5.0% without pretraining. At the same pretraining budget, the camera-space action representation also outperforms the torso-frame baseline. Together, these findings support pretraining with a camera-space action representation on large-scale human egocentric data as a scalable foundation for humanoid robot manipulation.
- Abstract(参考訳): エゴセントリックな人間のビデオは、手動操作のためのスケーラブルなデータソースを提供するが、人間型ロボットのトレーニングには、(1)人間の手の構造がロボットのエンドエフェクターと異なり、低コストのエゴセントリックな記録には、従来のリターゲティングで要求されるトーソキネマティクスが欠如していること、(2)ノイズの多い手動追跡や弱い一致したテキストアノテーションを含む異種データ品質の2つの課題がある。
我々は,人間中心型ビデオと異種ロボットデータを用いた視覚言語アクション(VLA)モデルであるIronMindを紹介した。
エンボディメントギャップを埋めるために、IronMindは、カメラ空間のアクション表現、エゴセントリックビデオのネイティブ参照空間、ロボットと人間のアクション次元を意味的に整合させることにより、明示的なボディーリターゲティングをバイパスする。
事前トレーニングの予算は250~10,000時間で、検証損失はデータスケールとほぼ直線的に減少する。
未確認の物体、余裕、推論のプロンプトを持つ6つの挑戦的なタスクにおいて、1万時間モデルは55.0%の成功率を達成し、事前訓練なしの全ての予算の11.7%は5,000時間と5.0%を達成している。
同じ事前訓練予算で、カメラ空間のアクション表現は、胴体フレームのベースラインよりも優れています。
これらの知見は,ヒューマノイドロボット操作のスケーラブルな基盤として,大規模な人間中心データに基づくカメラ空間の行動表現による事前訓練を支援する。
関連論文リスト
- Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data [60.94418315274988]
Ego2Robotは、キュレートされたビデオとインザワイルドのビデオの両方をサポートし、15のロボット形態にまたがる18,561時間のトレーニングデータを生成する。
Ego2Robotの合成データとロボットデータの併用による事前学習は、複数のタイプにわたるアウト・オブ・ディストリビューションの一般化を一貫して改善する。
論文 参考訳(メタデータ) (2026-08-03T17:52:26Z) - HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining [93.5192770515694]
Embodied foundation modelは、大きな言語モデルのようなデータスケーリングの恩恵を受けることが期待されているが、より厳密なデータボトルネックに直面している。
遠隔操作された実ロボット軌道は、正確な行動監督と実施の整合性のために、訓練前の主流の源である。
エゴセントリックなデータに基づいて事前訓練された基礎モデルは、実ロボットアクション予測において24%低い検証損失を達成する。
論文 参考訳(メタデータ) (2026-06-18T17:37:34Z) - ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining [40.678451625177026]
VLA(Vision-Language-Action)モデルは、大規模で多様な実施データから恩恵を受けるが、ロボットの軌道収集は費用がかかり、労力がかかる。
近年の進歩は、大規模な自我中心の人間ビデオが、事前訓練において補完的な現実世界の監督を提供することを示している。
異種データソースを併用した統合VLA事前学習フレームワークであるACE-EGO-0を紹介する。
論文 参考訳(メタデータ) (2026-06-15T18:40:18Z) - ActiveMimic: Egocentric Video Pretraining with Active Perception [84.2999803878421]
エゴセントリックな人間のビデオは、事前トレーニングのためのロボットデータに代わるスケーラブルな代替手段を提供する。
単体のRGBカメラから同期カメラと手首軌跡を復元する事前学習フレームワークであるActiveMimicを提案する。
我々は,ActiveMimicが人間のビデオで事前訓練されたベースラインを一貫して上回り,ロボットデータで事前訓練された最先端モデルと一致していることを示す。
論文 参考訳(メタデータ) (2026-06-04T14:01:01Z) - EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data [114.89243396877453]
EgoScaleは、大規模な自我中心の人間データ上に構築された人から器用な操作伝達フレームワークである。
簡単な2段階のトランスファーレシピを導入し, 大規模人体事前訓練と, ライトウェイトアライメントされた人間ロボットのトレーニングを行った。
最終方針は、22個のDoFデキスタラスロボットハンドを使用して、トレーニング済みのベースラインに対して平均成功率を54%向上させる。
論文 参考訳(メタデータ) (2026-02-18T18:59:05Z) - EgoHumanoid: Unlocking In-the-Wild Loco-Manipulation with Robot-Free Egocentric Demonstration [67.13034606664333]
EgoHumanoidは、エゴセントリックな人間のデモを使って視覚言語アクションポリシーを共同訓練する最初のフレームワークである。
スケーラブルな人的データ収集のためのポータブルシステムを開発した。
論文 参考訳(メタデータ) (2026-02-10T18:59:03Z) - MimicDreamer: Aligning Human and Robot Demonstrations for Scalable VLA Training [40.45924128424013]
低コストな人間によるデモンストレーションをロボットで使用可能な監視に変換するフレームワークであるMimicDreamerを提案する。
視覚的アライメントのために,高忠実度ロボットデモビデオを生成するビデオ拡散モデルH2R Alignerを提案する。
視点安定化のためにEgoStabilizerを提案する。
動作アライメントのために,人間の手の動きをロボットフレームにマッピングし,制約付き逆運動学解法を適用する。
論文 参考訳(メタデータ) (2025-09-26T11:05:10Z) - EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos [49.820119587446655]
本稿では,エゴセントリックな人間ビデオを用いたVLA(Vision-Language-Action)モデルのトレーニングについて検討する。
人間の手首と手の動きを予測する人間のビデオに基づいて訓練されたVLAによって、私たちはInverse Kinematicsを実行し、人間のアクションをロボットアクションに変換することができる。
シミュレーションベンチマークであるEgo Humanoid Manipulation Benchmarkを提案する。
論文 参考訳(メタデータ) (2025-07-16T17:27:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。