論文の概要: Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data
- arxiv url: http://arxiv.org/abs/2608.02580v1
- Date: Mon, 03 Aug 2026 17:52:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.74702
- Title: Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data
- Title(参考訳): Ego2Robot:人間中心のデータからスケーラブルなロボットデータ合成
- Abstract要約: Ego2Robotは、キュレートされたビデオとインザワイルドのビデオの両方をサポートし、15のロボット形態にまたがる18,561時間のトレーニングデータを生成する。
Ego2Robotの合成データとロボットデータの併用による事前学習は、複数のタイプにわたるアウト・オブ・ディストリビューションの一般化を一貫して改善する。
- 参考スコア(独自算出の注目度): 60.94418315274988
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning generalizable robot manipulation policies requires large-scale and diverse demonstration data. Egocentric human manipulation videos offer rich scene and task diversity, and prior work has shown that retargeting and rendering such videos into robot-format data can yield effective per-task policies at small scale. However, whether this approach can provide pretraining benefits for vision-language-action models at scale remains unexplored. We present \textbf{Ego2Robot}, a scalable pipeline that converts egocentric human manipulation videos into robot training data through action retargeting, robot-arm visual synthesis, and multi-level quality curation. Ego2Robot supports both curated datasets and in-the-wild videos, producing 18,561 hours of robot training data spanning 15 robot morphologies, making it the largest ego-to-robot dataset to date. To evaluate generalization, we extend RoboTwin2.0 with disentangled perturbation axes covering visual appearance, scene layout, embodiment morphology, and task semantics. Experiments show that joint pretraining on Ego2Robot-synthesized and robot data consistently improves out-of-distribution generalization across multiple perturbation types, with benefits validated on real-robot deployment. Project page: https://www-ye.github.io/ego2robot_blog/
- Abstract(参考訳): 汎用ロボット操作の学習には大規模かつ多様な実証データが必要である。
エゴセントリックな人間の操作ビデオは、リッチなシーンとタスクの多様性を提供します。
しかし、この手法が大規模に視覚言語-行動モデルに事前学習の利点をもたらすかどうかはまだ不明である。
我々は,エゴセントリックな人間の操作映像をロボットのトレーニングデータに変換するスケーラブルなパイプラインである‘textbf{Ego2Robot}を,アクションリターゲティング,ロボットアーム視覚合成,マルチレベル品質キュレーションを通じて提示する。
Ego2Robotは、キュレートされたデータセットと内蔵ビデオの両方をサポートし、15のロボット形態にまたがる18,561時間のトレーニングデータを生成する。
一般化を評価するため,RoboTwin2.0を拡張し,視覚的外観,シーンレイアウト,エンボディメント形態,タスクセマンティクスをカバーする。
実験により、Ego2Robotの合成データとロボットデータの共同事前学習は、複数の摂動型にわたる分散の一般化を一貫して改善し、実ロボットの展開に有効であることが示されている。
プロジェクトページ: https://www-ye.github.io/ego2robot_blog/
関連論文リスト
- JoyAI-RA 0.5: Scaling Robot Manipulation Learning via Dual Action Alignment [0.0]
本研究では,物理世界力学と視覚的意味論を結びつけるフレームワークであるJoyAI-RA 0.5を提案する。
インシシットアクションアライメントは、視覚的な遷移から潜在アクションを推論し、アクションフリーな人間、シミュレーション、ロボットデータを可能にする。
JoyAI-RAは、実際のAgiBotベンチマークで見られるタスクと見えないバリエーションの両方に強く依存する。
論文 参考訳(メタデータ) (2026-08-06T07:14:55Z) - EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot Demonstrations [12.604831042368078]
EgoEngineは、エゴセントリックな人間の操作ビデオから高忠実度ロボットデータに変換するためのフレームワークである。
EgoEngineは人間ビデオのロボットデータへのスケーラブルな変換を可能にしており、私たちの知る限り、エゴセントリックな人間ビデオから学習した初めてのゼロショットヴィジュモータなポリシーを実証している。
論文 参考訳(メタデータ) (2026-06-10T19:01:40Z) - Mitty: Diffusion-based Human-to-Robot Video Generation [57.494785199352975]
我々は,Human2Robotビデオ生成のためのビデオインコンテクスト学習を可能にする拡散変換器であるMittyを提案する。
事前訓練されたビデオ拡散モデルに基づいて構築されたMittyは、強い視覚的時間的事前情報を利用して、人間のデモをアクションラベルや中間抽象化なしでロボット実行ビデオに変換する。
Human2RobotとEPIC-Kitchensの実験によると、Mittyは最先端の結果、目に見えない環境への強力な一般化、人間の観察からスケーラブルなロボット学習のための新たな洞察を提供する。
論文 参考訳(メタデータ) (2025-12-19T05:52:15Z) - RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video [56.9581053843815]
画像とビデオにおけるロボットセグメンテーションの基礎モデルであるRobotSegを紹介する。
ロボットへの適応の欠如、手動のプロンプトへの依存、フレーム単位のトレーニングマスクアノテーションの必要性に対処する。
それは、画像とビデオの両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-11-28T07:51:02Z) - EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos [49.820119587446655]
本稿では,エゴセントリックな人間ビデオを用いたVLA(Vision-Language-Action)モデルのトレーニングについて検討する。
人間の手首と手の動きを予測する人間のビデオに基づいて訓練されたVLAによって、私たちはInverse Kinematicsを実行し、人間のアクションをロボットアクションに変換することができる。
シミュレーションベンチマークであるEgo Humanoid Manipulation Benchmarkを提案する。
論文 参考訳(メタデータ) (2025-07-16T17:27:44Z) - EgoZero: Robot Learning from Smart Glasses [54.6168258133554]
EgoZeroはProject Ariaスマートグラスで捉えた人間のデモから堅牢な操作ポリシーを学ぶ。
EgoZeroのポリシーをFranka Pandaロボットにデプロイし、7つの操作タスクに対して70%の成功率でゼロショット転送を実演する。
この結果から,実世界におけるロボット学習のためのスケーラブルな基盤として,現在地にある人間のデータを活用できることが示唆された。
論文 参考訳(メタデータ) (2025-05-26T17:59:17Z) - VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation [53.63540587160549]
VidBotは、WildのモノクルなRGBのみの人間ビデオから学習した3Dアベイランスを使って、ゼロショットロボット操作を可能にするフレームワークである。
VidBotは、人間の日常的なビデオを利用してロボットの学習をよりスケーラブルにする。
論文 参考訳(メタデータ) (2025-03-10T10:04:58Z) - Robots Pre-train Robots: Manipulation-Centric Robotic Representation from Large-Scale Robot Datasets [24.77850617214567]
本稿では,視覚的特徴と操作タスクの行動や受容といった動的情報の両方を抽出する基礎表現学習フレームワークを提案する。
具体的には、DROIDロボットデータセット上で視覚エンコーダを事前訓練し、ロボットの受容状態や動作などの動作関連データを活用する。
本研究では,視覚的観察をロボットの主観的状態-動作ダイナミクスと整合させる新しいコントラスト的損失と,事前トレーニング中の行動を予測する行動クローニング(BC)のようなアクター損失と,時間的コントラスト的損失を導入する。
論文 参考訳(メタデータ) (2024-10-29T17:58:13Z) - Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers [36.497624484863785]
Vid2Robotは、人間のビデオで操作タスクを入力として表現し、ロボットアクションを生成する、エンドツーエンドのビデオ条件付きポリシーである。
我々のモデルは、ビデオから人間とロボットのアクションの統一表現を学習するために、プロンプトロボット軌道対の大規模なデータセットを用いて訓練されている。
実世界のロボット上でのVid2Robotの評価を行い、人間のプロンプトビデオを用いた場合、BC-Zよりも20%以上の改善が見られた。
論文 参考訳(メタデータ) (2024-03-19T17:47:37Z) - Scaling Robot Learning with Semantically Imagined Experience [21.361979238427722]
ロボット学習の最近の進歩は、ロボットが操作タスクを実行できることを約束している。
この進歩に寄与する要因の1つは、モデルのトレーニングに使用されるロボットデータのスケールである。
本稿では,コンピュータビジョンや自然言語処理に広く用いられているテキスト・ツー・イメージ基盤モデルを利用した代替手法を提案する。
論文 参考訳(メタデータ) (2023-02-22T18:47:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。