論文の概要: EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos
- arxiv url: http://arxiv.org/abs/2607.09701v1
- Date: Sun, 21 Jun 2026 16:16:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.377478
- Title: EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos
- Title(参考訳): EgoSteer:エゴ中心ビデオからのステアブルデキスタラスマニピュレーションに向けたフルスタックシステム
- Authors: Yifan Zhong, Zhang Chen, Tianrui Guan, Fanlian Zeng, Yuyao Ye, Tianjia He, Ka Nam Lui, Jiayi Li, Tingrui Zhang, Ruilin Yan, Xinhao Ji, Guangyu Zhao, Wenjie Lou, Jiayuan Zhang, Yuanpei Chen, Yaodong Yang,
- Abstract要約: 本稿では,エゴセントリックな人間ビデオから,デキスタラスなVLA事前学習をスケールするフルスタックシステムを提案する。
EgoSmithは、高品質な事前トレーニングデータの9.6K時間に、Wild Egocentricビデオのキュレーションを行うデータパイプラインである。
EgoSteerは40以上のタスクにまたがるフリーフォーム命令を堅牢に実行し、障害回復、デクスタリティ、一般化を実証する。
- 参考スコア(独自算出の注目度): 27.122239961936756
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Steerability is a defining capability of generalist robot policies, yet remains largely absent in dexterous-hand systems for lack of large-scale, language-aligned, and action-accurate demonstration data. To address this bottleneck, we present a full-stack system that scales dexterous VLA pre-training from egocentric human videos and enables data-efficient real-robot post-training. It integrates EgoSmith, a data pipeline that curates in-the-wild egocentric videos into 9.6K hours of high-quality pre-training data with 9x higher throughput and better accuracy than prior SOTA; a unified robot stack for teleoperation and human-in-the-loop correction; and EgoSteer, a world-model-enhanced VLA trained on optimized infrastructure. Human-data pre-training equips EgoSteer with language-guided manipulation priors, which are grounded through robot post-training and improved by DAgger refinement. Empirically, EgoSteer robustly executes free-form instructions across 40+ diverse tasks, demonstrating failure recovery, dexterity, and generalization. The pre-trained model also few-shot adapts to complex long-horizon tasks, including box folding, on two embodiments with 75+% success. We open-source the system, data, and model at https://egosteer.github.io/.
- Abstract(参考訳): ステアビリティは、汎用的なロボットポリシーの定義能力であるが、大規模な、言語対応、行動精度の実証データが欠如しているため、器用な手作業のシステムでは依然としてほとんど欠落している。
このボトルネックに対処するために、エゴセントリックな人間ビデオからデキスタラスVLA事前学習をスケールし、データ効率のよい実ロボットポストトレーニングを可能にするフルスタックシステムを提案する。
EgoSmithは、高品質な事前学習データを9.6K時間にキュレートするデータパイプラインで、以前のSOTAの9倍のスループットと精度で、遠隔操作とループ修正のための統合されたロボットスタック、最適化されたインフラで訓練された世界モデルのVLAであるEgoSteerを統合している。
EgoSteerは、ロボットの訓練後、DAggerの改良によって改善されている。
実証的には、EgoSteerは40以上の多様なタスクにまたがるフリーフォーム命令を堅牢に実行し、障害回復、デクスタリティ、一般化を実証する。
事前訓練されたモデルは、75%以上の成功を収めた2つの実施形態において、箱の折り畳みを含む複雑なロングホライゾンタスクにも適応する。
私たちはこのシステム、データ、モデルをhttps://egosteer.github.io/でオープンソース化しました。
関連論文リスト
- Robot Self-Improvement via Human-Video Dynamics Models [52.14862052988773]
人間のビデオは、ロボットのエンボディメント間で伝達されるエンボディメントに依存しない動作、ダイナミクス、および値表現を学ぶのに利用できることを示す。
DGAC(Dynamics-Guided Action Correction)は,これらの適応モデルを用いて故障状態の修復を行うトレーニングフリーアプローチである。
以上の結果から,人間の先行とロボットの失敗が組み合わさって,スケーラブルな自律的政策改善を可能にすることが示唆された。
論文 参考訳(メタデータ) (2026-06-19T13:17:27Z) - HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining [93.5192770515694]
Embodied foundation modelは、大きな言語モデルのようなデータスケーリングの恩恵を受けることが期待されているが、より厳密なデータボトルネックに直面している。
遠隔操作された実ロボット軌道は、正確な行動監督と実施の整合性のために、訓練前の主流の源である。
エゴセントリックなデータに基づいて事前訓練された基礎モデルは、実ロボットアクション予測において24%低い検証損失を達成する。
論文 参考訳(メタデータ) (2026-06-18T17:37:34Z) - Contrastive Action-Image Pre-training for Visuomotor Control [91.5630572541332]
エンドエフェクタアクションのプロキシとして,大規模なエゴセントリックビデオからの人間の手ポーズを取り扱う視覚エンコーダであるCAIPを紹介する。
人間のビデオは32,041時間、ロボット操作のデータは88時間しかなく、CAIPは最先端の視覚エンコーダより優れています。
論文 参考訳(メタデータ) (2026-06-15T20:00:20Z) - ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining [40.678451625177026]
VLA(Vision-Language-Action)モデルは、大規模で多様な実施データから恩恵を受けるが、ロボットの軌道収集は費用がかかり、労力がかかる。
近年の進歩は、大規模な自我中心の人間ビデオが、事前訓練において補完的な現実世界の監督を提供することを示している。
異種データソースを併用した統合VLA事前学習フレームワークであるACE-EGO-0を紹介する。
論文 参考訳(メタデータ) (2026-06-15T18:40:18Z) - EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data [114.89243396877453]
EgoScaleは、大規模な自我中心の人間データ上に構築された人から器用な操作伝達フレームワークである。
簡単な2段階のトランスファーレシピを導入し, 大規模人体事前訓練と, ライトウェイトアライメントされた人間ロボットのトレーニングを行った。
最終方針は、22個のDoFデキスタラスロボットハンドを使用して、トレーニング済みのベースラインに対して平均成功率を54%向上させる。
論文 参考訳(メタデータ) (2026-02-18T18:59:05Z) - PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence [19.558594034613996]
Egocentric2Embodiment Translation Pipelineは、生の人間中心のビデオをマルチレベルなスキーマ駆動型実施監視に変換する。
E2E-3Mデータセットのトレーニングにより、Egocentric-aware embodied brainであるPhysBrainを得る。
論文 参考訳(メタデータ) (2025-12-18T17:27:03Z) - Developing Vision-Language-Action Model from Egocentric Videos [14.1517430035289]
エゴセントリックなビデオは、人間がオブジェクトやツールを操作する方法を捉え、オブジェクトの操作を学ぶための多様な動きの手がかりを提供する。
このようなビデオを利用してロボットのポリシーを訓練する以前の研究は、手動の詳細な記録のような補助的なアノテーションに依存していた。
本研究では,エゴセントリックビデオから6DoFオブジェクト操作トラジェクトリを抽出するフレームワークであるEgoScalerを活用することで,この問題に対処する。
論文 参考訳(メタデータ) (2025-09-26T07:09:33Z) - Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos [66.62109400603394]
本稿では,大規模な人体ビデオで訓練された視覚・言語・行動モデルであるBeing-H0を紹介する。
提案手法は,人間のビデオからの大規模VLA事前学習,3次元推論のための物理空間アライメント,ロボット作業のためのポストトレーニング適応を組み合わせた,新しいトレーニングパラダイムである物理インストラクションチューニングに重点を置いている。
本研究では,手の動き生成と指示の結果としてのBeat-H0の卓越性を実証的に示すとともに,モデルやデータサイズにもよく対応している。
論文 参考訳(メタデータ) (2025-07-21T13:19:09Z) - Robotic Offline RL from Internet Videos via Value-Function Pre-Training [67.44673316943475]
ロボットオフラインRLにおける大規模ビデオデータセットを活用するシステムを開発した。
ビデオデータセットにおける価値学習は、下流のロボットオフラインRLに対して、他のアプローチよりも理解しやすい表現を学習することを示す。
論文 参考訳(メタデータ) (2023-09-22T17:59:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。