論文の概要: Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
- arxiv url: http://arxiv.org/abs/2607.14183v1
- Date: Wed, 15 Jul 2026 14:49:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.856205
- Title: Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
- Title(参考訳): Open-AoE: 自己学習のためのオープンなエゴセントリックな操作データセットとツールチェーン
- Authors: Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li,
- Abstract要約: オープンでコミュニティ指向のエゴセントリックな操作と,キャプチャからモデルトレーニングまでのツール中心のパイプラインであるOpen-AoEを紹介します。
最初のリリースでは、400以上のスマートフォンを使用して500以上の自然環境で収集された約2000時間のビデオが含まれている。
- 参考スコア(独自算出の注目度): 82.27496680935589
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Egocentric videos of human manipulation provide scalable supervision for embodied intelligence, yet existing resources rarely combine low-cost continuous capture, manipulation-level structured annotations, and reusable tools for robot learning. We present Open-AoE, an open, community-oriented egocentric manipulation dataset and toolchain spanning the full pipeline from smartphone capture to model training. Its first release contains approximately 2,000 hours of manipulation video collected in natural environments by 500+ contributors using 400+ smartphones. The dataset provides text annotations, MANO-based hand poses, camera trajectories, and temporally localized atomic actions. Open-AoE further includes a data processing pipeline that transforms raw recordings into structured samples through temporal action segmentation, semantic annotation, hand reconstruction, and camera trajectory reconstruction. Meanwhile, we provide a separate downstream toolchain supports visualization, cross-embodiment retargeting, model-specific data conversion, and training recipes for VLA policies, WAMs, and World Models. By integrating scalable capture, structured processing, and downstream adaptation, Open-AoE reduces the barriers to both data contribution and reuse, providing practical open infrastructure for embodied model training, human-to-robot transfer, and world modeling.
- Abstract(参考訳): 人間の操作のエゴセントリックなビデオは、エンボディインテリジェンスのためのスケーラブルな監視を提供するが、既存のリソースは、低コストの継続的キャプチャ、操作レベルの構造化アノテーション、ロボット学習のための再利用可能なツールを組み合わせることはめったにない。
オープンでコミュニティ指向のエゴセントリックな操作データセットであるOpen-AoEと、スマートフォンキャプチャからモデルトレーニングまでの完全なパイプラインにまたがるツールチェーンについて紹介する。
最初のリリースには、400以上のスマートフォンを使用して500人以上のコントリビュータが自然環境で収集した約2000時間の操作ビデオが含まれている。
このデータセットは、テキストアノテーション、MANOベースの手ポーズ、カメラ軌跡、時間的局所化された原子アクションを提供する。
Open-AoEはさらに、時間的アクションセグメンテーション、セマンティックアノテーション、手再構築、カメラ軌道再構成を通じて生記録を構造化されたサンプルに変換するデータ処理パイプラインを含んでいる。
一方、我々は、可視化、クロス・エボディメント・リターゲティング、モデル固有のデータ変換、VLAポリシー、WAM、ワールドモデルのためのトレーニングレシピをサポートする別の下流ツールチェーンを提供しています。
スケーラブルなキャプチャ、構造化処理、下流適応を統合することで、Open-AoEはデータコントリビューションと再利用の両方の障壁を減らし、具体化されたモデルトレーニング、人間とロボットの移動、世界モデリングのための実用的なオープンインフラストラクチャを提供する。
関連論文リスト
- EgoAERO: Learning Dexterous Manipulation from a Single Egocentric Video without Object Assets [17.334975740648648]
EgoAEROは、オブジェクト資産なしで1つのエゴセントリックなRGB-D人間のデモから、巧妙な操作を学ぶ。
EgoAEROは、アセットレスオブジェクト追跡と再構築を通じて、接触一貫性のあるハンドオブジェクト軌跡を再構築する。
EgoDex-Rは4.3MのRGB-Dフレームを持つ大規模なエゴセントリックなデータセットである。
論文 参考訳(メタデータ) (2026-06-06T08:39:52Z) - From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data [71.22409934108924]
人間のビデオは豊富で、豊富な相互作用を捉え、現実世界の操作に多様な意味と物理的な手がかりを提供する。
この調査は、人間のビデオがビジョン・ランゲージ・アクション(VLA)モデルの効果的な知識にどのように変換されるか、統一された視点を提供する。
この領域では、非構造化動画をトレーニング可能なエピソードに構造化すること、エンボディメントと視点の不均一性の下でロボットが実行可能なアクションにビデオから制御すること、現実世界の展開性能と転送効率をよりよく予測する評価プロトコルを設計すること、の3つのオープンな課題を強調している。
論文 参考訳(メタデータ) (2026-05-18T06:19:16Z) - Reconstruction-Driven Multimodal Representation Learning for Automated Media Understanding [0.1411701037241356]
本稿では,テキスト,音声,視覚データ間の統一表現を学習するマルチモーダルオートエンコーダを提案する。
線形ベースラインに比べてクラスタリングとアライメントの指標が大幅に改善された。
その結果、現代放送の自動化、検索可能性、コンテンツ管理効率を高めるために、再構成駆動型マルチモーダル学習の可能性を浮き彫りにした。
論文 参考訳(メタデータ) (2025-11-17T19:13:51Z) - Watch and Learn: Learning to Use Computers from Online Videos [50.10702690339142]
Watch & Learn(W&L)は、インターネット上で簡単に利用できる人間のデモビデオを、大規模に実行可能なUIトラジェクトリに変換するフレームワークである。
我々は,タスク対応ビデオ検索を用いた逆動的ラベリングパイプラインを開発し,生のウェブビデオから53k以上の高品質なトラジェクトリを生成する。
これらの結果から,実世界展開に向けたCUAの実践的かつスケーラブルな基盤として,Webスケールの人間デモビデオが注目されている。
論文 参考訳(メタデータ) (2025-10-06T10:29:00Z) - EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer [35.27100635173712]
視覚言語アクション(VLA)モデルは、堅牢な一般化を達成するために、多種多様なトレーニングデータに依存している。
本稿では,VLAポリシー拡張フレームワークであるEmbodied Manipulation Media Adaptation (EMMA)を提案する。
DreamTransferは、3D構造や幾何学的妥当性を損なうことなく、ロボットビデオのテキスト制御による視覚的編集、前景、背景、照明条件の変換を可能にする。
AdaMixは、動的にトレーニングバッチを再重み付けして、知覚的あるいは運動学的に困難なサンプルに最適化する、ハードサンプル対応のトレーニング戦略である。
論文 参考訳(メタデータ) (2025-09-26T14:34:44Z) - Developing Vision-Language-Action Model from Egocentric Videos [14.1517430035289]
エゴセントリックなビデオは、人間がオブジェクトやツールを操作する方法を捉え、オブジェクトの操作を学ぶための多様な動きの手がかりを提供する。
このようなビデオを利用してロボットのポリシーを訓練する以前の研究は、手動の詳細な記録のような補助的なアノテーションに依存していた。
本研究では,エゴセントリックビデオから6DoFオブジェクト操作トラジェクトリを抽出するフレームワークであるEgoScalerを活用することで,この問題に対処する。
論文 参考訳(メタデータ) (2025-09-26T07:09:33Z) - Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos [66.62109400603394]
本稿では,大規模な人体ビデオで訓練された視覚・言語・行動モデルであるBeing-H0を紹介する。
提案手法は,人間のビデオからの大規模VLA事前学習,3次元推論のための物理空間アライメント,ロボット作業のためのポストトレーニング適応を組み合わせた,新しいトレーニングパラダイムである物理インストラクションチューニングに重点を置いている。
本研究では,手の動き生成と指示の結果としてのBeat-H0の卓越性を実証的に示すとともに,モデルやデータサイズにもよく対応している。
論文 参考訳(メタデータ) (2025-07-21T13:19:09Z) - KALIE: Fine-Tuning Vision-Language Models for Open-World Manipulation without Robot Data [45.25288643161976]
本稿では,ロボット制御をスケーラブルに行うために,KALIE(Keypoint Affordance Learning from Imagined Environments)を提案する。
モーターコマンドを直接生成する代わりに、KALIEはポイントベースの価格表現を予測してロボットを制御する。
我々はKALIEが、50個のデータポイントしか持たない未確認オブジェクトで、新しい操作タスクを堅牢に解くことができることを実証した。
論文 参考訳(メタデータ) (2024-09-21T08:45:16Z) - ALP: Action-Aware Embodied Learning for Perception [60.64801970249279]
認知のための行動認識型身体学習(ALP)について紹介する。
ALPは、強化学習ポリシーと逆ダイナミクス予測目標を最適化することにより、行動情報を表現学習に組み込む。
ALPは、複数の下流認識タスクにおいて、既存のベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2023-06-16T21:51:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。