論文の概要: AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems
- arxiv url: http://arxiv.org/abs/2503.06669v2
- Date: Thu, 13 Mar 2025 06:59:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-03-14 12:35:47.629601
- Title: AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems
- Title(参考訳): AgiBot World Colosseo: スケーラブルでインテリジェントなシステムのための大規模操作プラットフォーム
- Abstract要約: AgiBot Worldは、217のタスクにまたがる100万以上のトラジェクトリを5つのデプロイメントシナリオで構成した大規模なプラットフォームである。
AgiBot Worldは高品質で多様なデータ配信を保証する。
GO-1は、現実世界のデクスタラスタスクや長距離タスクにおいて例外的な能力を示す。
- 参考スコア(独自算出の注目度): 88.28501640292686
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We explore how scalable robot data can address real-world challenges for generalized robotic manipulation. Introducing AgiBot World, a large-scale platform comprising over 1 million trajectories across 217 tasks in five deployment scenarios, we achieve an order-of-magnitude increase in data scale compared to existing datasets. Accelerated by a standardized collection pipeline with human-in-the-loop verification, AgiBot World guarantees high-quality and diverse data distribution. It is extensible from grippers to dexterous hands and visuo-tactile sensors for fine-grained skill acquisition. Building on top of data, we introduce Genie Operator-1 (GO-1), a novel generalist policy that leverages latent action representations to maximize data utilization, demonstrating predictable performance scaling with increased data volume. Policies pre-trained on our dataset achieve an average performance improvement of 30% over those trained on Open X-Embodiment, both in in-domain and out-of-distribution scenarios. GO-1 exhibits exceptional capability in real-world dexterous and long-horizon tasks, achieving over 60% success rate on complex tasks and outperforming prior RDT approach by 32%. By open-sourcing the dataset, tools, and models, we aim to democratize access to large-scale, high-quality robot data, advancing the pursuit of scalable and general-purpose intelligence.
- Abstract(参考訳): 汎用ロボット操作における現実的な課題に対して,スケーラブルなロボットデータがどのように対処できるかを考察する。
AgiBot Worldは、217のタスクにまたがる100万以上のトラジェクトリを5つのデプロイメントシナリオでまとめた大規模なプラットフォームで、既存のデータセットと比較して、データスケールのオーダー・オブ・マグニチュードの増加を実現しています。
AgiBot Worldは、ヒューマン・イン・ザ・ループ検証を備えた標準化されたコレクションパイプラインによって加速され、高品質で多様なデータ配布を保証する。
グリッパーから器用な手、微妙なスキル獲得のための粘性触覚センサーまで拡張可能である。
データ上に構築されたGenie Operator-1(GO-1)は、遅延動作表現を利用してデータ利用を最大化し、データ量の増加による予測可能なパフォーマンススケーリングを実証する新しいジェネラリストポリシーである。
データセット上で事前トレーニングされたポリシは、ドメイン内および配布外シナリオの両方において、Open X-Embodimentでトレーニングされたものよりも30%パフォーマンスが向上します。
GO-1は、実世界のデキスタラスタスクや長距離タスクにおいて例外的な能力を示し、複雑なタスクで60%以上の成功率を達成し、RTTのアプローチを32%上回っている。
データセット、ツール、モデルをオープンソース化することで、大規模で高品質なロボットデータへのアクセスを民主化し、スケーラブルで汎用的なインテリジェンスを追求することを目指している。
関連論文リスト
- Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections [20.699475306823462]
日常的な作業をカバーする多彩なバイマニュアル操作のデモを1500時間実施する。
我々はこの包括的コーパスを用いて、強力な視覚言語アクション(VLA)モデルであるXR-2を訓練する。
本研究では,専門家による実証データの量の変化と,リアルタイムの人的介入によるDAgger修正データに対するポストトレーニングの2つの重要なスケーリング軸について検討する。
論文 参考訳(メタデータ) (2026-09-03T09:37:09Z) - AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation [22.559633314919342]
AXISは成長可能なコミュニティ主導のデータエンジンであり、スケーラブルなロボット学習のためのベンチマークである。
新しい操作タスクを自動生成し、検証し、コミュニティが作成したデモをトレーニング可能なデータに変換する。
AXISの継続事前訓練は、0.0.5$の総合的な成功率を5.8%向上させる。
データボリュームの増加と一貫したスケーリングを示しており、レイアウト、センサーノイズ、カメラの摂動で観測される最大のゲインである。
論文 参考訳(メタデータ) (2026-07-23T17:58:08Z) - From Foundation to Application: Improving VLA Models in Practice [62.1552185059214]
3つの機能ドメインの改善を通じてLingBot-VLAを進化させるLingBot-VLA 2.0を提案する。
以前のバージョンと比較して、データ処理パイプラインを改訂し、事前トレーニングのために約6万時間のデータをキュレートします。
特に,本システムでは,頭部,腰,移動台,器用な手の自由度を考慮し,ロボットがより複雑なタスクを現実的なシナリオでこなせるようにしている。
論文 参考訳(メタデータ) (2026-07-07T15:33:12Z) - EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks [41.23218228921582]
EgoLiveは、実際のタスク指向の人間ルーチンに焦点を当てた、オープンソースのアノテートエゴセントリックデータセットとしては最大である。
カスタマイズされたヘッドマウントキャプチャデバイスと、包括的な高精度なマルチモーダルアノテーションを通じて、リードデータ品質を提供する。
すべてのデータは、制約のない現実世界のシナリオでのみ収集され、ホームサービス、小売、その他の実用的な作業シナリオを含む、垂直フィールドの人間の作業データを含む。
論文 参考訳(メタデータ) (2026-04-26T07:21:15Z) - UltraDexGrasp: Learning Universal Dexterous Grasping for Bimanual Robots with Synthetic Data [70.96218513410454]
両面ロボットを用いた普遍的デクスタラスグリップのためのフレームワークであるUltraDexGraspを紹介する。
提案したデータ生成パイプラインは、最適化に基づくグリップ合成と計画に基づくデモ生成を統合する。
我々はUltraDexGrasp-20Mに基づいて、点雲を入力とし、一方向の注意を通してシーン特徴を集約し、制御コマンドを予測する、シンプルで効果的な把握ポリシーを開発した。
論文 参考訳(メタデータ) (2026-03-05T15:54:21Z) - RoboGene: Boosting VLA Pre-training via Diversity-Driven Agentic Framework for Real-World Task Generation [37.52152452548065]
RoboGeneは多様な物理的に可能な操作タスクを生成するために設計されたエージェントフレームワークである。
広範に定量的な分析と大規模な実世界の実験を行い、18k軌道のデータセットを収集した。
結果は、RoboGeneが最先端の基礎モデルよりも大幅に優れていることを示している。
論文 参考訳(メタデータ) (2026-02-18T13:29:43Z) - FieldGen: From Teleoperated Pre-Manipulation Trajectories to Field-Guided Data Generation [60.28409233931666]
FieldGenは、スケーラブルで多様な、高品質な実世界のデータ収集を可能にする、フィールド誘導型データ生成フレームワークである。
実験により、FieldGenでトレーニングされたポリシーは、遠隔操作ベースのベースラインと比較して、より高い成功率と安定性を達成することが示された。
論文 参考訳(メタデータ) (2025-10-23T17:47:12Z) - R2RGEN: Real-to-Real 3D Data Generation for Spatially Generalized Manipulation [74.41728218960465]
本稿では,実世界のデータを生成するために,ポイントクラウド観測-アクションペアを直接拡張するリアルタイム3Dデータ生成フレームワーク(R2RGen)を提案する。
R2RGenは、広範な実験におけるデータの効率を大幅に向上させ、モバイル操作におけるスケーリングと応用の強い可能性を示す。
論文 参考訳(メタデータ) (2025-10-09T17:55:44Z) - H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation [27.585828712261232]
H-RDT(Human to Robotics Diffusion Transformer)は、人間の操作データを利用してロボット操作能力を向上する新しいアプローチである。
私たちの重要な洞察は、大規模なエゴセントリックな人間操作ビデオとペアの3Dハンドポーズアノテーションが、自然な操作戦略を捉えたリッチな行動優先を提供するということです。
本研究では,(1)大規模な人間操作データに対する事前トレーニング,(2)モジュール型アクションエンコーダとデコーダを用いたロボット固有のデータに対するクロスエボディメント微調整という2段階の訓練パラダイムを導入する。
論文 参考訳(メタデータ) (2025-07-31T13:06:59Z) - Latent Policy Steering with Embodiment-Agnostic Pretrained World Models [8.265847442964045]
我々は,既存の費用対効果のあるデータを活用することで,ロボットの動作を学習する際のデータ収集の労力を削減することを目的としている。
我々は,多身体データを用いた世界モデル(WM)のトレーニングを行うために,光学フローを具体化に依存しない動作表現として利用する。
我々は,WMの潜在空間を探索して行動閉鎖ポリシーの出力を改善する手法,LPS (Latent Policy Steering) を開発した。
論文 参考訳(メタデータ) (2025-07-17T17:57:57Z) - Is Diversity All You Need for Scalable Robotic Manipulation? [50.747150672933316]
ロボット学習におけるデータ多様性の役割について,従来の「より多様な方がよい」という直観に固執する3つの重要な次元(タスク),実施形態(ロボットの使用方法),専門家(専門家)を用いて検討する。
タスクの多様性は、タスクごとのデモンストレーション量よりも重要であり、多様な事前学習タスクから新しい下流シナリオへの移行に有効であることを示す。
本稿では,速度のあいまいさを緩和する分散デバイアス法を提案する。GO-1-Proは,2.5倍の事前学習データを用いて,15%の性能向上を実現している。
論文 参考訳(メタデータ) (2025-07-08T17:52:44Z) - RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation [51.86515213749527]
本稿では,多様な実データの自動生成を可能にするスケーラブルなシミュレーションフレームワークであるRoboTwin 2.0を紹介する。
sim-to-real転送を改善するため、RoboTwin 2.0は5つの軸に沿って構造化されたドメインランダム化を組み込んでいる。
このフレームワークは、5つのロボットエボディメントにまたがる50のデュアルアームタスクにまたがってインスタンス化されます。
論文 参考訳(メタデータ) (2025-06-22T16:26:53Z) - Semantically Controllable Augmentations for Generalizable Robot Learning [40.89398799604755]
ロボット操作の現実に見えないシナリオへの一般化には、トレーニング中にさまざまなデータセットを公開する必要がある。
本稿では,意味制御可能な拡張とロボットデータセットの高速乗算のための生成的拡張フレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-02T05:25:34Z) - General Flow as Foundation Affordance for Scalable Robot Learning [17.542499720026047]
大規模RGBDビデオデータセットから直接,言語条件付き3次元フロー予測モデルを開発する。
提案手法は,ゼロショットの人間とロボットのスキル伝達において,81%の成功率を達成した。
論文 参考訳(メタデータ) (2024-01-21T09:39:11Z) - Learning from Imperfect Demonstrations with Self-Supervision for Robotic Manipulation [30.791222277450053]
現在の模倣学習(IL)は通常不完全なデータを破棄し、成功した専門家データにのみ焦点をあてる。
本稿では、専門家と不完全なデータを組み合わせた自己監督データフィルタリングフレームワーク(SSDF)を導入し、故障したトラジェクトリセグメントの品質スコアを計算する。
SSDFは、高品質な不完全なデータでトレーニングデータセットを正確に拡張し、すべてのロボット操作タスクの成功率を改善する。
論文 参考訳(メタデータ) (2024-01-17T04:15:56Z) - RoboAgent: Generalization and Efficiency in Robot Manipulation via
Semantic Augmentations and Action Chunking [54.776890150458385]
マルチタスク操作能力を持つユニバーサルエージェントを訓練するための効率的なシステムを開発した。
私たちは、12のスキルを持つ1つのエージェントを訓練することができ、38のタスクでその一般化を実証することができます。
平均すると、RoboAgentは目に見えない状況において、従来の方法よりも40%以上性能が高い。
論文 参考訳(メタデータ) (2023-09-05T03:14:39Z) - BridgeData V2: A Dataset for Robot Learning at Scale [73.86688388408021]
BridgeData V2は、ロボット操作行動の大規模で多様なデータセットである。
対象は、24の環境にまたがる60,096個のトラジェクトリだ。
論文 参考訳(メタデータ) (2023-08-24T17:41:20Z) - Scaling Data Generation in Vision-and-Language Navigation [116.95534559103788]
本稿では,学習のための大規模データ生成に有効なパラダイムを提案する。
我々は、HM3DとGibsonのデータセットから1200以上のフォトリアリスティック環境を適用し、490万の命令軌道対を合成する。
我々の大規模データセットのおかげで、既存のエージェントの性能は(以前のSoTAでは+11%絶対)、単純な模倣学習によってR2Rテストの分割で80%の単ラン成功率で大幅に向上できる。
論文 参考訳(メタデータ) (2023-07-28T16:03:28Z) - RT-1: Robotics Transformer for Real-World Control at Scale [98.09428483862165]
我々は,有望なスケーラブルなモデル特性を示す,ロボティクストランスフォーマーと呼ばれるモデルクラスを提示する。
実世界の課題を遂行する実ロボットの大規模データ収集に基づいて,様々なモデルクラスと,データサイズ,モデルサイズ,データの多様性の関数として一般化する能力について検証した。
論文 参考訳(メタデータ) (2022-12-13T18:55:15Z) - ProcTHOR: Large-Scale Embodied AI Using Procedural Generation [55.485985317538194]
ProcTHORは、Embodied AI環境の手続き的生成のためのフレームワークである。
ナビゲーション、アレンジメント、アーム操作のための6つの具体化されたAIベンチマークに対して、最先端の結果を実証する。
論文 参考訳(メタデータ) (2022-06-14T17:09:35Z) - The Imaginative Generative Adversarial Network: Automatic Data
Augmentation for Dynamic Skeleton-Based Hand Gesture and Human Action
Recognition [27.795763107984286]
本稿では、入力データの分布を近似し、この分布から新しいデータをサンプリングする新しい自動データ拡張モデルを提案する。
以上の結果から,拡張戦略は訓練が高速であり,ニューラルネットワークと最先端手法の両方の分類精度を向上させることが可能であることが示唆された。
論文 参考訳(メタデータ) (2021-05-27T11:07:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。