論文の概要: Monkey See, Can Monkey Do? A Benchmark for Evaluating Robot Skill Learning by Observation
- arxiv url: http://arxiv.org/abs/2609.08209v2
- Date: Wed, 09 Sep 2026 03:55:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.569695
- Title: Monkey See, Can Monkey Do? A Benchmark for Evaluating Robot Skill Learning by Observation
- Title(参考訳): 猿はできるのか? 観察によるロボットスキル学習評価のためのベンチマーク
- Authors: Weiwei Gu, Anmol Gupta, Anant Sah, Ryan Varghese, Lalitha Shreya Vanam, Prabhath Adireddi, Peter Karkus, Nakul Gopalan,
- Abstract要約: 観察から学ぶ(LfO)は、人間と動物が互いに社会的に学習する方法を再現する基本的なロボット機能である。
近年の研究では、人間のビデオから操作スキルを学ぶことの有望な成果が示されている。
人間のビデオからポリシーを学ぶモデルを評価するための統一ベンチマークであるRoboReelを紹介する。
- 参考スコア(独自算出の注目度): 6.576658827863041
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning from Observation (LfO) is a fundamental robotic capability that replicates how humans and animals socially learn from each other. Beyond its biological parallels, this modality provides a practical solution for data scaling in sample-inefficient and data-starved domains like robotics. Recent work has demonstrated promising results in learning manipulation skills from human videos, yet progress in this area remains difficult to assess. Existing methods vary widely in assumptions, hardware choices, and environment setups making it difficult to draw meaningful comparisons and identify advances in the field. To address these challenges, we introduce RoboReel: a unified benchmark for evaluating models that learn policies from human videos. RoboReel consists of bundled real-world human demonstration videos, simulated robot trajectories, and evaluation environments on ten manipulation tasks. We develop four test suites to evaluate the models' performance on multiple axes, including the robustness to visual distractors and the ability to complete long-horizon tasks. Our benchmark covers learning-from-observation models from different categories, and studies the effectiveness of multiple representation choices in our benchmark evaluation that covers over seven state-of-the-art algorithms (including our VLA based variants) in the field of LfO. Finally, we present an analysis of the different types of algorithms showing that long-horizon tasks and tasks with low tolerances are still challenging for current models. Webpage: https://roboreel.github.io
- Abstract(参考訳): 観察から学ぶ(LfO)は、人間と動物が互いに社会的に学習する方法を再現する基本的なロボット機能である。
生物学的な並列性以外にも、このモダリティは、サンプル非効率およびロボティクスのようなデータスターベッドドメインにおけるデータスケーリングの実践的なソリューションを提供する。
近年の研究では、人間のビデオから操作スキルを学ぶことの有望な成果が示されているが、この分野の進歩はいまだに評価が難しい。
既存の手法は、仮定、ハードウェアの選択、環境設定において多岐にわたりおり、意味のある比較を引き出すのが難しく、分野の進歩を特定するのが困難である。
これらの課題に対処するために、人間のビデオからポリシーを学ぶモデルを評価するための統一ベンチマークであるRoboReelを紹介します。
RoboReelは、実世界の人間のデモビデオ、シミュレーションされたロボット軌道、そして10の操作タスクの評価環境で構成されている。
複数の軸上でのモデルの性能を評価するための4つのテストスイートを開発した。
本ベンチマークでは,LfOの分野における7つの最先端アルゴリズム(VLAに基づく変種を含む)をカバーする,複数の表現選択の有効性について検討した。
最後に, 従来のモデルでは, 長期的タスクや耐障害性の低いタスクが依然として困難であることを示すアルゴリズムの種類について分析する。
Webページ: https://roboreel.github.io
関連論文リスト
- From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data [71.22409934108924]
人間のビデオは豊富で、豊富な相互作用を捉え、現実世界の操作に多様な意味と物理的な手がかりを提供する。
この調査は、人間のビデオがビジョン・ランゲージ・アクション(VLA)モデルの効果的な知識にどのように変換されるか、統一された視点を提供する。
この領域では、非構造化動画をトレーニング可能なエピソードに構造化すること、エンボディメントと視点の不均一性の下でロボットが実行可能なアクションにビデオから制御すること、現実世界の展開性能と転送効率をよりよく予測する評価プロトコルを設計すること、の3つのオープンな課題を強調している。
論文 参考訳(メタデータ) (2026-05-18T06:19:16Z) - ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation [16.729702815913907]
VLM(Vision-Language Models)は、人工知能とロボティクスに革命をもたらした。
ロボット操作では、VLMは主に高レベルプランナーとして使用されるが、最近の研究は、その低レベル推論能力についても研究している。
VLMの低レベルロボット操作推論能力を評価するために,新しいベンチマークManipBenchを提案する。
論文 参考訳(メタデータ) (2025-05-14T18:01:00Z) - What Are You Doing? A Closer Look at Controllable Human Video Generation [73.89117620413724]
What Are You Doing?」は、人間の制御可能な画像とビデオの生成を評価するための新しいベンチマークである。
このビデオは、1,544本のキャプション付きビデオで構成されており、56の細かなカテゴリーで細かな収集と注釈付けがなされている。
制御可能な画像・映像生成における7つの最先端モデルの詳細な解析を行う。
論文 参考訳(メタデータ) (2025-03-06T17:59:29Z) - Mitigating the Human-Robot Domain Discrepancy in Visual Pre-training for Robotic Manipulation [16.809190349155525]
そこで本研究では,容易に利用可能な人間ロボットのビデオデータを利用して,ドメインギャップを埋める新しい適応パラダイムを提案する。
提案手法では,人間とロボットのビデオのセマンティクスを整列させるために,人間ロボットのアライメント損失を用いて,事前学習したモデルをパラメータ効率よくロボット領域に適応させる。
論文 参考訳(メタデータ) (2024-06-20T11:57:46Z) - What Matters in Learning from Offline Human Demonstrations for Robot
Manipulation [64.43440450794495]
ロボット操作のための6つのオフライン学習アルゴリズムについて広範な研究を行う。
我々の研究は、オフラインの人間のデータから学習する際の最も重要な課題を分析します。
人間のデータセットから学ぶ機会を強調します。
論文 参考訳(メタデータ) (2021-08-06T20:48:30Z) - Learning Generalizable Robotic Reward Functions from "In-The-Wild" Human
Videos [59.58105314783289]
ドメインに依存しないビデオ識別器(DVD)は、2つのビデオが同じタスクを実行しているかどうかを判断するために識別器を訓練することによりマルチタスク報酬関数を学習する。
DVDは、人間のビデオの広いデータセットで少量のロボットデータから学習することで、一般化することができる。
DVDと視覚モデル予測制御を組み合わせることで、実際のWidowX200ロボットのロボット操作タスクを単一の人間のデモから未知の環境で解決できます。
論文 参考訳(メタデータ) (2021-03-31T05:25:05Z) - Model-Based Visual Planning with Self-Supervised Functional Distances [104.83979811803466]
モデルに基づく視覚的目標達成のための自己監視手法を提案する。
私たちのアプローチは、オフラインでラベルなしのデータを使って完全に学習します。
このアプローチは,モデルフリーとモデルベース先行手法の両方で大幅に性能が向上することがわかった。
論文 参考訳(メタデータ) (2020-12-30T23:59:09Z) - Visual Imitation Made Easy [102.36509665008732]
本稿では,ロボットへのデータ転送を容易にしながら,データ収集プロセスを単純化する,模倣のための代替インターフェースを提案する。
我々は、データ収集装置やロボットのエンドエフェクターとして、市販のリーチ・グラブラー補助具を使用する。
我々は,非包括的プッシュと包括的積み重ねという2つの課題について実験的に評価した。
論文 参考訳(メタデータ) (2020-08-11T17:58:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。