Fugu-MT 論文翻訳(概要): RM-PRT: Realistic Robotic Manipulation Simulator and Benchmark with Progressive Reasoning Tasks

論文の概要: RM-PRT: Realistic Robotic Manipulation Simulator and Benchmark with Progressive Reasoning Tasks

arxiv url: http://arxiv.org/abs/2306.11335v2
Date: Wed, 21 Jun 2023 06:56:47 GMT
ステータス: 翻訳完了
システム内更新日: 2023-06-22 10:27:59.544472
Title: RM-PRT: Realistic Robotic Manipulation Simulator and Benchmark with Progressive Reasoning Tasks
Title（参考訳）: rm-prt: ロボット操作シミュレータとプログレッシブ推論タスクを用いたベンチマーク
Authors: Pengzhen Ren, Kaidong Zhang, Hetao Zheng, Zixuan Li, Yuhang Wen, Fengda Zhu, Mas Ma, Xiaodan Liang
Abstract要約: 本稿では,現実的なロボット操作シミュレータを導入し,Progressive Reasoning Tasksベンチマークを用いたロボットマニピュレーションを構築する。 RM-PRTベンチマークは、Unreal Engine 5をベースにした、新しい高忠実なデジタルツインシーンを構築している。本研究では,4つの自然言語理解タスクを段階的推論レベルで設定し,自然言語の指示を理解するロボットの能力を評価する。
参考スコア（独自算出の注目度）: 61.943889635281344
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Recently, the advent of pre-trained large-scale language models (LLMs) like ChatGPT and GPT-4 have significantly advanced the machine's natural language understanding capabilities. This breakthrough has allowed us to seamlessly integrate these open-source LLMs into a unified robot simulator environment to help robots accurately understand and execute human natural language instructions. To this end, in this work, we introduce a realistic robotic manipulation simulator and build a Robotic Manipulation with Progressive Reasoning Tasks (RM-PRT) benchmark on this basis. Specifically, the RM-PRT benchmark builds a new high-fidelity digital twin scene based on Unreal Engine 5, which includes 782 categories, 2023 objects, and 15K natural language instructions generated by ChatGPT for a detailed evaluation of robot manipulation. We propose a general pipeline for the RM-PRT benchmark that takes as input multimodal prompts containing natural language instructions and automatically outputs actions containing the movement and position transitions. We set four natural language understanding tasks with progressive reasoning levels and evaluate the robot's ability to understand natural language instructions in two modes of adsorption and grasping. In addition, we also conduct a comprehensive analysis and comparison of the differences and advantages of 10 different LLMs in instruction understanding and generation quality. We hope the new simulator and benchmark will facilitate future research on language-guided robotic manipulation. Project website: https://necolizer.github.io/RM-PRT/ .
Abstract（参考訳）: 近年、ChatGPTやGPT-4のような訓練済みの大規模言語モデル(LLM)が出現し、マシンの自然言語理解能力が大幅に向上した。このブレークスルーにより、これらのオープンソースのLLMを統合型ロボットシミュレータ環境にシームレスに統合し、ロボットが人間の自然言語命令を正確に理解し実行できるようにする。この目的のために,本研究では,現実的なロボット操作シミュレータを導入し,プログレッシブ推論タスクを用いたロボットマニピュレーション(RM-PRT)ベンチマークを構築する。具体的には、RM-PRTベンチマークは、ロボット操作の詳細な評価のためにChatGPTが生成した82のカテゴリ、2023のオブジェクト、および15Kの自然言語命令を含む、Unreal Engine 5に基づく新しい高忠実なデジタルツインシーンを構築する。本稿では,自然言語命令を含むマルチモーダルプロンプトを入力とし,移動と位置遷移を含む動作を自動的に出力するRM-PRTベンチマークの汎用パイプラインを提案する。本研究では,4つの自然言語理解タスクを段階的推論レベルで設定し,ロボットが自然言語の指示を理解する能力を評価する。さらに、命令理解と生成品質における10種類のLLMの違いと利点を総合的に分析し、比較する。新しいシミュレータとベンチマークにより、言語誘導型ロボット操作の今後の研究が促進されることを願っている。プロジェクトWebサイト: https://necolizer.github.io/RM-PRT/。

関連論文リスト

VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation [53.63540587160549]
VidBotは、WildのモノクルなRGBのみの人間ビデオから学習した3Dアベイランスを使って、ゼロショットロボット操作を可能にするフレームワークである。 VidBotは、人間の日常的なビデオを利用してロボットの学習をよりスケーラブルにする。
論文参考訳（メタデータ） (2025-03-10T10:04:58Z)
Human-Humanoid Robots Cross-Embodiment Behavior-Skill Transfer Using Decomposed Adversarial Learning from Demonstration [9.42179962375058]
本稿では,デジタル人間モデルを共通プロトタイプとして使用することにより,データのボトルネックを低減するための転送可能なフレームワークを提案する。このモデルは、人間による実演から、敵対的な模倣を通して行動プリミティブを学習し、複雑なロボット構造を機能的な構成要素に分解する。本フレームワークは,多種多様な構成のヒューマノイドロボット5体を用いて検証した。
論文参考訳（メタデータ） (2024-12-19T18:41:45Z)
$π_0$: A Vision-Language-Action Flow Model for General Robot Control [77.32743739202543]
本稿では,インターネット規模のセマンティック知識を継承するために,事前学習された視覚言語モデル(VLM)上に構築された新しいフローマッチングアーキテクチャを提案する。我々は,事前訓練後のタスクをゼロショットで実行し,人からの言語指導に追従し,微調整で新たなスキルを習得する能力の観点から,我々のモデルを評価した。
論文参考訳（メタデータ） (2024-10-31T17:22:30Z)
Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models [53.22792173053473]
我々はPolarisという対話型ロボット操作フレームワークを紹介した。ポラリスはGPT-4と接地された視覚モデルを利用して知覚と相互作用を統合する。本稿では,Syn2Real(Synthetic-to-Real)ポーズ推定パイプラインを提案する。
論文参考訳（メタデータ） (2024-08-15T06:40:38Z)
Manipulate-Anything: Automating Real-World Robots using Vision-Language Models [47.16659229389889]
実世界のロボット操作のためのスケーラブルな自動生成手法であるManipulate-Anythingを提案する。 Manipulate-Anythingは、特権のある状態情報や手書きのスキルなしで現実世界の環境で動作でき、静的オブジェクトを操作できる。
論文参考訳（メタデータ） (2024-06-27T06:12:01Z)
Towards Generalizable Zero-Shot Manipulation via Translating Human Interaction Plans [58.27029676638521]
我々は、人間の受動的ビデオが、そのようなジェネラリストロボットを学習するための豊富なデータ源であることを示す。我々は、シーンの現在の画像とゴール画像から将来の手やオブジェクトの設定を予測する人間の計画予測器を学習する。学習システムは、40個のオブジェクトに一般化する16以上の操作スキルを実現できることを示す。
論文参考訳（メタデータ） (2023-12-01T18:54:12Z)
Open-World Object Manipulation using Pre-trained Vision-Language Models [72.87306011500084]
ロボットが人からの指示に従うためには、人間の語彙の豊かな意味情報を繋げなければならない。我々は、事前学習された視覚言語モデルを利用して、オブジェクト識別情報を抽出するシンプルなアプローチを開発する。実際の移動マニピュレータにおける様々な実験において、MOOはゼロショットを様々な新しいオブジェクトカテゴリや環境に一般化する。
論文参考訳（メタデータ） (2023-03-02T01:55:10Z)
Scaling Robot Learning with Semantically Imagined Experience [21.361979238427722]
ロボット学習の最近の進歩は、ロボットが操作タスクを実行できることを約束している。この進歩に寄与する要因の1つは、モデルのトレーニングに使用されるロボットデータのスケールである。本稿では,コンピュータビジョンや自然言語処理に広く用いられているテキスト・ツー・イメージ基盤モデルを利用した代替手法を提案する。
論文参考訳（メタデータ） (2023-02-22T18:47:51Z)
Zero-Shot Robot Manipulation from Passive Human Videos [59.193076151832145]
我々は,人間の映像からエージェント非依存の行動表現を抽出するフレームワークを開発した。我々の枠組みは、人間の手の動きを予測することに基づいている。トレーニングされたモデルゼロショットを物理ロボット操作タスクにデプロイする。
論文参考訳（メタデータ） (2023-02-03T21:39:52Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。