Fugu-MT 論文翻訳(概要): PLEX: Making the Most of the Available Data for Robotic Manipulation Pretraining

論文の概要: PLEX: Making the Most of the Available Data for Robotic Manipulation Pretraining

arxiv url: http://arxiv.org/abs/2303.08789v2
Date: Wed, 8 Nov 2023 22:32:39 GMT
ステータス: 翻訳完了
システム内更新日: 2023-11-10 18:36:30.359746
Title: PLEX: Making the Most of the Available Data for Robotic Manipulation Pretraining
Title（参考訳）: plex: ロボット操作の事前訓練のために利用可能なデータを最大限に活用する
Authors: Garrett Thomas, Ching-An Cheng, Ricky Loynd, Felipe Vieira Frujeri, Vibhav Vineet, Mihai Jalobeanu, Andrey Kolobov
Abstract要約: 本稿では,タスク非依存のビジュモータトラジェクトリから学習するトランスフォーマーに基づくアーキテクチャを提案する。特に、コンプレックスのトランスフォーマーにおける相対的な位置エンコーディングを使用することは、人間が編集したデモから学習する低データ体制において大いに役立ちます。
参考スコア（独自算出の注目度）: 28.504762473732296
License: http://creativecommons.org/licenses/by/4.0/
Abstract: A rich representation is key to general robotic manipulation, but existing approaches to representation learning require large amounts of multimodal demonstrations. In this work we propose PLEX, a transformer-based architecture that learns from a small amount of task-agnostic visuomotor trajectories and a much larger amount of task-conditioned object manipulation videos -- a type of data available in quantity. PLEX uses visuomotor trajectories to induce a latent feature space and to learn task-agnostic manipulation routines, while diverse video-only demonstrations teach PLEX how to plan in the induced latent feature space for a wide variety of tasks. Experiments showcase PLEX's generalization on Meta-World and SOTA performance in challenging Robosuite environments. In particular, using relative positional encoding in PLEX's transformers greatly helps in low-data regimes of learning from human-collected demonstrations. The paper's accompanying code and data are available at https://microsoft.github.io/PLEX.
Abstract（参考訳）: 豊かな表現は一般的なロボット操作の鍵であるが、既存の表現学習には大量のマルチモーダルなデモンストレーションが必要である。本研究では,タスク非依存のビズモータトラジェクトリとタスク条件のオブジェクト操作ビデオから学ぶ,トランスフォーマーベースのアーキテクチャであるPLEXを提案する。 PLEXは、潜在機能空間を誘導し、タスクに依存しない操作ルーチンを学ぶために、visuomotor trajectoriesを使用する。実験では、Robosuite環境におけるPLEXのMeta-WorldとSOTAパフォーマンスの一般化を示す。特に、plexのトランスフォーマーに相対的な位置エンコーディングを使用することは、人間の集団的なデモンストレーションから学習する低データ環境に大きく役立つ。論文の添付コードとデータはhttps://microsoft.github.io/PLEX.comで公開されている。

関連論文リスト

LLaRA: Supercharging Robot Learning Data for Vision-Language Policy [56.505551117094534]
我々はLLaRA: Large Language and Robotics Assistantを紹介した。まず、既存の行動クローニングデータセットからロボットのための会話スタイルの指導データを生成する自動パイプラインを提案する。このようなデータセットを限定的に微調整したVLMは、ロボット制御において有意義な行動決定を導出できることを示す。
論文参考訳（メタデータ） (2024-06-28T17:59:12Z)
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning [50.99807031490589]
LLARVAは,ロボット学習タスク,シナリオ,環境を統一するための,新しい指導指導法で訓練されたモデルである。我々は,Open X-Embodimentデータセットから8.5Mの画像-視覚的トレースペアを生成し,モデルを事前学習する。実験によって強い性能が得られ、LLARVAは現代のいくつかのベースラインと比較してよく機能することを示した。
論文参考訳（メタデータ） (2024-06-17T17:55:29Z)
JUICER: Data-Efficient Imitation Learning for Robotic Assembly [21.43402768760014]
本稿では,人体実験予算を小さくすることで,模擬学習性能を向上させるパイプラインを提案する。我々のパイプラインは、表現力のあるポリシーアーキテクチャと、データセットの拡張とシミュレーションベースのデータ拡張のための様々な技術を組み合わせています。シミュレーションで4つの家具組立タスクのパイプラインを実演し、2500近い時間ステップで最大5つの部品をマニピュレータで組み立てます。
論文参考訳（メタデータ） (2024-04-04T18:00:15Z)
Any-point Trajectory Modeling for Policy Learning [64.23861308947852]
我々は、ビデオフレーム内の任意の点の将来の軌跡を予測するために、ATM(Any-point Trajectory Modeling)を導入する。 ATMは、強力なビデオ事前トレーニングベースラインを平均80%上回っている。本研究では,人間の動画やビデオからの操作スキルを,異なるロボット形態から効果的に伝達する学習方法を示す。
論文参考訳（メタデータ） (2023-12-28T23:34:43Z)
Imitating Task and Motion Planning with Visuomotor Transformers [71.41938181838124]
タスク・アンド・モーション・プランニング(TAMP)は、多様なデモンストレーションの大規模なデータセットを自律的に生成できる。本研究では,TAMPスーパーバイザが生成する大規模データセットと,それらに適合するフレキシブルトランスフォーマーモデルの組み合わせが,ロボット操作の強力なパラダイムであることを示す。我々は,TAMPエージェントを模倣して大規模ビジュモータトランスフォーマーポリシーを訓練する OPTIMUS という新しい模倣学習システムを提案する。
論文参考訳（メタデータ） (2023-05-25T17:58:14Z)
VIMA: General Robot Manipulation with Multimodal Prompts [82.01214865117637]
ロボット操作タスクの幅広い範囲をマルチモーダルプロンプトで表現できることを示す。我々は,数千の手続き的に生成されたテーブルトップタスクからなる新しいシミュレーションベンチマークを開発した。我々は、これらのプロンプトを処理し、自動回帰的に運動動作を出力するトランスフォーマーベースのロボットエージェントVIMAを設計する。
論文参考訳（メタデータ） (2022-10-06T17:50:11Z)
Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation [52.94101901600948]
マルチタスク6-DoF操作のための言語条件付き行動閉鎖エージェントPerActを開発した。 PerActはPerceiver Transformerを用いて言語目標とRGB-Dボクセル観測を符号化し、"次の最良のボクセル動作を検出する"ことで識別された動作を出力する。以上の結果から,PerActは多様なテーブルトップタスクにおいて,非構造化イメージ・ツー・アクション・エージェントと3D ConvNetベースラインを著しく上回っていることがわかった。
論文参考訳（メタデータ） (2022-09-12T17:51:05Z)
Visual Imitation Made Easy [102.36509665008732]
本稿では,ロボットへのデータ転送を容易にしながら,データ収集プロセスを単純化する,模倣のための代替インターフェースを提案する。我々は、データ収集装置やロボットのエンドエフェクターとして、市販のリーチ・グラブラー補助具を使用する。我々は,非包括的プッシュと包括的積み重ねという2つの課題について実験的に評価した。
論文参考訳（メタデータ） (2020-08-11T17:58:50Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。