論文の概要: Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?
- arxiv url: http://arxiv.org/abs/2606.26428v1
- Date: Wed, 24 Jun 2026 22:39:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.094708
- Title: Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?
- Title(参考訳): Play2Perfect: 精密な組み立てのためのDexterous Play Pretrainingには何が重要か?
- Abstract要約: ロボットが正確な組み立てを完了する前には、まず遊び方を学ばなければならない、と私たちは主張する。
本研究では,多種多様なオブジェクトや目標に対して,タスクに依存しない事前学習を行うためのRLフレームワークであるPlay2Perfectを提案する。
我々は,より密集した多段階報酬が与えられた場合においても,前者はRLトレーニングのスクラッチの33倍のサンプル効率が得られた。
- 参考スコア(独自算出の注目度): 23.560816279987538
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-fingered robots promise the speed and dexterity of human hands, yet challenging problems such as precise assembly have remained out of reach. These tasks are contact-rich, making data collection for imitation learning difficult, and sparse-reward, making direct exploration with reinforcement learning (RL) intractable. Consequently, prior work has made progress by structuring the problem with specialized grippers, tool attachments, and environment fixtures. In this work, we argue that before a robot can perfect precise assembly, it must first learn to play. We further ask the question: what factors in the process of learning to play matter for precise assembly? We propose Play2Perfect, an RL framework for task-agnostic pretraining through play on diverse objects and goals, which is then perfected on precise assembly. The goal of play is to acquire reusable manipulation priors, such as grasping, in-hand reorientation and pose reaching. Finetuning then adapts this general prior to assembly, focusing exploration on the final contact-rich, high-precision interactions needed for success. We systematically study key design choices in play pretraining, including object diversity, training objective, trajectory diversity, and goal precision. We show that our prior is 33x more sample-efficient than RL training from scratch, even when provided with dense, multi-stage rewards. We demonstrate zero-shot sim-to-real transfer, achieving 60% success on tight insertions with only 0.5 mm contact clearance, and over 50% success on long-horizon multi-part assembly and screwing.
- Abstract(参考訳): マルチフィンガーロボットは人間の手のスピードと器用さを約束するが、正確な組み立てのような難題は解決していない。
これらのタスクは接触に富み、模倣学習のためのデータ収集が難しくなり、スパース・リワードとなり、強化学習(RL)による直接探索が困難になる。
その結果, 従来の作業は, 特殊なグリップ, ツールアタッチメント, 環境器具を用いて, 問題を構造化することで進展した。
この研究では、ロボットが正確な組み立てを完了する前には、まず遊び方を学ぶ必要がある、と論じる。
我々はさらに質問する: 正確な組み立てのために重要なことを学ぶ過程における要素は何か?
本稿では,多種多様なオブジェクトや目標のプレイを通じてタスクに依存しない事前学習を行うためのRLフレームワークであるPlay2Perfectを提案する。
遊びのゴールは、握り、手動の向きを変え、手を伸ばしたりといった、再利用可能な操作先を取得することである。
ファインタニングはこの一般化を組み立て前に適応させ、成功に必要な最終的な接触に富んだ高精度な相互作用を探求する。
競技前訓練における重要な設計選択を体系的に研究し,対象の多様性,訓練目標,軌道の多様性,目標精度について検討した。
我々は,より密集した多段階報酬が与えられた場合においても,前者はRLトレーニングのスクラッチの33倍のサンプル効率が得られた。
我々はゼロショット・シム・トゥ・リアルトランスファーを実証し、0.5mmの接触クリアランスしか持たないタイトインサートで60%成功し、ロングホライズン多部組立およびねじりで50%以上成功している。
関連論文リスト
- Investigating Knowledge Transfer Across Interactive Dialogue Games [73.44278078966448]
異なる対話ゲーム間での知識伝達について検討する。
Clembench スイートのゲーム上で LLM モデルを微調整することにより、転送可能性について検討する。
いくつかのゲームは微調整よりも転送の恩恵を受けており、ビジュオパティアル・ファミリー(例えば探索ゲーム)は転送が最善である。
論文 参考訳(メタデータ) (2026-08-25T01:47:31Z) - Continual Quadruped Robots Coordination via Semantic Skill Discovery [17.82598716904032]
マルチクワッドループ調整は、ペイロード容量の増強、コンタクト範囲の拡大、課題への適応性の向上などにより、注目を集めている。
既存のマルチクワッドループ操作の方法は、通常、事前に定義されたタスクファミリやクローズドタスクファミリにフォーカスする。
本稿では,検索・適応・更新プロセスとして連続的な多重四分法協調を定式化するセマンティック・スキル・ライブラリー・フレームワークであるConquerを提案する。
論文 参考訳(メタデータ) (2026-06-06T11:07:13Z) - Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning [50.464623632604976]
本研究では,スーパーマリオランドにおける長期意思決定のための視覚言語モデル(VLM)の学習について検討する。
本稿では,軽量なターンレベルの批評家によるPPOの適応版を提案し,トレーニングの安定性とサンプル効率を大幅に向上させる。
我々は,VLMエージェントのオープントレーニングフレームワークであるOdysseusを紹介し,ゲーム内の複数のレベルにおいて,実質的なゲインを達成する。
論文 参考訳(メタデータ) (2026-05-01T02:05:56Z) - Game-TARS: Pretrained Foundation Models for Scalable Generalist Multimodal Game Agents [56.25101378553328]
本稿では,汎用ゲームエージェントであるGame-TARSについて紹介する。
Game-TARSは500B以上のトークンで事前トレーニングされており、様々な軌跡とマルチモーダルデータがある。
実験により、Game-TARSは、オープンワールドMinecraftタスクにおける以前のソータモデルの約2倍の成功率を達成することが示された。
論文 参考訳(メタデータ) (2025-10-27T17:43:51Z) - Technical Challenges of Deploying Reinforcement Learning Agents for Game
Testing in AAA Games [58.720142291102135]
本稿では,既存の自動ゲームテストソリューションに,スクリプト型ボットをベースとして,実験的な強化学習システムを追加する取り組みについて述べる。
ゲーム制作において強化学習を活用するためのユースケースを示し、ゲームのために同じ旅をしたいと思う人なら誰でも遭遇する最大の時間をカバーしています。
我々は、機械学習、特にゲーム生産において効果的なツールである強化学習を作るのに価値があり、必要であると考えるいくつかの研究指針を提案する。
論文 参考訳(メタデータ) (2023-07-19T18:19:23Z) - Unifying Language Learning Paradigms [96.35981503087567]
データセットやセットアップ全体にわたって普遍的に有効である事前学習モデルのための統一的なフレームワークを提案する。
本研究では, 事前学習対象を相互に配置し, 異なる対象間の補間を効果的に行う方法を示す。
また,テキスト内学習において,ゼロショットSuperGLUEで175B GPT-3,ワンショット要約でT5-XXLの性能を3倍に向上させた。
論文 参考訳(メタデータ) (2022-05-10T19:32:20Z) - It Takes Four to Tango: Multiagent Selfplay for Automatic Curriculum
Generation [107.10235120286352]
汎用強化学習エージェントを効率的に訓練するには、ゴールカリキュラムの自動生成が必要である。
自動ゴール生成フレームワークCuSPを提案する。
本手法は,様々な制御タスクに対して,効率的な目標のカリキュラムを生成するのに有効であることを示す。
論文 参考訳(メタデータ) (2022-02-22T01:23:23Z) - Continual Learning of Control Primitives: Skill Discovery via
Reset-Games [128.36174682118488]
エージェントが最小限の監督力でスキルを習得できる方法を示す。
私たちは、エージェントを学習タスクの初期状態の広いセットに"リセット"する必要があるという洞察を利用して、多様な"リセットスキル"を学ぶための自然な設定を提供します。
論文 参考訳(メタデータ) (2020-11-10T18:07:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。