論文の概要: Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment
- arxiv url: http://arxiv.org/abs/2607.14047v2
- Date: Thu, 16 Jul 2026 14:36:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 14:53:42.228963
- Title: Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment
- Title(参考訳): Zero2Skill: 自律的なデータ収集、トレーニング、デプロイを通じてロボットスキルをブートストラップする
- Authors: Boyuan Wang, Zhenyuan Zhang, Zhiqin Yang, Peijun Gu, Shuya Wang, Xiaofeng Wang, Xianghui Ze, Yifan Chang, Guosheng Zhao, Jiangnan Shao, Guan Huang, Hengyu Liu, Yonggang Zhang, Wei Xue, Chunyuan Guan, Chenglin Pu, Yike Guo, Xingang Wang, Zheng Zhu,
- Abstract要約: 既存のパイプラインは、自己リセット、VLM検証、言語指導による修正を通じて、人間の労力を減らす。
Zero2Skill(ゼロ2スキル)は、人ロボットの共生型エージェントシステムで、丸ごとの修正を維持・再利用する。
- 参考スコア(独自算出の注目度): 53.913175773174636
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Autonomous data collection governs the volume and quality of real-world trajectories for manipulation policy learning. Existing pipelines reduce human effort via self-resetting, VLM verification, or language-guided correction, yet episode-scoped fixes must be reissued whenever the same failure recurs, so oversight cost grows with session length rather than with the number of distinct problems. We present Zero2Skill, a human-robot symbiotic agentic system in which corrections are retained and reused across rounds. The collection loop collects, verifies, and resets autonomously, pausing for a remote operator only when a phase exhausts an explicit retry budget. An LLM parser maps each natural-language utterance to a structured adjustment stored in Corrective Memory, so addressed failure modes typically need not be corrected again under the same conditions. On a real-robot desktop-clearing testbed, Zero2Skill matches teleoperation episode success while reducing human working time to 16%. Language corrections improve verifier-human agreement in all four evaluated settings and raise average single-attempt success from 12.5% to 47.5% (arm-selection: 20.0% to 50.0%). Policies fine-tuned on Zero2Skill data match teleoperation-trained policy success at a fraction of collection human cost.
- Abstract(参考訳): 自律的なデータ収集は、ポリシー学習のための現実世界の軌跡の量と品質を管理する。
既存のパイプラインは、自己リセット、VLM検証、言語指導による修正を通じて人間の労力を減らすが、エピソードスコープによる修正は、同じ障害が再帰するたびに再発行されなければならない。
Zero2Skill(ゼロ2スキル)は、人ロボットの共生型エージェントシステムで、丸ごとの修正を維持・再利用する。
収集ループは自動で収集、検証、リセットされ、フェーズが明示的な再試行予算を浪費したときのみリモートオペレーターを一時停止する。
LLMパーサは、各自然言語の発話を補正メモリに格納された構造化された調整にマッピングするので、対処された障害モードは、通常同じ条件下で修正する必要はない。
実際のロボットによるデスクトップクリーニングテストベッドでは、Zero2Skillは遠隔操作のエピソードの成功と一致し、人間の作業時間を16%削減した。
言語修正は、評価された4つの設定すべてにおいて検証者と人間による合意を改善し、平均的な単一目標の成功を12.5%から47.5%に引き上げる(アーム選択:20.0%から50.0%)。
Zero2Skillのデータに微調整されたポリシーは、遠隔操作で訓練されたポリシーの成功を、人件費のごく一部で一致させる。
関連論文リスト
- GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents [17.26555663132631]
GRASP(Gated Regression-Aware Skill Proposer)は、エージェントの改善を、境界付きスキルライブラリへの一連の編集として扱う。
臨床ベンチマークでは5つのベースモデルでGRASPを評価した。
論文 参考訳(メタデータ) (2026-05-28T09:30:09Z) - AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration [175.74514061083195]
提案するAutoResearchClawは,5つのメカニズムに基づいて構築されたマルチエージェント自律型研究パイプラインである。
25トピックの実験ステージベンチマークであるARC-Benchでは、AutoResearchClawがAI Scientist v2を54.7%上回っている。
論文 参考訳(メタデータ) (2026-05-19T15:49:51Z) - Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training [54.896907620476675]
本稿では,学習世界モデルを用いた学習後学習フレームワークを提案する。
Hi-WMは中間状態をキャッシュし、ロールバックとブランチをサポートする。
我々は、剛性と変形性のあるオブジェクト相互作用と2つのポリシーバックボーンにまたがる3つの実世界の操作タスクについて、Hi-WMを評価する。
論文 参考訳(メタデータ) (2026-04-23T14:42:54Z) - Learning Actionable Manipulation Recovery via Counterfactual Failure Synthesis [21.197844940385725]
現在の障害学習パラダイムは、コストと安全性の低い実世界のデータ収集か、シミュレータベースの摂動に依存している。
このフレームワークは,実世界の実演を成功させるのから直接,フォトリアリスティックでファクトファクトファクトのロールアウトを合成するものだ。
生成の世界モデル内でアクションを摂動させることで、Dream2Fixはシミュレータに頼ることなくペアの失敗言語データを生成する。
論文 参考訳(メタデータ) (2026-03-13T19:02:58Z) - FlowCorrect: Efficient Interactive Correction of Generative Flow Policies for Robotic Manipulation [0.7666240799116112]
FlowCorrectはモジュール型のインタラクティブな模倣学習アプローチで、フローマッチング操作ポリシのデプロイメント時適応を可能にする。
実際のロボットを4つのテーブルトップタスク(ピック・アンド・プレイス、注ぐ、カップアップライト、挿入)で評価した。
修正予算の低いFlowCorrectは、以前に失敗したケースで80%の成功率を達成した。
論文 参考訳(メタデータ) (2026-02-25T16:06:49Z) - RAPT: Model-Predictive Out-of-Distribution Detection and Failure Diagnosis for Sim-to-Real Humanoid Robots [1.5765892172285598]
本稿では,50Hzのヒューマノイド制御のための軽量で自己監督型展開時間モニタRAPTを提案する。
RAPTは,数値シミュレーションから確率的時間的確率多様体を学習し,実行時の予測偏差を評価する。
我々は,シミュレーションおよび物理ハードウェアにおける4つの複雑なタスクに対して,Unitree G1ヒューマノイド上でRAPTを評価する。
論文 参考訳(メタデータ) (2026-02-02T01:04:55Z) - Training Language Models to Self-Correct via Reinforcement Learning [98.35197671595343]
自己補正は、現代の大規模言語モデル(LLM)では、ほとんど効果がないことが判明した。
完全自己生成データを用いたLLMの自己補正能力を大幅に向上させるマルチターンオンライン強化学習手法であるSCoReを開発した。
SCoReは最先端の自己補正性能を実現し,MATHとHumanEvalでそれぞれ15.6%,9.1%向上した。
論文 参考訳(メタデータ) (2024-09-19T17:16:21Z) - Automatically measuring speech fluency in people with aphasia: first
achievements using read-speech data [55.84746218227712]
本研究の目的は,言語習得の分野で開発された信号処理algorithmの関連性を評価することである。
論文 参考訳(メタデータ) (2023-08-09T07:51:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。