論文の概要: Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment
- arxiv url: http://arxiv.org/abs/2607.14047v3
- Date: Wed, 22 Jul 2026 04:19:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 14:36:03.33651
- Title: Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment
- Title(参考訳): Zero2Skill: 自律的なデータ収集、トレーニング、デプロイを通じてロボットスキルをブートストラップする
- Abstract要約: 既存のパイプラインは、自己リセット、VLM検証、言語指導による修正を通じて、人間の労力を減らす。
Zero2Skill(ゼロ2スキル)は、人ロボットの共生型エージェントシステムで、丸ごとの修正を維持・再利用する。
- 参考スコア(独自算出の注目度): 53.913175773174636
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Autonomous data collection governs the volume and quality of real-world trajectories for manipulation policy learning. Existing pipelines reduce human effort via self-resetting, VLM verification, or language-guided correction, yet episode-scoped fixes must be reissued whenever the same failure recurs, so oversight cost grows with session length rather than with the number of distinct problems. We present Zero2Skill, a human-robot symbiotic agentic system in which corrections are retained and reused across rounds. The collection loop collects, verifies, and resets autonomously, pausing for a remote operator only when a phase exhausts an explicit retry budget. An LLM parser maps each natural-language utterance to a structured adjustment stored in Corrective Memory, so addressed failure modes typically need not be corrected again under the same conditions. On a real-robot desktop-clearing testbed, Zero2Skill matches teleoperation episode success while reducing human working time to 16%. Language corrections improve verifier-human agreement in all four evaluated settings and raise average single-attempt success from 12.5% to 47.5% (arm-selection: 20.0% to 50.0%). Policies fine-tuned on Zero2Skill data match teleoperation-trained policy success at a fraction of collection human cost.
- Abstract(参考訳): 自律的なデータ収集は、ポリシー学習のための現実世界の軌跡の量と品質を管理する。
既存のパイプラインは、自己リセット、VLM検証、言語指導による修正を通じて人間の労力を減らすが、エピソードスコープによる修正は、同じ障害が再帰するたびに再発行されなければならない。
Zero2Skill(ゼロ2スキル)は、人ロボットの共生型エージェントシステムで、丸ごとの修正を維持・再利用する。
収集ループは自動で収集、検証、リセットされ、フェーズが明示的な再試行予算を浪費したときのみリモートオペレーターを一時停止する。
LLMパーサは、各自然言語の発話を補正メモリに格納された構造化された調整にマッピングするので、対処された障害モードは、通常同じ条件下で修正する必要はない。
実際のロボットによるデスクトップクリーニングテストベッドでは、Zero2Skillは遠隔操作のエピソードの成功と一致し、人間の作業時間を16%削減した。
言語修正は、評価された4つの設定すべてにおいて検証者と人間による合意を改善し、平均的な単一目標の成功を12.5%から47.5%に引き上げる(アーム選択:20.0%から50.0%)。
Zero2Skillのデータに微調整されたポリシーは、遠隔操作で訓練されたポリシーの成功を、人件費のごく一部で一致させる。
関連論文リスト
- REVOLVE: An Automated Closed-Loop Framework for Evolving Robot Manipulation with Minimal Human Intervention [17.399763167916195]
人間の介入を最小限に抑えてロボット操作を進化させるための自動クローズドループフレームワークであるREVOLVEを提案する。
統一されたソフトウェアプラットフォーム上に構築されたREVOLVEは、データ収集、ポリシトレーニングとデプロイメント、障害回復、継続的な学習を単一のクローズドループワークフローに統合する。
論文 参考訳(メタデータ) (2026-09-13T16:08:03Z) - Rethinking Demonstration Unlearning in Imitation Learning for Robotics [4.7767476304018075]
損失を忘れたり、単一のメンバシップアタックのような機械学習から継承されたメトリクスは、クローズドループに作用するポリシーから編集が取り除かれたものを確立しない。
そこで,本研究では,2つの軸に沿った実証的アンラーニング(unlearning)を読み取るリトレイン校正監査(retrain-calibrated audit)を導入する。
論文 参考訳(メタデータ) (2026-08-21T06:53:55Z) - ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies [0.576537956677604]
本稿では,凍結したDINOv3バックボーン上の因果変換器であるValueFormerを紹介する。
障害エピソードには、障害ステージ前の成功曲線を保存するステージ認識、成功テーマデカイリターンとラベル付けされ、単一の障害時間ではなく、ミス間隔から検出が監視される。
論文 参考訳(メタデータ) (2026-08-03T23:46:39Z) - EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration [75.13534797264485]
我々は,ロボット遠隔操作に代わるスケーラブルな代替手段として,自己中心型ヒューマンデータキャプチャー障害回復プロセスが提供されることを示した。
タスクレベルの障害設定を効率的にアレンジし、短いリカバリセグメントを記録することで、人間のオペレータは1時間あたりの有効なリカバリデータの10倍以上のデータを生成できる。
論文 参考訳(メタデータ) (2026-07-22T04:44:26Z) - HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation [24.40844636932594]
HELPは、人間の効率の良い大規模ロボットのポストトレーニングパイプラインである。
2つの特殊オペレーターが同時に12のロボットを監督します。
HELPは80%-95%の成功率を獲得し、タスクのスループットを1.7$times$--4.2$times$で改善する。
論文 参考訳(メタデータ) (2026-07-08T03:03:38Z) - Sequential Planning via Anchored Robotic Keypoints [3.176338968032152]
トレーニング不要なニューロシンボリック操作システムであるSPARK(Anchored Robotic Keypoints, SPARK)について述べる。
単一のGeminiコールは、構成可能なキネマティックプリミティブの型付き振舞いツリー(BT)としてプランを構成する。
2つ目のGeminiコールでは、オブジェクトごとに3つの代替テキストプロンプトが提案され、SAM3がそれぞれを評価します。
代替のプロンプトは、空間スイートに+27.7、オブジェクトスイートに+10.0、全体のリカバリループに+5.0を加算する。
論文 参考訳(メタデータ) (2026-06-29T17:48:01Z) - WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation [49.31386176285509]
WatchActは、観察された人間の行動に基づくロボット操作のベンチマークである。
WatchActは4つの機能ドメインで14タスクにわたる3,000のロングホライゾンインスタンスで構成されている。
シミュレーションとFranka Research 3ロボットの両方で、現在のシステムはWatchActの解決には程遠い。
論文 参考訳(メタデータ) (2026-06-24T23:13:56Z) - Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models [95.75234389806654]
本稿では、Qwen-VL上に構築された一般化可能なビジョン・ランゲージ・アクション基盤モデルであるQwen-RobotManipを提案する。
Qwen-RobotManipは、操作の表現、動き、行動の次元にわたって統合されたアライメントフレームワークを導入している。
人間とロボットの合成パイプラインは、エゴセントリックな手の動きを15プラットフォームにわたるロボットの軌道に変換する。
論文 参考訳(メタデータ) (2026-06-16T12:14:39Z) - GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents [17.26555663132631]
GRASP(Gated Regression-Aware Skill Proposer)は、エージェントの改善を、境界付きスキルライブラリへの一連の編集として扱う。
臨床ベンチマークでは5つのベースモデルでGRASPを評価した。
論文 参考訳(メタデータ) (2026-05-28T09:30:09Z) - AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration [175.74514061083195]
提案するAutoResearchClawは,5つのメカニズムに基づいて構築されたマルチエージェント自律型研究パイプラインである。
25トピックの実験ステージベンチマークであるARC-Benchでは、AutoResearchClawがAI Scientist v2を54.7%上回っている。
論文 参考訳(メタデータ) (2026-05-19T15:49:51Z) - Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training [54.896907620476675]
本稿では,学習世界モデルを用いた学習後学習フレームワークを提案する。
Hi-WMは中間状態をキャッシュし、ロールバックとブランチをサポートする。
我々は、剛性と変形性のあるオブジェクト相互作用と2つのポリシーバックボーンにまたがる3つの実世界の操作タスクについて、Hi-WMを評価する。
論文 参考訳(メタデータ) (2026-04-23T14:42:54Z) - Learning Actionable Manipulation Recovery via Counterfactual Failure Synthesis [21.197844940385725]
現在の障害学習パラダイムは、コストと安全性の低い実世界のデータ収集か、シミュレータベースの摂動に依存している。
このフレームワークは,実世界の実演を成功させるのから直接,フォトリアリスティックでファクトファクトファクトのロールアウトを合成するものだ。
生成の世界モデル内でアクションを摂動させることで、Dream2Fixはシミュレータに頼ることなくペアの失敗言語データを生成する。
論文 参考訳(メタデータ) (2026-03-13T19:02:58Z) - FlowCorrect: Efficient Interactive Correction of Generative Flow Policies for Robotic Manipulation [0.7666240799116112]
FlowCorrectはモジュール型のインタラクティブな模倣学習アプローチで、フローマッチング操作ポリシのデプロイメント時適応を可能にする。
実際のロボットを4つのテーブルトップタスク(ピック・アンド・プレイス、注ぐ、カップアップライト、挿入)で評価した。
修正予算の低いFlowCorrectは、以前に失敗したケースで80%の成功率を達成した。
論文 参考訳(メタデータ) (2026-02-25T16:06:49Z) - RAPT: Model-Predictive Out-of-Distribution Detection and Failure Diagnosis for Sim-to-Real Humanoid Robots [1.5765892172285598]
本稿では,50Hzのヒューマノイド制御のための軽量で自己監督型展開時間モニタRAPTを提案する。
RAPTは,数値シミュレーションから確率的時間的確率多様体を学習し,実行時の予測偏差を評価する。
我々は,シミュレーションおよび物理ハードウェアにおける4つの複雑なタスクに対して,Unitree G1ヒューマノイド上でRAPTを評価する。
論文 参考訳(メタデータ) (2026-02-02T01:04:55Z) - ReSURE: Regularizing Supervision Unreliability for Multi-turn Dialogue Fine-tuning [72.05731026796335]
マルチターン対話システムは、低品質のデータに晒された場合、しばしば劣化した性能に悩まされる。
本稿では,適応学習手法であるReSUREを提案する。
単一ソースと混合品質のデータセットの実験では、安定性と応答品質が改善された。
論文 参考訳(メタデータ) (2025-08-27T15:54:01Z) - Training Language Models to Self-Correct via Reinforcement Learning [98.35197671595343]
自己補正は、現代の大規模言語モデル(LLM)では、ほとんど効果がないことが判明した。
完全自己生成データを用いたLLMの自己補正能力を大幅に向上させるマルチターンオンライン強化学習手法であるSCoReを開発した。
SCoReは最先端の自己補正性能を実現し,MATHとHumanEvalでそれぞれ15.6%,9.1%向上した。
論文 参考訳(メタデータ) (2024-09-19T17:16:21Z) - Automatically measuring speech fluency in people with aphasia: first
achievements using read-speech data [55.84746218227712]
本研究の目的は,言語習得の分野で開発された信号処理algorithmの関連性を評価することである。
論文 参考訳(メタデータ) (2023-08-09T07:51:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。