論文の概要: HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation
- arxiv url: http://arxiv.org/abs/2607.09776v2
- Date: Wed, 15 Jul 2026 15:49:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 14:31:40.671851
- Title: HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation
- Title(参考訳): HELP:ロールアウトセグメンテーションによる人力効率の高い大規模ロボットのポストトレーニング
- Authors: Shaopeng Zhai, Qi Zhang, Tianyi Zhang, Haoran Zhang, Fuxian Huang, Zhanhui Lin, Zijun Xu, Weinan Zhang,
- Abstract要約: HELPは、人間の効率の良い大規模ロボットのポストトレーニングパイプラインである。
2つの特殊オペレーターが同時に12のロボットを監督します。
HELPは80%-95%の成功率を獲得し、タスクのスループットを1.7$times$--4.2$times$で改善する。
- 参考スコア(独自算出の注目度): 24.40844636932594
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: When adapting Vision Language Action (VLA) models to downstream tasks, multiple rounds of post-training are often required to progressively address policy weaknesses. In this report, we focus on maximizing human efficiency during this iterative process, measured by policy improvement and task throughput per unit of human labor and time. We propose HELP, a Human-Efficient Large-scale robot Post-training pipeline in which two specialized operators supervise twelve robots concurrently. A trained Teleoperator provides high-value remote interventions and recovery demonstrations, while a Floor Operator monitors the robot fleet, triggers takeovers, and performs physical resets. This role specialization improves human efficiency by reducing task switching, lowering operator training costs, and expanding robot interaction coverage. Beyond increasing rollout volume, concurrent supervision also broadens the range of policy behaviors observed by the human team, making recurring failure modes easier to identify and enabling more targeted takeovers, resets, and recovery demonstrations. To efficiently utilize the large and mixed-quality rollout data, HELP incorporates \vlac, an automatic rollout segmentation critic specifically designed for this setting. It separates autonomous trajectories into progress-making, idle, failure-inducing, and recovery segments. Useful rollout segments are retained and combined with Human-in-the-Loop data for the next post-training round. Across four real-world manipulation tasks, HELP achieves 80\%--95\% success rates and improves task throughput by 1.7$\times$--4.2$\times$ over the base model. Under matched HITL recovery budgets, VLAC-CUT further amplifies throughput gains by 1.20$\times$--3.43$\times$ and success-rate gains by 1.50$\times$--3.00$\times$ over HITL-only updates.
- Abstract(参考訳): 視覚言語行動(VLA)モデルを下流タスクに適用する場合、政策の弱点に段階的に対処するためには、ポストトレーニングの複数のラウンドが必要になることが多い。
本稿では、この反復的プロセスにおける人的効率の最大化に焦点をあて、政策改善と人的労働時間単位のタスクスループットによって測定する。
本稿では,2つの特殊オペレータが同時に12個のロボットを監督する,人力効率の高い大規模ロボットポストトレーニングパイプラインHELPを提案する。
訓練されたTeleoperatorは、高価値なリモート介入とリカバリデモを提供し、Floor Operatorはロボット群を監視し、テイクオーバをトリガーし、物理的リセットを実行する。
この役割の専門化は、タスクスイッチングの削減、オペレータのトレーニングコストの削減、ロボットのインタラクションカバレッジの拡大によって、人間の効率を向上させる。
ロールアウトボリュームの増加に加えて、同時監視は、ヒューマンチームが観察するポリシー行動の範囲を広げ、繰り返し発生する障害モードを識別しやすくし、よりターゲットを絞ったテイクオーバー、リセット、リカバリデモを可能にします。
HELPは大規模かつ混合的なロールアウトデータを効率的に活用するため、この設定用に特別に設計された自動ロールアウトセグメンテーション批評家である \vlac を組み込んでいる。
自律的な軌道を進捗、アイドル、障害誘発、回復セグメントに分離する。
有意義なロールアウトセグメントは、次のトレーニングラウンドでHuman-in-the-Loopデータと組み合わせて保持される。
4つの実世界の操作タスクの中で、HELPは80\%--95\%の成功率を獲得し、タスクのスループットを1.7$\times$--4.2$\times$で改善する。
適合したHITL回復予算の下では、VLAC-CUTはさらにスループットのゲインを1.20$\times$--3.43$\times$、成功率のゲインを1.50$\times$--3.00$\times$ over HITLのみの更新で増幅する。
関連論文リスト
- HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining [93.5192770515694]
Embodied foundation modelは、大きな言語モデルのようなデータスケーリングの恩恵を受けることが期待されているが、より厳密なデータボトルネックに直面している。
遠隔操作された実ロボット軌道は、正確な行動監督と実施の整合性のために、訓練前の主流の源である。
エゴセントリックなデータに基づいて事前訓練された基礎モデルは、実ロボットアクション予測において24%低い検証損失を達成する。
論文 参考訳(メタデータ) (2026-06-18T17:37:34Z) - Learning while Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies [23.266003019334438]
汎用的なロボットポリシーは、大規模な事前トレーニングの恩恵を受ける傾向にあるが、オフラインデータだけでは、堅牢な現実世界のデプロイメントには不十分である。
本稿では,VLA(Vision-Language-Action)ポリシーの継続学習のための,艦隊規模のオフライン-オンライン強化学習フレームワークであるLWDを紹介する。
論文 参考訳(メタデータ) (2026-05-01T05:20:26Z) - RADAR: Closed-Loop Robotic Data Generation via Semantic Planning and Autonomous Causal Environment Reset [48.645870795753105]
ロボットのためのロバスト自動データ取得(RADAR)について紹介する。
RADARは完全に自律的でクローズドループのデータ生成エンジンで、収集サイクルから人間の介入を完全に取り除きます。
シミュレーションでは、複雑な長期タスクにおいて、最大90%の成功率を達成する。
論文 参考訳(メタデータ) (2026-03-12T11:18:52Z) - RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks [28.827331437876452]
データ収集、ポリシー学習、タスク実行を単一のVLM駆動コントローラで統合するエージェントロボットフレームワークであるRoboClawを提案する。
ポリシーレベルでは、RoboClaw氏はEntangled Action Pairs(EAP)を紹介している。
デプロイ中、同じエージェントが高レベルの推論を行い、学習されたポリシープリミティブを動的にオーケストレーションして長期のタスクを遂行する。
論文 参考訳(メタデータ) (2026-03-12T05:22:59Z) - Human-in-the-Loop Failure Recovery with Adaptive Task Allocation [2.518621093955008]
ロボットの故障を人間オペレーター(ARFA)に割り当てる適応的手法を提案する。
解決すべき障害のすべてに対して、報酬関数は演算子機能と履歴データ、タスク緊急性、現在のワークロード分布に基づいて期待される結果を算出する。
シミュレーションとユーザスタディにより、ARFAはランダムなアロケーションよりも優れ、ロボットのアイドル時間を大幅に短縮し、システム全体の性能を向上し、オペレータ間でより分散されたワークロードをもたらすことが示された。
論文 参考訳(メタデータ) (2026-02-03T14:55:48Z) - RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction [23.89121398540929]
本稿では,擬似学習事前学習後のループ内ロールアウトトレーニングの新たな段階であるRaCを紹介する。
RaCでは、リカバリと修正行動を示す人間の介入軌道に関するロボットポリシーを微調整する。
我々は、RaCが10$times$少ないデータ収集時間とサンプルを使用して、従来の最先端技術よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-09-09T17:41:29Z) - Robot Fine-Tuning Made Easy: Pre-Training Rewards and Policies for
Autonomous Real-World Reinforcement Learning [58.3994826169858]
ロボット強化学習のためのリセット不要な微調整システムであるRoboFuMEを紹介する。
我々の洞察は、オフラインの強化学習技術を利用して、事前訓練されたポリシーの効率的なオンライン微調整を確保することである。
提案手法では,既存のロボットデータセットからのデータを組み込んで,目標タスクを3時間以内の自律現実体験で改善することができる。
論文 参考訳(メタデータ) (2023-10-23T17:50:08Z) - Self-Improving Robots: End-to-End Autonomous Visuomotor Reinforcement
Learning [54.636562516974884]
模倣と強化学習において、人間の監督コストは、ロボットが訓練できるデータの量を制限する。
本研究では,自己改善型ロボットシステムのための新しい設計手法であるMEDAL++を提案する。
ロボットは、タスクの実施と解除の両方を学ぶことで、自律的にタスクを練習し、同時にデモンストレーションから報酬関数を推論する。
論文 参考訳(メタデータ) (2023-03-02T18:51:38Z) - A Framework for Efficient Robotic Manipulation [79.10407063260473]
単一のロボットアームがピクセルからスパースリワード操作ポリシーを学習できることを示します。
デモは10回しかなく、単一のロボットアームがピクセルからスパースリワード操作のポリシーを学習できることを示しています。
論文 参考訳(メタデータ) (2020-12-14T22:18:39Z) - Human-in-the-Loop Imitation Learning using Remote Teleoperation [72.2847988686463]
6-DoF操作設定に合わせたデータ収集システムを構築します。
システムによって収集された新しいデータに基づいて,ポリシーを反復的にトレーニングするアルゴリズムを開発した。
介入型システムで収集したデータに基づいて訓練されたエージェントと、非介入型デモ参加者が収集した同等数のサンプルで訓練されたアルゴリズムを上回るエージェントを実証する。
論文 参考訳(メタデータ) (2020-12-12T05:30:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。