論文の概要: Maximizing Human Efficiency in Large-Scale Robot Post-Training via VLAC-Cut Guided Pipeline
- arxiv url: http://arxiv.org/abs/2607.09776v1
- Date: Wed, 08 Jul 2026 03:03:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.189692
- Title: Maximizing Human Efficiency in Large-Scale Robot Post-Training via VLAC-Cut Guided Pipeline
- Title(参考訳): VLAC-Cutガイドパイプラインを用いた大規模ロボット後訓練における人的効率の最大化
- Abstract要約: 本研究では,少数の人間の操作者がロボットを監督することのできる,人間の効率の良いポストトレーニングパイプラインを提案する。
訓練されたTeleoperatorは、高価値なリモート介入とリカバリデモに焦点を当て、Floor Operatorは複数のロボットを監視し、テイクオーバをトリガーし、物理的リセットを実行する。
VLAC-CUTは自動ロールアウトキュレーションツールで、自律的なロボット軌道をプログレスメイキング、アイドル、フェール誘導、リカバリに分割する。
- 参考スコア(独自算出の注目度): 11.537225471547037
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: When adapting Vision Language Action (VLA) models to downstream tasks, multiple rounds of post training are required because a single round of data cannot resolve all issues, making continuous iterations necessary to progressively address the weaknesses exposed in previous rounds. In this report, we aim to maximize human efficiency during post-training, defined as the policy improvement and task throughput achieved per unit of human labor and time. We propose a human-efficient post-training pipeline that enables a small number of human operators to supervise multiple robots. The pipeline is built around a specialized division of labor: a trained Teleoperator focuses on high-value remote interventions and recovery demonstrations, while a Floor Operator monitors multiple robots, triggers takeovers, and performs physical resets. This role specialization reduces task switching, lowers operator training costs, and allows limited human labor to supervise more robot interaction across a larger fleet. To improve data utilization efficiency, we introduce VLAC-CUT as an automatic rollout curation tool. It segments autonomous robot trajectories into progress-making, idle, failure-inducing, and recovery portions, preserving useful segments while filtering harmful or uninformative ones. The curated rollout data are combined with Human-in-the-Loop data for the next post-training round. We validate the proposed pipeline on four real-world manipulation tasks. Across iterative post-training rounds, the final policies achieve 80\%--95\% success rates and improve task throughput by 1.7$\times$--4.2$\times$ over the base model. Under the same human-intervention budget, VLAC-CUT guided rollout reuse outperforms HITL-only training in both success rate and throughput.
- Abstract(参考訳): ビジョン言語アクション(VLA)モデルを下流タスクに適用する場合、単一のラウンドのデータですべての問題を解決できないため、複数のラウンドのポストトレーニングが必要になります。
本稿では,人的労働時間単位当たりの政策改善とタスクスループットを規定したポストトレーニングにおける人的効率の最大化を目指す。
少数の人間の操作者が複数のロボットを監督することのできる,人間の効率の良いポストトレーニングパイプラインを提案する。
訓練されたTeleoperatorは、高価値なリモート介入とリカバリデモに焦点を当て、Floor Operatorは複数のロボットを監視し、テイクオーバをトリガーし、物理的リセットを実行する。
この役割の専門化は、タスクの切り替えを減らし、オペレーターのトレーニングコストを削減し、限られた人間の労働力によって、より大きな船隊をまたいでより多くのロボットのインタラクションを監督することを可能にする。
データ利用効率を向上させるため,自動ロールアウトキュレーションツールとしてVLAC-CUTを導入する。
自律的なロボットの軌道を、進行、アイドル、障害発生、回復の部分に分割し、有害または非情報的な部分をフィルタリングしながら有用なセグメントを保存する。
キュレートされたロールアウトデータは、次のトレーニングラウンドのHuman-in-the-Loopデータと組み合わせられる。
提案したパイプラインを実世界の4つの操作タスクで検証する。
反復的なポストトレーニングラウンド全体で、最終ポリシーは80\%--95\%の成功率を獲得し、タスクのスループットを1.7$\times$--4.2$\times$で改善する。
同じヒューマン・インターベンション予算の下では、VLAC-CUTのロールアウトはHITLのみのトレーニングを成功率とスループットの両方で上回っている。
関連論文リスト
- Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models [120.24139942108405]
ロボットデータのスケーリングは、一般のVision-Language-Action(VLA)モデルを構築する上で重要である。
固定されたロボットデータ予算の下では、継続した事前訓練は限られた軌道を伝達可能な視覚行動知識に変換する必要がある。
本稿では,VLA指向のVLMバックボーンであるVLActを提案する。
論文 参考訳(メタデータ) (2026-08-27T17:59:40Z) - EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration [75.13534797264485]
我々は,ロボット遠隔操作に代わるスケーラブルな代替手段として,自己中心型ヒューマンデータキャプチャー障害回復プロセスが提供されることを示した。
タスクレベルの障害設定を効率的にアレンジし、短いリカバリセグメントを記録することで、人間のオペレータは1時間あたりの有効なリカバリデータの10倍以上のデータを生成できる。
論文 参考訳(メタデータ) (2026-07-22T04:44:26Z) - HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining [93.5192770515694]
Embodied foundation modelは、大きな言語モデルのようなデータスケーリングの恩恵を受けることが期待されているが、より厳密なデータボトルネックに直面している。
遠隔操作された実ロボット軌道は、正確な行動監督と実施の整合性のために、訓練前の主流の源である。
エゴセントリックなデータに基づいて事前訓練された基礎モデルは、実ロボットアクション予測において24%低い検証損失を達成する。
論文 参考訳(メタデータ) (2026-06-18T17:37:34Z) - SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation [57.131411215593744]
ロングホライゾン操作のための微調整視覚言語アクション(VLA)ポリシーは、依然として行動クローニングに大きく依存している。
本稿では,MMOE(Multi-gate Mixture-of-Experts)値ヘッドとアクションプリミティブベースのステージ推定器を組み合わせたマルチタスクステージ認識報酬モデルRMを紹介する。
RM 上に構築した SPIRAL は,安価で自律的なロールアウトから VLA ポリシーを改善する,政治上の報酬誘導型フレームワークである。
論文 参考訳(メタデータ) (2026-06-09T01:46:23Z) - Learning while Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies [23.266003019334438]
汎用的なロボットポリシーは、大規模な事前トレーニングの恩恵を受ける傾向にあるが、オフラインデータだけでは、堅牢な現実世界のデプロイメントには不十分である。
本稿では,VLA(Vision-Language-Action)ポリシーの継続学習のための,艦隊規模のオフライン-オンライン強化学習フレームワークであるLWDを紹介する。
論文 参考訳(メタデータ) (2026-05-01T05:20:26Z) - Sustainable Transfer Learning for Adaptive Robot Skills [0.0]
本研究では、強化学習(RL)を用いたペグ・イン・ホールタスクに着目し、異なるロボットプラットフォーム間の政策伝達について検討する。
その結果、ゼロショット転送は成功率を低下させ、タスクの実行時間を比較的長くする一方で、微調整はトレーニングの時間ステップを小さくしてパフォーマンスを著しく向上させることがわかった。
論文 参考訳(メタデータ) (2026-04-08T11:06:10Z) - RADAR: Closed-Loop Robotic Data Generation via Semantic Planning and Autonomous Causal Environment Reset [48.645870795753105]
ロボットのためのロバスト自動データ取得(RADAR)について紹介する。
RADARは完全に自律的でクローズドループのデータ生成エンジンで、収集サイクルから人間の介入を完全に取り除きます。
シミュレーションでは、複雑な長期タスクにおいて、最大90%の成功率を達成する。
論文 参考訳(メタデータ) (2026-03-12T11:18:52Z) - RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks [28.827331437876452]
データ収集、ポリシー学習、タスク実行を単一のVLM駆動コントローラで統合するエージェントロボットフレームワークであるRoboClawを提案する。
ポリシーレベルでは、RoboClaw氏はEntangled Action Pairs(EAP)を紹介している。
デプロイ中、同じエージェントが高レベルの推論を行い、学習されたポリシープリミティブを動的にオーケストレーションして長期のタスクを遂行する。
論文 参考訳(メタデータ) (2026-03-12T05:22:59Z) - Human-in-the-Loop Failure Recovery with Adaptive Task Allocation [2.518621093955008]
ロボットの故障を人間オペレーター(ARFA)に割り当てる適応的手法を提案する。
解決すべき障害のすべてに対して、報酬関数は演算子機能と履歴データ、タスク緊急性、現在のワークロード分布に基づいて期待される結果を算出する。
シミュレーションとユーザスタディにより、ARFAはランダムなアロケーションよりも優れ、ロボットのアイドル時間を大幅に短縮し、システム全体の性能を向上し、オペレータ間でより分散されたワークロードをもたらすことが示された。
論文 参考訳(メタデータ) (2026-02-03T14:55:48Z) - RoboReward: General-Purpose Vision-Language Reward Models for Robotics [124.34685604054312]
視覚言語モデル(VLM)は、自動報酬モデルとして期待されているが、実際のロボットタスクにおけるそれらの効果は理解されていない。
大規模な実ロボットコーパス上に構築されたロボティクス報酬データセットとベンチマークであるRoboRewardを導入することで、このギャップを埋めることを目指している。
論文 参考訳(メタデータ) (2026-01-02T12:47:34Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction [23.89121398540929]
本稿では,擬似学習事前学習後のループ内ロールアウトトレーニングの新たな段階であるRaCを紹介する。
RaCでは、リカバリと修正行動を示す人間の介入軌道に関するロボットポリシーを微調整する。
我々は、RaCが10$times$少ないデータ収集時間とサンプルを使用して、従来の最先端技術よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-09-09T17:41:29Z) - One-Step Diffusion Policy: Fast Visuomotor Policies via Diffusion Distillation [80.71541671907426]
OneStep Diffusion Policy (OneDP)は、事前訓練された拡散政策から知識を単一ステップのアクションジェネレータに蒸留する新しいアプローチである。
OneDPはロボット制御タスクの応答時間を著しく短縮する。
論文 参考訳(メタデータ) (2024-10-28T17:54:31Z) - Robot Fine-Tuning Made Easy: Pre-Training Rewards and Policies for
Autonomous Real-World Reinforcement Learning [58.3994826169858]
ロボット強化学習のためのリセット不要な微調整システムであるRoboFuMEを紹介する。
我々の洞察は、オフラインの強化学習技術を利用して、事前訓練されたポリシーの効率的なオンライン微調整を確保することである。
提案手法では,既存のロボットデータセットからのデータを組み込んで,目標タスクを3時間以内の自律現実体験で改善することができる。
論文 参考訳(メタデータ) (2023-10-23T17:50:08Z) - Self-Improving Robots: End-to-End Autonomous Visuomotor Reinforcement
Learning [54.636562516974884]
模倣と強化学習において、人間の監督コストは、ロボットが訓練できるデータの量を制限する。
本研究では,自己改善型ロボットシステムのための新しい設計手法であるMEDAL++を提案する。
ロボットは、タスクの実施と解除の両方を学ぶことで、自律的にタスクを練習し、同時にデモンストレーションから報酬関数を推論する。
論文 参考訳(メタデータ) (2023-03-02T18:51:38Z) - A Framework for Efficient Robotic Manipulation [79.10407063260473]
単一のロボットアームがピクセルからスパースリワード操作ポリシーを学習できることを示します。
デモは10回しかなく、単一のロボットアームがピクセルからスパースリワード操作のポリシーを学習できることを示しています。
論文 参考訳(メタデータ) (2020-12-14T22:18:39Z) - Human-in-the-Loop Imitation Learning using Remote Teleoperation [72.2847988686463]
6-DoF操作設定に合わせたデータ収集システムを構築します。
システムによって収集された新しいデータに基づいて,ポリシーを反復的にトレーニングするアルゴリズムを開発した。
介入型システムで収集したデータに基づいて訓練されたエージェントと、非介入型デモ参加者が収集した同等数のサンプルで訓練されたアルゴリズムを上回るエージェントを実証する。
論文 参考訳(メタデータ) (2020-12-12T05:30:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。