論文の概要: Co-Evolving Robot Orchestrators and Policies through Deployment
- arxiv url: http://arxiv.org/abs/2610.09228v1
- Date: Tue, 06 Oct 2026 23:44:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.648625
- Title: Co-Evolving Robot Orchestrators and Policies through Deployment
- Title(参考訳): デプロイによるロボットオーケストレータとポリシの共進化
- Abstract要約: 視覚言語モデル(VLM)オーケストレータは、ポリシーをいつ呼び出すか、どのように指示するか、代わりにスクリプトスキルを使用するかを学ぶ。
デプロイ中にオーケストレータとポリシが共進化するRobo-COPを提案する。
シミュレーションされた10のRoboLabタスクの中で、Robo-COPは、凍結したポリシーで同じハーネスで64.8%から73.8%のホールドアウト成功率を示した。
- 参考スコア(独自算出の注目度): 39.83012561389426
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) policies trained on large datasets are capable within their training domains, yet they still fail to generalize to the variety of situations a robot meets in real-world deployment. Agentic robot systems complement the policy with a vision-language model (VLM) orchestrator that learns when to call the policy, how to instruct it, and when to use scripted skills instead. However, because the harness is built around a frozen policy that has limited language steerability, the orchestrator can avoid the policy's failures but never overcome them. The policy becomes the bottleneck of the whole system. Fine-tuning the policy can remove this bottleneck, but updating it alone decouples it from an orchestrator tuned to its old behavior. We propose Robo-COP, in which the orchestrator and policy co-evolve during deployment. Robo-COP curates skill demonstrations from its own executions, fine-tunes the policy when this data can address recurring failures, and adopts each new policy only after it improves the skills it was trained for. Across ten simulated RoboLab tasks, Robo-COP raises mean held-out success from 64.8% to 73.8% over the same harness with a frozen policy, while fine-tuning on a fixed schedule without verification reaches only 65.8%. On three real-world tasks, Robo-COP raises held-out success from 38.3% to 50.0%. Robo-COP turns deployment into a self-improving flywheel in which robots learn by doing, with each improvement in execution producing better data for the next round of learning. Videos and code are available at https://robo-cop.pages.dev/.
- Abstract(参考訳): 大規模なデータセットに基づいてトレーニングされた視覚言語アクション(VLA)ポリシーは、トレーニングドメイン内でも機能するが、ロボットが現実世界のデプロイメントで遭遇するさまざまな状況に一般化することができない。
エージェントロボットシステムは、ポリシーを視覚言語モデル(VLM)オーケストレータで補完する。
しかし、ハーネスは言語ステアビリティが制限されたフリーズポリシを中心に構築されているため、オーケストレータはポリシーの失敗を避けることができるが、それを克服することはない。
ポリシーはシステム全体のボトルネックになります。
ポリシーの微調整は、このボトルネックを取り除くことができるが、それを単独で更新することで、古い振る舞いに合わせてオーケストレータから切り離すことができる。
デプロイ中にオーケストレータとポリシが共進化するRobo-COPを提案する。
Robo-COPは、自身の実行からスキルデモをキュレートし、このデータが繰り返し発生する障害に対処可能なポリシを微調整し、トレーニングされたスキルを改善した後のみ、それぞれの新ポリシを採用する。
シミュレーションされた10回のRoboLabタスクで、Robo-COPは64.8%から73.8%まで、凍結されたポリシーで同じハーネスでホールドアウトの成功率を上げ、検証なしで固定スケジュールで微調整するのは65.8%に過ぎなかった。
実世界の3つのタスクにおいて、Robo-COPは38.3%から50.0%に成功している。
Robo-COPは、デプロイを自己改善型のフライホイールに変えて、ロボットが行うことによって学習する。
ビデオとコードはhttps://robo-cop.pages.dev/.comで公開されている。
関連論文リスト
- Mulligan: Performance-Guided Data Collection for Efficient On-Robot Learning [49.96968347002295]
人間のデモから学ぶことは、ロボットに新しいタスクを教えるための信頼できる方法だが、ポリシーが改善するにつれて、追加のデモから得られる利益は減少する。
我々は、高精度な操作タスクにおいて、監督エピソードの固定予算から改善を最大化する方法を問う。
フェールが初期状態の小さなサブセットに集中できることを観察するため、均一なコレクションは、ポリシーがすでに処理している状態にオペレータの時間の大部分を費やします。
論文 参考訳(メタデータ) (2026-10-05T06:56:13Z) - Taming VLAs under Robot Execution Errors: Self-Compensation and Stress Testing [59.15715295478112]
視覚言語アクション(VLA)ポリシーは、ロボットが実行した動作が命令された動作から逸脱した場合にしばしば失敗する。
本稿では,VLAポリシーがロボットの実行エラーを事前に補償できるデプロイ時適応手法である自己補償型VLAを提案する。
論文 参考訳(メタデータ) (2026-09-29T12:08:13Z) - Addressing the Orchestration Gap in Generalist Robots via Physical Agency [28.555813508134623]
汎用ロボットは、認識、世界知識、計画、成功検出、回復、低レベル制御といった行動について推論する必要がある。
本稿では,これらの機能を,一般的な言語条件のポリシ/コントロールエージェントと,ハイレベルなエージェントマネージャ/オーケストレータに分解可能であることを示す。
事前学習を通じて推論を行うためのポリシをトレーニングするのではなく、高レベルの計画を行うことができるクローズドループ物理エージェントオーケストレータを構築し、目標を達成可能なサブゴールに分解し、低レベルのモーターコマンドを指令し、低レベルの観測結果を追跡し検証し、失敗から回復する。
論文 参考訳(メタデータ) (2026-07-23T18:18:32Z) - Learning while Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies [23.266003019334438]
汎用的なロボットポリシーは、大規模な事前トレーニングの恩恵を受ける傾向にあるが、オフラインデータだけでは、堅牢な現実世界のデプロイメントには不十分である。
本稿では,VLA(Vision-Language-Action)ポリシーの継続学習のための,艦隊規模のオフライン-オンライン強化学習フレームワークであるLWDを紹介する。
論文 参考訳(メタデータ) (2026-05-01T05:20:26Z) - Act-Observe-Rewrite: Multimodal Coding Agents as In-Context Policy Learners for Robot Manipulation [0.0]
本稿では、LLMエージェントがロボット操作ポリシーを改善するためのフレームワークであるAct-Observe-Rewrite(AOR)を提案する。
AORはLLM推論の単位として、完全な低レベルモーター制御を実装している。
エージェントは、デモンストレーション、報酬工学、勾配更新なしで高い成功率を達成する。
論文 参考訳(メタデータ) (2026-03-03T22:15:55Z) - Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance [66.51390591688802]
バリューガイド型ポリシーステアリング(V-GPS)は、ポリシーの重みを微調整したり、アクセスしたりすることなく、幅広い種類のジェネラリストポリシーと互換性がある。
同じ値関数は、異なるアーキテクチャで5つの最先端ポリシーの性能を向上させることができることを示す。
論文 参考訳(メタデータ) (2024-10-17T17:46:26Z) - FLaRe: Achieving Masterful and Adaptive Robot Policies with Large-Scale Reinforcement Learning Fine-Tuning [74.25049012472502]
FLaReは、堅牢な事前訓練された表現、大規模なトレーニング、勾配安定化技術を統合する大規模な強化学習フレームワークである。
提案手法は,タスク完了に向けた事前訓練されたポリシーを整列し,これまで実証され,全く新しいタスクや実施状況において,最先端(SoTA)のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-09-25T03:15:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。