論文の概要: Addressing the Orchestration Gap in Generalist Robots via Physical Agency
- arxiv url: http://arxiv.org/abs/2607.21725v1
- Date: Thu, 23 Jul 2026 18:18:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:56.968724
- Title: Addressing the Orchestration Gap in Generalist Robots via Physical Agency
- Title(参考訳): 一般用ロボットにおける物理エージェントによるオーケストレーションギャップの対応
- Authors: Liane Galanti, Dhruv Shah, Tri Dao,
- Abstract要約: 汎用ロボットは、認識、世界知識、計画、成功検出、回復、低レベル制御といった行動について推論する必要がある。
本稿では,これらの機能を,一般的な言語条件のポリシ/コントロールエージェントと,ハイレベルなエージェントマネージャ/オーケストレータに分解可能であることを示す。
事前学習を通じて推論を行うためのポリシをトレーニングするのではなく、高レベルの計画を行うことができるクローズドループ物理エージェントオーケストレータを構築し、目標を達成可能なサブゴールに分解し、低レベルのモーターコマンドを指令し、低レベルの観測結果を追跡し検証し、失敗から回復する。
- 参考スコア(独自算出の注目度): 28.555813508134623
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: General-purpose robots need to reason about their actions, combining perception, world knowledge, planning, success detection, recovery, and low-level control. Today's state-of-the-art models attempt to combine all these capabilities into the learned policy via large-scale pre-training. Instead, we show that these capabilities can be decomposed into a general language-conditioned policy/control agent and a high-level agent manager/orchestrator. Rather than training policies to reason via pre-training, we build a closed-loop physical agent orchestrator that can do high-level planning, decompose the goal into achievable subgoals, command low-level motor commands, track and verify the outcome from low-level observations, and recover from failures. Our Physical Agency orchestrator (Pigey) can control existing vision-language-action (VLA) policies as well as parametrized skills to solve complex reasoning tasks in the real world, without any additional data collection or post-training. We evaluate Pigey extensively across simulation benchmarks and challenging real-world robotic manipulation tasks, and demonstrate significant performance improvements over existing generalist policies. On LIBERO-PRO, Pigey advances the state-of-the-art by over 4x (12.8% -> 53.3%) with no task-specific fine-tuning. On a real robot, Pigey lifts the frozen policy from near-zero to over 90% on reasoning-limited tasks. We call the difference between what frozen motor skills achieve alone and inside the agentic loop the orchestration gap.
- Abstract(参考訳): 汎用ロボットは、認識、世界知識、計画、成功検出、回復、低レベル制御といった行動について推論する必要がある。
今日の最先端モデルは、これらすべての機能を大規模な事前学習を通じて学習ポリシーに組み込もうとしている。
代わりに、これらの機能は、一般的な言語条件のポリシー/制御エージェントと、ハイレベルなエージェントマネージャ/オーケストレータに分解できることを示す。
事前学習を通じて推論を行うためのポリシをトレーニングするのではなく、高レベルの計画を行うことができるクローズドループ物理エージェントオーケストレータを構築し、目標を達成可能なサブゴールに分解し、低レベルのモーターコマンドを指令し、低レベルの観測結果を追跡し検証し、失敗から回復する。
我々の物理機関のオーケストレータ(Pigey)は、既存の視覚言語アクション(VLA)ポリシーを制御できるだけでなく、実世界の複雑な推論タスクを、追加のデータ収集やポストトレーニングなしで解決するためのパラメタライズされたスキルも制御できる。
シミュレーションベンチマークや実世界のロボット操作の課題に対して,Pigeyを広範囲に評価し,既存のジェネラリストポリシーよりも大幅な性能向上を示した。
LIBERO-PROでは、Pigeyはタスク固有の微調整なしで4倍(12.8%から>53.3%)以上の最先端を推し進めている。
本物のロボットでは、Pigeyは解凍ポリシーをほぼゼロから90%以上まで引き上げる。
我々は、フリーズモータスキルが単独で達成するものと、エージェントループ内のオーケストレーションギャップの違いを呼んでいる。
関連論文リスト
- Ctrl-World: A Controllable Generative World Model for Robot Manipulation [53.71061464925014]
汎用ロボットポリシーは、幅広い操作スキルを実行することができる。
未知の物体や命令で 彼らの能力を評価し 改善することは 重要な課題です
世界モデルは、イマジネーション空間内でポリシーの展開を可能にすることで、有望でスケーラブルな代替手段を提供する。
論文 参考訳(メタデータ) (2025-10-11T09:13:10Z) - FLaRe: Achieving Masterful and Adaptive Robot Policies with Large-Scale Reinforcement Learning Fine-Tuning [74.25049012472502]
FLaReは、堅牢な事前訓練された表現、大規模なトレーニング、勾配安定化技術を統合する大規模な強化学習フレームワークである。
提案手法は,タスク完了に向けた事前訓練されたポリシーを整列し,これまで実証され,全く新しいタスクや実施状況において,最先端(SoTA)のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-09-25T03:15:17Z) - Robotic Control via Embodied Chain-of-Thought Reasoning [86.6680905262442]
学習したロボット制御ポリシーの鍵となる制限は、トレーニングデータの外部で一般化できないことである。
視覚言語行動モデル(VLA)に関する最近の研究は、大規模なインターネット事前学習型視覚言語モデルを使用することで、その堅牢性と一般化能力を大幅に向上させることができることを示した。
ロボットの動作を予測する前に、VLAに対して、計画、サブタスク、動作、視覚的接地機能について複数の推論を行うために、VLAに対してEmbodied Chain-of-Thought Reasoning (ECoT)を導入する。
論文 参考訳(メタデータ) (2024-07-11T17:31:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。