論文の概要: Addressing the Orchestration Gap in Generalist Robots via Physical Agency
- arxiv url: http://arxiv.org/abs/2607.21725v1
- Date: Thu, 23 Jul 2026 18:18:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:56.968724
- Title: Addressing the Orchestration Gap in Generalist Robots via Physical Agency
- Title(参考訳): 一般用ロボットにおける物理エージェントによるオーケストレーションギャップの対応
- Abstract要約: 汎用ロボットは、認識、世界知識、計画、成功検出、回復、低レベル制御といった行動について推論する必要がある。
本稿では,これらの機能を,一般的な言語条件のポリシ/コントロールエージェントと,ハイレベルなエージェントマネージャ/オーケストレータに分解可能であることを示す。
事前学習を通じて推論を行うためのポリシをトレーニングするのではなく、高レベルの計画を行うことができるクローズドループ物理エージェントオーケストレータを構築し、目標を達成可能なサブゴールに分解し、低レベルのモーターコマンドを指令し、低レベルの観測結果を追跡し検証し、失敗から回復する。
- 参考スコア(独自算出の注目度): 28.555813508134623
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: General-purpose robots need to reason about their actions, combining perception, world knowledge, planning, success detection, recovery, and low-level control. Today's state-of-the-art models attempt to combine all these capabilities into the learned policy via large-scale pre-training. Instead, we show that these capabilities can be decomposed into a general language-conditioned policy/control agent and a high-level agent manager/orchestrator. Rather than training policies to reason via pre-training, we build a closed-loop physical agent orchestrator that can do high-level planning, decompose the goal into achievable subgoals, command low-level motor commands, track and verify the outcome from low-level observations, and recover from failures. Our Physical Agency orchestrator (Pigey) can control existing vision-language-action (VLA) policies as well as parametrized skills to solve complex reasoning tasks in the real world, without any additional data collection or post-training. We evaluate Pigey extensively across simulation benchmarks and challenging real-world robotic manipulation tasks, and demonstrate significant performance improvements over existing generalist policies. On LIBERO-PRO, Pigey advances the state-of-the-art by over 4x (12.8% -> 53.3%) with no task-specific fine-tuning. On a real robot, Pigey lifts the frozen policy from near-zero to over 90% on reasoning-limited tasks. We call the difference between what frozen motor skills achieve alone and inside the agentic loop the orchestration gap.
- Abstract(参考訳): 汎用ロボットは、認識、世界知識、計画、成功検出、回復、低レベル制御といった行動について推論する必要がある。
今日の最先端モデルは、これらすべての機能を大規模な事前学習を通じて学習ポリシーに組み込もうとしている。
代わりに、これらの機能は、一般的な言語条件のポリシー/制御エージェントと、ハイレベルなエージェントマネージャ/オーケストレータに分解できることを示す。
事前学習を通じて推論を行うためのポリシをトレーニングするのではなく、高レベルの計画を行うことができるクローズドループ物理エージェントオーケストレータを構築し、目標を達成可能なサブゴールに分解し、低レベルのモーターコマンドを指令し、低レベルの観測結果を追跡し検証し、失敗から回復する。
我々の物理機関のオーケストレータ(Pigey)は、既存の視覚言語アクション(VLA)ポリシーを制御できるだけでなく、実世界の複雑な推論タスクを、追加のデータ収集やポストトレーニングなしで解決するためのパラメタライズされたスキルも制御できる。
シミュレーションベンチマークや実世界のロボット操作の課題に対して,Pigeyを広範囲に評価し,既存のジェネラリストポリシーよりも大幅な性能向上を示した。
LIBERO-PROでは、Pigeyはタスク固有の微調整なしで4倍(12.8%から>53.3%)以上の最先端を推し進めている。
本物のロボットでは、Pigeyは解凍ポリシーをほぼゼロから90%以上まで引き上げる。
我々は、フリーズモータスキルが単独で達成するものと、エージェントループ内のオーケストレーションギャップの違いを呼んでいる。
関連論文リスト
- Physical Agentic AI: An Architecture for Orchestrating a Robot Crew with LLMs [6.2312877626161205]
本稿では,スキルグラウンドロボットエージェントオーケストレーションのためのフレームワークであるPhysical Agentic AIを紹介する。
ロボットオーケストレーションレイヤは、スキルライブラリ、ロボット状態、名前付きロケーション、ワークフローコントラクトを非アクチュエータミッションプランナに公開する。
我々は,ガゼボで全条件で全ミッションが実行され,ドローン-UGV検索・ディスパッチミッションを評価する。
論文 参考訳(メタデータ) (2026-08-23T23:35:31Z) - Improving Robotic Generalist Policies via Flow Reversal Steering [92.97477771370428]
汎用ポリシーは多様なロボットデータセットから幅広いスキルを学ぶことができる。
新しい課題を解決し、改善するためには、ポリシーのリッチな振る舞いから適切なアクションを推論し、呼び出す方法が必要です。
本稿では,フローリバーサルステアリング (FRS) を提案し,フローポリシーを逆に通すことで,最適だが合理的な動作をとる手法を提案し,それらを一般の動作モードにマッピングする。
論文 参考訳(メタデータ) (2026-06-11T17:59:45Z) - Act-Observe-Rewrite: Multimodal Coding Agents as In-Context Policy Learners for Robot Manipulation [0.0]
本稿では、LLMエージェントがロボット操作ポリシーを改善するためのフレームワークであるAct-Observe-Rewrite(AOR)を提案する。
AORはLLM推論の単位として、完全な低レベルモーター制御を実装している。
エージェントは、デモンストレーション、報酬工学、勾配更新なしで高い成功率を達成する。
論文 参考訳(メタデータ) (2026-03-03T22:15:55Z) - Ctrl-World: A Controllable Generative World Model for Robot Manipulation [53.71061464925014]
汎用ロボットポリシーは、幅広い操作スキルを実行することができる。
未知の物体や命令で 彼らの能力を評価し 改善することは 重要な課題です
世界モデルは、イマジネーション空間内でポリシーの展開を可能にすることで、有望でスケーラブルな代替手段を提供する。
論文 参考訳(メタデータ) (2025-10-11T09:13:10Z) - RoBridge: A Hierarchical Architecture Bridging Cognition and Execution for General Robotic Manipulation [90.81956345363355]
RoBridgeは、一般的なロボット操作のための階層的なインテリジェントアーキテクチャである。
大規模事前学習型視覚言語モデル(VLM)に基づくハイレベル認知プランナー(HCP)で構成されている。
強化学習の手続き的スキルを解き放ち、認知と実行のギャップを効果的に埋める。
論文 参考訳(メタデータ) (2025-05-03T06:17:18Z) - FLaRe: Achieving Masterful and Adaptive Robot Policies with Large-Scale Reinforcement Learning Fine-Tuning [74.25049012472502]
FLaReは、堅牢な事前訓練された表現、大規模なトレーニング、勾配安定化技術を統合する大規模な強化学習フレームワークである。
提案手法は,タスク完了に向けた事前訓練されたポリシーを整列し,これまで実証され,全く新しいタスクや実施状況において,最先端(SoTA)のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-09-25T03:15:17Z) - Grounding Language Models in Autonomous Loco-manipulation Tasks [3.8363685417355557]
異なるシナリオにおけるタスクに基づいて行動を学び、選択し、計画する新しいフレームワークを提案する。
我々は,大規模言語モデル(LLM)の計画と推論機能を活用し,階層的なタスクグラフを構築する。
CENTAUROロボットを用いたシミュレーションおよび実世界の実験により、言語モデルに基づくプランナーが、新しいロコ操作タスクに効率的に適応できることが示されている。
論文 参考訳(メタデータ) (2024-09-02T15:27:48Z) - Robotic Control via Embodied Chain-of-Thought Reasoning [86.6680905262442]
学習したロボット制御ポリシーの鍵となる制限は、トレーニングデータの外部で一般化できないことである。
視覚言語行動モデル(VLA)に関する最近の研究は、大規模なインターネット事前学習型視覚言語モデルを使用することで、その堅牢性と一般化能力を大幅に向上させることができることを示した。
ロボットの動作を予測する前に、VLAに対して、計画、サブタスク、動作、視覚的接地機能について複数の推論を行うために、VLAに対してEmbodied Chain-of-Thought Reasoning (ECoT)を導入する。
論文 参考訳(メタデータ) (2024-07-11T17:31:01Z) - Yell At Your Robot: Improving On-the-Fly from Language Corrections [84.09578841663195]
高いレベルのポリシーは、人間のフィードバックによって言語修正の形で容易に管理できることを示す。
このフレームワークは、ロボットがリアルタイムの言語フィードバックに迅速に適応するだけでなく、このフィードバックを反復的なトレーニングスキームに組み込むことを可能にする。
論文 参考訳(メタデータ) (2024-03-19T17:08:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。