論文の概要: ACE: Agentic Control for Embodied Manipulation via Zero-shot Workflow Reasoning
- arxiv url: http://arxiv.org/abs/2607.04162v1
- Date: Sun, 05 Jul 2026 08:07:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.843856
- Title: ACE: Agentic Control for Embodied Manipulation via Zero-shot Workflow Reasoning
- Title(参考訳): ACE:ゼロショットワークフロー推論による身体操作のためのエージェント制御
- Abstract要約: 自然言語からのテーブルトップピック・アンド・プレースのためのゼロショットワークフロー推論フレームワークであるACEを紹介する。
我々は,数立方体を用いたゼロショット多段方程式生成や制約に基づくオブジェクト検索など,論理的に複雑で長い水平タスクにおけるACEを評価する。
- 参考スコア(独自算出の注目度): 32.18940485472935
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-ended tabletop manipulation requires agents to not only understand natural language but also adapt to dynamic environments and execution failures. We present ACE (Agentic Control for Embodied Manipulation), a zero-shot workflow reasoning framework for tabletop pick-and-place from natural language. Rather than relying on direct low-level action mapping, ACE combines agentic workflow reasoning with two robot-facing executable skills: a visual grounding interface and a reusable pick-and-place primitive. To bridge semantic reasoning and physical control, the active sub-goal is grounded into a mask-mediated vision-action interface. This unified mask specifies the target object and destination, is tracked over time, exposed for human verification, and ultimately passed to a task-agnostic downstream policy for execution. Crucially, ACE operates in a closed loop supported by a multi-timescale memory. After an action is executed, the system automatically verifies whether the intended sub-goal succeeded, using the outcome to advance, retry, repair, or replan. This enables online adaptation to user corrections, scene changes, and physical failures. We evaluate ACE on logically complex, long-horizon tasks, including zero-shot multi-step equation formation with number cubes and constraint-based object retrieval. ACE demonstrates task-level zero-shot generalization on novel semantic constraints and randomized tabletop scenes without task-specific retraining. Specifically, while standard end-to-end baselines struggle to complete these logically demanding tasks, ACE achieves a 50% success rate in equation formation and a 70% success rate in constraint retrieval. This contrast demonstrates that explicit workflow reasoning and mask-mediated control offer a robust, practical route toward adaptable robotic manipulation.
- Abstract(参考訳): オープンなテーブルトップ操作では、エージェントは自然言語だけでなく、動的環境や実行障害にも適応する必要がある。
自然言語からのテーブルトップピック・アンド・プレースのためのゼロショットワークフロー推論フレームワークであるACE(Agentic Control for Embodied Manipulation)を提案する。
ACEは、直接の低レベルアクションマッピングに頼るのではなく、エージェントワークフロー推論と、視覚的な接地インターフェースと再利用可能なピック・アンド・プレイスプリミティブという、ロボットが対象とする2つの実行可能なスキルを組み合わせる。
意味論的推論と物理的制御をブリッジするために、アクティブなサブゴールはマスクを介する視覚-アクションインターフェースに接地される。
この統一マスクは、対象のオブジェクトと宛先を特定し、時間とともに追跡され、人間の検証のために露出され、最終的に実行のためにタスクに依存しない下流ポリシーに渡される。
重要なことは、ACEはマルチタイムメモリでサポートされているクローズドループで動作する。
動作が実行された後、システムは目的のサブゴールが成功したかどうかを自動的に検証し、その結果を使用して前進、再試行、修復、再計画を行う。
これにより、ユーザの修正、シーンの変更、物理的障害へのオンライン適応が可能になる。
我々は,数立方体を用いたゼロショット多段方程式生成や制約に基づくオブジェクト検索など,論理的に複雑で長い水平タスクにおけるACEを評価する。
ACEは、タスク固有のリトレーニングなしで、新しいセマンティック制約とランダム化されたテーブルトップシーンに対するタスクレベルのゼロショットの一般化を実証する。
具体的には、標準的なエンドツーエンドベースラインはこれらの論理的に要求されるタスクを完了させるのに苦労するが、ACEは方程式形成における50%の成功率と制約検索における70%の成功率を達成する。
この対比は、明示的なワークフロー推論とマスクによる制御が、適応可能なロボット操作への堅牢で実用的な経路を提供することを示している。
関連論文リスト
- EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents [56.25120535601186]
視覚言語アクション(VLA)モデルは、視覚観察と言語指示を直接ロボットアクションにマッピングする。
本稿では,各スキル決定を実行提案として扱うフレームワークであるEmbodiedSkillsを提案する。
共有可能スキルインタフェースは、ハイレベルスキル選択、バウンドローレベルVLA実行、ポストアクション検証を接続する。
論文 参考訳(メタデータ) (2026-09-01T14:14:47Z) - Bridging Semantics and Physics with Constrained LLMs for Safe and Trustworthy Robotic Manipulation [6.975054201075641]
言語誘導ロボットは、正しいように見える計画を作る以上のことをしなければならない。
計画は、運動と衝突の制約の下で物理的に実現不可能でありながら、言語学的に有効なように見える。
推論実行境界を型付き契約として形式化し、このギャップを埋めます。
論文 参考訳(メタデータ) (2026-08-29T17:26:20Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - IMBench: A Benchmark for Intuitive Robotic Manipulation [11.843368723732679]
人間は推論と運動制御を組み合わせて、様々な制約の下で複雑な操作タスクを解く。
既存のベンチマークは、この統合を達成できない。
IMBENCHは直感的な操作を知覚、身体的推論、行動生成、反復実行にまたがる統合機能として評価するためのベンチマークである。
論文 参考訳(メタデータ) (2026-07-17T05:34:29Z) - ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI [110.18670135256235]
Embodied AIは、独立した知覚やアクションモジュールから、目標を理解し、計画し、進捗を監視し、経験から改善する物理的なエージェントへと移行している。
ACE-Brain-0.5は,ロボットの知性を5つの結合関数にまとめる統一的な基礎モデルである。
単一の8Bバックボーンは、最初の4つの機能をインスタンス化する: オブジェクトとアベイランスを接地し、3Dとエゴセントリックな空間関係を推論し、命令をサブゴールに分解し、ナビゲーションと操作アクションを生成し、検証と回復の進捗を推定する。
論文 参考訳(メタデータ) (2026-07-05T17:43:06Z) - SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning [99.49739831030388]
このインタフェースの設計は,オープンエンド空間推論のためのエージェントのキャパシティをいかに形作るかを検討する。
本研究では,アクションインタフェースとしてコードを採用する空間推論のためのトレーニングフリーフレームワークであるSpatialClawを提案する。
論文 参考訳(メタデータ) (2026-06-11T17:59:36Z) - PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations [66.94988600664574]
我々は,目標達成型強化学習を通じて事前学習を再構築するVLA基盤モデルであるtextbfPRTS(textbfPrimitive textbfReasoning and textbfTasking textbfSystem)を提案する。
論文 参考訳(メタデータ) (2026-04-30T06:14:02Z) - RADAR: Closed-Loop Robotic Data Generation via Semantic Planning and Autonomous Causal Environment Reset [48.645870795753105]
ロボットのためのロバスト自動データ取得(RADAR)について紹介する。
RADARは完全に自律的でクローズドループのデータ生成エンジンで、収集サイクルから人間の介入を完全に取り除きます。
シミュレーションでは、複雑な長期タスクにおいて、最大90%の成功率を達成する。
論文 参考訳(メタデータ) (2026-03-12T11:18:52Z) - EmboAlign: Aligning Video Generation with Compositional Constraints for Zero-Shot Manipulation [17.037238350207513]
大規模なインターネットデータに事前訓練されたビデオ生成モデル(VGM)は、時間的に一貫性のあるロールアウトビデオを生成することができる。
提案手法は,VGM出力を推論時に視覚言語モデルによって生成された洞察と整合するデータフリーフレームワークである。
本研究では,6つの実ロボット操作タスクに対して,厳密で制約に敏感な実行を必要とする手法を評価する。
論文 参考訳(メタデータ) (2026-03-05T23:31:56Z) - Learning Object-Centric Spatial Reasoning for Sequential Manipulation in Cluttered Environments [0.0]
我々は,低レベルの行動実行から高レベルの空間的推論を分離するフレームワークUnveilerを提案する。
この分離されたアーキテクチャは、パラメータ数と推論時間の観点からより計算的に効率的であることを示す。
シミュレーションでは,97.6%の成功率,90.0%の完全閉塞シナリオを達成し,複雑な操作タスクにおけるオブジェクト中心推論の能力について考察した。
論文 参考訳(メタデータ) (2026-03-03T01:45:53Z) - UniManip: General-Purpose Zero-Shot Robotic Manipulation with Agentic Operational Graph [23.060488218180936]
We present UniManip, a framework based on a Bi-level Agentic Operational Graph (AOG)
タスクオーケストレーションのための高レベルのエージェント層と、動的状態表現のための低レベルのScene Layerを結合することにより、システムは、抽象的な計画と幾何学的制約を継続的に整合させる。
実験では、未確認のオブジェクトやタスクに対するシステムの堅牢なゼロショット能力を評価し、最先端のVLAや階層的なベースラインと比較して22.5%と25.0%の成功率を示した。
論文 参考訳(メタデータ) (2026-02-13T16:47:26Z) - V-CAGE: Context-Aware Generation and Verification for Scalable Long-Horizon Embodied Tasks [6.820118518027692]
V-CAGEは、大規模なセマンティックアライメントデータセットを生成するクローズドループフレームワークである。
本研究では,シーン合成における幾何学的整合性を実現する文脈認識型インスタンス化機構を提案する。
また、階層的な命令分解モジュールを用いて、抽象意図と低レベル制御のギャップを埋める。
論文 参考訳(メタデータ) (2026-01-21T16:41:51Z) - Geometrically-Constrained Agent for Spatial Reasoning [53.93718394870856]
視覚言語モデルは空間的推論において基本的な意味-幾何学的ギャップを示す。
現在のパラダイムは、このギャップを埋めることに失敗します。
本稿では,形式的タスク制約を導入することにより,このギャップを解消する学習自由エージェントパラダイムを提案する。
論文 参考訳(メタデータ) (2025-11-27T17:50:37Z) - Visual Backdoor Attacks on MLLM Embodied Decision Making via Contrastive Trigger Learning [89.1856483797116]
MLLMをベースとした組込みエージェントに視覚的バックドアを注入する最初のフレームワークであるBEATを紹介する。
テキストトリガーとは異なり、オブジェクトトリガーは視点や照明の幅が広いため、確実に移植することは困難である。
BEATは攻撃の成功率を最大80%まで達成し、強い良識のあるタスクパフォーマンスを維持します。
論文 参考訳(メタデータ) (2025-10-31T16:50:49Z) - CAPE: Corrective Actions from Precondition Errors using Large Language
Models [8.547766794082184]
本研究では,計画中の条件誤差を解決するための修正行動を提案する新しい手法を提案する。
CAPEは、アクション前提条件からの少数ショット推論を活用することにより、生成されたプランの品質を改善する。
そこでCAPEはSayCanに比べて76.49%の精度でタスク計画の正しさを向上する。
論文 参考訳(メタデータ) (2022-11-17T23:14:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。