論文の概要: Agent as Policy for Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2609.12541v2
- Date: Mon, 14 Sep 2026 08:11:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.063598
- Title: Agent as Policy for Robotic Manipulation
- Title(参考訳): ロボットマニピュレーションのためのエージェント
- Abstract要約: 我々はエージェント・アズ・ポリシーを導入し、エージェントの制御下でタスク・プランニングと実行を行う。
本研究では,複数の実世界の操作タスクに対して,高精度な操作,動的動作,変形可能なオブジェクトを対象とするAGPについて検討する。
AGPは、評価されたタスク構成ごとに少なくとも10のトライアルのうち8つを成功させる。
- 参考スコア(独自算出の注目度): 27.777226380588928
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We demonstrate that a general-purpose agent can directly drive a physical robot throughout task execution without any task-specific or environment-specific training. We introduce Agent as Policy (AGP), which places task planning and execution under the agent's control. Given a task and a robot interface, the agent interprets visual evidence, writes executable programs, issues motion commands, and revises its actions in response to physical outcomes. This brings the agent's reasoning and programming capabilities into continuous interaction with the physical world. We study AGP across multiple real-world manipulation tasks spanning precision manipulation, dynamic motions, and deformable objects. These include assembly from human videos, block construction from goal images, dice flipping, targeted throwing, and bimanual towel folding. Across assembly, block construction, and dice flipping, AGP succeeds in at least eight of ten trials for each evaluated task configuration. We further study efficiency through task experience accumulation and find that reusing saved procedures and programs shortens execution time across repeated trials. These findings support a path for general-purpose agents to act as robot policies, extending their autonomy to physical manipulation through runtime reasoning, programming, and interaction.
- Abstract(参考訳): 汎用エージェントは、タスク固有のトレーニングや環境固有のトレーニングを必要とせずに、タスク実行を通して、物理的なロボットを直接駆動できることを実証する。
我々はエージェント・アズ・ポリシー(AGP)を導入し、エージェントの制御下にタスク・プランニングと実行を配置する。
タスクとロボットインタフェースが与えられた場合、エージェントは視覚的エビデンスを解釈し、実行可能なプログラムを書き、動作コマンドを発行し、身体的な結果に応じて行動を修正する。
これにより、エージェントの推論とプログラミング能力は、物理世界との継続的な相互作用をもたらす。
本研究では,複数の実世界の操作タスクに対して,高精度な操作,動的動作,変形可能なオブジェクトを対象とするAGPについて検討する。
これには、人間のビデオからの組み立て、ゴールイメージからの構築をブロックする、ダイスフリップ、ターゲット投げ、バイマニュアルタオルの折りたたみなどが含まれる。
組立、ブロック構成、ダイスフリップにおいて、AGPは評価された各タスク構成に対して少なくとも10のトライアルで8回成功している。
さらに,タスク体験の蓄積を通じて効率性について検討し,再利用手順とプログラムが繰り返し試行錯誤して実行時間を短縮することを見出した。
これらの発見は、汎用エージェントがロボットポリシーとして振る舞う道をサポートし、実行時推論、プログラミング、インタラクションを通じて、その自律性を物理的操作に拡張する。
関連論文リスト
- IMBench: A Benchmark for Intuitive Robotic Manipulation [11.843368723732679]
人間は推論と運動制御を組み合わせて、様々な制約の下で複雑な操作タスクを解く。
既存のベンチマークは、この統合を達成できない。
IMBENCHは直感的な操作を知覚、身体的推論、行動生成、反復実行にまたがる統合機能として評価するためのベンチマークである。
論文 参考訳(メタデータ) (2026-07-17T05:34:29Z) - Behavior Prompting Policy: Demonstrations as Prompts for Manipulation [12.69446064622751]
我々は,ロボットが1人の人間の実演を前提として,推論時に新しいタスクを実行できるようにするパラダイムである行動プロンプトについて研究する。
我々はアルゴリズム、データ、評価に貢献する。
論文 参考訳(メタデータ) (2026-06-29T15:23:44Z) - Acting and Planning with Hierarchical Operational Models on a Mobile Robot: A Study with RAE+UPOM [5.758011837296545]
本稿では,行動と計画の両方の階層的操作モデルを共有する,アクター・プランナ統合システムの最初の物理的展開について述べる。
RAE+UPOMを実環境に配置した移動マニピュレータにオブジェクト収集タスクを実装した。
論文 参考訳(メタデータ) (2025-07-15T14:20:26Z) - COHERENT: Collaboration of Heterogeneous Multi-Robot System with Large Language Models [49.24666980374751]
COHERENTは、異種マルチロボットシステムの協調のための新しいLCMベースのタスク計画フレームワークである。
提案-実行-フィードバック-調整機構は,個々のロボットに対して動作を分解・割り当てするように設計されている。
実験の結果,我々の研究は,成功率と実行効率の面で,従来の手法をはるかに上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2024-09-23T15:53:41Z) - Make-An-Agent: A Generalizable Policy Network Generator with Behavior-Prompted Diffusion [41.52811286996212]
Make-An-Agentは、行動から政治への生成のための新しいポリシーパラメータジェネレータである。
所望の行動の1つの実演をプロンプトとして、エージェントに対して制御ポリシーを生成する方法を示す。
また,Make-An-Agentによって生成されたポリシーを,ロコモーションタスク上で現実世界のロボットに展開する。
論文 参考訳(メタデータ) (2024-07-15T17:59:57Z) - Track2Act: Predicting Point Tracks from Internet Videos enables Generalizable Robot Manipulation [65.46610405509338]
我々は、ゼロショットロボット操作を可能にする汎用的な目標条件ポリシーを学習することを目指している。
私たちのフレームワークであるTrack2Actは、ゴールに基づいて将来のタイムステップで画像内のポイントがどのように動くかを予測する。
学習したトラック予測を残留ポリシーと組み合わせることで,多種多様な汎用ロボット操作が可能となることを示す。
論文 参考訳(メタデータ) (2024-05-02T17:56:55Z) - Learning to Act from Actionless Videos through Dense Correspondences [87.1243107115642]
本稿では,様々なロボットや環境にまたがる多様なタスクを確実に実行可能なビデオベースのロボットポリシーを構築するためのアプローチを提案する。
本手法は,ロボットの目標を指定するための汎用表現として,状態情報と行動情報の両方を符号化するタスク非依存表現として画像を利用する。
テーブルトップ操作とナビゲーションタスクの学習方針における我々のアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2023-10-12T17:59:23Z) - RoboAgent: Generalization and Efficiency in Robot Manipulation via
Semantic Augmentations and Action Chunking [54.776890150458385]
マルチタスク操作能力を持つユニバーサルエージェントを訓練するための効率的なシステムを開発した。
私たちは、12のスキルを持つ1つのエージェントを訓練することができ、38のタスクでその一般化を実証することができます。
平均すると、RoboAgentは目に見えない状況において、従来の方法よりも40%以上性能が高い。
論文 参考訳(メタデータ) (2023-09-05T03:14:39Z) - Zero-Shot Robot Manipulation from Passive Human Videos [59.193076151832145]
我々は,人間の映像からエージェント非依存の行動表現を抽出するフレームワークを開発した。
我々の枠組みは、人間の手の動きを予測することに基づいている。
トレーニングされたモデルゼロショットを物理ロボット操作タスクにデプロイする。
論文 参考訳(メタデータ) (2023-02-03T21:39:52Z) - ProgPrompt: Generating Situated Robot Task Plans using Large Language
Models [68.57918965060787]
大規模言語モデル(LLM)は、タスク計画中の潜在的な次のアクションを評価するために使用することができる。
本稿では, プログラム型LCMプロンプト構造を用いて, 配置環境間での計画生成機能を実現する。
論文 参考訳(メタデータ) (2022-09-22T20:29:49Z) - Synthesis and Execution of Communicative Robotic Movements with
Generative Adversarial Networks [59.098560311521034]
我々は、繊細な物体を操作する際に人間が採用するのと同じキネマティクス変調を2つの異なるロボットプラットフォームに転送する方法に焦点を当てる。
我々は、ロボットのエンドエフェクターが採用する速度プロファイルを、異なる特徴を持つ物体を輸送する際に人間が何をするかに触発されて調整する。
我々は、人体キネマティクスの例を用いて訓練され、それらを一般化し、新しい有意義な速度プロファイルを生成する、新しいジェネレーティブ・アドバイサル・ネットワークアーキテクチャを利用する。
論文 参考訳(メタデータ) (2022-03-29T15:03:05Z) - Manipulation of Articulated Objects using Dual-arm Robots via Answer Set
Programming [10.316694915810947]
調音物体の操作はロボティクスにおいて最も重要なものであり、最も複雑な操作の1つと見なすことができる。
従来、この問題は、柔軟性と移植性に欠けるアドホックなアプローチによって対処されてきた。
本稿では,ロボット制御アーキテクチャにおける調音オブジェクトの自動操作のための解答セットプログラミング(ASP)に基づくフレームワークを提案する。
論文 参考訳(メタデータ) (2020-10-02T18:50:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。