論文の概要: ETA: A New Agentic Paradigm for Embodied Tasks
- arxiv url: http://arxiv.org/abs/2608.03924v1
- Date: Tue, 04 Aug 2026 16:56:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 07:04:20.734875
- Title: ETA: A New Agentic Paradigm for Embodied Tasks
- Title(参考訳): ETA: 身体的タスクのための新しいエージェントパラダイム
- Authors: Yitong Chen, Zezheng Huai, Sixian Li, Yubang Wang, Haozhe Zhang, Yifei Zhang, Hechang Chen, Jingjing Gong, Yu-Gang Jiang, Xipeng Qiu,
- Abstract要約: 本稿では,デジタルエージェントを物理世界へ拡張するための新しいパラダイムであるEmbodied Task Agent(ETA)を紹介する。
ETAは、一度に1つのツールコールを選択するPlanner、実行を制御するInterface、結果と新鮮な観察を返送するWorldを中心にロボットを集中させる。
ETAは、置換可能なPlanner、構成可能なツールとスキル、監査可能なメモリ、再生可能なトラジェクトリ、シミュレーションと実際のロボットのための一般的なインターフェースを提供する。
- 参考スコア(独自算出の注目度): 76.25893120982523
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When will robots have their ChatGPT moment? Such a breakthrough requires a general-purpose robot that can handle unfamiliar tasks in unfamiliar environments, remain controllable over long interactions, and learn from experience. Today's embodied systems largely follow an end-to-end observation-to-action path. Despite rapid progress, they remain far from this goal: their generalization depends heavily on the coverage of robot training data, while long task execution remains difficult to control and inspect. To realize this goal, we introduce the Embodied Task Agent (ETA), a new paradigm for extending digital agents into the physical world, and release OpenETA as its open-source implementation. ETA centers the robot around a Planner that chooses one Tool call at a time, an Interface that controls execution, and a World that returns the result and a fresh observation. This loop allows the agent to verify outcomes, adapt its plan, and turn successful and failed interactions into reusable experience. OpenETA provides replaceable Planners, composable Tools and Skills, auditable memory, replayable trajectories, and common interfaces for simulation and real robots. For Codex, OpenETA can operate as a lightweight plugin that exposes only observe, mark_point, and move_to.
- Abstract(参考訳): ロボットはいつChatGPTの瞬間を持てるのか?
このようなブレークスルーには、馴染みのない環境下でのタスクを処理し、長時間のインタラクションをコントロールし、経験から学ぶことのできる汎用ロボットが必要だ。
今日の実施されたシステムは、主にエンドツーエンドの観察から行動へのパスに従っている。
彼らの一般化はロボットのトレーニングデータのカバレッジに大きく依存するが、長いタスクの実行は制御と検査が困難である。
この目標を達成するために,デジタルエージェントを物理世界へ拡張するための新しいパラダイムであるEmbodied Task Agent (ETA)を導入し,オープンソース実装としてOpenETAをリリースする。
ETAは、一度に1つのツールコールを選択するPlanner、実行を制御するInterface、結果と新鮮な観察を返送するWorldを中心にロボットを集中させる。
このループにより、エージェントは結果を確認し、その計画を適用し、成功し、失敗したインタラクションを再利用可能なエクスペリエンスに変えることができる。
OpenETAは、置換可能なPlanner、構成可能なツールとスキル、監査可能なメモリ、再生可能なトラジェクトリ、シミュレーションと実際のロボットのための共通インターフェースを提供する。
Codexでは、OpenETAは、Observive、mark_point、 move_toのみを公開する軽量プラグインとして動作することができる。
関連論文リスト
- A Glimpse into Long-term Physical Coexistence with Intelligent Robots [12.275897522668858]
PHILIAは、ロボットゲートウェイの抽象化を中心に構築されたマルチロボットエージェントである。
高周波、低レベルロボットの実行から、低頻度、高セマンティックエージェントを分離する。
本稿では,エージェント記憶とシーン理解がロボット行動に基礎を置いている代表的ユースケースについて述べる。
論文 参考訳(メタデータ) (2026-07-13T10:40:32Z) - VIA: Visual Interface Agent for Robot Control [34.69686658431114]
VIA(Visual Interface Agent for Robot Control)は、ロボット制御をエージェントタスクとして再キャストするフレームワークである。
スクリーンショットを撮り、直感的なコマンドを出し、結果を観察し、調整することで、ブラウザベースの3Dインターフェースを介してマニピュレータを駆動する。
3つのLIBEROゴールタスクで96.7%、ロングホライゾン虹組立タスクで100%を達成している。
論文 参考訳(メタデータ) (2026-07-13T05:52:12Z) - VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation [32.23131310342716]
オープンボキャブラリのロングホライゾン操作では、ロボットが柔軟な指示や複雑な多目的シーンを推論する必要がある。
本稿では,VLMが異種ロボット機能を中断可能なツールとしてオーケストレーションするクローズドエージェントループを用いて,これらの要求に対処する。
本稿では,VLA/WAMを中間ロールアウト時の中断可能なツールとして扱うことで,VLMの計画,監視,回復を行うVoLoAgentを提案する。
論文 参考訳(メタデータ) (2026-06-05T16:21:27Z) - NovaPlan: Zero-Shot Long-Horizon Manipulation via Closed-Loop Video Language Planning [36.20611975009607]
クローズドループVLMとビデオプランニングを統合した階層型フレームワークであるNovaPlanを紹介する。
高いレベルでは、VLMプランナーはタスクをサブゴールに分解し、クローズドループでロボットの実行を監視する。
低レベルのロボット動作を計算するために,タスク関連オブジェクトキーポイントと人手ポーズの両方を抽出し,活用する。
論文 参考訳(メタデータ) (2026-02-23T18:35:18Z) - COHERENT: Collaboration of Heterogeneous Multi-Robot System with Large Language Models [49.24666980374751]
COHERENTは、異種マルチロボットシステムの協調のための新しいLCMベースのタスク計画フレームワークである。
提案-実行-フィードバック-調整機構は,個々のロボットに対して動作を分解・割り当てするように設計されている。
実験の結果,我々の研究は,成功率と実行効率の面で,従来の手法をはるかに上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2024-09-23T15:53:41Z) - Track2Act: Predicting Point Tracks from Internet Videos enables Generalizable Robot Manipulation [65.46610405509338]
我々は、ゼロショットロボット操作を可能にする汎用的な目標条件ポリシーを学習することを目指している。
私たちのフレームワークであるTrack2Actは、ゴールに基づいて将来のタイムステップで画像内のポイントがどのように動くかを予測する。
学習したトラック予測を残留ポリシーと組み合わせることで,多種多様な汎用ロボット操作が可能となることを示す。
論文 参考訳(メタデータ) (2024-05-02T17:56:55Z) - RoboScript: Code Generation for Free-Form Manipulation Tasks across Real
and Simulation [77.41969287400977]
本稿では,コード生成を利用したデプロイ可能なロボット操作パイプラインのためのプラットフォームである textbfRobotScript を提案する。
自由形自然言語におけるロボット操作タスクのためのコード生成ベンチマークも提案する。
我々は,Franka と UR5 のロボットアームを含む,複数のロボットエボディメントにまたがるコード生成フレームワークの適応性を実証した。
論文 参考訳(メタデータ) (2024-02-22T15:12:00Z) - ALAN: Autonomously Exploring Robotic Agents in the Real World [28.65531878636441]
ALANは自律的なロボットエージェントで、ほとんどトレーニングや対話の時間なしで現実世界でタスクを実行できる。
これは、物体の動きを反映し、ロボットの位置の変化を無視する環境変化を測定することで実現される。
我々は,ロボットが操作スキルを効率的に探索し,発見することを可能にするために,2つの異なる実世界のプレイキッチン設定に対するアプローチを評価した。
論文 参考訳(メタデータ) (2023-02-13T18:59:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。