論文の概要: UniETP: Unifying Environments for Generalizable Embodied Task Planning
- arxiv url: http://arxiv.org/abs/2607.18062v1
- Date: Mon, 20 Jul 2026 15:30:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.680385
- Title: UniETP: Unifying Environments for Generalizable Embodied Task Planning
- Title(参考訳): UniETP:一般化可能なタスク計画のための統合環境
- Abstract要約: Embodied Task Planningは、エージェントが対話的な環境内で一連のアトミックアクションを実行し、ユーザが指定したタスクを完了する必要がある場合である。
UniETPは、標準化と多様性の両方で特徴付けられる。一方、すべてのシミュレータを一貫した観察と行動空間に形式化し、複雑なタスク目標をサポートするための評価システムを構築する。
- 参考スコア(独自算出の注目度): 42.65363241295469
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper focuses on the problem of Embodied Task Planning, where an agent is required to execute a sequence of atomic actions within an interactive environment to complete a user-specified task. Though a variety of simulators and datasets have previously been built for this task, these efforts are largely isolated, with each using its own observation format, action type, and task domain. This fragmentation complicates comprehensive model evaluation and hinders the scalability of training data. As an effort towards generalizable embodied planning, we propose UniETP, a unified interface integrating four commonly-used simulators (AI2-THOR, VirtualHome, Habitat, BEHAVIOR). UniETP is characterized by both standardization and diversity. On one hand, it formalizes all the simulators into a consistent observation and action space, and builds an evaluation system to support complicated task goal. On the other hand, it enhances task diversity and complexity across dimensions like task logic, instance grounding, and instruction understanding, constructing a new dataset with varied levels of difficulty in an automatic manner. Extensive experiments on the proposed benchmark are conducted to evaluate the embodied planning capabilities of recent models and analyze the performance bottlenecks. Codes and data will be available at https://github.com/woyut/UniETP .
- Abstract(参考訳): 本稿では,ユーザ特定タスクを完了させるために,エージェントが対話型環境内でアトミックなアクションのシーケンスを実行する必要がある,という課題に焦点をあてる。
このタスクのために様々なシミュレータやデータセットが作られてきたが、これらの取り組みは主に分離されており、それぞれが独自の観察形式、アクションタイプ、タスクドメインを使用している。
この断片化は、包括的なモデル評価を複雑にし、トレーニングデータのスケーラビリティを妨げる。
提案するUniETPは,一般的な4つのシミュレータ(AI2-THOR, VirtualHome, Habitat, BEHAVIOR)を統合した統一インターフェースである。
UniETPは標準化と多様性の両方が特徴である。
一方,全てのシミュレータを一貫した観察・行動空間に形式化し,複雑なタスク目標をサポートする評価システムを構築する。
一方、タスクロジック、インスタンスグラウンド、命令理解といった次元にわたるタスクの多様性と複雑さを高め、さまざまなレベルの難易度を持つ新しいデータセットを自動で構築する。
提案するベンチマークの大規模な実験により,最近のモデルの具体的計画能力を評価し,性能ボトルネックを解析した。
コードとデータはhttps://github.com/woyut/UniETP で入手できる。
関連論文リスト
- DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows [69.12339622053588]
我々はDuMateBenchを紹介した。DuMateBenchは匿名化およびプライバシスクリーニングによるユーザセッションから再構築されたリアルセッションベンチマークである。
結果として得られたベンチマークは、8つの広いシナリオにまたがる200のタスクと、17のきめ細かい機能カテゴリで構成されている。
これらのタスクは、Isufficient、Unstable、Noisyの3種類の環境複雑性を注入した、分離されたDockerコンテナで実行します。
論文 参考訳(メタデータ) (2026-08-27T02:36:23Z) - More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe [52.210953881548996]
遠隔センシングベンチマークに挑戦することで,視覚言語モデルが競争力や最先端のパフォーマンスを達成可能であることを示す。
我々のモデルは、テキストで直接答えるか、セグメント化とグラウンド化のためにローカライズツールを呼び出すことができる単一の言語ポリシーを使用する。
提案手法は,高分解能,マルチテンポラル,マルチモーダル,マルチビュータスクを含む,幅広いベンチマークの競合性を実現する。
論文 参考訳(メタデータ) (2026-07-17T13:25:44Z) - SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks [73.92333717662558]
SpaceWorldは、複雑な現実世界のタスクにおけるマルチモーダルエージェントのインタラクティブな空間的理解を評価するためのベンチマークである。
多様なドメイン(例えば、家庭のルーチン、旅行、社会協力など)にまたがる760の人称タスクが特徴である。
信頼性評価のために、各タスクは、人間検証された初期状態、参照軌跡、端末状態検証器を含む。
論文 参考訳(メタデータ) (2026-06-08T15:51:51Z) - RoboAgent: Chaining Basic Capabilities for Embodied Task Planning [46.248451288196435]
本稿では,エージェントが環境から視覚的観察を取得し,与えられたタスクを達成するためのアトミックアクションを実行する,具体的タスク計画に焦点を当てる。
本稿では,機能駆動型計画パイプラインであるRoboAgentを提案する。
我々は,(1)専門家プランによる行動クローニング,(2)モデルで収集した軌跡を用いたDAggerトレーニング,(3)専門家ポリシーによる強化学習からなる多段階的パラダイムを用いている。
論文 参考訳(メタデータ) (2026-04-09T04:01:27Z) - OFA-MAS: One-for-All Multi-Agent System Topology Design based on Mixture-of-Experts Graph Generative Models [57.94189874119267]
マルチエージェントシステム(MAS)は複雑な問題を解決するための強力なパラダイムを提供する。
現在のグラフ学習に基づく設計手法は、しばしば「1対1」のパラダイムに準拠している。
自然言語で記述されたタスクに対して適応的な協調グラフを生成する一対一のフレームワークOFA-TADを提案する。
論文 参考訳(メタデータ) (2026-01-19T12:23:44Z) - Towards Unified Modeling in Federated Multi-Task Learning via Subspace Decoupling [23.642760378344335]
Federated Multi-Task Learning (FMTL) は、複数のクライアントがローカルデータを交換することなく異種タスクを実行できる。
既存のFMTLメソッドのほとんどは、各クライアント用にパーソナライズされたモデルを構築することに集中しており、複数の異種タスクの集約を統一モデルにサポートできない。
マルチタスクモデル統合に特化して設計された更新構造対応アグリゲーション手法であるFedDEAを提案する。
論文 参考訳(メタデータ) (2025-05-30T03:53:21Z) - Planning-Guided Diffusion Policy Learning for Generalizable Contact-Rich Bimanual Manipulation [16.244250979166214]
Generalizable Planning-Guided Diffusion Policy Learning (GLIDE)は、コンタクトリッチな双方向操作タスクを解決するためのアプローチである。
本稿では,特徴抽出,タスク表現,行動予測,データ拡張における重要な設計オプションのセットを提案する。
本手法は, 多様な地形, 寸法, 物理的特性の物体を効果的に操作することができる。
論文 参考訳(メタデータ) (2024-12-03T18:51:39Z) - Flex: End-to-End Text-Instructed Visual Navigation from Foundation Model Features [59.892436892964376]
本稿では,視覚に基づく制御ポリシを用いて,ロバストな閉ループ性能を実現するために必要な最小限のデータ要件とアーキテクチャ適応について検討する。
この知見はFlex (Fly lexically) で合成され, 凍結パッチワイド特徴抽出器として, 事前学習された視覚言語モデル (VLM) を用いたフレームワークである。
本研究では,本手法の有効性を,行動クローンによる訓練を実世界のシーンに応用した,四重項フライ・トゥ・ターゲットタスクに適用した。
論文 参考訳(メタデータ) (2024-10-16T19:59:31Z) - ET-Plan-Bench: Embodied Task-level Planning Benchmark Towards Spatial-Temporal Cognition with Foundation Models [38.89166693142495]
ET-Plan-Benchは、Large Language Models (LLMs) を用いたタスク計画の具体化のためのベンチマークである。
様々な難易度や複雑さのレベルにおいて、制御可能で多様な実施タスクが特徴である。
我々のベンチマークでは、大規模で定量化され、高度に自動化され、きめ細かな診断フレームワークとして認識されている。
論文 参考訳(メタデータ) (2024-10-02T19:56:38Z) - Adapting Segment Anything Model for Unseen Object Instance Segmentation [70.60171342436092]
Unseen Object Instance(UOIS)は、非構造環境で動作する自律ロボットにとって不可欠である。
UOISタスクのためのデータ効率のよいソリューションであるUOIS-SAMを提案する。
UOIS-SAMは、(i)HeatmapベースのPrompt Generator(HPG)と(ii)SAMのマスクデコーダに適応する階層識別ネットワーク(HDNet)の2つの重要なコンポーネントを統合する。
論文 参考訳(メタデータ) (2024-09-23T19:05:50Z) - EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning [84.6451394629312]
実世界のシナリオにおけるMLLMの計画能力を評価するベンチマークであるEgoPlan-Benchを紹介する。
EgoPlan-Benchは、人間レベルのタスクプランニングを実現するためのMLLMの改善のかなりの範囲を浮き彫りにする。
また,EgoPlan-Bench上でのモデル性能を効果的に向上する特殊命令チューニングデータセットであるEgoPlan-ITを提案する。
論文 参考訳(メタデータ) (2023-12-11T03:35:58Z) - GenSim: Generating Robotic Simulation Tasks via Large Language Models [34.79613485106202]
GenSimは、リッチなシミュレーション環境とエキスパートのデモを自動的に生成することを目指している。
既存のベンチマークを10倍から100以上のタスクに拡張するために、GPT4を使用します。
最小限のsim-to-real適応により、GPT4生成したシミュレーションタスクで事前訓練されたマルチタスクポリシーは、現実世界で目に見えないロングホライゾンタスクへのより強力な転送を示す。
論文 参考訳(メタデータ) (2023-10-02T17:23:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。