論文の概要: Compiling and Benchmarking Task-State Horizons for Embodied Agents
- arxiv url: http://arxiv.org/abs/2608.08036v1
- Date: Sat, 08 Aug 2026 09:45:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.615065
- Title: Compiling and Benchmarking Task-State Horizons for Embodied Agents
- Title(参考訳): エージェントのタスク状態ホライズンズのコンパイルとベンチマーク
- Abstract要約: 最前線のエージェントモデルは、長い水平配置タスクのための高レベルプランナーとしてますます展開されている。
我々は、エージェントがタスク状態水平線(TSH)として追跡しなければならないタスク関連状態遷移のスパンを定義する。
状態遷移依存を実行可能なシンボルグラフに変換するロボットタスクコンパイラであるRoboGraphを紹介する。
- 参考スコア(独自算出の注目度): 2.8397380902242966
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Frontier agentic models are increasingly deployed as high-level planners for long-horizon embodied tasks. Existing robotic benchmarks have advanced long-horizon evaluation, but primarily characterize difficulty through action-sequence length and subtask complexity, overlooking a distinct challenge: agents must track evolving task-relevant world states induced by both their exploration and environmental dynamics. We define the span of task-relevant state transitions that an agent must track as task-state horizon (TSH). To evaluate how agent performance varies with TSH, we introduce RoboGraph, a robotic task compiler that translates state-transition dependencies into executable symbolic graphs. Specifically, RoboGraph constructs task-state horizons from spatial and temporal causal dependencies, including those induced by unexpected failures and interventions during task execution. Building on RoboGraph, we release a benchmark comprising 588 episodes across 84 scenes with varying TSHs. Experiments evaluating 15 advanced agentic models in both semantic and visual closed-loop environments show that most models struggle with demanding TSHs, revealing substantial gaps in maintaining, exploring, and updating task-relevant state over long horizon.
- Abstract(参考訳): 最前線のエージェントモデルは、長い水平配置タスクのための高レベルプランナーとしてますます展開されている。
既存のロボットベンチマークでは、長期にわたる評価が進んでいるが、主にアクションシーケンスの長さとサブタスクの複雑さによる困難を特徴付けている。
我々は、エージェントがタスク状態水平線(TSH)として追跡しなければならないタスク関連状態遷移のスパンを定義する。
エージェントのパフォーマンスがTSHでどのように変化するかを評価するために,状態遷移依存を実行可能なシンボルグラフに変換するロボットタスクコンパイラであるRoboGraphを紹介する。
具体的には、RoboGraphは、タスク実行中に予期しない障害や介入によって引き起こされたものを含む、空間的および時間的因果依存性からタスク状態の水平線を構築する。
RoboGraph上に構築されたベンチマークでは、84シーンにわたる588エピソードと、さまざまなTSHのベンチマークを公開しています。
セマンティックおよびビジュアルクローズループ環境で15の高度なエージェントモデルを評価する実験は、ほとんどのモデルが要求されるTSHに苦しむことを示し、長い地平線上でタスク関連状態の維持、探索、更新にかなりのギャップがあることを明らかにした。
関連論文リスト
- S2-HWM: Sparse Event-Structured Hierarchical World Model for Long-Horizon Surgical Robot Manipulation [8.13774443902788]
不規則な間隔で意味のある相互作用が生じる一方で、タスク報酬が不足しているため、長期手術ロボットの操作は困難である。
本稿では,スパースイベント構造化階層的世界モデルであるS2-HWMを提案する。
SurRoLベースのPegTransferタスクでは、S2-HWMが98.7%の成功率を獲得し、GAS DreamerV3ベースラインを22.7%上回る。
論文 参考訳(メタデータ) (2026-08-13T11:29:20Z) - A Task-State Representation for Long-Horizon Mobile GUI Agents [53.359524744953575]
Task-State Representation (TSR)は、感覚入力からタスク状態を明示的に分離する、トレーニング不要のフレームワークである。
4つのモバイルGUIベンチマークによる実験では、TSRの有効性が検証され、成功率が12ポイントまで向上した。
論文 参考訳(メタデータ) (2026-07-01T06:37:21Z) - Cybo-Waiter: A Physical Agentic Framework for Humanoid Whole-Body Locomotion-Manipulation [14.648223907591849]
移動と操作は、姿勢、到達可能性、バランスによって密結合しているため、ヒューマノイドにとって長い地平線実行は困難である。
提案するヒューマノイドエージェントフレームワークは,VLM計画を検証可能なタスクプログラムに変換し,マルチオブジェクト3D監視でループをクローズする。
テーブルトップ操作と長軸ヒューマノイドロコ操作による実験は、複数物体の接地、時間的安定性、リカバリ駆動のリプランニングによるロバスト性の向上を示す。
論文 参考訳(メタデータ) (2026-03-11T11:41:32Z) - LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces [65.11019654023978]
LongCLI-Benchは、長期にわたる現実的なタスクにまたがるエージェント能力を評価するために設計されたベンチマークである。
私たちは、1000以上のコンピュータサイエンスの課題と現実世界のタスクから、20の高品質で長い水平タスクをキュレートしました。
実験によると、最先端のエージェントでさえLongCLI-Benchの20%未満のパスレートを達成する。
論文 参考訳(メタデータ) (2026-02-15T23:12:57Z) - ANCHOR: Branch-Point Data Generation for GUI Agents [52.22377425487]
デスクトップ環境向けのエンドツーエンドGUIエージェントは、大量の高品質なインタラクションデータを必要とする。
本稿では,拡張フレームワークであるAnchorについて紹介する。このフレームワークは,小規模で検証済みのシードデモから,スケーラブルなデスクトップ監視をブートストラップする。
OSWorldとWindowsAgentArenaの標準デスクトップベンチマークの実験では、拡張されたコーパスに微調整されたモデルが一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-02-06T19:55:26Z) - Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation [25.0921056409982]
シングルエージェントGUIエージェントは、ハイレベルな機能と低レベルな実行能力のバランスをとるのに苦労する。
統一されたポリシーモデルのトレーニングとは異なり、私たちはハイレベルなスケジューリングモデルのトレーニングに重点を置いています。
低レベルのExecutorモデルと統合可能なCoordinator-Executor-State Trackerフレームワークを構築します。
論文 参考訳(メタデータ) (2025-11-27T09:01:38Z) - UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios [63.67884284105684]
textbfUltraHorizonは、複雑な現実世界の課題に不可欠な基礎的能力を測定する新しいベンチマークである。
エージェントは、隠されたルールを反復的に発見しなければならない、長期にわたる発見タスクで設計されている。
実験の結果, LLM-agents はこれらの設定において常に不利な成績を示し, ヒトは高いスコアを得ることができた。
論文 参考訳(メタデータ) (2025-09-26T02:04:00Z) - Embodied Long Horizon Manipulation with Closed-loop Code Generation and Incremental Few-shot Adaptation [12.077740860502878]
身体的ロングホライゾン操作では、ロボットシステムが視覚や自然言語などのマルチモーダル入力を処理し、それらを実行可能なアクションに変換する必要がある。
近年,大規模言語モデル (LLM) を自然言語を用いてタスクをサブタスクに分解し,事前訓練した低レベルコントローラを誘導する高レベルプランナとしての利用が検討されている。
我々のフレームワークは,LoHoRavens,CALVIN,Franka Kitchen,および乱雑な現実世界設定をまたいだ,30以上の多様かつ不明瞭なロングホライゾンタスクに対して,最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-03-27T20:32:58Z) - Generalizable Long-Horizon Manipulations with Large Language Models [91.740084601715]
本研究は,Large Language Models (LLMs) の機能を活用して,汎用可能な長距離操作のための原始的なタスク条件を生成するフレームワークを導入する。
我々は,Pybulletに基づくロボット操作タスクスイートを作成し,長期作業評価を行う。
論文 参考訳(メタデータ) (2023-10-03T17:59:46Z) - Modeling Long-horizon Tasks as Sequential Interaction Landscapes [75.5824586200507]
本稿では,一連のデモビデオからのみ,サブタスク間の依存関係と遷移を学習するディープラーニングネットワークを提案する。
これらのシンボルは、画像観察から直接学習し、予測できることが示される。
我々は,(1)人間によって実行されるパズル片のブロック積み重ね,(2)物体のピック・アンド・プレイスとキャビネットドアを7-DoFロボットアームで滑らせるロボット操作という,2つの長期水平作業において,我々の枠組みを評価する。
論文 参考訳(メタデータ) (2020-06-08T18:07:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。