論文の概要: Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy
- arxiv url: http://arxiv.org/abs/2606.27251v1
- Date: Thu, 25 Jun 2026 16:36:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.359651
- Title: Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy
- Title(参考訳): 摘出スキルから毎日の身体自律へのOmnimodal Embodied Agentの適応
- Authors: Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang,
- Abstract要約: 非構造化環境で永続的なエンボディエージェントを構築するには、異種ツールの統一的なオーケストレーションが必要である。
我々は,多モーダルなセマンティックプランナを統合したフレームワークであるOmniActを紹介した。
すべての複雑性レベルにわたって、エンドツーエンドの成功において一貫した改善が達成されます。
- 参考スコア(独自算出の注目度): 79.09714980186278
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Building persistent embodied agents in unstructured environments demands unified orchestration of heterogeneous tools spanning both cyber (APIs, IoT) and physical (manipulation, navigation) domains, coupled with autonomous recovery from physical failures that inevitably arise over extended operation. Existing systems treat these as separate problems: VLM-based planners lack a unified cyber-physical action space, agent frameworks accumulate unbounded context that degrades temporal coherence, and VLA policies execute open-loop without detecting their own failures. We argue that persistent autonomy requires not a monolithic model but a hierarchical asynchronous architecture with explicit separation of planning, memory, and verification. To this end, we present OmniAct, a framework integrating a multimodal semantic planner for skill routing across unified action spaces, an adaptive hierarchical memory with event-boundary-driven compression for sub-linear context growth, and an asynchronous visual preemption engine that closes the semantic loop during physical execution. Across 40 real-world long-horizon tasks on two robotic platforms coordinating four IoT devices, OmniAct achieves consistent improvements in end-to-end success across all complexity levels, maintains near-flat token consumption over under 100k+ accumulated interaction tokens, and elevates mid-scale open-weight models to proprietary-level performance.
- Abstract(参考訳): 非構造化環境で永続的なエンボディエージェントを構築するには、サイバー(API、IoT)と物理(操作、ナビゲーション)ドメインにまたがる異種ツールの統一的なオーケストレーションと、拡張操作によって必然的に発生する物理的障害からの自律的な回復が要求される。
既存のシステムは、これらを別の問題として扱う: VLMベースのプランナーは、統一されたサイバー物理アクション空間を欠いている、エージェントフレームワークは、時間的一貫性を低下させる無制限のコンテキストを蓄積し、VLAポリシーは、自身の障害を検出することなくオープンループを実行する。
永続的な自律性はモノリシックなモデルではなく、計画、メモリ、検証を明確に分離した階層的な非同期アーキテクチャを必要とする、と私たちは主張する。
この目的のために、OmniAct、統合されたアクション空間間のスキルルーティングのためのマルチモーダルなセマンティックプランナ、サブ線形コンテキスト成長のためのイベント境界駆動圧縮を備えた適応階層メモリ、および物理実行中にセマンティックループを閉じる非同期視覚プリエンプションエンジンを提案する。
OmniActは4つのIoTデバイスをコーディネートする2つのロボットプラットフォーム上の40の現実世界の長期タスクに対して、すべての複雑性レベルにわたってエンドツーエンドの成功を一貫して改善し、100k以上の蓄積されたインタラクショントークンをほぼフラットに使用し、中規模のオープンウェイトモデルをプロプライエタリレベルのパフォーマンスに高める。
関連論文リスト
- Learning Reactive Dexterous Grasping via Hierarchical Task-Space RL Planning and Joint-Space QP Control [50.28263951510334]
本稿では,リアクティブなデクスタリーグルーピングのためのハイブリッド階層型制御フレームワークを提案する。
提案手法は,低レベル共同実行から高レベル空間意図を明示的に分離する。
我々は厳密なシミュレーションと現実のパイプラインを通して提案したフレームワークを広範囲に検証する。
論文 参考訳(メタデータ) (2026-05-05T04:49:38Z) - DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks [54.32016216994156]
本稿では,DINOv3特徴を生成対象として用い,視覚ノイズから相互作用意味を乱す因果潜在世界モデル(CLWM)を提案する。
メモリスケーリングを克服するため、CLWMはDual-State Test-Time Training (TTT)メモリを備えている。
EmbodiChainは、トレーニング中に物理基底軌道の無限の流れを注入することによって効率法を確立するオンラインフレームワークである。
論文 参考訳(メタデータ) (2026-04-13T03:19:36Z) - V-CAGE: Vision-Closed-Loop Agentic Generation Engine for Robotic Manipulation [6.820118518027692]
本稿では,自律型ロボットデータ合成のためのエージェントフレームワークであるV-CAGEを提案する。
従来のスクリプトパイプラインとは異なり、V-CAGEはエンボディ化されたエージェントシステムとして動作する。
大規模ビデオデータセットのストレージボトルネックを克服するために、知覚駆動圧縮アルゴリズムを実装した。
論文 参考訳(メタデータ) (2026-04-10T06:56:17Z) - ROSClaw: A Hierarchical Semantic-Physical Framework for Heterogeneous Multi-Agent Collaboration [9.434833852972353]
ROSClawは、統一視覚言語モデル(VLM)コントローラにポリシー学習とタスク実行を統合する異種ロボットのためのエージェントフレームワークである。
自律的なクローズループフレームワークを確立することにより、ROSClawはロボット固有の開発への依存を最小限に抑える。
論文 参考訳(メタデータ) (2026-04-06T13:16:24Z) - RADAR: Closed-Loop Robotic Data Generation via Semantic Planning and Autonomous Causal Environment Reset [48.645870795753105]
ロボットのためのロバスト自動データ取得(RADAR)について紹介する。
RADARは完全に自律的でクローズドループのデータ生成エンジンで、収集サイクルから人間の介入を完全に取り除きます。
シミュレーションでは、複雑な長期タスクにおいて、最大90%の成功率を達成する。
論文 参考訳(メタデータ) (2026-03-12T11:18:52Z) - ACLM: ADMM-Based Distributed Model Predictive Control for Collaborative Loco-Manipulation [9.708461585583791]
重荷のロコ操作による共同輸送は、脚のあるロボットにとって難しいが必須の能力である。
本研究は,ロコマニピュレーションのための分散モデル予測制御フレームワークであるマルチプライアの交互方向法を提案する。
論文 参考訳(メタデータ) (2026-03-07T08:06:51Z) - UniManip: General-Purpose Zero-Shot Robotic Manipulation with Agentic Operational Graph [23.060488218180936]
We present UniManip, a framework based on a Bi-level Agentic Operational Graph (AOG)
タスクオーケストレーションのための高レベルのエージェント層と、動的状態表現のための低レベルのScene Layerを結合することにより、システムは、抽象的な計画と幾何学的制約を継続的に整合させる。
実験では、未確認のオブジェクトやタスクに対するシステムの堅牢なゼロショット能力を評価し、最先端のVLAや階層的なベースラインと比較して22.5%と25.0%の成功率を示した。
論文 参考訳(メタデータ) (2026-02-13T16:47:26Z) - Towards Efficient Agents: A Co-Design of Inference Architecture and System [66.59916327634639]
本稿では,エージェントアクセラレーションのための統合フレームワークであるAgentInferを提案する。
問題をAgentCollab、AgentSched、AgentSAM、AgentCompressの4つの相乗的コンポーネントに分解する。
BrowseComp-zhとDeepDiverベンチマークの実験では、これらの手法の相乗的コラボレーションを通じて、AgentInferは非効率なトークン消費を50%以上削減することを示した。
論文 参考訳(メタデータ) (2025-12-20T12:06:13Z) - AutoLayout: Closed-Loop Layout Synthesis via Slow-Fast Collaborative Reasoning [102.71841660031065]
Autoは、クローズドループの自己検証プロセスをデュアルシステムフレームワークに統合する、完全に自動化された方法である。
Autoの有効性は8つの異なるシナリオで検証され、SOTA法よりも10.1%改善された。
論文 参考訳(メタデータ) (2025-07-06T08:35:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。