論文の概要: ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI
- arxiv url: http://arxiv.org/abs/2607.04426v1
- Date: Sun, 05 Jul 2026 17:43:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.926754
- Title: ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI
- Title(参考訳): ACE-Brain-0.5:物理エージェントAIのための統一基盤モデル
- Authors: ACE-Brain Team, :, Ziyang Gong, Haoming Gu, Zehang Luo, Tianyi Zhang, Tao Tao, Yixiao Chi, Zhe Liu, Lingsi Zhu, Jingyuan Liu, Anke Tang, Songze Li, Yilun Kong, Ningjing Liu, Tianyu Zhu, Yunpeng Qing, Shuang Luo, Xiang Liu, Shi Fu, Dawei Nie, Sixiang Liu, Zhexi Wen, Feng Pan, Xiaofeng Wang, Zhi Hou, Chunxiao Liu, Xue Yang, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang,
- Abstract要約: Embodied AIは、独立した知覚やアクションモジュールから、目標を理解し、計画し、進捗を監視し、経験から改善する物理的なエージェントへと移行している。
ACE-Brain-0.5は,ロボットの知性を5つの結合関数にまとめる統一的な基礎モデルである。
単一の8Bバックボーンは、最初の4つの機能をインスタンス化する: オブジェクトとアベイランスを接地し、3Dとエゴセントリックな空間関係を推論し、命令をサブゴールに分解し、ナビゲーションと操作アクションを生成し、検証と回復の進捗を推定する。
- 参考スコア(独自算出の注目度): 110.18670135256235
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Embodied AI is moving from isolated perception or action modules toward physical agents that understand, plan under goals, act through robot bodies, monitor progress, and improve from experience. Existing systems address this loop only in parts: end-to-end policies generate actions but often lack spatial reasoning, planning, and execution assessment, while robot-agent systems orchestrate tools or specialists but do not learn a shared representation. This fragmentation limits general Physical Agentic AI. We present ACE-Brain-0.5, a unified embodied foundation model that organizes robot intelligence into five coupled functions: spatial perception, decision making, embodied interaction, self-monitoring, and self-improvement. Built on ACE-Brain-0, which established spatial intelligence as a shared scaffold across robot platforms, ACE-Brain-0.5 extends an understanding-centric model into a closed-loop foundation model. A single 8B backbone instantiates the first four functions: grounding objects and affordances, reasoning over 3D and egocentric spatial relations, decomposing instructions into subgoals, generating navigation and manipulation actions, and estimating progress for verification and recovery. To unify these capabilities without cross-task interference, we introduce SSR+, which extends Scaffold-Specialize-Reconcile with a Reactivate stage after task-vector merging. The fifth function, self-improvement, is realized by a companion framework that updates external execution state, including task schemas, spatial memory, and failure-recovery cases, from rollouts. Across fifteen benchmarks, ACE-Brain-0.5 improves over ACE-Brain-0 on 14 of 18 spatial perception and grounding benchmarks, achieves competitive navigation and manipulation performance, and provides strong progress estimation in ID and OOD settings. Together, these results mark an early step toward general Physical Agentic AI.
- Abstract(参考訳): Embodied AIは、独立した知覚やアクションモジュールから、目標を理解し、計画し、ロボット本体を通して行動し、進捗を監視し、経験から改善する物理的なエージェントへと移行している。
エンドツーエンドポリシーはアクションを生成するが、しばしば空間的推論、計画、実行評価を欠いている。
この断片化は一般的な物理エージェントAIを制限する。
本稿では,ロボットインテリジェンスを空間認識,意思決定,具体的相互作用,自己監視,自己改善の5つの機能にまとめる統合型エンボディベースモデルACE-Brain-0.5を提案する。
ACE-Brain-0.5は、ロボットプラットフォームをまたいだ共有足場として空間知性を確立したACE-Brain-0上に構築され、理解中心のモデルをクローズドループ基盤モデルに拡張した。
単一の8Bバックボーンは、最初の4つの機能をインスタンス化する: オブジェクトとアベイランスを接地し、3Dとエゴセントリックな空間関係を推論し、命令をサブゴールに分解し、ナビゲーションと操作アクションを生成し、検証と回復の進捗を推定する。
SSR+は,タスク・ベクター・マージ後のReactivateステージとScaffold-Specialize-Reconcileを拡張したものだ。
5番目の機能である自己改善は、タスクスキーマ、空間メモリ、障害復旧ケースを含む外部実行状態をロールアウトから更新するフレームワークによって実現されている。
15のベンチマークで、ACE-Brain-0.5は18の空間知覚と接地ベンチマークの14のACE-Brain-0よりも改善され、競合するナビゲーションと操作性能を達成し、IDとOOD設定における強力な進捗推定を提供する。
これらの結果は、一般の物理エージェントAIへの第一歩となる。
関連論文リスト
- HoloAgent-0: A Unified Embodied Agent Framework with 3D Spatial Memory [13.283448291226597]
HoloAgent-0は、現実世界のロボット展開のための統合型エージェントフレームワークである。
クローズドループ実行のためのEmbodied AgentOS、物理世界接地のための3D空間記憶、ロボットアクションのための具体的スキルである。
実ハードウェアにHoloAgent-0をデプロイし,その空間記憶,長距離ナビゲーション,動作生成,オブジェクト探索,クロスロボットコーディネーション,移動操作によるクローズループ実行を評価した。
論文 参考訳(メタデータ) (2026-06-22T16:31:48Z) - ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining [40.678451625177026]
VLA(Vision-Language-Action)モデルは、大規模で多様な実施データから恩恵を受けるが、ロボットの軌道収集は費用がかかり、労力がかかる。
近年の進歩は、大規模な自我中心の人間ビデオが、事前訓練において補完的な現実世界の監督を提供することを示している。
異種データソースを併用した統合VLA事前学習フレームワークであるACE-EGO-0を紹介する。
論文 参考訳(メタデータ) (2026-06-15T18:40:18Z) - VAIC: Vision-Guided Humanoid Agile Object Interaction Control via Decoupled Commands [56.029505206531155]
Vision Guided Agile Interaction Control (VAIC)は、現在のコントローラとヒューマノイドロボットのギャップを埋める統合フレームワークである。
まず、特権教師政策は、正確な物体運動学と正確な環境状態を用いて多様な相互作用スキルを習得する。
第二に、デプロイ可能な学生ポリシーは、全体追跡を複数の軸にまたがる速度目標に置き換えることで、これらの能力を蒸留する。
論文 参考訳(メタデータ) (2026-06-08T09:52:55Z) - RADAR: Closed-Loop Robotic Data Generation via Semantic Planning and Autonomous Causal Environment Reset [48.645870795753105]
ロボットのためのロバスト自動データ取得(RADAR)について紹介する。
RADARは完全に自律的でクローズドループのデータ生成エンジンで、収集サイクルから人間の介入を完全に取り除きます。
シミュレーションでは、複雑な長期タスクにおいて、最大90%の成功率を達成する。
論文 参考訳(メタデータ) (2026-03-12T11:18:52Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning [31.000965640377128]
ABot-M0は、システマティックデータキュレーションパイプラインを構築するフレームワークである。
これは不均一な生データを統一的で効率的な表現にエンドツーエンドに変換することを可能にする。
ABot-M0はデュアルストリーム機構を通じてモジュール認識をサポートする。
論文 参考訳(メタデータ) (2026-02-11T16:47:01Z) - InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy [138.89177083578213]
空間接地とロボット制御のための統合フレームワークであるInternVLA-M1を紹介する。
InternVLA-M1は、(i)2.3M以上の空間的推論データに基づく空間的グラウンドトレーニングと(ii)空間的に誘導された後トレーニングという、2段階のパイプラインを使用する。
結果: InternVLA-M1 は SimplerEnv Google Robot で+14.6%、WidowX で+17%、LIBERO Franka で+4.3% で、空間誘導なしでその変種を上回った。
論文 参考訳(メタデータ) (2025-10-15T17:30:05Z) - Kolb-Based Experiential Learning for Generalist Agents with Human-Level Kaggle Data Science Performance [81.05882480184587]
本稿では,自律エージェントに対するVygotskyのZPDを用いて,Kolbの学習サイクルの計算フレームワークを提案する。
Agent Kは、KolbとVygotskyにインスパイアされた人間の認知学習をうまく統合する第1のAIシステムである。
金9個、銀8個、銅12個で、メダル獲得競争で金4個、銀4個を含む。エージェントKは、コルブとヴィーゴツキーにインスパイアされた人間の認知学習をうまく統合する第1のAIシステムである。
論文 参考訳(メタデータ) (2024-11-05T23:55:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。