論文の概要: ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
- arxiv url: http://arxiv.org/abs/2607.10350v2
- Date: Wed, 15 Jul 2026 07:33:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 12:21:59.333091
- Title: ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
- Title(参考訳): ABot-AgentOS: 生涯のマルチモーダルメモリを備えた汎用ロボットエージェントOS
- Authors: Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Zixiao Tang, Zhining Gu, Yang Cai, Linbo Zheng, Jingjing Ma, Mingyang Yin, Zedong Chu, Ziqiao Li, Mu Xu,
- Abstract要約: ABot-AgentOSは、低レベルコントローラの上に位置する一般的なロボットエージェントオペレーティングシステムである。
シーンコンディショニング、コンテキストアイソレーションされたスキル実行、マルチステージ検証、マルチモーダルメモリ、エッジクラウドコラボレーションのためのデリバティブなエージェント層を提供する。
- 参考スコア(独自算出の注目度): 43.42185367745744
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Recent VLM and VLA systems have improved robotic perception and action prediction, yet long-horizon embodied agents still require a general runtime layer for reasoning, memory, tool use, verification, and cross-embodiment execution. We present ABot-AgentOS, a general robotic Agent Operating System that sits above low-level controllers and provides a deliberative agent layer for scene-conditioned planning, context-isolated skill execution, multi-stage verification, multi-modal memory, and edge-cloud collaboration. To evaluate such systems, we introduce EmbodiedWorldBench, an executable benchmark with 16 indoor, outdoor, and hybrid scenes, four difficulty levels, and over 200 tasks involving navigation, object search, NPC dialogue, dynamic events, and trace-grounded scoring. ABot-AgentOS further introduces Universal Multi-modal Graph Memory, a persistent source-grounded substrate that converts dialogue, visual observations, spatial context, temporal relations, and task traces into typed nodes and edges. A failure-driven self-evolution loop converts diagnosed memory failures into gated runtime evo-assets that are promoted only to later evaluation splits, preventing current-split ground-truth leakage while enabling continual improvement. On an initial EmbodiedWorldBench subset, ABot-AgentOS improves over a single-controller baseline in both task success and goal completion. Across memory benchmarks, ABot-AgentOS Static achieves 87.5 on LoCoMo, 59.9 on OpenEQA EM-EQA, 88.6 on Mem-Gallery, and 76.5 Acc@All on NExT-QA; self-evolution further improves LoCoMo to 88.7, OpenEQA to 60.4, and Mem-Gallery to 89.0. These results suggest that a general Agent OS layer can improve long-horizon embodied execution while providing persistent, auditable memory for continual interaction.
- Abstract(参考訳): 近年のVLMおよびVLAシステムはロボットの知覚と行動予測を改善しているが、長い水平なエンボディエージェントは推論、メモリ、ツールの使用、検証、クロス・エボデーメントの実行に一般的なランタイム層を必要とする。
ABot-AgentOSは、低レベルコントローラの上に位置する汎用ロボットエージェントオペレーティングシステムであり、シーンコンディショニング計画、コンテキストアイソレーションされたスキル実行、マルチステージ検証、マルチモーダルメモリ、エッジクラウドコラボレーションのための検討エージェント層を提供する。
このようなシステムを評価するために、EmbodiedWorldBenchという16の屋内・屋外・ハイブリッドシーン、難易度レベル4つ、ナビゲーション、オブジェクト検索、NPC対話、動的イベント、トレーサグラウンドスコアを含む200以上のタスクからなる実行可能ベンチマークを紹介した。
ABot-AgentOSはさらにUniversal Multi-modal Graph Memoryを導入した。これは対話、視覚的観察、空間的コンテキスト、時間的関係、タスクトレースを型付きノードとエッジに変換する永続的なソースグラウンドの基板である。
障害駆動型自己進化ループは、診断されたメモリ障害をゲート実行時エボアセットに変換し、後続の評価分割のみに昇格させる。
最初のEmbodiedWorldBenchサブセットでは、ABot-AgentOSはタスク成功とゴール完了の両方において、シングルコントローラベースラインよりも改善されている。
メモリベンチマーク全体で、ABot-AgentOS StaticはLoCoMoが87.5、OpenEQA EM-EQAが59.9、Mem-Galleryが88.6、NExT-QAが76.5Acc@All、自己進化によりLoCoMoが88.7、OpenEQAが60.4、Mem-Galleryが89.0となった。
これらの結果から,一般的なエージェントOS層は,持続的相互作用のための永続的監査可能なメモリを提供しながら,長期的エンボディ実行を改善することができることが示唆された。
関連論文リスト
- ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI [110.18670135256235]
Embodied AIは、独立した知覚やアクションモジュールから、目標を理解し、計画し、進捗を監視し、経験から改善する物理的なエージェントへと移行している。
ACE-Brain-0.5は,ロボットの知性を5つの結合関数にまとめる統一的な基礎モデルである。
単一の8Bバックボーンは、最初の4つの機能をインスタンス化する: オブジェクトとアベイランスを接地し、3Dとエゴセントリックな空間関係を推論し、命令をサブゴールに分解し、ナビゲーションと操作アクションを生成し、検証と回復の進捗を推定する。
論文 参考訳(メタデータ) (2026-07-05T17:43:06Z) - eMEM: A Hybrid Spatio-Temporal Memory System For Embodied Agents [1.8047694351309203]
物理環境で動作するエンボディエージェントのためのハイブリッドグラフベースメモリシステムeMEMを提案する。
eMEMはこのギャップをマルチインデックスアーキテクチャ(構造化ストレージ用ITE、近傍セマンティックサーチ用hlib、空間クエリ用Rツリー)で埋める。
また,eMEM-Bench v1は,メモリ評価のためのProcTHOR-10Kシーン上で構築したベンチマークである。
論文 参考訳(メタデータ) (2026-06-02T09:22:12Z) - AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents [35.5648433882265]
We present AndroTMem, a diagnosis framework for anchored memory in long-horizon Android GUI agent。
私たちのベンチマークであるAndroTMem-Benchは、34,473のインタラクションステップを持つ1,069のタスクからなる(タスク当たり32.1、最大65)。
本稿では、因果的に連結された中間状態アンカーのコンパクトな集合として相互作用列を表すAnchored State Memory (ASM)を提案する。
論文 参考訳(メタデータ) (2026-03-19T02:45:21Z) - RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies [54.23445842621374]
記憶は、長い水平と歴史に依存したロボット操作にとって重要である。
近年,視覚言語アクション(VLA)モデルにメモリ機構が組み込まれ始めている。
本稿では,VLAモデルの評価と進展のための大規模標準ベンチマークであるRoboMMEを紹介する。
論文 参考訳(メタデータ) (2026-03-04T21:59:32Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - It Takes Two to Tango: A Holistic Simulator for Joint Order Scheduling and Multi-Agent Path Finding in Robotic Warehouses [18.101514832695067]
WareRoverはOSとMAPFの動的結合を強制する総合シミュレーションプラットフォームである。
標準ベンチマークとは異なり、WareRoverは順序ストリーム、物理を意識した動作制約、非線形回復機構を単一の評価ループに統合する。
論文 参考訳(メタデータ) (2026-02-15T05:51:58Z) - UltraCUA: A Foundation Model for Computer Use Agents with Hybrid Action [77.63125913907771]
本稿では,GUIプリミティブと高レベルのプログラムツールコールのギャップを埋める基盤モデルであるUltraCUAを提案する。
7Bおよび32Bモデルによる実験は、最先端のエージェントよりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-10-20T17:48:26Z) - MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation [59.31354761628506]
このようなタスクは本質的にマルコフ的ではないが、主流のVLAモデルはそれを見落としているため、ロボット操作には時間的コンテキストが不可欠である。
本稿では,長距離ロボット操作のためのコグニション・メモリ・アクション・フレームワークであるMemoryVLAを提案する。
本稿では,3つのロボットを対象とした150以上のシミュレーションと実世界のタスクについて評価する。
論文 参考訳(メタデータ) (2025-08-26T17:57:16Z) - EmbodiedAgent: A Scalable Hierarchical Approach to Overcome Practical Challenge in Multi-Robot Control [2.9374620169143673]
EmbodiedAgentは異種マルチロボット制御のための階層的なフレームワークである。
提案手法は,次アクション予測パラダイムと構造化メモリシステムを統合し,タスクを実行可能なロボットスキルに分解する。
100のシナリオにまたがる18,000以上のアノテートされたプランニングインスタンスのデータセットであるMultiPlan+を紹介します。
論文 参考訳(メタデータ) (2025-04-14T09:33:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。