論文の概要: ECoMEM: Explicit Concept Memory for Memory-Dependent Robot Control
- arxiv url: http://arxiv.org/abs/2610.00801v1
- Date: Wed, 30 Sep 2026 22:54:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.798683
- Title: ECoMEM: Explicit Concept Memory for Memory-Dependent Robot Control
- Title(参考訳): ECoMEM: メモリ依存型ロボット制御のための明示的概念記憶
- Abstract要約: 現在の視覚言語アクション(VLA)ポリシーは、アクションに必要な情報が現在の観察から消えると、しばしば失敗する。
既存のアプローチは通常、長い歴史を提供するか、観察行動軌跡から暗黙の記憶を学ぶ。
私たちは、過去の証拠を根拠とした説明を、その行動の学習から切り離しています。
- 参考スコア(独自算出の注目度): 16.592888860803914
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A robot may lose sight of an object it must later retrieve, need to recall what a person demonstrated earlier, or track which steps of a task it has already completed. Current vision-language-action (VLA) policies often fail once the information needed for action disappears from the current observation, making memory critical for long-horizon robot behavior. Existing approaches typically provide longer histories or learn implicit memory from observation-action trajectories. But action supervision tells a policy how to act, not what to remember: it does not specify which past facts should persist or how they should change as new evidence arrives. We therefore separate maintaining an evidence-grounded account of the past from learning how to act on it. This insight motivates Explicit Concept Memory (ECoMEM), which represents task-relevant history with a reusable library of grounded concepts. An evidence-based Writer selects and updates these records, while a learned Reader turns them into memory tokens that directly condition the VLA. Across 16 RoboMME tasks, ECoMEM leads the evaluated robot policies on 15 tasks. On two new real-robot tasks, the same memory library either transfers directly or requires only one new concept, achieving 86.1% success versus 8.6% for a no-memory VLA. These results show that explicit concepts provide a reusable and extensible memory interface for robot control. Project website: https://ecomem.github.io/
- Abstract(参考訳): ロボットは、後から取得しなければならない物体を見失ったり、以前に見せたことを思い出したり、すでに完了したタスクのどのステップを追跡したりする必要がある。
現在の視覚-言語-アクション(VLA)ポリシーは、アクションに必要な情報が現在の観察から消えると、しばしば失敗する。
既存のアプローチは通常、長い歴史を提供するか、観察行動軌跡から暗黙の記憶を学ぶ。
しかし、行動監督官は政策に対して、何を思い出すべきかではなく、行動の仕方を教えている。
そのため私たちは、過去の証拠を根拠とした説明を、その行動の学習から切り離しています。
この洞察は Explicit Concept Memory (ECoMEM) を動機付けている。
エビデンスベースのWriterはこれらのレコードを選択して更新し、学習したReaderはそれらをVLAを直接条件とするメモリトークンに変換する。
16のRoboMMEタスクに対して、ECoMEMは15タスクで評価されたロボットポリシーをリードする。
2つの新しい実ロボットタスクでは、同じメモリライブラリが直接転送するか、あるいは1つの新しい概念しか必要とせず、86.1%が成功し、8.6%が無メモリのVLAである。
これらの結果から,明示的な概念はロボット制御のための再利用可能な拡張可能なメモリインタフェースを提供することが示された。
プロジェクトウェブサイト: https://ecomem.github.io/
関連論文リスト
- Simple Agentic Memory for Generalist Robot Policies [47.607127507858884]
我々は,冷凍汎用ロボットポリシーのためのトレーニング不要メモリ層であるSimple Agentic Robot Memory (SimpleARM)を紹介する。
メモリ依存型ロボット操作タスクのベンチマークであるRoboMME上でSimpleARMを評価する。
論文 参考訳(メタデータ) (2026-09-29T03:16:27Z) - Remember what you did?: Learning Behavioral Memories for Partially Observable Object Manipulation [1.5192151934554061]
圧縮行動記憶ポリシー(CAMP)について紹介する。
CAMPは、ロボット自身の行動履歴が、高度に情報的かつ自己管理的な信号として機能する、という洞察に基づいている。
CAMPを4つの実ロボット・セットアップと2つの新しいシミュレーション・ベンチマークで評価した。
論文 参考訳(メタデータ) (2026-06-19T07:56:58Z) - MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models [80.70528162709276]
効果的な制御は過去の相互作用の記憶と将来の状態の想像を必要とするため、ロボット操作には時間モデリングが不可欠である。
本稿では,VLAモデルにメモリと想像力を付与し,ロボット操作のためのフル時間モデリングフレームワークであるMemoryVLA++を提案する。
提案手法は,Libero,SimplerEnv,Mikasa-Robo,Calvin,Libero-Plus,多種多様な実ロボットタスクにまたがって高い性能を実現する。
論文 参考訳(メタデータ) (2026-06-08T17:59:53Z) - Worth Remembering: Surprise-Gated Robot Episodic Memory [12.101245779148316]
本稿では,V-JEPA-2によって提供されるセマンティックにリッチなデプロイメントに依存しない潜在空間において,サプライズを計算する手法を提案する。
4次元シーングラフに基づく空間記憶を増強するために,我々のゲート型エピソードメモリを用いて,ロボット質問応答における最先端ベンチマークよりも一貫した改善を示す。
論文 参考訳(メタデータ) (2026-06-02T15:39:27Z) - RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies [54.23445842621374]
記憶は、長い水平と歴史に依存したロボット操作にとって重要である。
近年,視覚言語アクション(VLA)モデルにメモリ機構が組み込まれ始めている。
本稿では,VLAモデルの評価と進展のための大規模標準ベンチマークであるRoboMMEを紹介する。
論文 参考訳(メタデータ) (2026-03-04T21:59:32Z) - MEM: Multi-Scale Embodied Memory for Vision Language Action Models [73.3883864595845]
本稿では,マルチスケール・エンボダイドメモリ(MEM)について紹介する。
MEMはビデオベースの短水平メモリをビデオエンコーダで圧縮し、テキストベースの長水平メモリと組み合わせている。
MEMは、キッチンを掃除したり、チーズサンドイッチを焼いたりして、最大15分間のタスクをロボットが実行できるようにする。
論文 参考訳(メタデータ) (2026-03-04T00:03:02Z) - MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation [59.31354761628506]
このようなタスクは本質的にマルコフ的ではないが、主流のVLAモデルはそれを見落としているため、ロボット操作には時間的コンテキストが不可欠である。
本稿では,長距離ロボット操作のためのコグニション・メモリ・アクション・フレームワークであるMemoryVLAを提案する。
本稿では,3つのロボットを対象とした150以上のシミュレーションと実世界のタスクについて評価する。
論文 参考訳(メタデータ) (2025-08-26T17:57:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。