論文の概要: Mimir: A Neuro-Symbolic Memory System with Dynamic Grounding for Embodied Agents in Interactive Environments
- arxiv url: http://arxiv.org/abs/2608.04933v1
- Date: Wed, 05 Aug 2026 14:57:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.966459
- Title: Mimir: A Neuro-Symbolic Memory System with Dynamic Grounding for Embodied Agents in Interactive Environments
- Title(参考訳): Mimir: 対話環境における動的接地機能を備えた神経シンボリック記憶システム
- Authors: Haoming Xu, Zhenlin He, Hengyi Wang, Jiafeng Xu, Hao Dong,
- Abstract要約: ロングホライゾン・エンボディド・タスクでは、エージェントは部分的な観察可能性の下で行動し、シーンの信念と実行の進捗を保ちながら行動する必要がある。
タスクメモリからワールドメモリを分離し,各アクションの前に動的に記憶する,ニューロシンボリックメモリであるMimirを紹介する。
試験されたバックボーン全体で、ミミルはEB-ALFREDとEB-Habitatのタスクを常に改善し、最大利得は42.5%、平均利得は23.0%である。
- 参考スコア(独自算出の注目度): 15.524473346555395
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Long-horizon embodied task requires agents to act under partial observability while preserving both scene belief and execution progress. Flat histories or implicit policy states may contain past observations, but they do not provide an explicit interface for deciding which world facts support the currently active goal. We introduce Mimir, a neuro-symbolic memory that separates world memory from task memory and dynamically grounds them before each action. World memory maintains object locations, object states, and perceptual evidence, while task memory maintains an ordered goal agenda, progress state, hand state, failures, and execution constraints. A grounding module binds the active goal to recalled world candidates, fills missing source locations, and attaches evidence before planning and embodiment-specific execution. Across tested backbones, Mimir consistently improves on different EB-ALFRED and EB-Habitat tasks, with maximum gains of 42.5% and average gains of 23.0%, respectively. Compared with the best results among prior agent and memory systems evaluated under the same backbone, Mimir improves the overall average success rate by 8.5%. Finally, on the EB-Habitat Long-horizon subset, Mimir achieves 86.0% success rate, substantially outperforming current closed-source models. Our code will be released soon.
- Abstract(参考訳): ロングホライゾン・エンボディド・タスクでは、エージェントは部分的な観察可能性の下で行動し、シーンの信念と実行の進捗を保ちながら行動する必要がある。
フラットな歴史や暗黙の政策状態は過去の観察を含むかもしれないが、どの世界事実が現在活発な目標をサポートするかを決定するための明確なインターフェースを提供していない。
タスクメモリからワールドメモリを分離し,各アクションの前に動的に記憶する,ニューロシンボリックメモリであるMimirを紹介する。
WorldMemoryはオブジェクト位置、オブジェクト状態、知覚的エビデンスを保持し、TaskMemoryは順序付けられた目標アジェンダ、進捗状態、ハンドステート、障害、実行制約を維持します。
グラウンドモジュールは、リコールされた世界の候補者にアクティブなゴールをバインドし、ソースの場所を埋め、計画と実施固有の実行の前にエビデンスをアタッチする。
試験されたバックボーン全体で、ミミルはEB-ALFREDとEB-Habitatのタスクを常に改善し、最大利得は42.5%、平均利得は23.0%である。
同じバックボーンで評価された先行エージェントとメモリシステムのベストな結果と比較して、Mimirは全体の平均成功率を8.5%改善する。
最後に、EB-Habitat Long-Horizonサブセットでは、Mimirは86.0%の成功率に達し、現在のクローズドソースモデルよりも大幅に優れている。
私たちのコードはまもなくリリースされるでしょう。
関連論文リスト
- MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning [27.103249755262212]
ロングホライズンロボットの計画には、将来の目標を解釈可能な具体的体験の記憶が必要である。
私たちは、Embodied Action Memory(EAM)を、後の決定のために永続的なメモリ状態として、そのエクスペリエンスを形成、維持、使用する能力として定式化します。
MEMORAは, 生成・統合・検索ライフサイクルと4つの型付きストアでEMAを実現する。
論文 参考訳(メタデータ) (2026-07-15T18:12:28Z) - DIM-WAM: World-Action Modeling with Diverse Historical Event Memory [23.350949759638056]
世界行動モデルは、将来の視覚状態と行動を共同で予測することで、有望なロボット操作性能を示す。
マルチスケールの歴史的文脈、ローカルな未来のダイナミクス、グローバルなタスク進捗を統合したメモリ拡張ワールドアクションモデルであるDiM-WAMを紹介する。
RMBenchでは、DiM-WAMが平均28.4%、LingBot-VAが69.8%、メモリメモリのMem-0ベースラインが42.0%である。
論文 参考訳(メタデータ) (2026-06-26T03:17:39Z) - HiMem-WAM: Hierarchical Memory-Gated World Action Models for Robotic Manipulation [12.167895321305464]
動作中心の潜伏動作、ハイレベルなスキル潜伏動作、境界トリガーによるメモリ更新を統合した階層型メモリゲート型WAMであるHiMem-WAMを提案する。
具体的には,低レベル動作と高レベルスキル潜伏者を協調的に学習する階層型潜伏行動フレームワークを開発する。
境界対応メモリゲートは、予測されたスキル遷移時にコンパクトなタスク状態を書き、将来のビデオや光フロー推定をテスト時間生成することなく因果推論を可能にする。
論文 参考訳(メタデータ) (2026-06-09T03:22:34Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies [54.23445842621374]
記憶は、長い水平と歴史に依存したロボット操作にとって重要である。
近年,視覚言語アクション(VLA)モデルにメモリ機構が組み込まれ始めている。
本稿では,VLAモデルの評価と進展のための大規模標準ベンチマークであるRoboMMEを紹介する。
論文 参考訳(メタデータ) (2026-03-04T21:59:32Z) - MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation [59.31354761628506]
このようなタスクは本質的にマルコフ的ではないが、主流のVLAモデルはそれを見落としているため、ロボット操作には時間的コンテキストが不可欠である。
本稿では,長距離ロボット操作のためのコグニション・メモリ・アクション・フレームワークであるMemoryVLAを提案する。
本稿では,3つのロボットを対象とした150以上のシミュレーションと実世界のタスクについて評価する。
論文 参考訳(メタデータ) (2025-08-26T17:57:16Z) - RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems [41.89907261427986]
エージェントは、部分的可観測性、空間的推論の制限、高速なマルチメモリ統合など、現実世界の環境において永続的な課題に直面している。
本稿では, 空間, 時間, エピソディック, セマンティックメモリを並列化して, 効率的な長期計画と対話型環境学習を実現する, 脳にインスパイアされたフレームワークであるRoboMemoryを紹介する。
EmbodiedBenchの実験によると、Qwen2.5-VL-72B-Ins上に構築されたRoboMemoryはベースラインを25%上回り、クローズドソース(SOTA)のGemini-1.5を超えている。
論文 参考訳(メタデータ) (2025-08-02T15:39:42Z) - FindingDory: A Benchmark to Evaluate Memory in Embodied Agents [49.18498389833308]
本研究では,Habitatシミュレータに長距離エンボディタスクのための新しいベンチマークを導入する。
このベンチマークは、持続的なエンゲージメントとコンテキスト認識を必要とする60タスクにわたるメモリベースの機能を評価する。
論文 参考訳(メタデータ) (2025-06-18T17:06:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。