論文の概要: EmbodiedMemory-Bench: Benchmarking Embodied Memory for Long-Horizon Embodied Tasks
- arxiv url: http://arxiv.org/abs/2609.28236v1
- Date: Wed, 23 Sep 2026 15:00:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.081786
- Title: EmbodiedMemory-Bench: Benchmarking Embodied Memory for Long-Horizon Embodied Tasks
- Title(参考訳): EmbodiedMemory-Bench: 長期作業におけるEmbodied Memoryのベンチマーク
- Abstract要約: ロングホライゾン・エンボディド・インタラクションは、エージェントが観察、行動、変化に遭遇する際の環境に関する情報を保持し、継続的に更新する必要がある。
我々の分析は、この限界を4つの重要な欠陥、すなわち、微粒な視覚記憶の弱さ、信頼性の低い動的世界状態追跡、そして相互作用の結果によって明らかになった世界状態の記録の欠如に遡る。
既存のベンチマークでは、長期にわたるエンボディード相互作用の間、これらのメモリ能力を直接評価しない。
EmbodiedMemory-Benchは4つのタスクファミリーで2,554のインタラクティブなエピソードで構成されている。
具体的経験を空間・事象・事象に整理した外部記憶システムである Embodied-Memorizer (EMem) について述べる。
- 参考スコア(独自算出の注目度): 20.393302005387003
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon embodied interaction requires agents to retain and continually update information about the environment as they observe, act, and encounter change. Yet current agents struggle to maintain such memory reliably. Our analysis traces this limitation to four key deficiencies: weak fine-grained visual memory, unreliable dynamic world-state tracking, failing to record world state revealed by interaction outcomes, and limited generalization from prior experience. However, existing benchmarks do not directly assess these memory capabilities during long-horizon embodied interaction. To address this gap, we introduce EmbodiedMemory-Bench (EMem-Bench), comprising 2,554 interactive episodes across four task families. EMem-Bench requires agents to build and update memory from interaction history, then use it to complete a later task by acting in the environment. We further present Embodied-Memorizer (EMem), an external memory system that organizes embodied experience into spatial, event, and scene memories. We also train EMem-8B, an 8B policy that manages and uses these memories. We evaluate a diverse range of open-source and proprietary MLLMs and representative multimodal memory systems. Results show that current models remain weak and uneven across the four challenges. Under matched backbones, EMem achieves the best overall performance among the evaluated memory systems and improves both open-source and proprietary models, while EMem-8B further improves over its backbone. Project page: https://zju-omniai.github.io/EmbodiedMemoryBench/
- Abstract(参考訳): ロングホライゾン・エンボディド・インタラクションは、エージェントが観察、行動、変化に遭遇する際の環境に関する情報を保持し、継続的に更新する必要がある。
しかし、現在のエージェントはそのようなメモリを確実に維持するのに苦労している。
我々の分析は、この限界を4つの重要な欠陥に遡る: 弱いきめ細かな視覚記憶、信頼性の低い動的世界状態追跡、相互作用の結果によって明らかになった世界状態の記録の欠如、および以前の経験からの限定的な一般化である。
しかし、既存のベンチマークでは、長期にわたるエンボディード相互作用の間、これらのメモリ能力を直接評価していない。
このギャップに対処するために,4つのタスクファミリーにまたがる2,554のインタラクティブなエピソードからなるEmbodiedMemory-Bench(EMem-Bench)を紹介した。
EMem-Benchでは、エージェントがインタラクション履歴からメモリを構築し、更新し、その後、環境内で動作することでタスクを完了させる必要がある。
さらに,エンボディード体験を空間記憶,イベント記憶,シーン記憶に整理する外部記憶システムであるEmbodied-Memorizer(EMem)について述べる。
また、これらの記憶を管理し、利用する8BポリシーであるEMem-8Bを訓練する。
我々は,オープンソースおよびプロプライエタリなMLLMと代表的マルチモーダルメモリシステムについて,多種多様な評価を行った。
結果は、現在のモデルは4つの課題において弱く不均一なままであることを示している。
一致したバックボーンの下では、EMemは評価されたメモリシステムの中で最高の全体的なパフォーマンスを達成し、オープンソースモデルとプロプライエタリモデルの両方を改善し、EMem-8Bはバックボーンをさらに改善する。
プロジェクトページ: https://zju-omniai.github.io/EmbodiedMemoryBench/
関連論文リスト
- WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - Personalize-then-Store: Benchmarking and Learning Personalized Memory for Long-horizon Agents [20.22872890297194]
既存の大規模言語モデル(LLM)ベースのメモリシステムは、基本的な現実を覆い隠す、普遍的で静的なポリシーを適用している。
パーソナライズされたメモリシステムを評価するための最初のベンチマークであるPerMemBenchを紹介する。
本稿では,過渡セッションのメモリ操作を選択的にバイパスする軽量フレームワークであるセッションレベルのストレージゲーティングを提案する。
論文 参考訳(メタデータ) (2026-05-25T07:48:33Z) - MemGym: a Long-Horizon Memory Environment for LLM Agents [69.79226770543049]
本稿では,エージェントメモリのベンチマークであるMemGymを紹介する。
MemGymは、メモリパフォーマンスを推論、検索、ツール使用能力から切り離すメモリアイソレーションスコアを報告している。
MEMGYM-CODEQAとMEMGYM-DRの合成パイプラインは、長さ制御可能であり、各ステージでアブレーションを検証可能であり、下流のシナリオと密に整合している。
論文 参考訳(メタデータ) (2026-05-20T07:25:33Z) - LMEB: Long-horizon Memory Embedding Benchmark [49.57481835614834]
埋め込みモデルの能力を評価する包括的なフレームワークであるLong-Horizon Memory Embedding Benchmark (LMEB)を紹介する。
LMEBは4つのメモリタイプにまたがる22のデータセットと193のゼロショット検索タスクにまたがる。
我々は、数億から100億のパラメータを含む、広く使われている15の埋め込みモデルを評価した。
論文 参考訳(メタデータ) (2026-03-13T02:09:57Z) - RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies [54.23445842621374]
記憶は、長い水平と歴史に依存したロボット操作にとって重要である。
近年,視覚言語アクション(VLA)モデルにメモリ機構が組み込まれ始めている。
本稿では,VLAモデルの評価と進展のための大規模標準ベンチマークであるRoboMMEを紹介する。
論文 参考訳(メタデータ) (2026-03-04T21:59:32Z) - RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction [21.670389104174536]
RealMem**は、現実的なプロジェクトのシナリオに基礎を置いた最初のベンチマークです。
RealMemは11つのシナリオにわたる2,000以上のクロスセッション対話で構成され、評価に自然なユーザクエリを利用する。
本稿では,メモリの動的進化をシミュレートするために,Project Foundation Construction, Multi-Agent Dialogue Generation, and Memory synthesis and Schedule Managementを統合するパイプラインを提案する。
論文 参考訳(メタデータ) (2026-01-11T15:49:36Z) - Memory OS of AI Agent [3.8665965906369375]
大きな言語モデル(LLM)は、固定されたコンテキストウィンドウと不十分なメモリ管理から重要な課題に直面します。
本稿では,AIエージェントの総合的かつ効率的なメモリ管理を実現するために,メモリオペレーティングシステム(MemoryOS)を提案する。
論文 参考訳(メタデータ) (2025-05-30T15:36:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。