論文の概要: MEMOBench: A Process Level Memory Benchmark for Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2609.07047v1
- Date: Mon, 07 Sep 2026 05:06:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.364391
- Title: MEMOBench: A Process Level Memory Benchmark for Robotic Manipulation
- Title(参考訳): MEMOBench: ロボット操作のためのプロセスレベルのメモリベンチマーク
- Abstract要約: ロボット操作におけるプロセスレベルのメモリ評価のベンチマークである textbfMEMOBench を提案する。
MEMOBenchには30の履歴依存タスク、1500のエキスパートデモ、84のテンプレートから4,200の実行可能なチェックポイントインスタンスが含まれている。
- 参考スコア(独自算出の注目度): 36.81053166644513
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Robotic manipulation often requires acting on information that is no longer visible, yet Vision-Language-Action policies are usually evaluated when the current observation largely determines the next action. Existing robotic memory benchmarks expose this gap, but they still rely mainly on final task success and therefore conflate forgetting with manipulation failure. We present \textbf{MEMOBench}, a benchmark for process level memory evaluation in robotic manipulation. MEMOBench includes 30 history dependent tasks, 1{,}500 expert demonstrations, and 4{,}200 executable checkpoint instances from 84 templates. Each checkpoint pairs coarse to fine language with a simulator predicate and labels one memory operation: Storage, Update, or Compression. These annotations define Memory Storage Rate, Memory Update Rate, and Memory Compression Rate, which measure memory fidelity alongside task success. Across standard and memory augmented VLA policies, the strongest memory module baseline reaches only 31.9\% average success rate, and high storage often coexists with weak update and compression. Checkpoint language also supervises semantic, contrastive, and framewise memory alignment objectives, yielding modest gains across different memory operations. MEMOBench provides a diagnostic evaluation suite and training supervision for memory grounded robotic policies. The project page is available at https://github.com/Collab-Gen/MEMOBench.
- Abstract(参考訳): ロボット操作は、しばしば見えなくなった情報に行動する必要があるが、現在の観察が次の行動を大きく決定するときに、ビジョン・ランゲージ・アクションのポリシーが評価される。
既存のロボットメモリベンチマークは、このギャップを露呈するが、それらは依然として最終タスクの成功に大きく依存しているため、操作の失敗によって忘れを分割する。
本稿では,ロボット操作におけるプロセスレベルのメモリ評価のベンチマークである「textbf{MEMOBench}」を提案する。
MEMOBenchには30の履歴依存タスク、1{,}500のエキスパートデモ、84のテンプレートから4{,}200の実行可能なチェックポイントインスタンスが含まれている。
各チェックポイントは、シミュレータの述語と粗い言語にペアリングし、1つのメモリ操作(ストレージ、更新、圧縮)をラベル付けする。
これらのアノテーションはメモリストレージ率、メモリ更新率、メモリ圧縮率を定義しており、タスクの成功とともにメモリの忠実度を測定する。
標準およびメモリ拡張VLAポリシー全体では、最強のメモリモジュールベースラインは平均的な成功率31.9 %にしか達せず、高ストレージはしばしば弱い更新と圧縮で共存する。
チェックポイント言語はまた、セマンティック、コントラスト、フレーム単位でのメモリアライメントの目的を監督し、異なるメモリ操作で適度なゲインを得る。
MEMOBenchは、記憶基盤ロボットポリシーのための診断評価スイートとトレーニング監督を提供する。
プロジェクトページはhttps://github.com/Collab-Gen/MEMOBench.comで公開されている。
関連論文リスト
- Mechanistic Attention Guidance for Agent Memory Refinement [32.57216046158823]
検索ヘッドアテンションは,セグメントレベルのメモリ使用量を明らかにするためのメカニスティック信号を提供する。
本稿では,注意による利用パターンを用いてセグメントレベルのメモリ更新を誘導するフレームワークであるAttention-Guided Memory Refinement (AGMR)を提案する。
論文 参考訳(メタデータ) (2026-07-20T07:17:50Z) - MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning [27.103249755262212]
ロングホライズンロボットの計画には、将来の目標を解釈可能な具体的体験の記憶が必要である。
私たちは、Embodied Action Memory(EAM)を、後の決定のために永続的なメモリ状態として、そのエクスペリエンスを形成、維持、使用する能力として定式化します。
MEMORAは, 生成・統合・検索ライフサイクルと4つの型付きストアでEMAを実現する。
論文 参考訳(メタデータ) (2026-07-15T18:12:28Z) - Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents [72.3752981234916]
大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
メモリ操作をマルコフ決定プロセスとしてモデル化するフレームワークである制御プロセス(MemCon)としてメモリを提示する。
MemConは、複数のメモリベースラインのタスク成功率を最大15.2ポイント上回り、トークン消費量を5-20%削減している。
論文 参考訳(メタデータ) (2026-07-15T08:32:40Z) - MemGym: a Long-Horizon Memory Environment for LLM Agents [69.79226770543049]
本稿では,エージェントメモリのベンチマークであるMemGymを紹介する。
MemGymは、メモリパフォーマンスを推論、検索、ツール使用能力から切り離すメモリアイソレーションスコアを報告している。
MEMGYM-CODEQAとMEMGYM-DRの合成パイプラインは、長さ制御可能であり、各ステージでアブレーションを検証可能であり、下流のシナリオと密に整合している。
論文 参考訳(メタデータ) (2026-05-20T07:25:33Z) - EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective [21.66000179149483]
EvoMemBenchは、メモリスコープとメモリ内容の2つの軸に沿って編成された統一ベンチマークである。
本稿では,15個の代表記憶法と強い長文ベースラインを標準プロトコルで比較する。
結果は、現在のメモリシステムは、まだ一般的な解決策には程遠いことを示している。
論文 参考訳(メタデータ) (2026-05-18T13:54:38Z) - RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark [49.16825786282095]
記憶はロボットインテリジェンスにとって重要な要素であり、ロボットは長期のタスクを達成するために過去の観察と行動に頼る必要がある。
既存のロボットメモリベンチマークには、メモリ形成のためのマルチモーダルアノテーションがなく、タスクカバレッジと構造的複雑さが制限されており、実際の評価なしにシミュレーションに制限されている。
このギャップに対処するため、26タスクの大規模ベンチマークであるRoboMemArenaでは、タスク毎の平均軌道長が1,000ステップを超え、サブタスクの68.9%がメモリ依存である。
論文 参考訳(メタデータ) (2026-05-11T17:54:49Z) - RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies [54.23445842621374]
記憶は、長い水平と歴史に依存したロボット操作にとって重要である。
近年,視覚言語アクション(VLA)モデルにメモリ機構が組み込まれ始めている。
本稿では,VLAモデルの評価と進展のための大規模標準ベンチマークであるRoboMMEを紹介する。
論文 参考訳(メタデータ) (2026-03-04T21:59:32Z) - RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design [77.30163153176954]
RMBenchは、メモリの複雑さの複数のレベルにまたがる9つの操作タスクからなるシミュレーションベンチマークである。
Mem-0は、制御アブレーション研究をサポートするために設計された明示的なメモリコンポーネントを備えたモジュラー操作ポリシーである。
既存のポリシにおけるメモリ関連の制限を特定し、アーキテクチャ設計の選択がメモリパフォーマンスに与える影響に関する実証的な洞察を提供する。
論文 参考訳(メタデータ) (2026-03-01T18:59:59Z) - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks [55.145729491377374]
メモリを持つエージェントの既存の評価は、通常、単独で記憶と行動を評価する。
マルチセッションメモリ-エージェント環境ループにおけるエージェントメモリのベンチマークのための統合評価ジムであるMemoryArenaを紹介する。
MemoryArenaは、Webナビゲーション、優先制約付き計画、プログレッシブ情報検索、シーケンシャルなフォーマルな推論を含む評価をサポートする。
論文 参考訳(メタデータ) (2026-02-18T09:49:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。