論文の概要: MemoryLake on MemoryArena: A Matched Study of Agent Memory Backends
- arxiv url: http://arxiv.org/abs/2608.13883v1
- Date: Fri, 14 Aug 2026 02:19:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.252232
- Title: MemoryLake on MemoryArena: A Matched Study of Agent Memory Backends
- Title(参考訳): MemoryArenaにおけるMemoryLake - エージェントメモリバックエンドの整合性の検討
- Abstract要約: MemoryLakeをMem0、text-embedding-3-small vector RAG、および5つのMemoryArenaドメインの長いコンテキスト制御と比較する。
各バックエンドバンドルは書き込み、検索、統合、予算設定、迅速な組立選択を行うため、この研究は一致したシステムレベルの比較である。
- 参考スコア(独自算出の注目度): 8.130461324371604
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Most agent-memory benchmarks test post-hoc recall, whereas MemoryArena evaluates whether memory supports interdependent, multi-session task completion. We compare MemoryLake, a structured multi-track memory backend, with Mem0, text-embedding-3-small vector RAG, and a long-context control across all five MemoryArena domains. The systems share the same agent framework, requested gpt-5-mini model alias, task samples, and scoring code; the memory integration is the intentionally changed component. Because each backend bundles write, retrieval, consolidation, budgeting, and prompt-assembly choices, the study is a matched system-level comparison, not a representation-only ablation or a cost-matched experiment. On the shared evaluation sets, MemoryLake has the highest observed success rate (SR) in mathematics (9/40), physics (12/20), and progressive retrieval (4/20). Every system has zero SR in travel planning, and web shopping yields a single bundle-level success (long context, 1/150); MemoryLake ranks third on both the travel soft process score and shopping step match. Following MemoryArena's suite-level convention, a post-hoc equal-weight average over the five SRs is 20.5% for MemoryLake versus 13.6% for the best comparator. These are point estimates: sample sizes are modest, confidence intervals overlap, and we do not report paired significance tests. A separate MemoryLake-only run over all 221 progressive queries yields a failure-counted SR of 26.7% (59/221) and is not a baseline comparison. The results support a workload-dependent view of memory backends and an observed lead among the four evaluated systems on the shared sets; they do not establish benchmark-wide state of the art or a causal advantage of representation structure.
- Abstract(参考訳): ほとんどのエージェントメモリベンチマークは、ホック後のリコールをテストするが、MemoryArenaは、メモリが相互依存のマルチセッションタスク補完をサポートするかどうかを評価する。
我々は、構造化されたマルチトラックメモリバックエンドであるMemoryLakeと、Mem0、text-embedding-3-small vector RAG、および5つのMemoryArenaドメインの長いコンテキスト制御を比較した。
システムは同じエージェントフレームワーク、要求されたgpt-5-miniモデルエイリアス、タスクサンプル、スコアングコードを共有している。
各バックエンドバンドルは書き込み、検索、統合、予算設定、迅速な組立選択を行うため、この研究は、表現のみのアブレーションやコストマッチング実験ではなく、一致したシステムレベルの比較である。
共有評価セットにおいて、MemoryLakeは、数学(9/40)、物理学(12/20)、進歩的検索(4/20)において最も観測された成功率(SR)を有する。
どのシステムも旅行計画においてSRはゼロであり、Webショッピングは単一のバンドルレベルの成功(1/150)をもたらす。
MemoryArenaのスイートレベルの慣習に従えば、5つのSR上でのポストホットな等重量平均は、MemoryLakeが20.5%、ベストコンパレータが13.6%である。
サンプルサイズは適度であり、信頼区間は重なり、ペアの重要度テストは報告しない。
221のプログレッシブクエリで別々のMemoryLakeのみを実行すると、フェールカウントされたSRは26.7%(59/221)となり、ベースライン比較ではない。
結果は、メモリバックエンドのワークロード依存ビューをサポートし、共有セット上で評価された4つのシステムのうち、観測されたリードをサポートし、ベンチマーク全体のステート・オブ・ザ・アーティファクトや、表現構造の因果的アドバンテージを確立しない。
関連論文リスト
- MEMOBench: A Process Level Memory Benchmark for Robotic Manipulation [36.81053166644513]
ロボット操作におけるプロセスレベルのメモリ評価のベンチマークである textbfMEMOBench を提案する。
MEMOBenchには30の履歴依存タスク、1500のエキスパートデモ、84のテンプレートから4,200の実行可能なチェックポイントインスタンスが含まれている。
論文 参考訳(メタデータ) (2026-09-07T05:06:20Z) - Entity-Memory Graph Retrieval Improves Evidence Coverage in Long-Conversation Question Answering [0.0]
10のLoCoMo会話から1,986の質問に対して、グラフ検索はトップ25での公式証拠リコールを79.7468%から84.4842%に引き上げている。
試験されたGPT-3.5およびDeepSeek抽出器の両結果に対する試験的堅牢性をサポートする。
論文 参考訳(メタデータ) (2026-08-28T05:03:33Z) - Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner [55.80248281761638]
マルチモーダルな大言語モデル (MLLM) は、科学的および数学的推論において、印象的な認識を提供する。
本稿では,DG-Memを提案する。DG-Memは,トレーニングタイムのロールアウトから一度構築した外部記憶メモリと,テスト時に読み取り専用に相談することで,凍結したMLLMを拡張可能なエージェントメモリフレームワークである。
論文 参考訳(メタデータ) (2026-08-24T13:56:01Z) - Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents [72.3752981234916]
大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
メモリ操作をマルコフ決定プロセスとしてモデル化するフレームワークである制御プロセス(MemCon)としてメモリを提示する。
MemConは、複数のメモリベースラインのタスク成功率を最大15.2ポイント上回り、トークン消費量を5-20%削減している。
論文 参考訳(メタデータ) (2026-07-15T08:32:40Z) - MemGym: a Long-Horizon Memory Environment for LLM Agents [69.79226770543049]
本稿では,エージェントメモリのベンチマークであるMemGymを紹介する。
MemGymは、メモリパフォーマンスを推論、検索、ツール使用能力から切り離すメモリアイソレーションスコアを報告している。
MEMGYM-CODEQAとMEMGYM-DRの合成パイプラインは、長さ制御可能であり、各ステージでアブレーションを検証可能であり、下流のシナリオと密に整合している。
論文 参考訳(メタデータ) (2026-05-20T07:25:33Z) - EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective [21.66000179149483]
EvoMemBenchは、メモリスコープとメモリ内容の2つの軸に沿って編成された統一ベンチマークである。
本稿では,15個の代表記憶法と強い長文ベースラインを標準プロトコルで比較する。
結果は、現在のメモリシステムは、まだ一般的な解決策には程遠いことを示している。
論文 参考訳(メタデータ) (2026-05-18T13:54:38Z) - Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents [0.33842793760651557]
制御された介入の下で,候補記憶がモデル応答に与える影響を推定する因果記憶選択手法を提案する。
以上の結果から,CMIは,信頼性の高い長期記憶には関連性のみではなく,因果的有用性に基づくコンテキスト選択が必要であることが示唆された。
論文 参考訳(メタデータ) (2026-05-17T20:21:55Z) - Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory [50.857546269660276]
本稿では,大規模言語モデル(LLM)メモリを逐次進化させる診断評価フレームワークであるSeqMem-Evalを紹介する。
最終的なパフォーマンスのみに焦点を当てるのではなく、SeqMem-Evalは、シーケンシャル推論において、メモリ状態がどのように進化し、一般化し、エクスペリエンスを集約し、有用な情報を保持するかを評価する。
論文 参考訳(メタデータ) (2026-05-14T20:15:22Z) - MemX: A Local-First Long-Term Memory System for AI Assistants [0.0]
我々は、安定性指向の検索設計を備えたAIのためのローカルファーストの長期記憶システムであるMemXを提案する。
MemXは、libとOpenAI互換の組み込みAPI上にRustで実装されており、会話エージェントに対して永続的で検索可能な、説明可能なメモリを提供する。
論文 参考訳(メタデータ) (2026-03-17T06:39:54Z) - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks [55.145729491377374]
メモリを持つエージェントの既存の評価は、通常、単独で記憶と行動を評価する。
マルチセッションメモリ-エージェント環境ループにおけるエージェントメモリのベンチマークのための統合評価ジムであるMemoryArenaを紹介する。
MemoryArenaは、Webナビゲーション、優先制約付き計画、プログレッシブ情報検索、シーケンシャルなフォーマルな推論を含む評価をサポートする。
論文 参考訳(メタデータ) (2026-02-18T09:49:14Z) - MemR$^3$: Memory Retrieval via Reflective Reasoning for LLM Agents [29.652985606497882]
私たちは、自律的で正確で互換性のあるエージェントシステムとして、メモリ検索を構築します。
MemR$3$は、2つの中核的なメカニズムを持つ: 1) 解答品質を最適化するために検索、反映、回答のアクションを選択するルータ; 2) 解答プロセスを透過的に描画し、証拠収集プロセスを追跡するグローバルエビデンスギャップトラッカー。
論文 参考訳(メタデータ) (2025-12-23T10:49:42Z) - Rethinking Memory in AI: Taxonomy, Operations, Topics, and Future Directions [55.19217798774033]
メモリは、大規模言語モデル(LLM)ベースのエージェントを支える、AIシステムの基本コンポーネントである。
本稿ではまず,メモリ表現をパラメトリックおよびコンテキスト形式に分類する。
次に、コンソリデーション、更新、インデックス付け、フォッティング、検索、圧縮の6つの基本的なメモリ操作を紹介します。
論文 参考訳(メタデータ) (2025-05-01T17:31:33Z) - RMM: Reinforced Memory Management for Class-Incremental Learning [102.20140790771265]
クラスインクリメンタルラーニング(CIL)は、厳格な記憶予算の下で分類器を訓練する。
既存のメソッドは静的およびアドホックな戦略を使ってメモリ割り当てを行うが、これはしばしば準最適である。
本稿では,段階的な段階と異なるオブジェクトクラスに最適化された動的メモリ管理戦略を提案する。
論文 参考訳(メタデータ) (2023-01-14T00:07:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。