論文の概要: MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations
- arxiv url: http://arxiv.org/abs/2607.12893v1
- Date: Tue, 14 Jul 2026 15:33:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.211413
- Title: MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations
- Title(参考訳): MemOps: 長期会話におけるライフサイクルメモリオペレーションのベンチマーク
- Authors: Xixuan Hao, Zeyu Zhang, Zehao Lin, Yihang Sun, Ziliang Guo, Xichong Zhang, Yuxuan Liang, Feiyu Xiong, Zhiyu Li,
- Abstract要約: ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
- 参考スコア(独自算出の注目度): 50.24315431387575
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-term memory has become a foundational capability for LLM-based agents that accompany users across extended, multi-session interactions. Existing benchmarks, however, evaluate such memory almost exclusively through downstream question answering, scoring only the correctness of a final answer. This black-box formulation conflates the heterogeneous causes of memory failure, such as missing the introduction of a relevant fact, binding an operation to the wrong target, or relying on stale values after a correction. As a result, it can credit correct answers despite their reliance on inconsistent or unsafe memory states. In this paper, we argue that, in dynamic long-horizon interactions, memory is not a static collection of facts but a lifecycle of explicit operations, including remembering, forgetting, updating, reflecting, and their compositions. We introduce MemOps, a benchmark that reformulates conversational memory as a sequence of lifecycle operations and represents each memory event with a structured trace specifying its trigger, target, scope, state transition, and supporting evidence. A controllable generation pipeline embeds these operations into long, task-oriented conversations and produces gold operation traces together with six categories of operation-level probes, evaluated under both adjacent-evidence and long-context settings. Across long-context, retrieval-based, parametric and managed-memory systems, MemOps disentangles failure modes that final-answer accuracy alone conceals, revealing that current systems remain far from uniformly reliable. For instance, session-level retrieval outperforms turn-level retrieval, and long-context models remain notably weak at reconstructing ordered memory-state trajectories. These results move long-term memory evaluation from final-answer scoring toward interpretable, operation-level diagnosis.
- Abstract(参考訳): 長期記憶は、拡張されたマルチセッションインタラクションにユーザを伴ってLLMベースのエージェントの基盤機能となっている。
しかし、既存のベンチマークでは、ほとんどの場合、ダウンストリームの質問応答を通じてそのようなメモリを評価し、最終回答の正確性のみを評価する。
このブラックボックス定式化は、関連する事実の導入を欠いたり、間違ったターゲットに操作を結び付けたり、修正後の古い値に依存するなど、メモリ障害の不均一な原因を悪化させる。
その結果、一貫性のない、あるいは安全でないメモリ状態に依存しているにもかかわらず、正しい回答を信用することができる。
本稿では,動的な長距離相互作用において,記憶は事実の静的な収集ではなく,記憶,忘れ,更新,反映,およびそれらの構成を含む明示的な操作のライフサイクルである,と論じる。
MemOpsは,会話メモリをライフサイクル操作のシーケンスとして再構成し,トリガ,ターゲット,スコープ,状態遷移,エビデンスなどを指定する構造化トレースで各メモリイベントを表現するベンチマークである。
制御可能な生成パイプラインは、これらの操作を長いタスク指向の会話に埋め込み、隣接するエビデンスと長いコンテキスト設定の両方で評価された6種類の操作レベルプローブと共に金の操作トレースを生成する。
長いコンテキスト、検索ベース、パラメトリック、およびマネージドメモリシステム全体で、MemOpsはファイナル・アンサーの精度のみを隠蔽する障害モードをアンハングリングし、現在のシステムが一様に信頼性が保たないことを明らかにする。
例えば、セッションレベルの検索はターンレベルの検索よりも優れており、長いコンテキストモデルは順序付けられたメモリ状態の軌跡の再構築において顕著に弱いままである。
これらの結果は、最終回答スコアから長期記憶評価を、解釈可能な操作レベル診断へと移行させる。
関連論文リスト
- MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery [58.64329475683699]
我々は、長期記憶は監査可能な相互作用後のアーティファクトとして評価されるべきであると主張している。
我々は、メモリを備えたエージェントがシミュレーションユーザを支援するベンチマークであるMEMPROBEで、このビューをインスタンス化する。
私たちは、成功したアシストと回復可能なメモリが、異なる機能として振る舞うことに気付きました。
論文 参考訳(メタデータ) (2026-06-23T13:52:46Z) - RaMem: Contextual Reinstatement for Long-term Agentic Memory [21.228780482661076]
本稿では,検索したメモリフラグメントを文脈的エビデンスに変換するフレームワークであるAgenic Memory (RaMem) について述べる。
ラメムは4つの調整された段階を経る: (i) それぞれの記憶を元のエピソード条件、特にイベント時間、参照時間、セッションスパンおよび参加者に固定する証拠 (ii) 記憶条件誘導は、クエリによって入力されたエビデンス条件を導出する; (iii) 妥当性認識検索は、これらの条件を使用して、コンテンツ関連候補をフォールバック証拠として保持しながら、コンテキスト互換な記憶を優先順位付けする; (iv) コンテキスト保存合成は、選択された記憶の構造化されたコンテキストをジェネレータに保持する。
論文 参考訳(メタデータ) (2026-06-22T04:41:14Z) - REAL: A Reasoning-Enhanced Graph Framework for Long-Term Memory Management of LLMs [17.526686616588794]
大きな言語モデル(LLM)は、長い時間をかけてユーザーと対話することがますます期待されている。
LLMは過去のすべてのインタラクションを保持することができず、履歴情報の保存、更新、検索には長期記憶管理が不可欠である。
REALは長期会話記憶を時間的かつ信頼性に配慮したプロパティグラフとして構成する。
論文 参考訳(メタデータ) (2026-06-09T10:53:10Z) - Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents [51.30250860677378]
本稿では,連想記憶グラフとアクティブな再構成機構を組み合わせたフレームワークであるMRAgentを提案する。
Cue-Tag-Contentグラフ上で実行することで,メモリアクセスに直接推論を統合する。
LoCoMoベンチマークとLongMemEvalベンチマークの実験は、強いベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-06-04T11:29:46Z) - Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents [0.33842793760651557]
制御された介入の下で,候補記憶がモデル応答に与える影響を推定する因果記憶選択手法を提案する。
以上の結果から,CMIは,信頼性の高い長期記憶には関連性のみではなく,因果的有用性に基づくコンテキスト選択が必要であることが示唆された。
論文 参考訳(メタデータ) (2026-05-17T20:21:55Z) - MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios [33.8882826707344]
MemGroundは、リッチでゲーミフィケーションされたインタラクティブシナリオを基盤とした、厳格な長期メモリベンチマークである。
メモリ利用と行動軌跡の両方を包括的に定量化するために,多次元計量スイートを提案する。
論文 参考訳(メタデータ) (2026-03-23T02:57:39Z) - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks [55.145729491377374]
メモリを持つエージェントの既存の評価は、通常、単独で記憶と行動を評価する。
マルチセッションメモリ-エージェント環境ループにおけるエージェントメモリのベンチマークのための統合評価ジムであるMemoryArenaを紹介する。
MemoryArenaは、Webナビゲーション、優先制約付き計画、プログレッシブ情報検索、シーケンシャルなフォーマルな推論を含む評価をサポートする。
論文 参考訳(メタデータ) (2026-02-18T09:49:14Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents [20.357475946040054]
textscMem2ActBenchは、エージェントがツールベースのアクションを実行するために長期的なメモリを積極的に活用できるかどうかを評価するベンチマークである。
リバースジェネレーション法は400のツール使用タスクを生成し、ヒトの評価は91.3%が強いメモリ依存であることを確認した。
論文 参考訳(メタデータ) (2026-01-13T06:22:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。