論文の概要: Can Agent Memory Systems Track Evolving State?
- arxiv url: http://arxiv.org/abs/2608.19652v1
- Date: Thu, 20 Aug 2026 05:41:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.455156
- Title: Can Agent Memory Systems Track Evolving State?
- Title(参考訳): エージェントメモリシステムは進化状態を追跡することができるか?
- Abstract要約: 我々は、効果的なメモリシステムは世界の進化状態を追跡する必要があると主張している。
事実、制約、決定が長い相互作用によって修正されるため、答えは現在の状態を反映し、過小評価されるものではない。
この機能をステートトラッキングとして定義し、StateMemBenchでインスタンス化する。
- 参考スコア(独自算出の注目度): 19.24558136812374
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As LLM-based agents are deployed for longer and higher-stakes tasks, their memory systems continue to have crucial gaps. While existing memory benchmarks focus largely on recall-shaped tasks, we argue an effective memory system must track the evolving state of the world; as facts, constraints, and decisions are revised over a long interaction, answers must reflect the current state and not a superseded one. We define this capability as state tracking and instantiate it in StateMemBench, a benchmark of 234 multi-session scenarios spanning two conversation-length regimes. Its closed-pool grading scores whether an answer reflects the current state, the superseded state, or fails otherwise, separating state-tracking failures from other errors by construction. Our analysis shows that this task is challenging for existing memory systems, retrieval-augmented baselines, and long-context baselines. We then present StateMem, a state-first memory method that explicitly tracks supersession and relational dependencies, and show it improves current-state accuracy over the strongest same-backbone baseline by 1.8x (0.205 -> 0.363) on DeepSeek-V4-Flash and over the strongest memory system by 1.6x (0.149 -> 0.233) on Qwen-3.5-9B, while remaining competitive with the long-context baselines. Finally, we show the same state approach can be applied as a lightweight single-call wrapper over existing memory systems, lifting current-state accuracy by +32 to +67 points on StateMemBench across six memory and retrieval backends. A length- and cost-matched control attributes +15 to +32 of those points to state structure rather than added context.
- Abstract(参考訳): LLMベースのエージェントは、より長く高い処理のためにデプロイされるため、メモリシステムは依然として重大なギャップを保っている。
既存のメモリベンチマークは、主にリコール型のタスクに焦点を当てているが、効果的なメモリシステムは世界の進化状態を追跡する必要がある。
この機能をステートトラッキングとして定義し、StateMemBenchでインスタンス化する。これは、2つの会話長のレシエーションにまたがる234のマルチセッションシナリオのベンチマークである。
そのクローズプールグレーディングは、解答が現在の状態、過小評価された状態を反映しているか、そうでなければ失敗するかをスコアし、状態追跡の失敗と他のエラーを構成によって分離する。
分析の結果,既存のメモリシステム,検索拡張ベースライン,長文ベースラインにおいて,このタスクは困難であることが判明した。
次に,このステートファーストメモリ方式について述べる。このステートファーストメモリ方式は,Seek-V4-Flash上では1.8x (0.205 -> 0.363),Qwen-3.5-9Bでは1.6x (0.149 -> 0.233),長文ベースラインでは競争力を維持しながら,最強のバックボーンベースラインでは1.8x (0.205 -> 0.363),最強のメモリシステムでは1.6x (0.149 -> 0.233) の電流精度を向上させる。
最後に、既存のメモリシステムに対して軽量なシングルコールラッパーとして適用でき、6つのメモリおよび検索バックエンドでStateMemBench上で、現在の状態精度を+32から+67ポイント引き上げることができることを示す。
長さとコストにマッチした制御属性+15から+32は、追加のコンテキストではなく状態構造である。
関連論文リスト
- LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference [6.324239367257621]
長期にわたるアシスタントとエージェントは計算ストリームを消費し、最終的にコンテキストを上回る。
既存のコンテキスト保持、要約、検索は、選択した履歴へのアクセスを保存するが、作業コンテキストが変化すると、ライフサイクル全体にわたって永続的な状態を提供しない。
そこで本研究では,事前学習したフルアテンション LLM をメモリ状態で拡張し,ライフサイクル全体にわたって履歴情報を保存する,固有のメモリ方式 textbfLiveMem を提案する。
論文 参考訳(メタデータ) (2026-08-03T17:12:05Z) - Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents [72.3752981234916]
大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
メモリ操作をマルコフ決定プロセスとしてモデル化するフレームワークである制御プロセス(MemCon)としてメモリを提示する。
MemConは、複数のメモリベースラインのタスク成功率を最大15.2ポイント上回り、トークン消費量を5-20%削減している。
論文 参考訳(メタデータ) (2026-07-15T08:32:40Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory [7.7803190371583]
我々は,記憶バンク内に共存する古い,現在の,遷移の事実が検索中に混在している状態調整障害であるemphghostメモリについて検討し,その解答モデルを誤導する。
我々は,既存のメモリシステムのための状態認識オーバレイであるATMAを提案する。ATMAは,銀行内における過大評価とトランジションの記録を保持し,現在,歴史,およびトランジションラベルをQAに公開する。
論文 参考訳(メタデータ) (2026-07-02T09:28:29Z) - GateMem: Benchmarking Memory Governance in Multi-Principal Shared-Memory Agents [61.50171793000712]
GateMemはマルチプリンシパル共有メモリエージェントのベンチマークである。
医療、事務、教育、家庭の領域にまたがる。
強力なユーティリティ、堅牢なアクセス制御、信頼性のある忘れを同時に実現する方法は存在しない。
論文 参考訳(メタデータ) (2026-06-17T09:06:15Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - Is Agent Memory a Database? Rethinking Data Foundations for Long-Term AI Agent Memory [3.263386002412657]
長時間稼働するAIエージェントは永続的なメモリを必要とする。
現在のエージェントメモリシステムとデータベースパラダイムはメモリを記憶として扱う。
私たちのビジョンでは、長期エージェントメモリは新しいデータ管理ワークロードです。
論文 参考訳(メタデータ) (2026-05-25T18:22:42Z) - EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective [21.66000179149483]
EvoMemBenchは、メモリスコープとメモリ内容の2つの軸に沿って編成された統一ベンチマークである。
本稿では,15個の代表記憶法と強い長文ベースラインを標準プロトコルで比較する。
結果は、現在のメモリシステムは、まだ一般的な解決策には程遠いことを示している。
論文 参考訳(メタデータ) (2026-05-18T13:54:38Z) - Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory [50.857546269660276]
本稿では,大規模言語モデル(LLM)メモリを逐次進化させる診断評価フレームワークであるSeqMem-Evalを紹介する。
最終的なパフォーマンスのみに焦点を当てるのではなく、SeqMem-Evalは、シーケンシャル推論において、メモリ状態がどのように進化し、一般化し、エクスペリエンスを集約し、有用な情報を保持するかを評価する。
論文 参考訳(メタデータ) (2026-05-14T20:15:22Z) - RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design [77.30163153176954]
RMBenchは、メモリの複雑さの複数のレベルにまたがる9つの操作タスクからなるシミュレーションベンチマークである。
Mem-0は、制御アブレーション研究をサポートするために設計された明示的なメモリコンポーネントを備えたモジュラー操作ポリシーである。
既存のポリシにおけるメモリ関連の制限を特定し、アーキテクチャ設計の選択がメモリパフォーマンスに与える影響に関する実証的な洞察を提供する。
論文 参考訳(メタデータ) (2026-03-01T18:59:59Z) - Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects [11.300084544174894]
エージェントメモリを推論のための構造化第1級基板として扱うメモリアーキテクチャであるHindsightを提案する。
情報の追加、アクセス、更新の方法を管理する3つのコア操作 – 保持、リコール、リフレクション – をサポートしている。
オープンソースの20Bモデルは、全文ベースラインで全体の精度を39%から83.6%に引き上げる。
論文 参考訳(メタデータ) (2025-12-14T19:47:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。