論文の概要: PACMI: Provenance-Aware Cascading Memory Invalidation for Long-Term LLM Agents
- arxiv url: http://arxiv.org/abs/2610.05732v1
- Date: Mon, 05 Oct 2026 03:31:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 04:47:05.589188
- Title: PACMI: Provenance-Aware Cascading Memory Invalidation for Long-Term LLM Agents
- Title(参考訳): PACMI:長期LLMエージェントにおける前向きカスケードメモリ無効化
- Abstract要約: LLMエージェントは、長い地平線上でタスクを実行する際に、情報の保持と再利用を長期記憶に依存している。
既存の方法は、新しい観察やドメインの証拠が到着するにつれて時代遅れになる記憶を扱うための限られたサポートを提供する。
Provenance-Aware Cascading Memory Invalidation (PACMI) を提案する。
- 参考スコア(独自算出の注目度): 22.004895431694806
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents rely on long-term memory to retain and reuse information when performing tasks over long horizons. Existing methods provide limited support for handling memories that become outdated as new observations or domain evidence arrive. Such outdated memories may remain semantically relevant, continue to affect dependent records, and retain value as historical evidence. This calls for two capabilities: dependency tracking to identify downstream effects and historical preservation to retain useful past records. We propose Provenance-Aware Cascading Memory Invalidation (PACMI), a framework that represents memories and new evidence in a provenance graph with typed dependency edges. PACMI assigns records to a four-state validity lattice, propagates validity changes to dependent memories, and uses the resulting states for retrieval and stale-premise detection. We also introduce a diagnostic benchmark with 100 cases and 300 queries across five domains. The evaluation separates node, context-, and answer-level performance. PACMI achieves the highest final-answer accuracy on this benchmark, and its paired difference from the strongest baseline is significant under an exact McNemar test. The premise checker achieves perfect precision, recall, and F 1 on the controlled query distribution. Cascading propagation primarily improves memorystate correctness: removing it increases final-answer errors from 3 to 11, but the paired difference does not reach the 0.05 significance threshold. Code and data will be made publicly available.
- Abstract(参考訳): LLMエージェントは、長い地平線上でタスクを実行する際に、情報の保持と再利用を長期記憶に依存している。
既存の方法は、新しい観察やドメインの証拠が到着するにつれて時代遅れになる記憶を扱うための限られたサポートを提供する。
このような時代遅れの記憶は意味論的に関連し続け、依存する記録に影響を与え続け、歴史的証拠として価値を維持することができる。
これは、下流効果を識別するための依存性追跡と、有用な過去の記録を保持するための履歴保存の2つの機能を要求する。
Provenance-Aware Cascading Memory Invalidation (PACMI) を提案する。
PACMIは4状態の妥当性格子にレコードを割り当て、依存する記憶に対する妥当性の変化を伝播させ、その結果の状態を検索および静的検出に利用する。
また、5つのドメインにわたる100のケースと300のクエリの診断ベンチマークも導入しています。
評価は、ノード、コンテキスト、および回答レベルのパフォーマンスを分離する。
PACMIは、このベンチマークで最も高い最終問合せ精度を達成し、最も高いベースラインとのペア差は、正確なマクネマール試験において重要である。
前提チェッカーは、制御されたクエリ分布の完全精度、リコール、F1を達成する。
カスケーディング伝搬は、主にメモリ状態の正確さを改善する: 削除すると最終回答エラーが3から11に増加するが、ペアの差は0.05の閾値に達しない。
コードとデータは公開されます。
関連論文リスト
- Memory Canonicalization: A Framework and Benchmark for Cross-Model Drift in Persistent LLM Memory [0.0]
本稿では,生のメモリオブジェクトを明示的で構造的に曖昧な標準形式に書き換える書き込み時パイプラインを提案する。
完全正準化メモリに対するクロスモデル感情整合性の改善は, 生メモリに対する不整合性の改善がみられた。
論文 参考訳(メタデータ) (2026-10-04T11:09:27Z) - D$^2$ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory [10.177699115336425]
D$2$ACCIプロトコルは、ペア化されたエビデンス、保護されたスライス監視、トレースレベルのローカライズ可能性に基づいて、メモリ介入を促進、機能フラグ、拒否する。
我々はMemStackでプロトコルをインスタンス化し、3つの公開ベンチマークで評価し、LoCoMoで93.59%、LongMemEvalで90.93%、PersonaMem-V2で57.20%を達成した。
論文 参考訳(メタデータ) (2026-08-18T13:18:38Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - ConvMemory v3: A Validity Context Layer for Conversational Memory via Target-Conditioned Relation Verification [0.0]
ConvMemory v3では、この更新エビデンスを検出し、サーフェスする妥当性コンテキスト層が追加されている。
コアメカニズムは、特定のターゲット命題に関する関係判断を条件とする二重証拠ゲートである。
合成マルチホップ検証ベンチマークでは、ゲートの精度は90.12% +/- 1.73である。
論文 参考訳(メタデータ) (2026-06-25T08:36:43Z) - MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery [58.64329475683699]
我々は、長期記憶は監査可能な相互作用後のアーティファクトとして評価されるべきであると主張している。
我々は、メモリを備えたエージェントがシミュレーションユーザを支援するベンチマークであるMEMPROBEで、このビューをインスタンス化する。
私たちは、成功したアシストと回復可能なメモリが、異なる機能として振る舞うことに気付きました。
論文 参考訳(メタデータ) (2026-06-23T13:52:46Z) - MemTrace: Probing What Final Accuracy Misses in Long-Term Memory [39.696350769003104]
測定単位が知識点であるベンチマークであるMemTraceを紹介する。
MemTraceは3つの制御された次元に沿って各事実を探索する。
同様にプールされた精度は、異なる失敗を隠すことに気付きます。
論文 参考訳(メタデータ) (2026-06-15T22:21:23Z) - Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory [50.857546269660276]
本稿では,大規模言語モデル(LLM)メモリを逐次進化させる診断評価フレームワークであるSeqMem-Evalを紹介する。
最終的なパフォーマンスのみに焦点を当てるのではなく、SeqMem-Evalは、シーケンシャル推論において、メモリ状態がどのように進化し、一般化し、エクスペリエンスを集約し、有用な情報を保持するかを評価する。
論文 参考訳(メタデータ) (2026-05-14T20:15:22Z) - MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs [47.66730296440261]
我々は,新たなメモリが生成されるたびに記憶が取得されたことを記録した証明DAGを通じて,クレジットを後方に伝播するMemQを紹介した。
6つのベンチマークで、MemQは、一般化評価とランタイム学習の6つすべてで最高成功率を達成した。
さらに、$と$がEC-MDP構造とどのように相互作用するかを研究し、パラメータ選択と将来の研究の原則的なガイダンスを提供する。
論文 参考訳(メタデータ) (2026-05-08T18:30:24Z) - A Parametric Memory Head for Continual Generative Retrieval [52.66674234249913]
生成情報検索(GenIR)は、検索を単一のニューラルモデルに統合し、クエリから直接ドキュメント識別子(ドシデント)をデコードする。
逐次適応は、新たに追加された文書の検索を改善するが、以前のスライスの性能は著しく低下することを示す。
本稿では,モジュール型パラメトリックメモリヘッドで適応モデルを拡張するメモリのみの安定化ステージである,後適応メモリチューニング(PAMT)を提案する。
論文 参考訳(メタデータ) (2026-04-25T17:38:51Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。