論文の概要: Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents
- arxiv url: http://arxiv.org/abs/2605.17830v1
- Date: Mon, 18 May 2026 04:06:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:48.803588
- Title: Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents
- Title(参考訳): メモリを内蔵したLLMエージェントの長期的安全リスク
- Authors: Ahmad Al-Tawaha, Shangding Gu, Peizhi Niu, Ruoxi Jia, Ming Jin,
- Abstract要約: デプロイでは、単一のエージェントが長い水平線上で多くの独立したタスクを処理し、初期のタスクの間に蓄積されたメモリは、後続の無関係なタスクの振る舞いに影響を与える可能性がある。
本稿では,リードオンリーのメモリスナップショットに対して,プレフィックス長の異なる固定プローブセットを評価するトリガプローブプロトコルを提案する。
このプロトコルは、レコード、メモ、フォーム、Eメール対応、および8つのメモリアーキテクチャにまたがる3つのデプロイメントシナリオに適用する。
- 参考スコア(独自算出の注目度): 18.83666486835137
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety evaluations of memory-equipped LLM agents typically measure within-task safety: whether an agent completes a single scenario safely, often under adversarial conditions such as prompt injection or memory poisoning. In deployment, however, a single agent serves many independent tasks over a long horizon, and memory accumulated during earlier tasks can affect behavior on later, unrelated ones. Studying this regime requires evaluation along the temporal dimension across tasks: not whether an agent is safe at any single memory state, but how its safety profile changes as memory accumulates across many independent interactions. We call this failure mode temporal memory contamination. To isolate memory exposure from stream non-stationarity, we introduce a trigger-probe protocol that evaluates a fixed probe set against read-only memory snapshots at varying prefix lengths, together with a NullMemory counterfactual baseline for identifying memory-induced violations. We apply this protocol across three deployment scenarios spanning records, memos, forms, and email correspondence and eight memory architectures, and additionally on Claw-like AI agents, such as OpenClaw, using the platform's native memory mechanism. Memory-enabled agents consistently exceed the NullMemory baseline, and memory-induced violation rates show a robust upward trend with exposure length on both agent classes. Order-randomization experiments indicate that the effect is driven primarily by accumulated content rather than encounter order. Finally, a structural consequence of the event decomposition is that memory-induced risk is detectable from retrieval state before generation, which we confirm with a high-recall diagnostic monitor. Our results argue for treating memory safety as a longitudinal property that requires temporal evaluation, not a single-state property that can be captured by a snapshot.
- Abstract(参考訳): メモリを装備したLLMエージェントの安全性評価は、通常、マスク内の安全性を計測する: エージェントが1つのシナリオを安全に完了するかどうか、しばしば即時注射やメモリ中毒のような敵の条件下で測定する。
しかし、デプロイメントでは、単一のエージェントが長い水平線上で多くの独立したタスクを処理し、初期のタスクの間に蓄積されたメモリは、後続の無関係なタスクの振る舞いに影響を与える可能性がある。
エージェントが任意の単一のメモリ状態において安全であるかどうかではなく、メモリが多くの独立した相互作用にわたって蓄積されるにつれて、その安全性プロファイルがどのように変化するかである。
この障害モードを時間記憶汚染と呼ぶ。
ストリーム非定常性からメモリの露光を分離するために,プリフィックス長の異なる読み取り専用メモリスナップショットに対する固定プローブセットの評価を行うトリガプローブプロトコルと,メモリによる違反を識別するためのNullMemory対実ベースラインを導入する。
我々は、このプロトコルを、レコード、メモ、フォーム、Eメール対応、および8つのメモリアーキテクチャにまたがる3つのデプロイメントシナリオに適用し、さらにプラットフォームのネイティブメモリメカニズムを使用して、OpenClawのようなClawライクなAIエージェントにも適用する。
メモリ対応エージェントは、NullMemoryベースラインを一貫して上回り、メモリによる違反率は、両方のエージェントクラスに露出する時間とともに、強い上昇傾向を示す。
秩序のランダム化実験は、この効果が主に秩序に遭遇するのではなく、蓄積されたコンテンツによって引き起こされることを示している。
最後に、事象分解による構造的結果として、発生前の検索状態からメモリが引き起こすリスクを検出することがあり、ハイリコール診断モニターで確認する。
本研究は,メモリ安全性を時間的評価を必要とする長手特性として扱うことを目的としている。
関連論文リスト
- Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory [50.857546269660276]
本稿では,大規模言語モデル(LLM)メモリを逐次進化させる診断評価フレームワークであるSeqMem-Evalを紹介する。
最終的なパフォーマンスのみに焦点を当てるのではなく、SeqMem-Evalは、シーケンシャル推論において、メモリ状態がどのように進化し、一般化し、エクスペリエンスを集約し、有用な情報を保持するかを評価する。
論文 参考訳(メタデータ) (2026-05-14T20:15:22Z) - The Trap of Trajectory: Towards Understanding and Mitigating Spurious Correlations in Agentic Memory [7.707732051915869]
エージェントメモリシステムの診断では、メモリはクリーンな入力の推論を改善するが、それらが存在するときのスプリアスパターンへの依存を増幅する。
本稿では,CAMELを提案する。CAMELは,書き込み時間と検索時間の両方で,多様なメモリアーキテクチャ間で動作可能な,プラグアンドプレイキャリブレーション方式である。
全体として、CAMELはより信頼性の高いエージェントメモリデプロイメントに対して、原則的で軽量なソリューションを提供する。
論文 参考訳(メタデータ) (2026-05-10T05:04:13Z) - Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents [0.0]
コーディングエージェントは、以前の経験、トレースの修復、リポジトリローカルな運用知識を再利用するために、ますます外部メモリに依存している。
本稿では、純トップk検索問題ではなく、選択的かつリスクに敏感な制御問題として、イシューメモリの使用を再検討する。
リスクに敏感なコンテキスト帯域メモリコントローラであるRSCB-MCを導入し,メモリ使用の有無を判断し,トップレゾリューションを注入し,複数の候補を要約し,高精度または高速リコール検索,停止,あるいはフィードバックを求める。
論文 参考訳(メタデータ) (2026-04-30T00:32:53Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks [55.145729491377374]
メモリを持つエージェントの既存の評価は、通常、単独で記憶と行動を評価する。
マルチセッションメモリ-エージェント環境ループにおけるエージェントメモリのベンチマークのための統合評価ジムであるMemoryArenaを紹介する。
MemoryArenaは、Webナビゲーション、優先制約付き計画、プログレッシブ情報検索、シーケンシャルなフォーマルな推論を含む評価をサポートする。
論文 参考訳(メタデータ) (2026-02-18T09:49:14Z) - Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections [57.64370755825839]
セルフ進化エージェントはセッション間で内部状態を更新する。
我々はこのリスクを調査し、Zombie Agentと呼ばれる永続的な攻撃を形式化する。
我々は,攻撃者が制御するWebコンテンツを通じて間接的露光のみを使用するブラックボックス攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-17T15:28:24Z) - A-MemGuard: A Proactive Defense Framework for LLM-Based Agent Memory [31.673865459672285]
大規模言語モデル(LLM)エージェントは、過去のインタラクションから学習するためにメモリを使用する。
敵は、エージェントのメモリに一見無害なレコードを注入して、その将来の振る舞いを操作できる。
A-MemGuard は LLM エージェントメモリのための最初のプロアクティブな防御フレームワークである。
論文 参考訳(メタデータ) (2025-09-29T16:04:15Z) - MemGen: Weaving Generative Latent Memory for Self-Evolving Agents [57.1835920227202]
本稿では,エージェントに人間的な認知機能を持たせる動的生成記憶フレームワークであるMemGenを提案する。
MemGenは、エージェントが推論を通して潜在記憶をリコールし、増大させ、記憶と認知の密接なサイクルを生み出すことを可能にする。
論文 参考訳(メタデータ) (2025-09-29T12:33:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。