論文の概要: From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents
- arxiv url: http://arxiv.org/abs/2606.04329v1
- Date: Wed, 03 Jun 2026 01:04:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-04 20:44:18.459734
- Title: From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents
- Title(参考訳): 信頼できない入力から信頼された記憶へ: LLMエージェントにおける記憶中毒攻撃の系統的研究
- Authors: Pritam Dash, Tongyu Ge, Aditi Jain, Tanmay Shah, Zhiwei Shang,
- Abstract要約: メモリはAIエージェントの中核的なコンポーネントであり、対話を通じて知識を蓄積し、パフォーマンスを向上させることができる。
本研究は, LLM系薬剤の記憶障害に関する系統的研究である。
モデル機能,システムプロンプト設計,エージェントシステムアーキテクチャにおいて,4つのメモリ書き込みチャネルと9つの構造的脆弱性を識別する。
- 参考スコア(独自算出の注目度): 3.3489120273076876
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Memory is a core component of AI agents, enabling them to accumulate knowledge across interactions and improve performance. However, persistent memory introduces the risk of memory poisoning, where a single adversarial memory write can exert long-term influence over agent behavior. We present a systematic study of memory poisoning in LLM-based agents. We identify four memory write channels and nine structural vulnerabilities in model capabilities, system prompt design, and agent system architecture that make these channels exploitable. Based on these vulnerabilities, we develop a taxonomy of six classes of memory poisoning attacks. Furthermore, we design MPBench -- a benchmark for evaluating memory poisoning attacks, and show that agents designed to write and retrieve memory more aggressively are more exploitable. We also show that existing prompt injection defenses fail to cover memory poisoning attacks. Our findings provide a foundation for understanding and mitigating memory poisoning attacks against AI agents.
- Abstract(参考訳): メモリはAIエージェントの中核的なコンポーネントであり、対話を通じて知識を蓄積し、パフォーマンスを向上させることができる。
しかし、永続記憶は、単一の敵対的メモリ書き込みがエージェントの行動に長期的影響を及ぼすという、メモリ中毒のリスクをもたらす。
本研究は, LLM系薬剤の記憶障害に関する系統的研究である。
モデル機能,システムプロンプト設計,エージェントシステムアーキテクチャにおいて,4つのメモリ書き込みチャネルと9つの構造的脆弱性を識別し,これらのチャネルを悪用する。
これらの脆弱性に基づいて、記憶障害の6つのクラスを分類する。
さらに、記憶障害攻撃を評価するためのベンチマークであるMPBenchを設計し、メモリをより積極的に書き、取り出すように設計されたエージェントがより有効であることを示す。
また、既存のプロンプトインジェクション防御は、メモリ中毒攻撃をカバーできないことも示している。
我々の発見は、AIエージェントに対するメモリ中毒攻撃の理解と緩和の基盤を提供する。
関連論文リスト
- Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction [3.809725488301918]
大規模言語モデル(LLM)エージェントは、永続的で自律的なタスク実行をサポートするために、長期記憶を活用する傾向にある。
既存のメモリ中毒攻撃は、インジェクトされたコンテンツが直接メモリに格納され、選択的な抽出と書き換えの段階を見渡せると仮定する。
メカニスティック分析は、攻撃が埋め込み空間の異方性を悪用し、注意パターンを変えることを示唆している。
論文 参考訳(メタデータ) (2026-05-28T14:02:00Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - Memory poisoning and secure multi-agent systems [5.987250983212102]
エージェントAIとマルチエージェントシステム(MAS)のメモリ中毒攻撃が最近注目を集めている。
まず,これらのメモリシステムにおけるメモリ障害攻撃の可能性について検討し,その軽減策を提案する。
本稿では,セマンティックメモリに対するメモリ中毒の緩和戦略の例として,プライベート知識検索に基づく局所推論を実装することを提案する。
論文 参考訳(メタデータ) (2026-03-20T14:27:46Z) - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks [55.145729491377374]
メモリを持つエージェントの既存の評価は、通常、単独で記憶と行動を評価する。
マルチセッションメモリ-エージェント環境ループにおけるエージェントメモリのベンチマークのための統合評価ジムであるMemoryArenaを紹介する。
MemoryArenaは、Webナビゲーション、優先制約付き計画、プログレッシブ情報検索、シーケンシャルなフォーマルな推論を含む評価をサポートする。
論文 参考訳(メタデータ) (2026-02-18T09:49:14Z) - Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections [57.64370755825839]
セルフ進化エージェントはセッション間で内部状態を更新する。
我々はこのリスクを調査し、Zombie Agentと呼ばれる永続的な攻撃を形式化する。
我々は,攻撃者が制御するWebコンテンツを通じて間接的露光のみを使用するブラックボックス攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-17T15:28:24Z) - AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents [69.39123054975218]
メモリは過去と未来の重要なネクサスブリッジとして機能する。
自律エージェントに関する最近の研究は、認知神経科学に基づいて効率的な記憶を設計することに集中している。
論文 参考訳(メタデータ) (2025-12-29T10:01:32Z) - Memory in the Age of AI Agents [217.9368190980982]
この研究は、現在のエージェントメモリ研究の最新の展望を提供することを目的としている。
我々は,エージェントメモリ,すなわちトークンレベル,パラメトリック,潜時メモリの3つの支配的実現を同定する。
実用的な開発を支援するため、メモリベンチマークとオープンソースフレームワークの包括的な概要をコンパイルする。
論文 参考訳(メタデータ) (2025-12-15T17:22:34Z) - MemGen: Weaving Generative Latent Memory for Self-Evolving Agents [57.1835920227202]
本稿では,エージェントに人間的な認知機能を持たせる動的生成記憶フレームワークであるMemGenを提案する。
MemGenは、エージェントが推論を通して潜在記憶をリコールし、増大させ、記憶と認知の密接なサイクルを生み出すことを可能にする。
論文 参考訳(メタデータ) (2025-09-29T12:33:13Z) - A Machine with Short-Term, Episodic, and Semantic Memory Systems [9.42475956340287]
明示的な人間の記憶システムの認知科学理論に触発されて、我々は短期的、エピソード的、セマンティックな記憶システムを持つエージェントをモデル化した。
実験により,人間のような記憶システムを持つエージェントは,このメモリ構造を環境に残さずにエージェントよりも優れた性能を発揮できることが示唆された。
論文 参考訳(メタデータ) (2022-12-05T08:34:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。