論文の概要: Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems
- arxiv url: http://arxiv.org/abs/2607.14611v1
- Date: Thu, 16 Jul 2026 06:13:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.010521
- Title: Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems
- Title(参考訳): バッドメモリ:エージェントシステムにおけるメモリからのプロンプト注入リスクの評価
- Abstract要約: サンドボックス合成作業空間を用いたメモリベースエージェントシステムにおけるインジェクションインジェクション攻撃について検討した。
その結果、エージェントが信頼できない外部コンテンツを使って自分自身のメモリファイルを上書きすることは難しいが、これらのファイルにすでに組み込まれているペイロードは、現在のセッションと将来のセッションをうまく攻撃できることがわかった。
- 参考スコア(独自算出の注目度): 11.238342775567856
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A growing class of agentic systems maintain persistent state across sessions through memory files, behavioral preferences, and knowledge bases. While this makes agents more useful and self-improving, it also creates a new attack surface for prompt injections in which malicious instructions can be embedded within persistent files and influence future behavior. In this work, we study prompt injection attacks in memory-based agentic systems using a sandboxed synthetic workspace. We evaluate two agentic systems, Anthropic Claude Code and OpenAI Codex, across four models: Claude Haiku 4.5, Claude Opus 4.7, GPT-5.2, and GPT-5.5. Our results show that although it is difficult to make an agent overwrite its own memory files using untrusted external content, payloads already planted in those files can successfully attack current and future sessions. Attack success and payload persistence vary substantially across systems, models, adversarial goals, and multi-session attack sequences. These findings show that persistent memory changes the threat model for prompt injection and motivate defenses that protect memory updates without removing useful agent adaptation.
- Abstract(参考訳): エージェントシステムの成長するクラスは、メモリファイル、行動選好、知識ベースを通じてセッション間の永続的な状態を維持する。
これにより、エージェントはより有用で自己改善されるが、悪意のある命令を永続ファイルに埋め込んだり、将来の振る舞いに影響を与えるような、インジェクションのプロンプトのための新たなアタックサーフェスも生成する。
本研究では,サンドボックス型合成作業空間を用いたメモリベースエージェントシステムにおけるインジェクション攻撃について検討する。
我々は,2つのエージェントシステム,Arthropic Claude CodeとOpenAI Codexを,Claude Haiku 4.5,Claude Opus 4.7,GPT-5.2,GPT-5.5の4つのモデルで評価した。
その結果、エージェントが信頼できない外部コンテンツを使って自分自身のメモリファイルを上書きすることは難しいが、これらのファイルにすでに組み込まれているペイロードは、現在のセッションと将来のセッションをうまく攻撃できることを示した。
攻撃の成功とペイロードの持続性は、システム、モデル、敵目標、マルチセッション攻撃シーケンスによって大きく異なる。
これらの結果から, 永続記憶は, エージェント適応をなくすことなく, メモリ更新を保護し, 防御を促進・動機づけするための脅威モデルを変えることが示唆された。
関連論文リスト
- When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents [55.87577638514179]
我々は、リモートのブラックボックスが1つのメールペイロードを送信し、エージェントに有毒なメモリを誘導しなければならない、ステルスメモリインジェクションとして脅威を調査する。
我々は,ワンショットペイロード生成フレームワークであるMemGhostを提案する。
56のテストケースで、MemGhostはGPT-5.4でOpenClawで87.5%、Sonnet 4.6でClaude Code SDKで71.4%を達成している。
論文 参考訳(メタデータ) (2026-07-06T15:08:58Z) - Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens [65.53494487819053]
クローのようなAIエージェント(OpenClawなど)は、認証情報、ファイル、ツール、外部サービスへの永続的なアクセスを伴う、常にオンのプロセスである。
我々はClawのようなエージェントをエージェントコンピュータシステムとして扱い、そのゲートウェイランタイムがOSのような仲介の役割を担っている。
我々は、4つの攻撃面にわたる406の敵タスクのベンチマークであるSafeClawArenaを開発した。
論文 参考訳(メタデータ) (2026-06-29T18:00:45Z) - MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents [74.64265314956441]
そこで我々は,グラフ構造化外部メモリにテキスト画像のコーディネートを施したブラックボックス攻撃フレームワークを提案する。
MemVenomは、GPT-5ファミリーのWebエージェントで最大99.15%に達する、良質なパフォーマンスに最小限の影響を伴って、強力なエンドツーエンド攻撃を成功させる。
論文 参考訳(メタデータ) (2026-06-09T11:53:25Z) - Trojan Hippo: Weaponizing Agent Memory for Data Exfiltration [33.8989871605613]
トロイジャン・ヒッポ(Trojan Hippo)は、より現実的な脅威モデルで機能する永続メモリ攻撃のクラスである。
基本的なセキュリティ原則から着想を得た4つのメモリシステム防御を評価し,攻撃成功率を大幅に低下させることを確認した。
この相当なセキュリティとユーティリティのトレードオフのため、防衛の効果的な実世界の展開は、依然としてオープンな課題である。
論文 参考訳(メタデータ) (2026-05-03T17:07:20Z) - Poison Once, Exploit Forever: Environment-Injected Memory Poisoning Attacks on Web Agents [25.24487522342174]
メモリはLLMベースのWebエージェントをパーソナライズし、強力で、利用しやすいものにする。
環境注入型トラジェクトリベースエージェントメモリポジショニング(eTAMP)について紹介する。
eTAMPは、直接メモリアクセスを必要とせずにクロスセッション、クロスサイト妥協を実現する最初の攻撃である。
論文 参考訳(メタデータ) (2026-04-03T01:25:12Z) - Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections [57.64370755825839]
セルフ進化エージェントはセッション間で内部状態を更新する。
我々はこのリスクを調査し、Zombie Agentと呼ばれる永続的な攻撃を形式化する。
我々は,攻撃者が制御するWebコンテンツを通じて間接的露光のみを使用するブラックボックス攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-17T15:28:24Z) - AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management [47.49917373646469]
既存の防御は肥大した記憶を与えられたまま扱い、回復力を維持することに集中する。
我々は、明示的なメモリ管理を通じて間接的なインジェクションを防御するフレームワークであるAgentSysを紹介する。
論文 参考訳(メタデータ) (2026-02-07T06:28:51Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。