論文の概要: When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents
- arxiv url: http://arxiv.org/abs/2607.05189v1
- Date: Mon, 06 Jul 2026 15:08:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.20357
- Title: When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents
- Title(参考訳): 身近な人格エージェントに記憶を流し込む「Stealthy Memory Injection」
- Authors: Yechao Zhang, Shiqian Zhao, Jiawen Zhang, Jie Zhang, Gelei Deng, Xiaogeng Liu, Chaowei Xiao, Tianwei Zhang,
- Abstract要約: 我々は、リモートのブラックボックスが1つのメールペイロードを送信し、エージェントに有毒なメモリを誘導しなければならない、ステルスメモリインジェクションとして脅威を調査する。
我々は,ワンショットペイロード生成フレームワークであるMemGhostを提案する。
56のテストケースで、MemGhostはGPT-5.4でOpenClawで87.5%、Sonnet 4.6でClaude Code SDKで71.4%を達成している。
- 参考スコア(独自算出の注目度): 55.87577638514179
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Persistent personal agents combine long-term memory with access to users' external environments, enabling personalized foreground assistance and proactive background execution. This integration also creates a new path to compromise: untrusted external content can be silently written into persistent memory and later reused as trusted state. We study this threat as stealth memory injection, in which a remote black-box adversary delivers a single email payload that must induce the agent to write poisoned memory, stay hidden in the agent's response to the user, and affect future behavior. We introduce WhisperBench, a 108-case benchmark spanning five risk categories and both fact and preference poisoning. Built on a real IMAP/SMTP workflow and an authentic email agent skill, it enables full-cycle evaluation of stealth memory injection attacks. To enable this black-box attack under single-email delivery and without runtime feedback, we propose MemGhost, a one-shot payload generation framework. MemGhost uses an environment proxy to emulate persistent-agent execution and an objective proxy to convert memory adoption and conversational stealth into dense rubric-based rewards, then trains the attacker policy with supervised fine-tuning and reinforcement learning. Across 56 held-out test cases, MemGhost achieves 87.5% end-to-end success on OpenClaw with GPT-5.4 and 71.4% on Claude Code SDK with Sonnet 4.6. It also transfers across personal-agent architectures (NanoClaw and Hermes Agent) and memory backends (filesystem and vector-based Mem0), and remains effective against input-level, model-level, and system-level defenses. These results suggest that persistent memory can turn ordinary external processing into a practical pathway for long-term agent compromise.
- Abstract(参考訳): 永続的パーソナルエージェントは、長期記憶とユーザの外部環境へのアクセスを組み合わせることで、個人化された前景支援と積極的なバックグラウンド実行を可能にする。
信頼できない外部コンテンツは、静かに永続的なメモリに書き込むことができ、後に信頼された状態として再利用できる。
我々は、この脅威をステルスメモリインジェクションとして研究し、リモートブラックボックスの敵が単一の電子メールペイロードを配信し、エージェントに有害なメモリを書き込ませ、エージェントのユーザに対する反応に隠れ、将来の行動に影響を与える。
WhisperBenchは5つのリスクカテゴリ、事実と嗜好の両方にまたがる108ケースのベンチマークです。
実際のIMAP/SMTPワークフローと認証メールエージェントスキルに基づいて構築されており、ステルスメモリインジェクション攻撃の全サイクル評価を可能にする。
このブラックボックス攻撃を単一メール配信で実行時フィードバックなしで実現するため、単発ペイロード生成フレームワークであるMemGhostを提案する。
MemGhostは環境プロキシを使用して、永続的なエージェント実行をエミュレートし、客観的プロキシを使用して、メモリの採用と会話ステルスを密度の高いルーリックベースの報酬に変換し、監視された微調整と強化学習でアタッカーポリシーをトレーニングする。
56のテストケースで、MemGhostはGPT-5.4でOpenClawで87.5%、Sonnet 4.6でClaude Code SDKで71.4%を達成している。
また、パーソナルエージェントアーキテクチャ(NanoClawとHermes Agent)とメモリバックエンド(ファイルシステムとベクトルベースのMem0)をまたいで転送し、入力レベル、モデルレベル、システムレベルのディフェンスに対して有効である。
これらの結果から、永続記憶は、通常の外部処理を長期エージェントの妥協のための実践的な経路に転換する可能性が示唆された。
関連論文リスト
- Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens [65.53494487819053]
クローのようなAIエージェント(OpenClawなど)は、認証情報、ファイル、ツール、外部サービスへの永続的なアクセスを伴う、常にオンのプロセスである。
我々はClawのようなエージェントをエージェントコンピュータシステムとして扱い、そのゲートウェイランタイムがOSのような仲介の役割を担っている。
我々は、4つの攻撃面にわたる406の敵タスクのベンチマークであるSafeClawArenaを開発した。
論文 参考訳(メタデータ) (2026-06-29T18:00:45Z) - Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity? [54.701199583505144]
アプリケーション間アクセスは、ほとんど見落とされたプライバシーリスクを生み出す。
我々はAgentCIBenchを紹介します。これは、このリスクを決定論的に評価されたシナリオに変換する評価ハーネスです。
我々は15のフロンティアエージェントを評価し、驚くほど高い失敗率を見出す。
論文 参考訳(メタデータ) (2026-06-22T11:36:58Z) - MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents [74.64265314956441]
そこで我々は,グラフ構造化外部メモリにテキスト画像のコーディネートを施したブラックボックス攻撃フレームワークを提案する。
MemVenomは、GPT-5ファミリーのWebエージェントで最大99.15%に達する、良質なパフォーマンスに最小限の影響を伴って、強力なエンドツーエンド攻撃を成功させる。
論文 参考訳(メタデータ) (2026-06-09T11:53:25Z) - Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction [3.809725488301918]
大規模言語モデル(LLM)エージェントは、永続的で自律的なタスク実行をサポートするために、長期記憶を活用する傾向にある。
既存のメモリ中毒攻撃は、インジェクトされたコンテンツが直接メモリに格納され、選択的な抽出と書き換えの段階を見渡せると仮定する。
メカニスティック分析は、攻撃が埋め込み空間の異方性を悪用し、注意パターンを変えることを示唆している。
論文 参考訳(メタデータ) (2026-05-28T14:02:00Z) - Trojan Hippo: Weaponizing Agent Memory for Data Exfiltration [33.8989871605613]
トロイジャン・ヒッポ(Trojan Hippo)は、より現実的な脅威モデルで機能する永続メモリ攻撃のクラスである。
基本的なセキュリティ原則から着想を得た4つのメモリシステム防御を評価し,攻撃成功率を大幅に低下させることを確認した。
この相当なセキュリティとユーティリティのトレードオフのため、防衛の効果的な実世界の展開は、依然としてオープンな課題である。
論文 参考訳(メタデータ) (2026-05-03T17:07:20Z) - Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections [57.64370755825839]
セルフ進化エージェントはセッション間で内部状態を更新する。
我々はこのリスクを調査し、Zombie Agentと呼ばれる永続的な攻撃を形式化する。
我々は,攻撃者が制御するWebコンテンツを通じて間接的露光のみを使用するブラックボックス攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-17T15:28:24Z) - AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management [47.49917373646469]
既存の防御は肥大した記憶を与えられたまま扱い、回復力を維持することに集中する。
我々は、明示的なメモリ管理を通じて間接的なインジェクションを防御するフレームワークであるAgentSysを紹介する。
論文 参考訳(メタデータ) (2026-02-07T06:28:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。