論文の概要: Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents
- arxiv url: http://arxiv.org/abs/2607.15657v1
- Date: Fri, 17 Jul 2026 06:05:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.757461
- Title: Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents
- Title(参考訳): エージェントは偽の記憶を夢見るか? マルチモーダルAIエージェントの長期記憶に対するブラックボックス・ビジュアルアタック
- Abstract要約: 視覚データに対する無条件の信頼が重大な脆弱性を生み出すことを示す。
我々は,マルチモーダルメモリパイプラインを妥協するブラックボックス対逆フレームワークであるLucidを提案する。
Lucidは、歴史的コンテキストの可用性に基づいた2つの障害モードを可能にするために、知覚不可能な摂動を実現する。
- 参考スコア(独自算出の注目度): 10.17267846044351
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal AI agents increasingly rely on persistent long-term memory to ground generation in past visual and textual episodes. We show that unconditional trust in visual data creates a critical vulnerability. We propose Lucid, a black-box adversarial framework that compromises multimodal memory pipelines under a strictly image-bounded threat model, requiring no access to the target MLLM, target retrieval encoder, or the text channel. Lucid crafts imperceptible perturbations to enable two distinct failure modes based on the availability of historical context: (1) Memory poisoning, an in-context attack where the adversarial image replaces a benign one whose content is reinforced by prior textual context, reliably corrupting visual recall and steering the agent toward attacker-chosen narratives; (2) Memory injection, an out-of-context attack where the adversarial image replaces a benign one in a conversation turn devoid of prior textual grounding, causing the agent to generate attacker-influenced responses with no corrective signal from memory. We evaluate Lucid across various conversation domains and five black-box memory architectures, including graph-structured, LLM-summarized, and commercially deployed systems. Lucid achieves 61.6% ASR on poisoning and 58.4% ASR on injection, exposing a structural vulnerability in multimodal memory pipelines.
- Abstract(参考訳): マルチモーダルAIエージェントは、過去の視覚的およびテキスト的エピソードにおいて、永続的な長期記憶から地上生成にますます依存している。
視覚データに対する無条件の信頼が重大な脆弱性を生み出すことを示す。
我々は、ターゲットMLLM、ターゲット検索エンコーダ、テキストチャネルへのアクセスを必要とせず、厳密な画像境界付き脅威モデルの下でマルチモーダルメモリパイプラインを妥協するブラックボックス対向フレームワークであるLucidを提案する。
ルシッド・クラフト(Lucid craft)は、歴史的文脈の可用性に基づいて、2つの異なる障害モードを有効にするために、(1) メモリ中毒(Memory poisoning)、(1) 相手画像が前文の文脈で強化された良性のある良性なものを置き換えるインコンテクスト攻撃(Memory poisoning)、(2) 相手画像が前文の接地を欠いた会話において良性のあるものを置き換えるメモリインジェクション(Memory Injection)、(2) 相手画像が前文の接地を欠く会話において、良性のあるものを置き換えることで、メモリからの正統的なシグナルを発生させる。
我々は、様々な会話領域と5つのブラックボックスメモリアーキテクチャ(グラフ構造化、LCM要約、商用展開システムなど)でLucidを評価した。
Lucidは61.6%のASR、58.4%のASRを注射で達成し、マルチモーダルメモリパイプラインの構造上の脆弱性を露呈している。
関連論文リスト
- MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents [74.64265314956441]
そこで我々は,グラフ構造化外部メモリにテキスト画像のコーディネートを施したブラックボックス攻撃フレームワークを提案する。
MemVenomは、GPT-5ファミリーのWebエージェントで最大99.15%に達する、良質なパフォーマンスに最小限の影響を伴って、強力なエンドツーエンド攻撃を成功させる。
論文 参考訳(メタデータ) (2026-06-09T11:53:25Z) - Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction [3.809725488301918]
大規模言語モデル(LLM)エージェントは、永続的で自律的なタスク実行をサポートするために、長期記憶を活用する傾向にある。
既存のメモリ中毒攻撃は、インジェクトされたコンテンツが直接メモリに格納され、選択的な抽出と書き換えの段階を見渡せると仮定する。
メカニスティック分析は、攻撃が埋め込み空間の異方性を悪用し、注意パターンを変えることを示唆している。
論文 参考訳(メタデータ) (2026-05-28T14:02:00Z) - MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models [50.25006399944962]
メモリは、長いマルチモーダル相互作用を扱うために、大きな視覚言語モデルにとって不可欠である。
MEMLENSはマルチモーダルマルチセッション会話におけるメモリのベンチマークである。
我々は27個のLVLMと7個のメモリ増強剤を評価した。
論文 参考訳(メタデータ) (2026-05-14T14:41:17Z) - Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs [19.511422290404138]
マルチモーダル・ジェイルブレイク戦略は 視覚データに固有の 複雑な意味構造に 関与できない
textbfMemJackは、視覚的セマンティクスを明示的に活用して自動ジェイルブレイク攻撃を組織化するフレームワークである。
MemJackはQwen3-VL-Plusに対して71.48%のASRを達成した。
論文 参考訳(メタデータ) (2026-04-14T11:44:59Z) - From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents [78.30630000529133]
本稿ではファジィトレース理論に基づくピラミッド型マルチモーダルメモリアーキテクチャMM-Memを提案する。
MM-Memメモリは階層的に感覚バッファ、エピソードストリーム、シンボリックに構造する。
実験により、MM-Memがオフラインタスクとストリーミングタスクの両方で有効であることが確認された。
論文 参考訳(メタデータ) (2026-03-02T05:12:45Z) - Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections [57.64370755825839]
セルフ進化エージェントはセッション間で内部状態を更新する。
我々はこのリスクを調査し、Zombie Agentと呼ばれる永続的な攻撃を形式化する。
我々は,攻撃者が制御するWebコンテンツを通じて間接的露光のみを使用するブラックボックス攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-17T15:28:24Z) - Agentic Learner with Grow-and-Refine Multimodal Semantic Memory [50.81667005063605]
ViLoMemは、コンパクトなスキーマベースのメモリを構築するデュアルストリームメモリフレームワークである。
視覚的障害パターンと論理的推論エラーを符号化し、MLLMが成功し失敗した経験から学ぶことを可能にする。
論文 参考訳(メタデータ) (2025-11-26T18:55:08Z) - Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt [60.54666043358946]
本稿では,テキストと視覚のプロンプトを協調的に最適化することにより,ジェイルブレイクを実行するバイモーダル・アドバイサル・プロンプト・アタック(BAP)を提案する。
特に,大規模言語モデルを用いてジェイルブレイクの失敗を分析し,テキストのプロンプトを洗練させるために連鎖推論を採用する。
論文 参考訳(メタデータ) (2024-06-06T13:00:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。