論文の概要: Visual Memory Attacks Can Persist Through The KV Cache
- arxiv url: http://arxiv.org/abs/2610.09027v1
- Date: Tue, 06 Oct 2026 19:25:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.570653
- Title: Visual Memory Attacks Can Persist Through The KV Cache
- Title(参考訳): ビジュアルメモリ攻撃はKVキャッシュを通じてパーシスタンスできる
- Abstract要約: 攻撃は、後続のトークンのキー/値キャッシュを通じて持続するように訓練できることを示す。
仮想メモリインジェクション(VMI)アタック設定では、コンテキスト内に留まる敵画像が隠れたバックドアを植え付ける。
Qwen3-VL-8B-Instructでは、P-VMIはその最強構成で最大90%の目標達成を達成した。
- 参考スコア(独自算出の注目度): 27.010225018904077
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern language model systems operate autonomously over increasingly long contexts containing untrusted text and images. Can an adversarial input continue to steer a model even after that input is removed from its context? We show that attacks can be trained to persist through the key/value (KV) cache of subsequent tokens, allowing adversarial influence to outlive direct access to its source.We consider the Visual Memory Injection (VMI; Schlarmann and Hein, 2026) attack setting, in which an adversarial image that stays in the context plants a hidden backdoor: the model behaves normally until a chosen trigger elicits an attacker-chosen response. We first demonstrate persistence in this setting with optimized soft prompts, which remain effective after we mask the prompt from attention. We then introduce Persistent Visual Memory Injection (P-VMI), which optimizes images to preserve this adversarial behaviour after they are masked from attention. These attacks persist over conversations substantially longer than those used during optimization. On Qwen3-VL-8B-Instruct, P-VMI achieves up to approximately $90\%$ target success in its strongest configuration and remains effective under a stricter removal setting that exposes the image only on the first turn. A cache-swap ablation localizes the persistent influence to the KV cache. Finally, we show that these attacks can be trained to survive compaction that retains the KV cache of a summary generated by the same model, demonstrating that adversarial behaviour can persist in cached state without continued access to its source.
- Abstract(参考訳): 現代の言語モデルシステムは、信頼できないテキストや画像を含む、ますます長い文脈で自律的に機能する。
逆入力は、その入力がコンテキストから削除された後も、モデルを動かし続けることができるのか?
我々は、攻撃が後続のトークンのキー/値(KV)キャッシュを介して持続するように訓練できることを示し、そのソースへの直接アクセスに敵の影響が及ぼすことを示す。我々はVisual Memory Injection (VMI; Schlarmann and Hein, 2026) 攻撃設定を考える。
我々はまず,この設定における永続性を最適化されたソフトプロンプトで示し,注意からのプロンプトを隠蔽した後も有効であることを示す。
次にP-VMI(Persistent Visual Memory Injection)を紹介する。
これらの攻撃は、最適化時に使用されるものよりも会話よりもかなり長く持続する。
Qwen3-VL-8B-Instructでは、P-VMIは最強構成で最大90\%の目標達成を実現し、第1ターンにのみ画像を公開する厳格な削除設定の下では有効である。
キャッシュスワップアブレーションは、KVキャッシュへの永続的な影響をローカライズする。
最後に,これらの攻撃は,同一モデルが生成した要約のKVキャッシュを保持する圧縮を継続するためにトレーニング可能であることを示す。
関連論文リスト
- MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents [74.64265314956441]
そこで我々は,グラフ構造化外部メモリにテキスト画像のコーディネートを施したブラックボックス攻撃フレームワークを提案する。
MemVenomは、GPT-5ファミリーのWebエージェントで最大99.15%に達する、良質なパフォーマンスに最小限の影響を伴って、強力なエンドツーエンド攻撃を成功させる。
論文 参考訳(メタデータ) (2026-06-09T11:53:25Z) - Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction [3.809725488301918]
大規模言語モデル(LLM)エージェントは、永続的で自律的なタスク実行をサポートするために、長期記憶を活用する傾向にある。
既存のメモリ中毒攻撃は、インジェクトされたコンテンツが直接メモリに格納され、選択的な抽出と書き換えの段階を見渡せると仮定する。
メカニスティック分析は、攻撃が埋め込み空間の異方性を悪用し、注意パターンを変えることを示唆している。
論文 参考訳(メタデータ) (2026-05-28T14:02:00Z) - Test-Time Attention Purification for Backdoored Large Vision Language Models [23.890959327899925]
大規模視覚言語モデル(LVLM)におけるバックドア行動の新しい力学的理解を提供する。
テスト時に純粋に動作するトレーニングフリーのプラグアンドプレイディフェンスであるCleanSightを提案する。
CleanSightは、さまざまなデータセットとバックドアアタックタイプで、既存のピクセルベースの浄化防御を著しく上回る。
論文 参考訳(メタデータ) (2026-03-13T13:45:06Z) - Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections [57.64370755825839]
セルフ進化エージェントはセッション間で内部状態を更新する。
我々はこのリスクを調査し、Zombie Agentと呼ばれる永続的な攻撃を形式化する。
我々は,攻撃者が制御するWebコンテンツを通じて間接的露光のみを使用するブラックボックス攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-17T15:28:24Z) - The Illusion of Forgetting: Attack Unlearned Diffusion via Initial Latent Variable Optimization [51.835894707552946]
非学習型防衛は拡散モデル(DM)からNot-Safe-For-Work概念を浄化すると主張している
本研究では,未学習が言語記号と基礎知識のマッピングを部分的に破壊し,休眠記憶として残り続けることを示す。
IVOは、壊れたマッピングを再構築することで、これらの休眠記憶を再活性化する簡潔で強力な攻撃フレームワークである。
論文 参考訳(メタデータ) (2026-01-30T02:39:51Z) - Whose Narrative is it Anyway? A KV Cache Manipulation Attack [1.1011268090482578]
ヒストリースワッピング(History Swapping)は、KVキャッシュを操作して、ユーザ側のプロンプトを変更することなくモデル生成を操る、新しいブロックレベルの攻撃である。
この研究は、KVキャッシュが、文脈だけでなくトピックの軌跡や構造的計画もエンコードしているため、セキュリティ分析の重要なベクタであることを示している。
論文 参考訳(メタデータ) (2025-11-16T19:38:28Z) - Poison Once, Control Anywhere: Clean-Text Visual Backdoors in VLM-based Mobile Agents [54.35629963816521]
この研究は、VLMベースのモバイルエージェントをターゲットにした最初のクリーンテキストバックドアアタックであるVIBMAを紹介する。
この攻撃は、視覚的な入力だけを変更することによって、悪意ある振る舞いをモデルに注入する。
クリーンタスクの動作を保ちながら高い成功率を達成できることを示す。
論文 参考訳(メタデータ) (2025-06-16T08:09:32Z) - Backdoor Attack on Vision Language Models with Stealthy Semantic Manipulation [32.24294112337828]
BadSemは、トレーニング中に画像とテキストのペアを意図的に間違えることでバックドアを注入するデータ中毒攻撃だ。
実験の結果,BadSemは平均的ASRの98%以上を達成し,アウト・オブ・ディストリビューション・データセットに最適化し,有害なモダリティをまたいで転送可能であることがわかった。
我々の発見は、より安全なデプロイメントのためにビジョン言語モデルにおけるセマンティックな脆弱性に対処する緊急の必要性を浮き彫りにしている。
論文 参考訳(メタデータ) (2025-06-08T16:40:40Z) - Robustifying Vision-Language Models via Dynamic Token Reweighting [28.675118345987887]
大きな視覚言語モデル(VLM)は、ジェイルブレイク攻撃に対して非常に脆弱である。
マルチモーダル・ジェイルブレイク攻撃を緩和する新しい推論時防御法を提案する。
視覚的モダリティによって誘導される安全関連分布シフトの新しい定式化を導入する。
論文 参考訳(メタデータ) (2025-05-22T03:00:39Z) - BadCLIP: Dual-Embedding Guided Backdoor Attack on Multimodal Contrastive
Learning [85.2564206440109]
本報告では,防衛後においてもバックドア攻撃が有効であり続けるという現実的なシナリオにおける脅威を明らかにする。
バックドア検出や細調整防御のモデル化に抵抗性のあるemphtoolnsアタックを導入する。
論文 参考訳(メタデータ) (2023-11-20T02:21:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。