論文の概要: FragFuse: Bypassing Access Control of Large Language Model Agents via Memory-Based Query Fragmentation and Fusion
- arxiv url: http://arxiv.org/abs/2606.15609v1
- Date: Sun, 14 Jun 2026 05:31:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:33.751117
- Title: FragFuse: Bypassing Access Control of Large Language Model Agents via Memory-Based Query Fragmentation and Fusion
- Title(参考訳): FragFuse: メモリベースのクエリフラグメンテーションと融合による大規模言語モデルエージェントのアクセス制御の回避
- Authors: Zixin Rao, Wentian Zhu, Chan Aristella Lu, Zhaorun Chen, Wei Niu, Le Guan, Bo Li, Zhen Xiang,
- Abstract要約: 大規模言語モデル(LLM)エージェントは、複雑なタスク実行をサポートするために長期記憶に依存している。
FragFuseは、非特権のユーザがエージェントアクセス制御をバイパスできる最初の攻撃である。
FragFuseは平均バイパス成功率86.3%、終末有害タスク成功率41.1%を全設定で達成している。
- 参考スコア(独自算出の注目度): 21.904216364303267
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents increasingly rely on long-term memory to support complex task execution, user personalization, and domain adaptation. Meanwhile, emerging access-control mechanisms for LLM agents are being explored to block policy-violating requests and prevent misuse. We reveal a novel attack surface arising from agent memory operations: prohibited content that would trigger access control can be fragmented across interactions, stored in long-term memory in benign-appearing form, and later reconstructed through memory retrieval without appearing explicitly in the final user query. We propose FragFuse, the first attack that enables unprivileged users to bypass agent access control by exploiting this temporal channel introduced by long-term memory. FragFuse operates in three stages: (1) identifying rejection-responsive fragments via black-box adaptive querying with fragment masking; (2) injecting these fragments into memory using marker carrier queries; and (3) retrieving and fusing the stored fragments through a follow-up attack query. Although FragFuse can be instantiated manually for individual agents, we further develop a surrogate-based optimization scheme that tunes fusion instructions and marker designs, enabling automated attack generation without violating the attacker's threat-model assumptions. We evaluate FragFuse across four representative agent settings and task domains, covering three state-of-the-art agent access-control mechanisms. FragFuse achieves an average bypass success rate of 86.3% and an average end-to-end harmful task success rate of 41.1% across all settings, with only 4.4% average task-success degradation compared with configurations without access control. We also show that alternative defenses, including state-of-the-art prompt-injection detectors and perplexity detectors, do not effectively address this attack.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、複雑なタスクの実行、ユーザパーソナライゼーション、ドメイン適応をサポートするために、長期記憶に依存している。
LLMエージェントのアクセス制御機構は、ポリシー違反の要求をブロックし、誤用を防止するために検討されている。
我々は,エージェントメモリ操作による新たな攻撃面を明らかにした。アクセス制御をトリガーする禁止コンテンツは,インタラクション間で断片化され,良質な出現形態で長期記憶に格納され,その後,最終ユーザクエリに明示的に表示されずにメモリ検索によって再構築される。
本稿では,FragFuseを提案する。FragFuseは,長期記憶によって導入されたこの時間チャネルを活用することで,非特権ユーザによるエージェントアクセス制御を回避できる最初の攻撃である。
FragFuseは、(1)ブラックボックス適応型クエリとフラグメントマスキングによる拒絶応答性フラグメントの識別、(2)マーカーキャリアクエリを使用してメモリにこれらのフラグメントを注入すること、(3)フォローアップアタッククエリを通じて保存されたフラグメントの検索と再利用である。
FragFuseは個々のエージェントに対して手動でインスタンス化できるが、我々はさらに、融合命令やマーカー設計を調整し、攻撃者の脅威モデル仮定に違反することなく自動攻撃生成を可能にするサロゲートベースの最適化スキームを開発する。
我々はFragFuseを4つの代表エージェント設定とタスクドメインで評価し、3つの最先端エージェントアクセス制御機構を網羅した。
FragFuseは平均バイパス成功率86.3%、終末有害タスク成功率41.1%、アクセス制御のない構成に比べて4.4%しか劣化しない。
また、最先端のプロンプトインジェクション検出器やパープレキシティ検出器を含む代替防御が、この攻撃に効果的に対応していないことも示している。
関連論文リスト
- MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents [74.64265314956441]
そこで我々は,グラフ構造化外部メモリにテキスト画像のコーディネートを施したブラックボックス攻撃フレームワークを提案する。
MemVenomは、GPT-5ファミリーのWebエージェントで最大99.15%に達する、良質なパフォーマンスに最小限の影響を伴って、強力なエンドツーエンド攻撃を成功させる。
論文 参考訳(メタデータ) (2026-06-09T11:53:25Z) - Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction [3.809725488301918]
大規模言語モデル(LLM)エージェントは、永続的で自律的なタスク実行をサポートするために、長期記憶を活用する傾向にある。
既存のメモリ中毒攻撃は、インジェクトされたコンテンツが直接メモリに格納され、選択的な抽出と書き換えの段階を見渡せると仮定する。
メカニスティック分析は、攻撃が埋め込み空間の異方性を悪用し、注意パターンを変えることを示唆している。
論文 参考訳(メタデータ) (2026-05-28T14:02:00Z) - MemMorph: Tool Hijacking in LLM Agents via Memory Poisoning [33.50057841368287]
LLMエージェントは、ユーザのタスクを完了させるために外部ツールを選択することができる。
本稿では,エージェントの長期記憶を害してバイアスツールの選択を行う最初の攻撃であるMemMorphを提案する。
論文 参考訳(メタデータ) (2026-05-24T04:26:13Z) - AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification [25.817251923574286]
大規模言語モデル(LLM)エージェントのための新しい推論時間検出・緩和フレームワークを提案する。
AgentSentryは、時間的因果的テイクオーバーとしてマルチターンIPIをモデル化する最初の推論時防御である。
我々は, textscAgentDojo ベンチマークにおいて, 4つのタスクスイート, 3つの IPI 攻撃ファミリー, 複数のブラックボックス LLM に対する AgentSentry の評価を行った。
論文 参考訳(メタデータ) (2026-02-26T07:59:10Z) - Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections [57.64370755825839]
セルフ進化エージェントはセッション間で内部状態を更新する。
我々はこのリスクを調査し、Zombie Agentと呼ばれる永続的な攻撃を形式化する。
我々は,攻撃者が制御するWebコンテンツを通じて間接的露光のみを使用するブラックボックス攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-17T15:28:24Z) - AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management [47.49917373646469]
既存の防御は肥大した記憶を与えられたまま扱い、回復力を維持することに集中する。
我々は、明示的なメモリ管理を通じて間接的なインジェクションを防御するフレームワークであるAgentSysを紹介する。
論文 参考訳(メタデータ) (2026-02-07T06:28:51Z) - BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents [58.83028403414688]
大規模言語モデル(LLM)エージェントは、計画、メモリ、ツールの使用を組み合わせた多段階ワークフローを通じてタスクを実行する。
エージェントワークフローの特定のステージに注入されたバックドアトリガーは、複数の中間状態を通して持続し、下流出力に悪影響を及ぼす可能性がある。
LLMエージェントにおけるバックドア脅威を統一したエージェント中心のビューを提供するモジュールおよびステージアウェアフレームワークである textbfBackdoorAgent を提案する。
論文 参考訳(メタデータ) (2026-01-08T03:49:39Z) - Memory Injection Attacks on LLM Agents via Query-Only Interaction [49.14715983268449]
我々は,攻撃者がエージェントのメモリバンクを直接変更できると仮定することなく,新たなメモリインジェクション攻撃(MINJA)を提案する。
攻撃者は、クエリと出力観察を通してエージェントとのみ対話することで、悪意のあるレコードをメモリバンクに注入する。
MINJAは、任意のユーザがエージェントメモリに影響を与え、リスクを強調します。
論文 参考訳(メタデータ) (2025-03-05T17:53:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。