論文の概要: Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses
- arxiv url: http://arxiv.org/abs/2607.05029v1
- Date: Mon, 06 Jul 2026 13:10:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.157156
- Title: Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses
- Title(参考訳): LLMエージェントの記憶と防衛に反する攻撃を防げる
- Abstract要約: FARMA(Forged Amplifying Rationale Memory Attack)について紹介する。
FARMAは、エージェントの実際の知識よりも、エージェントの記憶された推論を毒する。
SENTINELは,鍛造推論エントリを検出するための層状防衛パイプラインである。
- 参考スコア(独自算出の注目度): 5.887807565440711
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Persistent memory has enabled large language model (LLM) agents to store factual knowledge, prior decisions, reasoning histories, tool usage information, and context. While this has improved the agent's functionality and continuity across tasks, it has also introduced a new attack surface: the agent's own reasoning history. In this paper, we introduce the Forged Amplifying Rationale Memory Attack (FARMA), which poisons an agent's remembered reasoning rather than its factual knowledge. It inserts forged reasoning traces using evasive language that bypasses keyword-based defenses, then amplifies them through self-referential reinforcement that defeats consensus-based defenses. To address FARMA, we introduce SENTINEL, a layered defense pipeline to detect forged reasoning entries. Its central component is the Reasoning Guard that structurally analyzes candidate entries for forgery using five weighted signals. We evaluate FARMA and SENTINEL across multiple agents and different LLM models with 50 trials and show that FARMA achieves an attack success rate of up to 100% under baseline conditions and is capable of defeating defense mechanisms like keyword filter and A-MemGuard. Our evaluation also shows that SENTINEL reduces FARMA's attack success rate to as low as 0% with no false positives observed across 326 benign agent traces. Our work demonstrates the need to protect not only an agent's retrieved content but also the integrity of its reasoning history.
- Abstract(参考訳): 永続メモリは、事実知識、事前決定、推論履歴、ツール使用情報、コンテキストを格納する大きな言語モデル(LLM)エージェントを可能にした。
これにより、エージェントの機能とタスク間の連続性が改善される一方で、エージェント自身の推論履歴という新たな攻撃面も導入された。
本稿では, エージェントの記憶的推論に悪影響を及ぼす, FARMA (Forged Amplifying Rationale Memory Attack) を提案する。
キーワードベースの防御をバイパスする回避言語を使用して偽の推論トレースを挿入し、コンセンサスベースの防御を破る自己参照強化を通じてそれらを増幅する。
FARMAに対処するために,我々は,鍛造推論エントリを検出するレイヤ化されたディフェンスパイプラインであるSENTINELを紹介した。
中心となる構成要素は5つの重み付け信号を用いて偽造候補のエントリを構造解析する推論ガードである。
我々は、FARMAとSENTINELを複数のエージェントおよび異なるLLMモデルで50の試験で評価し、FARMAがベースライン条件下での攻撃成功率を最大100%達成し、キーワードフィルタやA-MemGuardのような防御機構を破ることができることを示す。
また, SENTINELはFARMAの攻撃成功率を0%まで低下させ, 326個の良性薬剤の痕跡に偽陽性は認められなかった。
我々の研究は、エージェントが検索したコンテンツだけでなく、その推論履歴の完全性も保護する必要があることを示している。
関連論文リスト
- Proof-of-Execution Memory: Defending LLM Agents Against Forged-Reasoning Attacks by Verifying What Actually Happened [2.45357121165634]
本稿では,言語モデルに対して,最初の試みでSENTINELを回避しようとする自動攻撃者について述べる。
メモリを全く検査しないPEM(Proof-of-Execution Memory)を提案する。
論文 参考訳(メタデータ) (2026-08-17T02:54:04Z) - Salience Induction against Multi-Hop RAG Agents: Threat and Defense [13.060227960421171]
検索トレースをセマンティックに残しながらマルチホップバインディングをリダイレクトする真理保存編集として,サリエンス誘導を形式化する。
30%の編集予算の下で、サリエンス誘導は83.3%の攻撃成功率を達成した。
我々の軽量な入力側防御であるSalience Normalizationは、標準的な攻撃で15.3%、適応攻撃で23.6%に攻撃成功を減少させる。
論文 参考訳(メタデータ) (2026-07-20T04:27:50Z) - When Embedding-Based Defenses Fail: Rethinking Safety in LLM-Based Multi-Agent Systems [18.461135869777316]
大規模言語モデル (LLM) を利用したマルチエージェントシステム (MAS) により、エージェントは情報通信と共有が可能となり、複雑なタスクにおいて高いパフォーマンスを達成できる。
既存の埋め込みベースの防御は、疑わしいエージェントを検出してプルークすることを目的としているが、その効果は悪意のあるメッセージと良心的なメッセージの埋め込みを明確に分離することに依存する。
我々は,この障害モードを理論的に解析し,Slow Drift, Benign Wrapper, Chaos Seedingの3つの攻撃を経験的に検証する。
論文 参考訳(メタデータ) (2026-05-01T22:15:11Z) - Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections [57.64370755825839]
セルフ進化エージェントはセッション間で内部状態を更新する。
我々はこのリスクを調査し、Zombie Agentと呼ばれる永続的な攻撃を形式化する。
我々は,攻撃者が制御するWebコンテンツを通じて間接的露光のみを使用するブラックボックス攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-17T15:28:24Z) - CausalArmor: Efficient Indirect Prompt Injection Guardrails via Causal Attribution [49.689452243966315]
ツールコール機能を備えたAIエージェントは、IPI(Indirect Prompt Injection)攻撃の影響を受けやすい。
本稿では,選択防衛フレームワークCausalArmorを提案する。
AgentDojoとDoomArenaの実験は、CausalArmorが攻撃的な防御のセキュリティと一致することを示した。
論文 参考訳(メタデータ) (2026-02-08T11:34:08Z) - MemoryGraft: Persistent Compromise of LLM Agents via Poisoned Experience Retrieval [5.734678752740074]
MemoryGraftは、エージェントの動作を即時ジェイルブレイクではなく、エージェントの長期記憶に悪質な成功体験を埋め込むことによって妥協する、新しい間接的インジェクション攻撃である。
エージェントが実行中に読み取る良質な摂取レベルのアーティファクトを供給できる攻撃者は、それを誘導して有毒なRAGストアを構築することができることを示す。
エージェントが後に意味論的に類似したタスクに遭遇すると、語彙テンプレート上の結合検索と埋め込み類似性は、これらのグラフトされた記憶を確実に表面化し、エージェントは埋め込みされた安全でないパターンを採用し、セッション間の永続的な行動的ドリフトをもたらす。
論文 参考訳(メタデータ) (2025-12-18T08:34:40Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - MELON: Provable Defense Against Indirect Prompt Injection Attacks in AI Agents [60.30753230776882]
LLMエージェントは間接的プロンプトインジェクション(IPI)攻撃に対して脆弱であり、ツール検索情報に埋め込まれた悪意のあるタスクはエージェントをリダイレクトして不正なアクションを取ることができる。
マスク機能によって修正されたマスク付きユーザでエージェントの軌道を再実行することで攻撃を検知する新しいIPIディフェンスであるMELONを提案する。
論文 参考訳(メタデータ) (2025-02-07T18:57:49Z) - AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases [73.04652687616286]
本稿では,RAG とRAG をベースとした LLM エージェントを標的とした最初のバックドア攻撃である AgentPoison を提案する。
従来のバックドア攻撃とは異なり、AgentPoisonは追加のモデルトレーニングや微調整を必要としない。
エージェントごとに、AgentPoisonは平均攻撃成功率を80%以上達成し、良質なパフォーマンスに最小限の影響を与える。
論文 参考訳(メタデータ) (2024-07-17T17:59:47Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。