論文の概要: Proof-of-Execution Memory: Defending LLM Agents Against Forged-Reasoning Attacks by Verifying What Actually Happened
- arxiv url: http://arxiv.org/abs/2608.16032v1
- Date: Mon, 17 Aug 2026 02:54:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.509199
- Title: Proof-of-Execution Memory: Defending LLM Agents Against Forged-Reasoning Attacks by Verifying What Actually Happened
- Title(参考訳): 実行時記憶:実際に発生したことを検証して、偽推論攻撃に対するLLMエージェントの防御
- Authors: Md Habibur Rahman, Jaeho Kim,
- Abstract要約: 本稿では,言語モデルに対して,最初の試みでSENTINELを回避しようとする自動攻撃者について述べる。
メモリを全く検査しないPEM(Proof-of-Execution Memory)を提案する。
- 参考スコア(独自算出の注目度): 2.45357121165634
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents are stateless and rely on external memory to carry context between steps. Because agents treat that memory as trustworthy, an adversary who can write to it can steer their behavior. The FARMA attack does this with no malicious command: it inserts fabricated entries into the agent's reasoning memory claiming a required safety step is already done, so the agent skips it. SENTINEL, the defense proposed with FARMA, scores entries against a fixed list of suspicious wordings; its authors note that an attacker who knows the list can reword the forgery and evade it, and leave this open. We show the gap is worse than stated. An automated attacker that simply asks a language model to reword the forgery evades SENTINEL on its first try, reducing its protection to zero on every model tested. We also find a capability paradox: the attack succeeds far more often on stronger models (98-100% on GPT-4o and GPT-4o-mini) than on Llama-3.1-8B (44%), because more capable agents follow reworded claims more faithfully, so the threat grows with capability. We propose Proof-of-Execution Memory (PoEM), which does not inspect memory at all. PoEM keeps a separate, tamper-evident, HMAC-chained ledger of the safety steps that actually executed, writable only by the trusted action layer, and allows a skip only if the ledger confirms real execution. An attacker can change what memory says but cannot forge a ledger entry for a step that never ran, so rewording no longer helps. Across three models and three scenarios, PoEM drives attack success to 0% while leaving legitimate operation intact (0% false positives in eight of nine cells, 1.7% in the ninth, within sampling noise), whereas SENTINEL wrongly blocks 33-50% of legitimate operations. PoEM also withstands attacks aimed at itself, adds microseconds of overhead, and works unchanged in a real LangChain agent. PoEM protects exactly the decisions it gates.
- Abstract(参考訳): LLMエージェントはステートレスであり、ステップ間のコンテキストを保持するために外部メモリに依存している。
エージェントは、その記憶を信頼できるものとして扱うので、それを書ける敵は、自分の行動をコントロールできる。
FARMA攻撃は悪意のあるコマンドなしでこれを行う: エージェントの推論メモリに作成済みのエントリを挿入し、必要な安全ステップがすでに完了していると主張するため、エージェントはそれをスキップする。
FARMAで提案されたディフェンスであるSENTINELは、不審な単語の固定されたリストに対してエントリをスコアする。
私たちは、そのギャップが以前述べたよりも悪いことを示しています。
自動攻撃者は、単に言語モデルに対して、最初の試行でSENTINELを回避し、テストされたすべてのモデルにおいてその保護をゼロにすることを要求する。
また、この攻撃はLlama-3.1-8B(44%)よりも強力なモデル(GPT-4oとGPT-4o-miniでは98-100%)よりもはるかに頻繁に成功している。
メモリを全く検査しないPEM(Proof-of-Execution Memory)を提案する。
PoEMは、実際に実行される安全ステップの分離された、改ざんされたHMACチェーンの台帳を保持し、信頼されたアクション層によってのみ記述可能であり、台帳が実際の実行を確認する場合にのみスキップを許可する。
攻撃者はメモリを変更できるが、実行されないステップのために台帳のエントリを偽造することはできないため、リワードはもはや役に立たない。
3つのモデルと3つのシナリオで、PoEMは正常な操作を継続しながら0%に攻撃し(9つのセルのうち8つで0%が偽陽性、9つで1.7%がサンプリングノイズ)、SENTINELは33-50%の正常な操作を誤ってブロックする。
PoEMはそれ自体がターゲットとする攻撃にも耐えられ、オーバーヘッドのマイクロ秒を追加し、実際のLangChainエージェントでは動作しない。
PoEMは、それがゲートする決定を正確に保護する。
関連論文リスト
- MAPLE-Guard: Memory-Aware Link Enforcement Against Memory-Link Poisoning in Multi-Agent Systems [38.58713997316864]
MAPLE-Guardはメモリ対応マルチエージェントシステムのためのメモリリンクガードである。
メモリライフサイクルを監視し、書き込み、検索、プロモーション、エージェント間の再利用でゲートを配置する。
その結果,メモリ・アウェア・リンクの実施は,プロンプトレベルとトポロジレベルの防御によって残されたギャップをカバーすることが示唆された。
論文 参考訳(メタデータ) (2026-08-01T03:55:13Z) - ToxScreen: Detecting Whether an LLM Has Been Poisoned [1.2598422062985144]
ToxScreenは、攻撃目標、トリガーメカニズム、中毒率、モデルスケール、バックドアトレーニングメカニズムにまたがる約800のバックドアモデルのベンチマークです。
一方,攻撃成功率で候補をランク付けするトークン検索では,バックドアが有効である場合にトリガを復元する。
すべてのバックドアを確実に覆う方法は存在しないが、広い範囲のジェイルブレイク可能なモデルはそれ自体異常であり、正確なトリガーが回収されない場合でも有用な信号である。
論文 参考訳(メタデータ) (2026-07-29T12:35:58Z) - Salience Induction against Multi-Hop RAG Agents: Threat and Defense [13.060227960421171]
検索トレースをセマンティックに残しながらマルチホップバインディングをリダイレクトする真理保存編集として,サリエンス誘導を形式化する。
30%の編集予算の下で、サリエンス誘導は83.3%の攻撃成功率を達成した。
我々の軽量な入力側防御であるSalience Normalizationは、標準的な攻撃で15.3%、適応攻撃で23.6%に攻撃成功を減少させる。
論文 参考訳(メタデータ) (2026-07-20T04:27:50Z) - Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses [5.887807565440711]
FARMA(Forged Amplifying Rationale Memory Attack)について紹介する。
FARMAは、エージェントの実際の知識よりも、エージェントの記憶された推論を毒する。
SENTINELは,鍛造推論エントリを検出するための層状防衛パイプラインである。
論文 参考訳(メタデータ) (2026-07-06T13:10:13Z) - Manufactured Confidence: How Memory Consolidation Turns Hearsay into Confident Facts [0.0]
LLMエージェントは会話を格納された「成果物」に書き直す。
一度も真実であり、訂正されなかった役割は、平らな事実として記憶され、故意の注入のように振る舞う。
1つの負荷を持つメモリがハザードであり、1つの冗長なソースが正しい決定を復元する。
論文 参考訳(メタデータ) (2026-06-28T08:56:48Z) - Friend or Foe: How LLMs' Safety Mind Gets Fooled by Intent Shift Attack [53.34204977366491]
大きな言語モデル(LLM)は、印象的な機能にもかかわらず、ジェイルブレイク攻撃に対して脆弱なままである。
本稿では,攻撃意図について LLM を混乱させる ISA (Intent Shift Attack) を提案する。
私たちのアプローチでは、元の要求に対して最小限の編集しか必要とせず、自然で、可読性があり、一見無害なプロンプトをもたらす。
論文 参考訳(メタデータ) (2025-11-01T13:44:42Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - Memory Injection Attacks on LLM Agents via Query-Only Interaction [49.14715983268449]
我々は,攻撃者がエージェントのメモリバンクを直接変更できると仮定することなく,新たなメモリインジェクション攻撃(MINJA)を提案する。
攻撃者は、クエリと出力観察を通してエージェントとのみ対話することで、悪意のあるレコードをメモリバンクに注入する。
MINJAは、任意のユーザがエージェントメモリに影響を与え、リスクを強調します。
論文 参考訳(メタデータ) (2025-03-05T17:53:24Z) - MELON: Provable Defense Against Indirect Prompt Injection Attacks in AI Agents [60.30753230776882]
LLMエージェントは間接的プロンプトインジェクション(IPI)攻撃に対して脆弱であり、ツール検索情報に埋め込まれた悪意のあるタスクはエージェントをリダイレクトして不正なアクションを取ることができる。
マスク機能によって修正されたマスク付きユーザでエージェントの軌道を再実行することで攻撃を検知する新しいIPIディフェンスであるMELONを提案する。
論文 参考訳(メタデータ) (2025-02-07T18:57:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。