論文の概要: From A2A Attacks to Envelope-Layer Defense: Red-Teaming Evaluation of LLM Agents and a Three-Layer Isomorphic Attack-Defense Model
- arxiv url: http://arxiv.org/abs/2610.00392v1
- Date: Wed, 30 Sep 2026 11:19:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.631839
- Title: From A2A Attacks to Envelope-Layer Defense: Red-Teaming Evaluation of LLM Agents and a Three-Layer Isomorphic Attack-Defense Model
- Title(参考訳): A2Aアタックからエンベロープ層防御へ:LLMエージェントと3層同型アタックディフェンスモデルの再結合評価
- Abstract要約: A2A-TIBAは間接的なプロンプト注入とバイパス回避を組み合わせた攻撃原理である。
そこで本研究では,ASRを意味的拒絶率,意味的侵害率,インターセプション率,侵入率に拡張する4つの攻撃結果を提案する。
実験では、悪意のあるコンテンツがエージェントに入るチャネルであるエンベロープ層を、新たな防衛次元として明らかにした。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent interaction protocols such as ACP and A2A have moved LLM-based agents toward multi-agent collaboration, introducing new security threats. A task sent by a remote peer over A2A is treated as a legitimate request, providing a natural channel for indirect prompt injection. Existing agent security evaluations mostly rely on a single metric, the attack success rate (ASR), and cannot distinguish whether an attack failed because the LLM recognized the malicious content or because a mechanism at the agent layer blocked execution. To address this, we propose A2A-TIBA, an attack principle combining indirect prompt injection with bypass circumvention. Through implant-command-exfiltration steps, it induces the target agent to deploy a callback interaction program, after which the attacker issues commands bypassing the agent. To evaluate defenses finer, we design GDA Measurement, a red-team testbed method using raw context capture via an LLM gateway, dual data preservation, and agent-based autonomous judging. We propose four attack outcomes, Class A/B/C/D, extending ASR into semantic refusal rate, semantic breach rate, interception rate, and penetration rate. Experiments reveal the envelope layer -- the channel through which malicious content enters an agent -- as a new defense dimension. We accordingly propose ELA-ITL, a three-layer isomorphic attack-defense model, dividing defense into envelope packaging, LLM recognition, and agent interception, and attack into implant channel, prompt optimization, and execution mechanism. Testing on 15 agent front-end x LLM back-end combinations and building a 1,000-case dataset verifies the attack effectiveness of A2A-TIBA, the evaluation validity of GDA Measurement, and confirms that adding malicious prompt labels to envelope packaging such as A2A, tool, and memory channels significantly improves LLM recognition of malicious content.
- Abstract(参考訳): ACPやA2Aのようなエージェントインタラクションプロトコルは、LLMベースのエージェントをマルチエージェントコラボレーションに移行し、新たなセキュリティ脅威を導入した。
リモートピアがA2Aに送信したタスクは正当な要求として扱われ、間接的なプロンプトインジェクションのための自然なチャネルを提供する。
既存のエージェントのセキュリティ評価は、攻撃成功率(ASR)という単一の指標に大きく依存しており、LLMが悪意のあるコンテンツを認識したため、あるいはエージェント層のメカニズムが実行をブロックしたために攻撃が失敗したかどうかを区別できない。
そこで本研究では,間接的プロンプト注入とバイパス回避を組み合わせた攻撃原理であるA2A-TIBAを提案する。
インプラントコマンド-抽出ステップを通じて、ターゲットエージェントにコールバックインタラクションプログラムをデプロイさせ、その後攻撃者がエージェントをバイパスするコマンドを発行する。
GDA測定, LLMゲートウェイによる生のコンテキストキャプチャ, 二重データ保存, エージェントによる自律的判断を用いた赤チームテストベッド法を設計した。
そこで本研究では,ASRを意味的拒絶率,意味的侵害率,インターセプション率,侵入率に拡張する4つの攻撃結果を提案する。
実験では、悪意のあるコンテンツがエージェントに入るチャネルであるエンベロープ層を、新たな防衛次元として明らかにした。
そこで我々は,3層同型攻撃防御モデルであるERA-ITLを提案し,防御を封筒包装,LCM認識,エージェントインターセプションに分割し,インプラントチャネルへの攻撃,迅速な最適化,実行機構を提案する。
エージェントフロントエンド x LLM バックエンドの組み合わせのテストと1,000ケースのデータセットの構築により,A2A-TIBA の攻撃効果,GDA 測定の有効性が検証され,A2A やツール,メモリチャネルなどの封筒包装に悪意のあるプロンプトラベルを追加することで,悪意のあるコンテンツの LLM 認識が著しく向上することを確認した。
関連論文リスト
- Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection [17.713444943152506]
ツール利用大型言語モデル(LLM)エージェントは間接的プロンプトインジェクション(IPI)に対して脆弱である
既存のアダプティブアタックのほとんどは、ターゲットエージェントに対する繰り返しクエリと精製に依存している。
本研究では,攻撃適応を試験時間からオフライン戦略蒸留に移行するSAVORを提案する。
論文 参考訳(メタデータ) (2026-08-09T16:19:05Z) - Beyond Attack-Success Rate: Action-Graded Severity Scale for Tool-Using AI Agents [0.0]
エージェントのレッドチームベンチマークは、インジェクトされたエージェントが単一ビットとして侵入されたかどうかを報告している。
このバイナリ・アタック・サクセス・レートは、ディフェンダーが最も必要とする情報、すなわち、結果として生じるアクションがどれほど有害であるかを破棄する。
本研究では,7段階の順序尺度(L0〜L6)でエージェントのツールコール軌跡をスコアし,実行された動作が可逆性であったか,他者への到達範囲を超えたか,特権を拡大したかに応じて,アクショングレード調和ルーリックを導入する。
論文 参考訳(メタデータ) (2026-07-08T14:38:01Z) - Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment [25.752599132396437]
間接的なプロンプトインジェクションは、エージェントがタスク実行中に検索するサードパーティデータに悪意のある命令を埋め込むことによって、LLMベースのエージェントをハイジャックする。
既存のディフェンスでは、静的なベンチマークでほぼゼロの攻撃成功率を報告しているが、最近のアダプティブ評価では、攻撃者がデプロイされたディフェンスに対して最適化を許せば、これらの結果は崩壊する。
本稿では,攻撃者が制御するデータではなく,ユーザタスクに対する防衛判断を基礎としたトレーニングベースのRETAを提案する。
論文 参考訳(メタデータ) (2026-06-13T19:15:44Z) - PlanGuard: Defending Agents against Indirect Prompt Injection via Planning-based Consistency Verification [1.7904458681854372]
PlanGuardは、コンテキスト分離の原則に基づいた、トレーニング不要の防御フレームワークである。
PlanGuardは攻撃を効果的に中和し、アタック成功率(ASR)を72.8%から0%に下げる。
論文 参考訳(メタデータ) (2026-04-11T09:59:46Z) - Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis [48.70474961584997]
インダイレクト・プロンプト・インジェクション・アタック(IPIA)は大きな言語モデル(LLM)に重大な脅威をもたらす
IntentGuardは、命令追従インテント分析に基づく一般的な防御フレームワークである。
論文 参考訳(メタデータ) (2025-11-30T16:29:04Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - MELON: Provable Defense Against Indirect Prompt Injection Attacks in AI Agents [60.30753230776882]
LLMエージェントは間接的プロンプトインジェクション(IPI)攻撃に対して脆弱であり、ツール検索情報に埋め込まれた悪意のあるタスクはエージェントをリダイレクトして不正なアクションを取ることができる。
マスク機能によって修正されたマスク付きユーザでエージェントの軌道を再実行することで攻撃を検知する新しいIPIディフェンスであるMELONを提案する。
論文 参考訳(メタデータ) (2025-02-07T18:57:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。