論文の概要: Early Detection of Distributed Backdoors in Multi-Agent LLM Systems: A Characterization Study
- arxiv url: http://arxiv.org/abs/2607.24893v1
- Date: Mon, 27 Jul 2026 15:18:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.573923
- Title: Early Detection of Distributed Backdoors in Multi-Agent LLM Systems: A Characterization Study
- Title(参考訳): マルチエージェントLDMシステムにおける分散バックドアの早期検出:特性評価
- Authors: Diego Fernandez Arias, Dev Prashant Mistry, Ren Wang, Yibo Hu,
- Abstract要約: マルチエージェントLLMシステムは、単一のエージェントが完全に保持しないペイロードによって攻撃される。
ランがまだ展開されている間、そのような攻撃がどれほど早く検出できるかを示す。
次に、その警告のどれ程が、その分散構造ではなく、取り外し可能な表面のキューにかかっているかを測定する。
- 参考スコア(独自算出の注目度): 3.799596277597438
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-agent LLM systems can be attacked by a payload that no single agent ever holds in full: a poisoned tool hides encrypted fragments in its observations, spreads them across several agents, and an external step reassembles and executes them after the run. Per-step safety checks that judge each action in isolation may fail to recognize the complete distributed payload. We investigate how early such an attack can be detected while the run is still unfolding, and how robustly it can be caught once its most obvious cues are stripped away. We build a working instance on a hierarchical multi-agent system, run it under benign and attacked conditions across five language models and two task domains, and record when each fragment is injected and when the payload is assembled and executed. Detection is a race against assembly. Before the first fragment is injected, attacked and benign runs are indistinguishable; once injection begins, a prefix detector flags $99.3\%$ of successful attacks with a median of five steps remaining and a $10.3\%$ safe-run false-positive rate. Because assembly occurs only after the run, these alarms arrive in time to abort nearly every successful attack. We then measure how much of that warning rests on removable surface cues of the attack rather than on its distributed structure. Generic zero-shot and behavior-trained detectors provide almost no warning at all; the detectors that do work lean in part on removable surface cues, chiefly the ciphertext's length and entropy, and once the entropy cue is removed from the payload and the length features from the detector, detection arrives later and transfers poorly across domains, though a fine-tuned model recovers some of the loss.
- Abstract(参考訳): 有毒なツールは、その観察中に暗号化された断片を隠蔽し、複数のエージェントに分散させ、外部のステップが再組み立てされ、実行後に実行される。
各アクションを分離して判断するステップ毎の安全チェックは、完全な分散ペイロードを認識するのに失敗する可能性がある。
ランニング中にそのような攻撃がどの程度早期に検出可能か,また,最も明白な手がかりが取り除かれた後,いかに頑健に捕捉可能かを検討する。
階層型マルチエージェントシステム上で動作インスタンスを構築し、5つの言語モデルと2つのタスクドメインにまたがって良質で攻撃的な条件下で実行し、各フラグメントが注入され、ペイロードが組み立てられ実行されたときを記録する。
検出はアセンブリに対するレースです。
最初のフラグメントが注入される前に、攻撃とベニグランは区別できない; インジェクションが開始されると、プレフィックス検出器が99.3\%$で攻撃を成功させ、中央値が5ステップ、セーフランの偽陽性率が10.3\%である。
アセンブリは実行後にのみ発生するため、これらのアラームは、ほぼすべての攻撃を中止するために間に合うように到着する。
次に、その警告のどれ程が、その分散構造ではなく、取り外し可能な表面のキューにかかっているかを測定する。
ジェネリックゼロショットと行動訓練された検出器はほとんど警告を与えていない: 取り外し可能な表面のキュー、主に暗号文の長さとエントロピー、そしてエントロピーキューがペイロードから取り除かれ、検出器から長所の特徴が取り除かれると、検出は後で到着し、ドメイン間での転送が不十分になるが、微調整されたモデルでは損失の一部を回復する。
関連論文リスト
- From Attack Simulation to SIEM Rule: Deterministic Detection-as-Code Synthesis with Probe-Level Traceability [51.56484100374058]
セキュリティチームは、自身のシステムに対する攻撃をシミュレートして、監視が真の侵入者を捕まえるかどうかをチェックする。
人間はそのギャップを手でブリッジし、それぞれの発見を読み、対応するシグマルールを書きます。
ロックされたコーパスからプローブが引き出されると,この変換が部分的に自動化されることを示す。
論文 参考訳(メタデータ) (2026-06-03T14:26:25Z) - From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors [89.92617739143846]
ローカルエージェントハーネスにおけるマルチステップトロイの木馬攻撃を識別するベンチマークであるClawTrojanを紹介する。
そこで我々は,DASGuardを提案する。DASGuardは,コントロールライクなテキストをセンシティブなローカルファイルでスキャンし,その起源を辿り,信頼されたソースから派生しないコントロールコンテンツを除去する。
この結果から, DASGuardは, 実行時の攻撃ブロックと作業空間への衛生的コミットを組み合わせることで, 強力な動的防御を実現することがわかった。
論文 参考訳(メタデータ) (2026-05-29T09:19:07Z) - ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems [56.613157564882925]
悪意のある行動は、一見良心的なツールに埋め込まれ、エージェントの実行を静かにハイジャックしたり、機密データをリークしたり、無許可のアクションをトリガーしたりする。
影響は拡大しているが、このような脅威を評価するための包括的なベンチマークは今のところ存在しない。
実ネットワークの相互作用を観測してサプライチェーン中毒を検出するネットワークレベルのガードレールフレームワークであるShieldNetを提案する。
論文 参考訳(メタデータ) (2026-04-06T05:15:00Z) - AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification [25.817251923574286]
大規模言語モデル(LLM)エージェントのための新しい推論時間検出・緩和フレームワークを提案する。
AgentSentryは、時間的因果的テイクオーバーとしてマルチターンIPIをモデル化する最初の推論時防御である。
我々は, textscAgentDojo ベンチマークにおいて, 4つのタスクスイート, 3つの IPI 攻撃ファミリー, 複数のブラックボックス LLM に対する AgentSentry の評価を行った。
論文 参考訳(メタデータ) (2026-02-26T07:59:10Z) - BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents [58.83028403414688]
大規模言語モデル(LLM)エージェントは、計画、メモリ、ツールの使用を組み合わせた多段階ワークフローを通じてタスクを実行する。
エージェントワークフローの特定のステージに注入されたバックドアトリガーは、複数の中間状態を通して持続し、下流出力に悪影響を及ぼす可能性がある。
LLMエージェントにおけるバックドア脅威を統一したエージェント中心のビューを提供するモジュールおよびステージアウェアフレームワークである textbfBackdoorAgent を提案する。
論文 参考訳(メタデータ) (2026-01-08T03:49:39Z) - Immunity memory-based jailbreak detection: multi-agent adaptive guard for large language models [12.772312329709868]
大規模言語モデル(LLM)はAIシステムの基盤となっているが、敵のジェイルブレイク攻撃に弱いままである。
ジェイルブレイク検出のためのマルチエージェント適応ガード(MAAG)フレームワークを提案する。
MAAGはまず、入力プロンプトからアクティベーション値を抽出し、メモリバンクに格納された履歴アクティベーションと比較して、迅速な予備検出を行う。
論文 参考訳(メタデータ) (2025-12-03T01:40:40Z) - WAInjectBench: Benchmarking Prompt Injection Detections for Web Agents [34.909802797979324]
本稿では,Webエージェントを標的としたインジェクション攻撃を検出するための総合的なベンチマーク研究を行う。
悪意のあるサンプルと良心的なサンプルの両方を含むデータセットを構築します。
次に、テキストベースと画像ベースの両方の検出方法を体系化する。
論文 参考訳(メタデータ) (2025-10-01T18:34:06Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - SentinelAgent: Graph-based Anomaly Detection in Multi-Agent Systems [11.497269773189254]
大規模言語モデル(LLM)に基づくマルチエージェントシステム(MAS)に適したシステムレベルの異常検出フレームワークを提案する。
本稿では,エージェント間相互作用を動的実行グラフとしてモデル化し,ノード,エッジ,パスレベルでの意味的異常検出を可能にするグラフベースのフレームワークを提案する。
第2に,セキュリティポリシとコンテキスト推論に基づくMAS実行の監視,解析,介入を行うLLMによる監視エージェントである,プラグイン可能なSentinelAgentを導入する。
論文 参考訳(メタデータ) (2025-05-30T04:25:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。