論文の概要: SoK: When Safe Agents Fail Together: The Security of Multi Agent LLM Systems
- arxiv url: http://arxiv.org/abs/2609.00595v1
- Date: Tue, 01 Sep 2026 02:34:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.244294
- Title: SoK: When Safe Agents Fail Together: The Security of Multi Agent LLM Systems
- Title(参考訳): SoK: 安全なエージェントが一緒に失敗したとき - マルチエージェントLLMシステムのセキュリティ
- Authors: Rui Yang, Junjie Xu, Zhengyu Liu, Neil Fendley, Yang Hong, Ziyang Li, Yinzhi Cao,
- Abstract要約: マルチエージェントセキュリティシステム(MAS)は、情報、状態、決定、権限を主要境界を越えて移動させ、ローカルチェックが見逃す可能性のある障害を生成する。
我々はMASのセキュリティを,6つのインタラクションインターフェース,4つの敵位置,7つのシステムレベルリスク,8つの繰り返し攻撃経路を含む,実行中心の197の作業の解析を通じて体系化する。
我々は,A-I-Rフレームワークを導入し,敵位置,インタラクションインターフェース,およびシステムレベルリスクによる攻撃を組織化し,MAS全体でフラグメント化された攻撃機構を統一する。
- 参考スコア(独自算出の注目度): 28.27100643384546
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safe agents can fail together. Multi-agent LLM systems (MAS) move information, state, decisions, and authority across principal boundaries, creating failures that local checks may miss. Without an execution-level view, a multi-agent setting can easily be mistaken for evidence of a genuinely multi-agent security effect. We thus systematize MAS security through an execution-centered analysis of 197 works, covering six interaction interfaces, four adversary positions, seven system-level risks, and eight recurring attack paths. We introduce an A-I-R framework that organizes attacks by adversary position, interaction interface, and resulting system-level risk, unifying otherwise fragmented attack mechanisms across MAS. We organize defenses through a five-part contract covering path target, observation, intervention, trust boundary, and recovery, and identify path closure and recovery as key challenges. We audit 44 evaluation and benchmark works and identify open challenges in isolating interaction effects, designing comparable and diagnostic metrics, supporting reuse across MAS designs, and evaluating open-system operation. Together, these findings motivate an interaction-aware view of MAS security: trace attacks end to end, test whether defenses close those paths, and evaluate system-level effects with appropriate counterfactuals.
- Abstract(参考訳): 安全なエージェントは一緒に失敗する可能性があります。
マルチエージェントLLMシステム(MAS)は、情報、状態、決定、権限を主要境界を越えて移動させ、ローカルチェックが見逃す可能性のある障害を生成する。
実行レベルビューがなければ、真のマルチエージェントセキュリティ効果の証拠として、マルチエージェント設定を簡単に間違えることができる。
そこで我々は,MASのセキュリティを6つのインタラクションインターフェース,4つの敵位置,7つのシステムレベルリスク,8つの繰り返し攻撃経路を含む,実行中心の197の作業の解析を通じて体系化する。
我々は,A-I-Rフレームワークを導入し,敵位置,インタラクションインターフェース,システムレベルリスクによる攻撃を組織化し,MAS全体にわたってフラグメンテーションされた攻撃機構を統一する。
我々は,経路目標,観察,介入,信頼境界,回復を網羅する5部契約を通じて防衛を組織し,経路閉鎖と回復を重要課題とみなす。
44の評価とベンチマークを行い、相互作用効果の分離、比較と診断のメトリクスの設計、MAS設計間の再利用支援、オープンシステム操作の評価におけるオープンな課題を特定した。
これらの知見は,MASのセキュリティを相互に認識する視点を動機付けている: トレース攻撃は終端から終端まで,防御がそれらの経路を閉じているかどうかを検証し,適切な対策によってシステムレベルの効果を評価する。
関連論文リスト
- Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security [57.35851886874902]
エージェントAIシステムは、複雑なタスクを自律的に実行するが、その多段階の軌道には、信頼性に挑戦する新たな障害モードが導入されている。
この調査では、リスクの高いデプロイメントに不可欠な2つのコアディメンションを通じて、信頼できるエージェントAIを精査する。
各次元について、重要な概念を明確にし、エージェントワークフローに沿ってリスクが発生する場所を特定し、ステージ目標の緩和戦略を要約する。
論文 参考訳(メタデータ) (2026-05-17T10:26:37Z) - Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses [168.50301366360344]
Embodied AI (Embodied AI) は、知覚、認知、計画、相互作用を、安全クリティカルな環境で機能するエージェントに統合する。
デジタルAIシステムとは異なり、エンボディエージェントは不確実な検知、不完全な知識、動的な人間とロボットの相互作用の下で行動しなければならない。
この調査は、エンボディされたAIにおける安全性研究の包括的なレビューを提供し、完全なエンボディされたパイプラインにわたる攻撃と防御を調査している。
論文 参考訳(メタデータ) (2026-03-28T13:21:44Z) - Exposing Weak Links in Multi-Agent Systems under Adversarial Prompting [5.544819942438653]
本稿では,マルチエージェントシステムのセキュリティ評価を行うフレームワークであるSafeAgentsを提案する。
広く採用されている5つのマルチエージェントアーキテクチャについて検討する。
この結果から,一般的なデザインパターンには重大な脆弱性があることが判明した。
論文 参考訳(メタデータ) (2025-11-14T04:22:49Z) - Can an Individual Manipulate the Collective Decisions of Multi-Agents? [53.01767232004823]
M-Spoilerは、マルチエージェントシステム内のエージェントインタラクションをシミュレートして、対向サンプルを生成するフレームワークである。
M-スポイラーは、敵対的サンプルの最適化を積極的に支援するスタブボーン剤を導入した。
本研究は,マルチエージェントシステムにおける個々のエージェントの知識によって引き起こされるリスクを検証した。
論文 参考訳(メタデータ) (2025-09-20T01:54:20Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z) - The Dark Side of LLMs: Agent-based Attacks for Complete Computer Takeover [0.0]
大規模言語モデル(LLM)エージェントとマルチエージェントシステムは、従来のコンテンツ生成からシステムレベルの妥協まで及ぶセキュリティ脆弱性を導入している。
本稿では,自律エージェント内の推論エンジンとして使用されるLLMのセキュリティを総合的に評価する。
異なる攻撃面と信頼境界がどのように活用され、そのような乗っ取りを組織化できるかを示す。
論文 参考訳(メタデータ) (2025-07-09T13:54:58Z) - Who's the Mole? Modeling and Detecting Intention-Hiding Malicious Agents in LLM-Based Multi-Agent Systems [25.6233463223145]
大規模言語モデル(LLM-MAS)を用いたマルチエージェントシステムにおける意図隠蔽脅威について検討する。
高いステルス性を維持しながらタスク完了を微妙に妨害する4つの代表的な攻撃パラダイムを設計する。
これらの脅威に対処するために,心理学に着想を得た検出フレームワークであるAgentXposedを提案する。
論文 参考訳(メタデータ) (2025-07-07T07:34:34Z) - SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents [58.21223208538351]
本研究は,モバイルマルチモーダルエージェントを取り巻くセキュリティ問題について考察する。
行動シーケンス情報を組み込んだリスク識別機構の構築を試みる。
また、大規模言語モデルに基づく自動アセスメントスキームも設計している。
論文 参考訳(メタデータ) (2025-07-01T15:10:00Z) - Demonstrations of Integrity Attacks in Multi-Agent Systems [7.640342064257848]
マルチエージェントシステム(Multi-Agent Systems、MAS)は、システムの中核機能を破壊しずに自己利益を提供する悪意のあるエージェントに対して脆弱である可能性がある。
この研究は、悪意のあるエージェントが微妙なプロンプト操作を使用してバイアスMAS操作を行ない、様々な利益を得る、完全性攻撃を探索する。
論文 参考訳(メタデータ) (2025-06-05T02:44:49Z) - SentinelAgent: Graph-based Anomaly Detection in Multi-Agent Systems [11.497269773189254]
大規模言語モデル(LLM)に基づくマルチエージェントシステム(MAS)に適したシステムレベルの異常検出フレームワークを提案する。
本稿では,エージェント間相互作用を動的実行グラフとしてモデル化し,ノード,エッジ,パスレベルでの意味的異常検出を可能にするグラフベースのフレームワークを提案する。
第2に,セキュリティポリシとコンテキスト推論に基づくMAS実行の監視,解析,介入を行うLLMによる監視エージェントである,プラグイン可能なSentinelAgentを導入する。
論文 参考訳(メタデータ) (2025-05-30T04:25:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。