論文の概要: OpenEvoShield: Dual Non-Stationary Continual Defense for Open-World Multi-Agent System Attacks
- arxiv url: http://arxiv.org/abs/2607.19351v1
- Date: Wed, 13 May 2026 04:28:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.125143
- Title: OpenEvoShield: Dual Non-Stationary Continual Defense for Open-World Multi-Agent System Attacks
- Title(参考訳): OpenEvoShield: オープンワールドマルチエージェントシステムアタックのためのデュアル非定常防衛
- Authors: Litian Zhang, Chaozhuo Li, Yuting Zhang, Zejian Chen, Bingyu Yan, Qiwei Ye,
- Abstract要約: 既存の防衛は、デプロイをクローズドワールドの問題として扱い、トレーニングカバレッジを超えて配布がシフトすれば、急速に低下する。
LLM-MASのための共同進化型連続防衛フレームワークOpenEvoShieldを提案する。
100以上のデプロイメントラウンドの実験では、OpenEvoShieldが静的および連続的なベースラインを上回っている。
- 参考スコア(独自算出の注目度): 23.11259369956139
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based multi-agent systems (LLM-MAS) are increasingly deployed in safety-critical applications, where adversaries inject malicious instructions through inter-agent communication to propagate harmful behaviors. Unlike static threats, these attacks are doubly dynamic: adversaries refine injection strategies against deployed defenses while normal-agent behavior drifts with system expansion. Existing defenses treat deployment as a closed-world problem and degrade rapidly once either distribution shifts beyond training coverage. We propose OpenEvoShield, a co-evolutionary continual defense framework for LLM-MAS. An asymmetric rate controller (M1) decouples fast attack-side and slow normal-side learning rates from dual drift signals. A normal-boundary updater (M2) maintains a dynamic behavioral boundary at the slow rate, while an EWC-regularized policy ensemble (M3) fast-adapts without catastrophic forgetting. An energy-based multi-granularity detector (M4) fuses node-, subgraph-, and graph-level evidence to classify novel attacks as out-of-distribution. Experiments over 100 deployment rounds across five benchmarks and four MAS topologies show that OpenEvoShield outperforms static and continual baselines, detecting most previously unseen attacks while keeping false positive rates low.
- Abstract(参考訳): LLMベースのマルチエージェントシステム(LLM-MAS)は、敵がエージェント間通信を通じて悪意ある指示を注入し、有害な行動を伝達する安全クリティカルなアプリケーションにますます導入されている。
静的な脅威とは異なり、これらの攻撃は二重動的であり、敵は配置された防御に対して注入戦略を洗練し、通常のエージェントの振る舞いはシステム拡張とともに漂流する。
既存の防衛は、デプロイをクローズドワールドの問題として扱い、トレーニングカバレッジを超えて配布がシフトすれば、急速に低下する。
LLM-MASのための共同進化型連続防衛フレームワークOpenEvoShieldを提案する。
非対称速度制御装置(M1)は、二重ドリフト信号から高速な攻撃側と遅い正規側学習率を分離する。
通常の境界更新器(M2)は遅い速度で動的挙動境界を維持し、EWC規則化されたポリシーアンサンブル(M3)は破滅的な忘れをせずに高速適応する。
エネルギーベースの多粒度検出器(M4)は、ノード、サブグラフ、グラフレベルの証拠を融合させ、新規攻撃をアウト・オブ・ディストリビューション(out-of-distribution)として分類する。
5つのベンチマークと4つのMASトポロジにわたる100以上のデプロイメントラウンドの実験では、OpenEvoShieldは静的および連続的なベースラインよりも優れており、偽陽性率を低く保ちながら、これまで目に見えない攻撃を最も検出している。
関連論文リスト
- When Agents Go Rogue: Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems [14.51256195199332]
LLMベースのMulti-Agent Systems (MAS) はエージェントとインタラクションのレベルでの脆弱性のため、重大なセキュリティ上の課題に直面している。
既存のMASセキュリティディフェンスは、意味論的に明示的な悪意のある攻撃と、MASトポロジの明示的なグラフベースのモデリングとエージェントレベルの相互作用という、2つのコア前提に基づいて構築されている。
我々は,MASにおける悪意行動検出のためのアクティベーションベースのフレームワークであるAcMASを提案する。
論文 参考訳(メタデータ) (2026-07-07T21:12:27Z) - Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies [62.65225104423404]
自己進化エージェントシステムは、敵の影響力が永久に符号化される、質的に新しい脅威の風景を導入します。
モジュール・ライフサイクル・アタック・サーフェス・マトリックスを中心に組織化されたセキュリティとプライバシの分析を行った。
その結果, 自己進化は, 既知のすべての攻撃カテゴリをセッションバウンドからラインパーシスタントに変換することがわかった。
論文 参考訳(メタデータ) (2026-06-22T09:23:50Z) - Benchmarking Autonomous Agents against Temporal, Spatial, and Semantic Evasions [15.535628544812326]
LLMをベースとしたエージェントシステムを対象とした,新しい多次元回避フレームワークを提案する。
これらの脅威を定量化するために,2,254個の実世界のエージェント実行軌跡からなる総合ベンチマークであるA3S-Benchを構築した。
我々の回避フレームワークは平均リスクトリガー率を28.3%から52.6%に引き上げる。
論文 参考訳(メタデータ) (2026-05-21T11:07:51Z) - T-MAP: Red-Teaming LLM Agents with Trajectory-aware Evolutionary Search [49.99459363244884]
提案手法は, 対向的プロンプトの発見を導くために, 実行トラジェクトリを利用するトラジェクトリ対応の進化探索手法であるT-MAPを提案する。
本手法は,安全ガードレールをバイパスするだけでなく,実際のツールインタラクションによる有害な目標を確実に実現するための攻撃の自動生成を可能にする。
論文 参考訳(メタデータ) (2026-03-21T12:33:34Z) - SHIELD: An Auto-Healing Agentic Defense Framework for LLM Resource Exhaustion Attacks [5.779141020370452]
既存の防御は意味論的に意味のある攻撃に失敗する統計的フィルタに依存するか、攻撃戦略の進展に苦慮する静的LLMベースの検出器を使用するかのいずれかである。
3段階防衛エージェントを中心とした多エージェント自動治癒防衛フレームワークShiELDについて紹介する。
知識更新エージェントとプロンプト最適化エージェントの2つの補助エージェントは、攻撃が検出をバイパスした場合に閉じた自己修復ループを形成する。
論文 参考訳(メタデータ) (2026-01-27T04:03:15Z) - OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs [36.57820295876294]
MLLMの安全性評価のための統一的,モジュール型,高スループットのRed-teamingフレームワークであるOpenRTを紹介した。
OpenRTのコアとなるのは,5次元にわたるモジュール分離を可能にする対角カーネルを導入することで,自動化された再チームのパラダイムシフトだ。
このフレームワークは、ホワイトボックス勾配、マルチモーダル摂動、高度なマルチエージェント進化戦略など、37の多様な攻撃手法を統合している。
論文 参考訳(メタデータ) (2026-01-04T16:41:33Z) - AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning [78.5751183537704]
AdvEvo-MARLは、タスクエージェントに安全性を内部化する、共進化型マルチエージェント強化学習フレームワークである。
外部ガードに頼るのではなく、AdvEvo-MARLは攻撃者と防御者を共同で最適化する。
論文 参考訳(メタデータ) (2025-10-02T02:06:30Z) - Temporal Logic-Based Multi-Vehicle Backdoor Attacks against Offline RL Agents in End-to-end Autonomous Driving [26.094398456088403]
我々は、1台以上の車両の軌道をトリガーとして利用するエンド・ツー・エンドADシステムに対する新たなバックドア攻撃を導入する。
我々は、トリガーに似ているがバックドアを起動しないパッチトラジェクトリを組み込むことで、負のトレーニング戦略を開発する。
提案攻撃の柔軟性と効果を実証し、既存のエンドツーエンドADシステムの脆弱性を調査する。
論文 参考訳(メタデータ) (2025-09-21T07:13:19Z) - CyGATE: Game-Theoretic Cyber Attack-Defense Engine for Patch Strategy Optimization [73.13843039509386]
本稿では,攻撃と防御の相互作用をモデル化するゲーム理論フレームワークCyGATEを提案する。
CyGATEはサイバー・キル・チェーン(Cyber Kill Chain)の段階にわたって、サイバー紛争を部分的に観察可能なゲーム(POSG)として捉えている。
フレームワークの柔軟なアーキテクチャは、マルチエージェントシナリオの拡張を可能にする。
論文 参考訳(メタデータ) (2025-08-01T09:53:06Z) - Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security [63.41350337821108]
マルチモーダル大規模言語モデル(MLLM)のセキュリティを高めるために,Secure Tug-of-War(SecTOW)を提案する。
SecTOWは2つのモジュールで構成される:ディフェンダーと補助攻撃者。どちらも強化学習(GRPO)を使用して反復的に訓練される。
SecTOWは、一般的な性能を維持しながら、セキュリティを大幅に改善することを示す。
論文 参考訳(メタデータ) (2025-07-29T17:39:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。