論文の概要: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks
- arxiv url: http://arxiv.org/abs/2608.00134v1
- Date: Fri, 31 Jul 2026 14:04:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 15:28:25.884424
- Title: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks
- Title(参考訳): LLMの多施設同時多発テロ対策
- Authors: Siyuan Li, Zehao Liu, Haoyu Li, Xi Lin, Ning Liu, Jun Wu, Jianhua Li, Mohsen Guizani,
- Abstract要約: マルチターン攻撃に対するLDMの安全性を確保するためのプロアクティブ・ディフェンス・フレームワークを提案する。
特殊なエージェントが補完的な防衛戦略を実行するような、協調的なマルチエージェントアーキテクチャを採用している。
マルチターン攻撃における進化戦略をシミュレートするEMRAデータセットを提案する。
- 参考スコア(独自算出の注目度): 56.45762972211923
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As LLMs become increasingly integrated into complex applications, their vulnerability to adversarial attacks has raised significant concerns. However, existing defenses remain reactive in nature. This limitation makes it difficult for them to counter sophisticated threats, as adversaries continuously adjust their strategies across multi-turn interactions. In this paper, we present a proactive defense framework for securing LLMs against evolving multi-turn adversarial attacks that combines disruption, misdirection, and adaptation across successive interaction turns. In particular, it employs a cooperative multi-agent architecture in which specialized agents execute complementary defense strategies. These strategies include controlled response pacing to increase attack costs, strategically ambiguous outputs to mislead adversaries into ineffective strategies, and forensic analysis of interaction logs to identify attack patterns and refine defenses. These agents are coordinated by an adaptive mechanism that dynamically adjusts the defense strategy in response to escalating threats. To facilitate comprehensive evaluation, we present the EMRA dataset designed to simulate evolving strategies across multi-turn attacks, including 5,200 adversarial samples across eight attack types. Experimental results on EMRA across multiple LLM backbones show that the proposed framework reduces ASR by 69% on average relative to evaluated state-of-the-art baselines. Beyond suppressing harmful outputs, it sustains deceptive engagement, achieving an average DR more than six times that of the strongest baselines and increasing attacker-token consumption by 198.83% on average relative to evaluated baselines. Code and dataset are available at https://github.com/SiyuanLi00/CoopGuard.
- Abstract(参考訳): LLMが複雑なアプリケーションに統合されるにつれて、敵の攻撃に対する脆弱性が懸念されている。
しかし、既存の防御は本質的には反応しない。
この制限により、対戦相手がマルチターンインタラクションを通じて戦略を継続的に調整するため、高度な脅威に対処することが困難になる。
本稿では, 連続する相互作用ターン間の破壊, 不正方向, 適応を組み合わせた多ターン対向攻撃に対して, LLMを防御するための積極的な防御機構を提案する。
特に、特殊なエージェントが補完的な防衛戦略を実行するような、協調的なマルチエージェントアーキテクチャを採用している。
これらの戦略には、攻撃コストを増大させる制御された応答ペーシング、敵を非効果的な戦略に導くための戦略的曖昧なアウトプット、攻撃パターンを識別し防御を洗練するための相互作用ログの法医学的分析が含まれる。
これらのエージェントは、脅威のエスカレートに応じて防衛戦略を動的に調整する適応的なメカニズムによって調整される。
包括的評価を容易にするため,マルチターン攻撃における戦略の進化をシミュレートするEMRAデータセットを提案する。
複数のLLMバックボーンにまたがるEMRA実験の結果,提案フレームワークは評価された最先端ベースラインに対して平均69%のASR削減効果を示した。
有害なアウトプットを抑えるだけでなく、高いベースラインの6倍以上の平均DRを達成し、評価ベースラインに対する平均198.83%の攻撃トーケン消費を達成している。
コードとデータセットはhttps://github.com/SiyuanLi00/CoopGuard.comで入手できる。
関連論文リスト
- Defending LLM-based Multi-Agent Systems Against Cooperative Attacks with Sentence-Level Rectification [42.88763759237844]
大規模言語モデルに基づくマルチエージェントシステム(MAS)の悪意のあるエージェントは、誤情報を注入して他のエージェントを誤解させ、システム性能を損なう可能性がある。
本稿では,攻撃戦略を自律的に調整し,動的に調整する適応型協調攻撃フレームワークを提案する。
本稿では,エージェント通信における文レベルでのミスリード情報を識別・修正する防衛フレームワークであるSentence-Level Trustworthiness Analysis and Rectification(STAR)を紹介する。
論文 参考訳(メタデータ) (2026-05-27T07:56:33Z) - CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks [31.582651893036683]
CoopGuardは、協調エージェントに基づくステートフルなマルチラウンドLLM防衛フレームワークである。
補助的なラウンドレベル戦略のために3つの特殊エージェントを雇用している。
実験によると、CoopGuardは最先端の防御に対して攻撃の成功率を78.9%削減している。
論文 参考訳(メタデータ) (2026-04-05T11:06:13Z) - Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization [51.12422886183246]
大規模言語モデル(LLM)は、Webサービスにおいて急速に発展し、社会的リスクを増幅しつつ、前例のない能力を提供してきた。
既存の作業は、分離されたジェイルブレイク攻撃または静的防御に重点を置いており、現実世界のWebコンテキストにおける進化する脅威とセーフガードの間の動的な相互作用を無視している。
ACE-Safetyは、2つの重要な革新的手順をシームレスに統合することにより、攻撃と防御モデルを協調的に最適化する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-11-24T15:23:41Z) - Genesis: Evolving Attack Strategies for LLM Web Agent Red-Teaming [45.95972813586392]
既存のレッドチーム方式は、主にオフラインでトレーニングされた手作業による攻撃戦略や静的モデルに依存している。
我々は,アタッカー,スコラー,ストラテジストの3つのモジュールからなる新しいエージェントフレームワークであるGenesisを提案する。
我々のフレームワークは、新しい戦略を発見し、既存の攻撃ベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2025-10-21T05:49:37Z) - Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks [63.803415430308114]
現在の大規模言語モデルは、マルチターンインタラクション設定における敵攻撃に対して脆弱である。
本研究では,木探索と統合したオンライン強化学習フレームワークであるDialTree-RPOを提案する。
提案手法は,従来の最先端手法と比較して,10のターゲットモデルに対して25.9%以上のASRを実現している。
論文 参考訳(メタデータ) (2025-10-02T17:57:05Z) - Searching for Privacy Risks in LLM Agents via Simulation [61.229785851581504]
本稿では,プライバシクリティカルなエージェントインタラクションのシミュレーションを通じて,攻撃と防御戦略の改善を交互に行う検索ベースのフレームワークを提案する。
攻撃戦略は、直接の要求から、不正行為や同意偽造といった高度な戦術へとエスカレートする。
発見された攻撃と防御は、さまざまなシナリオやバックボーンモデルにまたがって伝達され、プライバシーに配慮したエージェントを構築するための強力な実用性を示している。
論文 参考訳(メタデータ) (2025-08-14T17:49:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。