論文の概要: Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)
- arxiv url: http://arxiv.org/abs/2608.04317v1
- Date: Wed, 05 Aug 2026 00:54:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.678813
- Title: Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)
- Title(参考訳): トライデント : サイバーディフェンスの深層強化学習(人工知能)
- Authors: Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani,
- Abstract要約: Tridentは3つのコンポーネントからなるエージェントレッドチームフレームワークである。
データセットは、RLVRのための13,000以上の高忠実度赤と青の相互作用軌道からなる。
単一の訓練可能な7Bプランナーは、平均522%のブルーエージェント防御性能を低下させる。
- 参考スコア(独自算出の注目度): 15.20114456320784
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous cyber defense systems based on Deep Reinforcement Learning (DRL) have attracted significant research attention, yet remain evaluated almost exclusively against static, heuristic red agents, leaving their robustness against adaptive threats critically understudied. Meanwhile, recent advances in Reinforcement Learning with Verifiable Rewards (RLVR) have improved LLM reasoning, but their integration into cybersecurity remains elusive due to the absence of suitable benchmark environments and interaction datasets. To bridge this gap, we introduce Trident, an agentic LLM red teaming framework comprising three components: a dynamic benchmark with isolated sandbox servers spanning CybORG CAGE 4 and CyberWheel, a dataset comprises over 13,000 high-fidelity red-blue interaction trajectories for RLVR, and a ``Code-as-Policy'' RLVR agentic architecture Trident Agentic). The latter reformulates red agent training as a contextual bandit via a tripartite Log Summarizer--Planner--Coder design, where a trainable Planner generates complete attack strategies from compressed execution logs, which a frozen Coder translates into executable Python policies deployed against live DRL defenders. Empirical evaluations reveal a fundamental brittleness in existing defenses: with a single trainable 7B planner, Trident reduces blue agent defensive performance by an average of 522% compared to static red agent baselines while autonomously discovering emergent behaviors such as decoy avoidance and adaptive state prioritization that static heuristics entirely fail to uncover.
- Abstract(参考訳): Deep Reinforcement Learning (DRL)に基づく自律的なサイバー防衛システムは研究の注目を集めているが、静的でヒューリスティックなレッドエージェントに対してのみ評価され、適応的な脅威に対する堅牢性は批判的に検討されている。
一方、近年の強化学習(Reinforcement Learning with Verifiable Rewards, RLVR)はLSM推論を改善しているが、適切なベンチマーク環境やインタラクションデータセットが存在しないため、サイバーセキュリティへの統合はいまだ解明されていない。
このギャップを埋めるために、Trident、CybORG CAGE 4とCyberWheelにまたがる分離サンドボックスサーバを備えた動的ベンチマーク、RLVR用の13,000以上の高忠実な赤と青のインタラクショントラジェクトリを含むデータセット、および ‘Code-as-Policy'のRLVRエージェントアーキテクチャであるTrident Agenticという3つのコンポーネントからなるエージェントLLMレッドチームフレームワークを紹介した。
トレーニング可能なPlannerは、圧縮された実行ログから完全な攻撃戦略を生成し、凍結されたCoderは、ライブDRLディフェンダーに対してデプロイされるPythonポリシーに変換する。
単一の訓練可能な7Bプランナを持つTridentは、静的レッドエージェントベースラインと比較して平均522%のブルーエージェント防御性能を低下させ、静的ヒューリスティックが完全に発見できないデコイ回避や適応状態優先化のような創発的な動作を自律的に発見する。
関連論文リスト
- Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks [56.45762972211923]
マルチターン攻撃に対するLDMの安全性を確保するためのプロアクティブ・ディフェンス・フレームワークを提案する。
特殊なエージェントが補完的な防衛戦略を実行するような、協調的なマルチエージェントアーキテクチャを採用している。
マルチターン攻撃における進化戦略をシミュレートするEMRAデータセットを提案する。
論文 参考訳(メタデータ) (2026-07-31T14:04:49Z) - Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies [62.65225104423404]
自己進化エージェントシステムは、敵の影響力が永久に符号化される、質的に新しい脅威の風景を導入します。
モジュール・ライフサイクル・アタック・サーフェス・マトリックスを中心に組織化されたセキュリティとプライバシの分析を行った。
その結果, 自己進化は, 既知のすべての攻撃カテゴリをセッションバウンドからラインパーシスタントに変換することがわかった。
論文 参考訳(メタデータ) (2026-06-22T09:23:50Z) - A Red Teaming Framework for Evaluating Robustness of AI-enabled Security Orchestration, Automation, and Response Systems [8.56054061802862]
大規模言語モデル(LLM)と強化学習(RL)を統合した,自律的なレッドチーム編成フレームワークを導入する。
階層設計では、戦略目的のためのLSMベースのプランナーと戦術実行のためのRLコントローラを組み合わせる。
論文 参考訳(メタデータ) (2026-05-16T16:46:06Z) - Dynamic Cyber Ranges [0.3179229570536315]
動的サイバーレンジ: インフラを強化し、侵入を監視し、リアルタイムで応答するLLM駆動のデフェンダーエージェントで強化されたサイバーレンジ環境を提案する。
攻撃者とディフェンダーエージェントは同じモデル能力から引き出されるため、Dynamic Cyber Rangesはモデルの改善に伴って評価ヘッドルームを保存する。
特に、小さな専用オンプレミスモデル(エイリアス2-mini)は、同じ未修正プロンプトの下で複数のシナリオでフロンティアモデルの防御結果と一致し、複雑なエンタープライズシナリオで攻撃者を10倍早く検出した。
論文 参考訳(メタデータ) (2026-04-27T08:44:30Z) - Enhancing Cloud Network Resilience via a Robust LLM-Empowered Multi-Agent Reinforcement Learning Framework [9.460661802313835]
CyberOps-Botsは、Large Language Models (LLM)によって強化された階層型マルチエージェント強化学習フレームワークである。
実際のクラウドデータセットの実験では、最先端のアルゴリズムと比較して、CyberOps-Botsはネットワーク可用性を68.5%高く維持している。
当社のフレームワークをコミュニティにリリースし、クラウドネットワークにおける堅牢で自律的な防衛の進展を促進します。
論文 参考訳(メタデータ) (2026-01-12T01:25:41Z) - BlueCodeAgent: A Blue Teaming Agent Enabled by Automated Red Teaming for CodeGen AI [19.047693413887107]
自動レッドチーム化によって実現された,エンドツーエンドのブルーチーム化エージェントであるBlueCodeAgentを提案する。
私たちのフレームワークは両方の側面を統合しています。レッドチーム化は多様なリスクのあるインスタンスを生成し、ブルーチーム化エージェントはこれらを利用して、これまで見てきた、そして目に見えないリスクシナリオを検出します。
BlueCodeAgentは、平均12.7%のF1スコアを3つのタスクで4つのデータセットで達成している。
論文 参考訳(メタデータ) (2025-10-20T22:00:10Z) - RL Is a Hammer and LLMs Are Nails: A Simple Reinforcement Learning Recipe for Strong Prompt Injection [82.41836544860833]
RL-Hammerは、攻撃モデルを訓練するためのシンプルなレシピで、強力なプロンプトインジェクションを実行するために自動的に学習する。
我々は,高度に効果的で普遍的な攻撃を可能にする実用的手法のセットを提案する。
RL-Hammerは、GPT-4oに対して98%のASR、GPT-5に対して72%のASRに達した。
論文 参考訳(メタデータ) (2025-10-06T15:06:04Z) - AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning [78.5751183537704]
AdvEvo-MARLは、タスクエージェントに安全性を内部化する、共進化型マルチエージェント強化学習フレームワークである。
外部ガードに頼るのではなく、AdvEvo-MARLは攻撃者と防御者を共同で最適化する。
論文 参考訳(メタデータ) (2025-10-02T02:06:30Z) - Autonomous Cyber Resilience via a Co-Evolutionary Arms Race within a Fortified Digital Twin Sandbox [0.0]
本稿では「信頼の傾向」に対処するARC(Adversarial Resilience Co-evolution)フレームワークを紹介する。
ARCは、Fortified Secure Digital Twin内での共同進化型武器レースを開催する。
包括的なアブレーション調査は、共進化プロセス自体が27%のパフォーマンス改善に寄与していることを示している。
論文 参考訳(メタデータ) (2025-06-25T03:28:48Z) - A Comprehensive Study of the Robustness for LiDAR-based 3D Object
Detectors against Adversarial Attacks [84.10546708708554]
3Dオブジェクト検出器は、セキュリティクリティカルなタスクにおいてますます重要になっている。
敵の攻撃に対する強固さを理解することが不可欠である。
本稿では,LiDARをベースとした3次元検出器の対角攻撃時のロバスト性評価と解析を行った。
論文 参考訳(メタデータ) (2022-12-20T13:09:58Z) - Fixed Points in Cyber Space: Rethinking Optimal Evasion Attacks in the
Age of AI-NIDS [70.60975663021952]
ネットワーク分類器に対するブラックボックス攻撃について検討する。
我々は、アタッカー・ディフェンダーの固定点がそれ自体、複雑な位相遷移を持つ一般サムゲームであると主張する。
攻撃防御力学の研究には連続的な学習手法が必要であることを示す。
論文 参考訳(メタデータ) (2021-11-23T23:42:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。