論文の概要: Evaluating Generalization Mechanisms in Autonomous Cyber Attack Agents
- arxiv url: http://arxiv.org/abs/2603.10041v1
- Date: Fri, 06 Mar 2026 22:24:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-12 16:22:32.581347
- Title: Evaluating Generalization Mechanisms in Autonomous Cyber Attack Agents
- Title(参考訳): 自律型サイバー攻撃エージェントの一般化メカニズムの評価
- Abstract要約: 我々は、自律的な攻撃エージェントが訓練対象のネットワークを超えた移動に失敗する方法について研究する。
3つのエージェントファミリー(従来のRL,適応エージェント,LLMベースのエージェント)を比較し,行動分布に基づく行動/XAI分析を用いて障害モードをローカライズする。
プロンプト駆動型LDMエージェントは、保持された再割り当てにおいて最も成功したが、推論時間の増大、透明性の低下、繰り返し/無効動作ループのような実用的な障害モードのコストがかかる。
- 参考スコア(独自算出の注目度): 0.5611004142746667
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Autonomous offensive agents often fail to transfer beyond the networks on which they are trained. We isolate a minimal but fundamental shift -- unseen host/subnet IP reassignment in an otherwise fixed enterprise scenario -- and evaluate attacker generalization in the NetSecGame environment. Agents are trained on five IP-range variants and tested on a sixth unseen variant; only the meta-learning agent may adapt at test time. We compare three agent families (traditional RL, adaptation agents, and LLM-based agents) and use action-distribution-based behavioral/XAI analyses to localize failure modes. Some adaptation methods show partial transfer but significant degradation under unseen reassignment, indicating that even address-space changes can break long-horizon attack policies. Under our evaluation protocol and agent-specific assumptions, prompt-driven pretrained LLM agents achieve the highest success on the held-out reassignment, but at the cost of increased inference-time compute, reduced transparency, and practical failure modes such as repetition/invalid-action loops.
- Abstract(参考訳): 自律攻撃エージェントは訓練対象のネットワークを超えて移動できないことが多い。
我々は、最小限だが基本的なシフト -- 他の固定されたエンタープライズシナリオにおけるホスト/サブネットIP再割り当て -- を分離し、NetSecGame環境における攻撃者の一般化を評価する。
エージェントは5つのIPレンジの変種で訓練され、6番目の見えない変種でテストされる。
3つのエージェントファミリー(従来のRL,適応エージェント,LLMベースのエージェント)を比較し,行動分布に基づく行動/XAI分析を用いて障害モードをローカライズする。
いくつかの適応手法は部分的移動を示すが、見知らぬ再割り当ての下で顕著な劣化を示し、アドレス空間の変化でさえ長期水平攻撃ポリシーを破る可能性があることを示している。
評価プロトコルとエージェント固有の仮定の下では,プリトレーニング済みのLCMエージェントは,計算時間の増加,透明性の低減,繰り返し/無効動作ループなどの実用的障害モードといったコストで,保持された再割り当てにおいて最高の成功を収める。
関連論文リスト
- Hierarchical Agentic Incident Response with Digital-Twin-Validated Attack Inference [7.174851769918924]
大規模言語モデル(LLM)エージェントは、運用状況に対して推論できるが、攻撃や応答を幻覚させる可能性がある。
LLMに基づく攻撃予測,ロールアウト計画,デジタルツイン検証を統合した階層型エージェント応答フレームワークを提案する。
3つのマルチステージ攻撃シナリオ下で33コンポーネントのエンタープライズネットワークテストベッド上で,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-08-15T04:01:27Z) - Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution [25.26084224278813]
Role-Agentは単一のLarge Language Model(LLM)を使用してエージェントと環境の両方として同時に機能する。
Role-Agentはパフォーマンスを継続的に改善し、強いベースラインよりも平均4%以上向上する。
論文 参考訳(メタデータ) (2026-06-09T14:28:07Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly [15.168064055560293]
我々は、自己進化型サイバーセキュリティエージェントフレームワークであるtextscCyberEvolverを紹介した。
textscCyberEvolverは、失敗した実行試行の経験に基づいて、自身の足場を反復的に修正する。
CTFの課題,脆弱性のエクスプロイト,および4つのオープンソースLCMを用いた侵入テストタスクについて,textscCyberEvolverの評価を行った。
論文 参考訳(メタデータ) (2026-05-25T16:26:59Z) - OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents [74.20327254615854]
大規模言語モデルエージェントは、シーケンシャルな意思決定タスクを解決するために、推論、行動選択、観察をインターリーブする。
LLMエージェントの既存の推論時間適応法は、主にプロンプトや検索に依存している。
提案するOLIVIAは,ReAct型エージェントのための推論時行動適応フレームワークである。
論文 参考訳(メタデータ) (2026-05-11T19:28:20Z) - Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails [103.05296856071931]
本稿では,自己進化型大規模言語モデル(LLM)エージェントに特有の,アライメント・ティッピング・プロセス(ATP)を同定する。
ATPは、連続的な相互作用によってエージェントが訓練中に確立されたアライメント制約を放棄し、強化された自己関心の戦略を支持するときに生じる。
実験の結果、アライメントの利点は自己進化の下で急速に低下し、最初は整合性のない状態に収束したモデルであることが判明した。
論文 参考訳(メタデータ) (2025-10-06T14:48:39Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z) - Free Agent in Agent-Based Mixture-of-Experts Generative AI Framework [0.0]
強化学習自由エージェント (Reinforcement Learning Free Agent, RLFA) アルゴリズムは、永続的な過パフォーマンスを示すエージェントを検出し、除去するための報酬に基づくメカニズムを導入する。
第一のユースケースは不正検出であり、RLFAは事前に設定された閾値以下で検出精度が低下するエージェントを即座に交換する。
このダイナミックでフリーの緊急サイクルは、持続的な正確さ、出現する脅威への迅速な適応、進行中の運用に対する最小限の中断を保証する。
論文 参考訳(メタデータ) (2025-01-29T13:00:22Z) - From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning [62.54484062185869]
本稿では,エージェントの強化学習プロセスの最適化にステップワイド報酬を利用するStepAgentを紹介する。
エージェント反射とポリシー調整を容易にする暗黙の逆・逆の強化学習手法を提案する。
論文 参考訳(メタデータ) (2024-11-06T10:35:11Z) - Can Agents Run Relay Race with Strangers? Generalization of RL to
Out-of-Distribution Trajectories [88.08381083207449]
異種エージェントの制御可能な状態に対する一般化失敗の有病率を示す。
本稿では,学習中のQ関数に従って環境をエージェントの旧状態にリセットする,STA(Self-Trajectory Augmentation)という新しい手法を提案する。
論文 参考訳(メタデータ) (2023-04-26T10:12:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。