論文の概要: Pen-Strategist: A Reasoning Framework for Penetration Testing Strategy Formation and Analysis
- arxiv url: http://arxiv.org/abs/2605.04499v1
- Date: Wed, 06 May 2026 05:02:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.651746
- Title: Pen-Strategist: A Reasoning Framework for Penetration Testing Strategy Formation and Analysis
- Title(参考訳): Pen-Strategist: 侵入テスト戦略の形成と分析のための推論フレームワーク
- Authors: Yasod Ginige, Pasindu Marasinghe, Sajal Jain, Suranga Seneviratne,
- Abstract要約: Pen-Strategistフレームワークは、論理的推論を通じてペンテスティング戦略を導出する、新しいドメイン固有の推論モデルで構成されている。
強化学習を用いた戦略生成のためのQwen-3-14Bモデルを微調整する。
CTFKnowベンチマークの実験では、ベースモデルよりも18%パフォーマンスが向上した。
- 参考スコア(独自算出の注目度): 1.0312951426012829
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cyber threats are rapidly increasing, expanding their impact from large-scale enterprises to government services and individual users, making robust security systems increasingly essential. However, a significant shortage of skilled cybersecurity professionals exacerbates this challenge. While recent research has explored automating tasks such as penetration testing using LLM-based agents, existing frameworks often perform poorly due to limited capability in strategy formulation, domain-specific reasoning, and accurate action and tool selection. To overcome these limitations, we propose Pen-Strategist framework, consisting of a novel domain-specific reasoning model that derives pentesting strategies via logical reasoning and a classifier that converts the strategies into actionable steps. First, we construct a reasoning dataset containing logical explanations for both strategy derivation and step selection in pentesting scenarios. We then fine-tune a Qwen-3-14B model for strategy generation using reinforcement learning. Evaluation on the test split of the dataset demonstrates a 87% improvement in strategy derivation performance compared to the baseline. Furthermore, we integrate the fine-tuned Pen-Strategist model into existing automated pentesting frameworks, such as PentestGPT, and evaluate its performance on vulnerable machines, achieving a 47.5% improvement in subtask completion while surpassing the baseline GPT-5. Further experiments on the CTFKnow benchmark show an 18% performance gain over the base model. For step prediction, we train a semantic-based CNN classifier, which outperforms commercial LLMs by 28% and enhances execution stability. Finally, we conduct a user study to qualitatively assess the generated strategies, and Pen-Strategist demonstrates superior performance compared to the Claude-4.6-Sonnet.
- Abstract(参考訳): サイバー脅威は急速に増加し、大企業から政府サービスや個人ユーザーへの影響が拡大し、堅牢なセキュリティシステムがますます不可欠になっている。
しかし、熟練したサイバーセキュリティ専門家の不足により、この課題はさらに悪化する。
近年, LLMをベースとしたエージェントを用いた浸透試験などのタスクの自動化が検討されているが, 戦略定式化やドメイン固有の推論, 正確なアクションとツールの選択などにおいて, 既存のフレームワークの能力が不足しているため, 多くの場合, 性能が低下している。
これらの制約を克服するために、論理的推論を通じてペンテスト戦略を導出する新しいドメイン固有推論モデルと、その戦略を実行可能なステップに変換する分類器からなるPen-Strategistフレームワークを提案する。
まず,ペンテストシナリオにおける戦略導出とステップ選択の論理的説明を含む推論データセットを構築する。
次に、強化学習を用いた戦略生成のためのQwen-3-14Bモデルを微調整する。
データセットのテスト分割の評価は、ベースラインと比較して戦略導出性能が87%改善したことを示している。
さらに、PentestGPTなどの既存の自動ペンテストフレームワークに微調整のPen-Strategistモデルを統合し、脆弱なマシン上での性能評価を行い、ベースラインのGPT-5を越えながらサブタスク完了率を47.5%向上した。
CTFKnowベンチマークのさらなる実験では、ベースモデルよりも18%パフォーマンスが向上した。
ステップ予測には意味に基づくCNN分類器を訓練し、商業LLMを28%上回り、実行安定性を向上させる。
最後に,生成した戦略を質的に評価するユーザスタディを行い,Pen-StrategistはClaude-4.6-Sonnetと比較して優れた性能を示す。
関連論文リスト
- Strategy Executability in Mathematical Reasoning: Leveraging Human-Model Differences for Effective Guidance [86.46794021499511]
戦略利用と戦略実行可能性の間には、これまで未定のギャップがある。
SSR(Selective Strategy Retrieval)は,実行可能性を明確にモデル化するテストタイムフレームワークである。
SSRは、直接解決、文脈内学習、単一ソースガイダンスよりも信頼性が高く一貫した改善をもたらす。
論文 参考訳(メタデータ) (2026-02-26T03:34:23Z) - Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning [49.290631188365786]
Scaf-GRPOは、モデルの独立した学習が停滞した時に介入するトレーニングフレームワークである。
これはQwen2.5-Math-7Bモデルのパス@1スコアを、バニラGRPOベースラインよりも44.3%向上させる。
この結果から、我々のフレームワークは、それまで到達範囲を超えていた問題を解決するモデルの能力を解き放つ、堅牢で効果的な方法論を提供することを示した。
論文 参考訳(メタデータ) (2025-10-22T17:41:30Z) - Plan before Solving: Problem-Aware Strategy Routing for Mathematical Reasoning with LLMs [49.995906301946]
既存の手法は通常、数学的推論を行うためにLLM(Large Language Models)をガイドするための固定戦略を利用する。
分析の結果,単一戦略は問題固有の要件に適応できず,有効性と効率性のトレードオフを見落としていることが明らかとなった。
本稿では,PRISM(Planning and Routing through Instance-Specific Modeling)を提案する。
論文 参考訳(メタデータ) (2025-09-29T07:22:41Z) - Pentest-R1: Towards Autonomous Penetration Testing Reasoning Optimized via Two-Stage Reinforcement Learning [12.155067662797281]
Pentest-R1は、侵入テストタスクの推論機能を最適化するために設計されたフレームワークである。
環境フィードバックから直接学習し、堅牢なエラー自己補正と適応戦略を開発する。
AutoPenBenchでは、Pentest-R1は24.2%の成功率に達し、ほとんどの最先端モデルを上回っている。
論文 参考訳(メタデータ) (2025-08-10T15:14:05Z) - PrompTrend: Continuous Community-Driven Vulnerability Discovery and Assessment for Large Language Models [1.03121181235382]
プラットフォーム間で脆弱性データを収集し,多次元スコアリングを用いて評価するシステムであるPrompTrendを提案する。
本研究は,現在の言語モデルにおいて,機能向上によってセキュリティが向上し,コミュニティ主導の心理的操作が主要な脅威となるという仮定に挑戦する。
論文 参考訳(メタデータ) (2025-07-25T11:52:46Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z) - Adversarial Training for Defense Against Label Poisoning Attacks [53.893792844055106]
ラベル中毒攻撃は機械学習モデルに重大なリスクをもたらす。
本稿では,これらの脅威に対処するために,サポートベクトルマシン(SVM)に基づく新たな対角的防御戦略を提案する。
提案手法は, 様々なモデルアーキテクチャに対応し, カーネルSVMを用いた予測勾配降下アルゴリズムを用いて, 対向学習を行う。
論文 参考訳(メタデータ) (2025-02-24T13:03:19Z) - Crimson: Empowering Strategic Reasoning in Cybersecurity through Large
Language Models [4.960466107669653]
サイバーセキュリティの領域において,大規模言語モデル(LLM)の戦略的推論能力を高めるシステムであるCrimsonを紹介する。
CVEとMITRE ATT&CK技術とを関連付けることで、クリムソンは脅威予測と戦略防衛の取り組みを進めた。
論文 参考訳(メタデータ) (2024-03-01T08:43:43Z) - Fine-tuning Strategies for Domain Specific Question Answering under Low
Annotation Budget Constraints [4.273966905160028]
低予算環境でQAモデルを微調整する最善の戦略は、事前訓練された言語モデル(PLM)を、ターゲットデータセットとSQuADデータセットからなるデータセットで微調整することです。
本実験は,QAシステムを低予算で微調整する方法に関する最初の調査の1つであり,QA実践者にとって最も実践的な関心事である。
論文 参考訳(メタデータ) (2024-01-17T12:21:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。