論文の概要: CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild
- arxiv url: http://arxiv.org/abs/2608.23181v3
- Date: Tue, 01 Sep 2026 12:45:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.455793
- Title: CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild
- Title(参考訳): CyberFactory: 野生のインスタンスでサイバーセキュリティ機能をスケーリングする
- Authors: Jian Yang, Haau-Sing Li, Shawn Guo, Zixi Zhao, Yibo Tan, Jiajun Wu, Aishan Liu, Zhoujun Li, Xianglong Liu, Tianyu Zheng, Bryan Dai, Chengran Yang, Weifeng Lv,
- Abstract要約: CyberFactoryは、CVEを含む公開脆弱性アーティファクトをワイルドから実行可能で検証可能なタスクインスタンスに変換する。
再利用可能な脆弱性分析スキルを使用して、ソースインスペクション、ドメイン前の問題解決、エビデンスベースのバリデーションを通じて教師を指導する。
CyberGymでは1時間の予算で52.4%のPass@1に達し、Qwen3.5ベースモデルを+22.8ポイント改善した。
- 参考スコア(独自算出の注目度): 49.44069582581181
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As large language models (LLMs) continue to advance in coding capabilities, their potential in cybersecurity has drawn increasing research attention, with closed-source LLMs (e.g., Mythos) delivering advanced cybersecurity capabilities. However, existing open-source efforts remain limited: frontier open-weight models do not provide reproducible cybersecurity training solutions, open-source training solutions focus on isolated tasks and lack scalable agentic data, and scaling agentic rollouts requires strong domain priors. In this work, we introduce \textbf{CyberFactory}, a unified open-source framework that connects data construction, trajectory synthesis, and model training across proof-of-concept (PoC) generation, vulnerability patching, and cybersecurity question answering (CyberQA). CyberFactory transforms public vulnerability artifacts, including CVEs from the wild, into executable and verifiable task instances. It further uses a reusable vulnerability-analysis skill to guide the teacher through source inspection, problem solving with domain prior, and evidence-based validation. The resulting supervision is agentic: the model interacts with tools and target environments and revises its solutions according to execution feedback. Using these trajectories, we train and release \modelname\footnote{\emph{Aegis} is, in Greek mythology, the protective shield of Zeus and Athena; the name reflects the model's defensive, security-oriented purpose.}, which internalizes the skill-guided procedure without requiring the skill at inference time. On CyberGym, \modelname reaches 52.4% Pass@1 under a one-hour budget, improving over its Qwen~3.5 base model by +22.8 points and outperforming the evaluated general-purpose backbones under the same scaffold.
- Abstract(参考訳): 大規模言語モデル(LLM)がコーディング能力の進歩を続けている中、サイバーセキュリティにおける彼らのポテンシャルは研究の関心を増し、高度なサイバーセキュリティ機能を提供するオープンソースLLM(例:Mythos)が登場した。
フェデラルなオープンウェイトモデルは再現可能なサイバーセキュリティトレーニングソリューションを提供しておらず、オープンソースのトレーニングソリューションは独立したタスクに重点を置いており、スケーラブルなエージェントデータを欠いている。
本研究では,概念実証(PoC)生成,脆弱性パッチ,サイバーセキュリティ質問応答(CyberQA)をまたいだデータ構築,トラジェクトリ合成,モデルトレーニングを結合する,統一的なオープンソースフレームワークである‘textbf{CyberFactory} を紹介する。
CyberFactoryは、CVEを含む公開脆弱性アーティファクトをワイルドから実行可能で検証可能なタスクインスタンスに変換する。
さらに、再利用可能な脆弱性分析スキルを使用して、ソースインスペクション、ドメイン前の問題解決、エビデンスベースのバリデーションを通じて教師を指導する。
モデルはツールやターゲット環境と相互作用し、実行時のフィードバックに従ってソリューションを修正します。
これらの軌跡を用いて、私たちは『モデルname\footnote{\emph{Aegis}』を訓練し、リリースする。ギリシア神話では、ゼウスとアテーナの保護シールドである。
推論時にスキルを必要とせずに、スキルガイドの手続きを内部化する。
CyberGymでは、1時間の予算で52.4%のPass@1に達し、Qwen~3.5ベースモデルを+22.8ポイント改善し、評価された汎用バックボーンを同じ足場で上回っている。
関連論文リスト
- RedSage: A Cybersecurity Generalist LLM [45.91667919408369]
RedSageは、ドメイン認識事前トレーニングとポストトレーニングを備えた、オープンソースでローカルにデプロイ可能なサイバーセキュリティアシスタントである。
フレームワーク、攻撃的テクニック、セキュリティツールにまたがる28.6Kのドキュメントにまたがって、大規模なWebフィルタリングと高品質なリソースのマニュアルコレクションを使用します。
RedSageは、確立されたサイバーセキュリティベンチマーク(例えば、CTI-Bench、CyberMetric、SECURE)と一般的なLCMベンチマークで評価され、より広範な一般化を評価する。
論文 参考訳(メタデータ) (2026-01-29T18:59:57Z) - Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs [65.6660735371212]
textbftextscJustAskは,インタラクションのみで効果的な抽出戦略を自律的に発見するフレームワークである。
これは、アッパー信頼境界に基づく戦略選択と、原子プローブと高レベルのオーケストレーションにまたがる階層的なスキル空間を用いて、オンライン探索問題として抽出を定式化する。
この結果から,現代のエージェントシステムにおいて,システムプロンプトは致命的ではあるがほぼ無防備な攻撃面であることがわかった。
論文 参考訳(メタデータ) (2026-01-29T03:53:25Z) - Agentic AI for Autonomous Defense in Software Supply Chain Security: Beyond Provenance to Vulnerability Mitigation [0.0]
本論文は,自律型ソフトウェアサプライチェーンセキュリティに基づくエージェント人工知能(AI)の例を含む。
大規模言語モデル(LLM)ベースの推論、強化学習(RL)、マルチエージェント調整を組み合わせている。
その結果、エージェントAIは、自己防衛的で積極的なソフトウェアサプライチェーンへの移行を促進することが示されている。
論文 参考訳(メタデータ) (2025-12-29T14:06:09Z) - PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach [49.14349403242654]
我々は、リスクを伴う行動に関わるモデルの確率を評価する新しいベンチマークフレームワークであるtextbfPropensityBench$を提示する。
私たちのフレームワークには,サイバーセキュリティ,自己増殖,バイオセキュリティ,化学セキュリティという,リスクの高い4つのドメインにまたがる6,648のツールを備えた,5,874のシナリオが含まれています。
オープンソースとプロプライエタリなフロンティアモデル全体で、私たちは9つの不確実性の兆候を発見しました。
論文 参考訳(メタデータ) (2025-11-24T18:46:44Z) - CyberSOCEval: Benchmarking LLMs Capabilities for Malware Analysis and Threat Intelligence Reasoning [1.3863707631653515]
サイバーディフェンダーは、セキュリティ警告、脅威情報信号、ビジネスコンテキストの変化に圧倒されている。
既存の評価では、現実世界のディフェンダーに最も関係のあるシナリオを十分に評価していない。
我々はCyberSecEval 4.0のオープンソースベンチマークスイートであるCyberSOCEvalを紹介した。
論文 参考訳(メタデータ) (2025-09-24T14:33:07Z) - DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents [52.92354372596197]
大規模言語モデル(LLM)は、強力な推論と計画能力のため、エージェントシステムの中心となってきています。
この相互作用は、外部ソースからの悪意のある入力がエージェントの振る舞いを誤解させる可能性がある、インジェクション攻撃のリスクも引き起こす。
本稿では,信頼に値するエージェントシステムのための動的ルールベースの分離フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-13T05:01:09Z) - CRAKEN: Cybersecurity LLM Agent with Knowledge-Based Execution [22.86304661035188]
大規模言語モデル(LLM)エージェントは、サイバーセキュリティタスクを自動化することができ、再設計することなく、進化するサイバーセキュリティの状況に適応することができる。
トレーニングデータ以外の最新のサイバーセキュリティの専門知識にアクセスし、複雑なタスク計画に新たな知識を統合することだ。
本稿では,3つのコア機構を通じて,サイバーセキュリティ能力を向上させる知識ベースLLMエージェントフレームワークであるCRAKENを提案する。
論文 参考訳(メタデータ) (2025-05-21T11:01:11Z) - Enhanced LLM-Based Framework for Predicting Null Pointer Dereference in Source Code [2.2020053359163305]
我々は「DeLLNeuN」と呼ばれる細調整大言語モデル(LLM)を用いた新しいアプローチを提案する。
Draper VDISCデータセットを用いて87%の精度と88%の精度を示した。
論文 参考訳(メタデータ) (2024-11-29T19:24:08Z) - CodeLMSec Benchmark: Systematically Evaluating and Finding Security
Vulnerabilities in Black-Box Code Language Models [58.27254444280376]
自動コード生成のための大規模言語モデル(LLM)は、いくつかのプログラミングタスクにおいてブレークスルーを達成した。
これらのモデルのトレーニングデータは、通常、インターネット(例えばオープンソースのリポジトリから)から収集され、障害やセキュリティ上の脆弱性を含む可能性がある。
この不衛生なトレーニングデータは、言語モデルにこれらの脆弱性を学習させ、コード生成手順中にそれを伝播させる可能性がある。
論文 参考訳(メタデータ) (2023-02-08T11:54:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。