論文の概要: CyberForge: Verified Vulnerability Injection at Repository Level for Cybersecurity Agent Training
- arxiv url: http://arxiv.org/abs/2608.06471v1
- Date: Thu, 06 Aug 2026 18:03:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.258069
- Title: CyberForge: Verified Vulnerability Injection at Repository Level for Cybersecurity Agent Training
- Title(参考訳): CyberForge: サイバーセキュリティエージェントトレーニングのためのリポジトリレベルでの脆弱性注入の検証
- Abstract要約: CyberForgeは、実際のC/C++プロジェクトに脆弱性を注入することで、実行可能なリポジトリレベルのセキュリティトレーニングデータを合成するフレームワークである。
結果として得られたコーパスには、80のプロジェクトにわたる検証済みの脆弱性1034と、63の弱点が含まれている。
このコーパスで収集された軌道の微調整により、SECのパッチの修理は+3.3から+14.7ポイント改善される。
- 参考スコア(独自算出の注目度): 42.087410274052836
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite recent advances, frontier large language model (LLM) agents remain limited in discovering and patching complex vulnerabilities in real-world software. Generally available agents can already aid attackers, who only need to find one exploitable weakness, while defenders must continuously identify and patch all vulnerabilities across fast-growing codebases. Stronger defensive agents would help close this gap, yet the scarcity of security training data with reproducible build and execution environments remains a bottleneck. We present CyberForge, a framework that synthesizes executable, repository-level security training data by injecting vulnerabilities into real C/C++ projects. It validates each instance dynamically: the injected build must pass the project's unit tests, and generated proof-of-vulnerability (PoV) must trigger on the injected build and not on the clean one. CyberForge is not limited by the availability of disclosed vulnerabilities, therefore it can scale in comparison to data augmentation techniques which rely on historic CVE data. The resulting corpus holds 1034 validated vulnerabilities across 80 projects and 63 weakness categories, with edit locality similar to real CVE patches under a real-versus-real noise floor. Fine-tuning on trajectories collected over this corpus improves SEC-bench patch repair by +3.3 to +14.7 points, in all six configurations of three model scales and two teachers, with the 31B student reaching its GPT-5.4-mini teacher, 72.7% against 74.0%. These gains generalize out of distribution to PatchEval, a corpus containing other programming languages, where every configuration also improves and the 31B student passes its teacher.
- Abstract(参考訳): 近年の進歩にもかかわらず、現実世界のソフトウェアにおける複雑な脆弱性の発見とパッチの分野では、フロンティア・大規模言語モデル(LLM)エージェントは限定的のままである。
一般的に利用可能なエージェントは攻撃者を支援することができ、攻撃者は悪用可能な弱点を見つけるだけでよい。
強力な防御エージェントは、このギャップを埋めるのに役立つだろうが、再現可能なビルドと実行環境を備えたセキュリティトレーニングデータの不足は、依然としてボトルネックである。
我々は、実際のC/C++プロジェクトに脆弱性を注入することで、実行可能なリポジトリレベルのセキュリティトレーニングデータを合成するフレームワークであるCyberForgeを紹介する。
インジェクトされたビルドはプロジェクトのユニットテストをパスしなければなりませんし、生成された実証-オブ-ハザーバビリティ(PoV)はインジェクトされたビルドをトリガーしなければなりません。
CyberForgeは、公開脆弱性の可用性によって制限されないため、履歴的なCVEデータに依存するデータ拡張テクニックと比較してスケールすることができる。
その結果得られたコーパスには、80のプロジェクトにわたる検証済みの脆弱性1034と63の弱点カテゴリがあり、実際のノイズフロアの下の実際のCVEパッチと同様のローカリティが編集されている。
このコーパスで収集された軌道の微調整により、SECのパッチの修理は+3.3から+14.7ポイント改善され、3つのモデルスケールと2人の教師の6つの構成で、31Bの学生はGPT-5.4-miniの教師に72.7%対74.0%で到達した。
これらの成果は、他のプログラミング言語を含むコーパスであるPatchEvalへの配布から一般化され、すべての構成も改善され、31Bの学生がその教師を追い越す。
関連論文リスト
- Vulnerability Localization Benchmark: Measuring Agentic Security Analysis at Repository Scale [54.83971397981572]
言語モデルエージェントは、ソフトウェアリポジトリ全体を通してますます運用される。
サイバーセキュリティ評価は、関連するコードを見つけることよりも、脆弱性を検出、再生、または修復できるかどうかを測定する。
脆弱性のローカライゼーションについて検討する。弱点クラスと不慣れなリポジトリが与えられた場合、その弱点に関連する実装ファイルを特定する。
論文 参考訳(メタデータ) (2026-09-14T17:44:51Z) - CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild [49.44069582581181]
CyberFactoryは、CVEを含む公開脆弱性アーティファクトをワイルドから実行可能で検証可能なタスクインスタンスに変換する。
再利用可能な脆弱性分析スキルを使用して、ソースインスペクション、ドメイン前の問題解決、エビデンスベースのバリデーションを通じて教師を指導する。
CyberGymでは1時間の予算で52.4%のPass@1に達し、Qwen3.5ベースモデルを+22.8ポイント改善した。
論文 参考訳(メタデータ) (2026-08-24T12:30:10Z) - VICBench: A Multi-Language Benchmark for Code Vulnerability Detection [12.72412925135797]
既存の脆弱性データセットは、プログラミング言語カバレッジの制限、パッチの複雑さの制限、プロジェクトスコープの狭さに悩まされている。
ベンチマーク - VICBench - Python、Java、C++の88プロジェクトで、48のCWEタイプをカバーする100のCVEに対して、100の検証済みのVICで構成されています。
VICBenchは、平均38.6行、対応する252.5行のVICの複雑な現実世界の脆弱性修正を特徴としている。
論文 参考訳(メタデータ) (2026-08-12T16:45:49Z) - PoCEvolve: Generating Proof-of-Concept Exploits from Security Patches with Vulnerability-Aware Prompt Evolution [9.074579150200455]
脆弱性修正コミットから直接PoCを生成する,脆弱性対応のプロンプト進化フレームワークであるPoCEvolveを紹介する。
PoCEvolveは、推論された脆弱性APIやコードカバレッジ情報など、脆弱性関連コンテキストのさまざまな次元の有用性を評価する。
詳細な脆弱性レポートが利用可能になった場合、PoCEvolveは71.7%の成功率に達し、PoCGenよりも11.1%向上した。
論文 参考訳(メタデータ) (2026-07-24T08:20:28Z) - Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens [65.53494487819053]
クローのようなAIエージェント(OpenClawなど)は、認証情報、ファイル、ツール、外部サービスへの永続的なアクセスを伴う、常にオンのプロセスである。
我々はClawのようなエージェントをエージェントコンピュータシステムとして扱い、そのゲートウェイランタイムがOSのような仲介の役割を担っている。
我々は、4つの攻撃面にわたる406の敵タスクのベンチマークであるSafeClawArenaを開発した。
論文 参考訳(メタデータ) (2026-06-29T18:00:45Z) - RAVEN: Agentic RAG for Automated Vulnerability Repair [48.8954115363348]
自動脆弱性修復のためのスケーラブルで効率的で自律的なフレームワークであるRAVENを提案する。
RAVENは、エージェント検索拡張生成(RAG)パイプラインと、制御された反復的な修復を統一されたフレームワークに統合する。
RAVENは全体の修復成功率83.13%を達成し、既存のすべての修復フレームワークを上回っている。
論文 参考訳(メタデータ) (2026-06-21T19:18:06Z) - Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw [87.97230960702274]
本稿では,OpenClawの安全性評価について紹介する。
エージェントの永続状態を3次元に統一するCIK分類法を導入する。
評価では、ライブOpenClawインスタンス上の12のアタックシナリオをカバーしています。
論文 参考訳(メタデータ) (2026-04-06T15:27:05Z) - CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability [50.57373283154859]
CVE-Factoryは、脆弱性タスクを自動変換するエキスパートレベルの品質を実現するための、最初のマルチエージェントフレームワークである。
最新の現実的な脆弱性についても評価され、66.2%の成功が証明されている。
コードセキュリティにおけるエージェントタスクの大規模スケーリングとして,1000以上の実行可能なトレーニング環境を合成する。
論文 参考訳(メタデータ) (2026-02-03T02:27:16Z) - CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale [45.97598662617568]
我々は188のソフトウェアプロジェクトにわたる1,507の実際の脆弱性を特徴とする大規模ベンチマークであるCyberGymを紹介した。
我々はCyberGymが35のゼロデイ脆弱性と17の歴史的不完全なパッチを発見できることを示した。
これらの結果は、CyberGymは、サイバーセキュリティにおけるAIの進歩を測定するための堅牢なベンチマークであるだけでなく、直接的な現実世界のセキュリティ効果を生み出すためのプラットフォームでもあることを強調している。
論文 参考訳(メタデータ) (2025-06-03T07:35:14Z) - There are More Fish in the Sea: Automated Vulnerability Repair via Binary Templates [4.907610470063863]
本稿では,Javaバイナリに対するテンプレートベースの自動脆弱性修復手法を提案する。
Vul4Jデータセットの実験では、TemVURが11の脆弱性の修正に成功した。
TemVURの一般化性を評価するため、MaryVuls4Jデータセットをキュレートする。
論文 参考訳(メタデータ) (2024-11-27T06:59:45Z) - Cybersecurity Defenses: Exploration of CVE Types through Attack Descriptions [1.0474508494260908]
VULDATは、文変換器MPNETを使用して、攻撃記述からシステムの脆弱性を識別する分類ツールである。
また,ATT&CKレポジトリから100件,CVEレポジトリから685件のアタック手法を適用した。
以上の結果より,F1スコア0.85,精度0.86,リコール0.83,F1スコア0.83,F1スコア0.85,F1スコア0.86,F1スコア0.83,F1スコア0。
論文 参考訳(メタデータ) (2024-07-09T11:08:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。