論文の概要: Refploit: Facilitating Exploit Construction via Code-Agent Trajectory Repair
- arxiv url: http://arxiv.org/abs/2607.01760v1
- Date: Thu, 02 Jul 2026 06:22:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.697511
- Title: Refploit: Facilitating Exploit Construction via Code-Agent Trajectory Repair
- Title(参考訳): Refploit: Code-Agent Trajectory repairによるエクスプロイト構築の促進
- Abstract要約: Refploitは、公開エクスプロイト参照からの脆弱性の再現を容易にするためのトラジェクトリリカバリフレームワークである。
我々はRefploitを3つのオープンソースのJava脆弱性データセットで評価し、143の脆弱性に対する172のエクスプロイト参照をカバーした。
- 参考スコア(独自算出の注目度): 13.559398564795048
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Vulnerability exploits play a crucial role in assessing the downstream impact of Java library vulnerabilities. While some vulnerabilities are accompanied by disclosed exploit references, automatically reproducing such references into runnable exploits remains challenging because they are often incomplete, unstructured, or only describe partial reproduction steps. Recent code agents provide a promising way to automate this process, but our study shows that their generated exploits often appear successful without triggering the actual vulnerable logic, such as replacing vulnerable APIs with self-implemented functions. To address this, we propose Refploit, an LLM-based trajectory recovery framework for facilitating vulnerability reproduction from public exploit references. The key insight is that a failed agent trajectory is not entirely useless. It may have already completed some reproduction subtasks while also revealing misleading directions that should be avoided. Refploit first validates an agent-generated exploit through differential execution. When the exploit is ineffective, Refploit analyzes its reproduction progress, locates the trajectory segments associated with the reproduction progress, and derives constraints to guide focused recovery. We evaluate Refploit on three open-source Java vulnerability datasets, covering 172 exploit references for 143 vulnerabilities. Under DeepSeek-V4-Flash, Refploit successfully reproduces 138 exploits, achieving a reproduction rate of 80.2%. It achieves a 64.3% relative improvement over the initially generated trajectories and outperforms both the SOTA exploit-generation method PoCGen and advanced code agents such as Codex with GPT-5.4. We further adapt Refploit to another code agent and observe consistent improvements, demonstrating its generality.
- Abstract(参考訳): 脆弱性のエクスプロイトは、Javaライブラリの脆弱性の下流への影響を評価する上で重要な役割を果たす。
いくつかの脆弱性は公開されているエクスプロイト参照を伴っているが、そのような参照を実行可能なエクスプロイトに自動で再現することは、しばしば不完全、非構造化、あるいは部分的な複製ステップのみを記述するため、難しいままである。
最近のコードエージェントは、このプロセスを自動化するための有望な方法を提供していますが、我々の研究では、脆弱性のあるAPIを自己実装機能に置き換えるなど、実際の脆弱なロジックを起動することなく、生成されたエクスプロイトが成功することが多いことを示しています。
そこで本稿では,LLMベースのトラジェクトリリカバリフレームワークであるRefploitを提案する。
重要な洞察は、失敗したエージェントの軌道は、完全には役に立たないことである。
すでにいくつかの再生サブタスクを完了したかもしれないが、避けるべき誤った方向も明らかにしている。
Refploitはまず、差分実行を通じてエージェントが生成したエクスプロイトを検証する。
エクスプロイトが有効でない場合、Refploitは再生進行を分析し、再生進行に関連する軌道セグメントを特定し、集中した回復を導くための制約を導出する。
我々はRefploitを3つのオープンソースのJava脆弱性データセットで評価し、143の脆弱性に対する172のエクスプロイト参照をカバーした。
DeepSeek-V4-Flashの下でRefploitは128のエクスプロイトを再現し、再生率は80.2%に達した。
当初生成されたトラジェクトリよりも64.3%の相対的な改善を実現し、SOTAのエクスプロイトジェネレーションメソッドPoCGenと、GPT-5.4のCodexのような先進的なコードエージェントの両方を上回っている。
我々はRefploitを他のコードエージェントに適応させ、一貫した改善を観察し、その汎用性を実証する。
関連論文リスト
- Vulnerability Localization Benchmark: Measuring Agentic Security Analysis at Repository Scale [54.83971397981572]
言語モデルエージェントは、ソフトウェアリポジトリ全体を通してますます運用される。
サイバーセキュリティ評価は、関連するコードを見つけることよりも、脆弱性を検出、再生、または修復できるかどうかを測定する。
脆弱性のローカライゼーションについて検討する。弱点クラスと不慣れなリポジトリが与えられた場合、その弱点に関連する実装ファイルを特定する。
論文 参考訳(メタデータ) (2026-09-14T17:44:51Z) - ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks? [92.21756459993695]
低レベルのプログラム推論を必要とするため、爆発は難しい作業です。
その重要性と診断価値にもかかわらず、搾取は未評価のままである。
ExploitGymは、AIエージェントのエクスプロイト能力に関する大規模で多様な、現実的なベンチマークである。
論文 参考訳(メタデータ) (2026-05-11T18:00:14Z) - SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization [61.91729298584227]
SecureForgeは、フロンティアモデルのセキュリティリスクを監査し、監査インフォームされたセキュアなシステムプロンプトを生成する自動化パイプラインである。
SecureForgeは、まず静的に検出可能な脆弱性を生成する良性プロンプトを特定し、その後、さまざまなシナリオの大規模な合成プロンプトコーパスに増幅する。
フロンティアモデルでは、SecureForgeは、ユニットテストの成功と出力セキュリティの両方において統計的に有意な改善をもたらし、出力脆弱性は最大48%削減された。
論文 参考訳(メタデータ) (2026-05-08T18:40:47Z) - A Multi-Agent Framework for Automated Exploit Generation with Constraint-Guided Comprehension and Reflection [30.539826266048014]
Vulnsageは自動エクスプロイト生成のためのマルチエージェントフレームワークである。
explosionjsのような最先端のツールよりも34.64%のエクスプロイトを生成する。
Vulnsageは、現実世界のシナリオで146のゼロデイ脆弱性を発見し、検証した。
論文 参考訳(メタデータ) (2026-04-06T19:47:17Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - VulnRepairEval: An Exploit-Based Evaluation Framework for Assessing Large Language Model Vulnerability Repair Capabilities [41.85494398578654]
VulnRepairEvalは、関数型Proof-of-Conceptエクスプロイトに固定された評価フレームワークである。
我々のフレームワークは、再現可能な微分評価を可能にする包括的でコンテナ化された評価パイプラインを提供する。
論文 参考訳(メタデータ) (2025-09-03T14:06:10Z) - PoCGen: Generating Proof-of-Concept Exploits for Vulnerabilities in Npm Packages [13.877936187495555]
我々は,npmパッケージの脆弱性に対するPoCエクスプロイトを自律的に生成し,検証する新しいアプローチであるPoCGenを提案する。
PoCGenはSecBench$.jsデータセットの脆弱性の77%のエクスプロイトを生成することに成功した。
論文 参考訳(メタデータ) (2025-06-05T12:37:33Z) - There are More Fish in the Sea: Automated Vulnerability Repair via Binary Templates [4.907610470063863]
本稿では,Javaバイナリに対するテンプレートベースの自動脆弱性修復手法を提案する。
Vul4Jデータセットの実験では、TemVURが11の脆弱性の修正に成功した。
TemVURの一般化性を評価するため、MaryVuls4Jデータセットをキュレートする。
論文 参考訳(メタデータ) (2024-11-27T06:59:45Z) - Exploring Automatic Cryptographic API Misuse Detection in the Era of LLMs [60.32717556756674]
本稿では,暗号誤用の検出において,大規模言語モデルを評価するための体系的評価フレームワークを提案する。
11,940個のLCM生成レポートを詳細に分析したところ、LSMに固有の不安定性は、報告の半数以上が偽陽性になる可能性があることがわかった。
最適化されたアプローチは、従来の手法を超え、確立されたベンチマークでこれまで知られていなかった誤用を明らかにすることで、90%近い顕著な検出率を達成する。
論文 参考訳(メタデータ) (2024-07-23T15:31:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。