論文の概要: Quality-Assured Fuzz Harness Generation via the Four Principles Framework
- arxiv url: http://arxiv.org/abs/2605.21824v1
- Date: Wed, 20 May 2026 23:48:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.030156
- Title: Quality-Assured Fuzz Harness Generation via the Four Principles Framework
- Title(参考訳): ファジィ・アセスメントによるファジィ・ハーネス生成
- Authors: Ze Sheng, Dmitrijs Trizna, Luigino Camastra, Zhicheng Chen, Qingxiao Xu, Jeff Huang,
- Abstract要約: 生成プロセスを通じて正確性を向上させる自律型ハーネス生成システムであるQuartetFuzzを提案する。
コアとなるのはFour Principlesフレームワーク -- Logic Correctness (P1)、API Protocol Compliance (P2)、Security Boundary Respect (P3)、Entry Point Adequacy (P4) である。
- 参考スコア(独自算出の注目度): 9.484544174862325
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fuzz testing is the dominant technique for finding memory-safety vulnerabilities in C/C++ software, yet its effectiveness hinges on the quality of fuzz harnesses -- the programs that bridge fuzzers and library APIs. A growing body of tools now automate harness generation, but none systematically ensures the correctness of produced harnesses: logic errors, API misuse, and lifecycle violations go undetected at the source level. As LLM-driven generation scales harness creation, uncontrolled quality turns scale into a liability. We present QuartetFuzz, an autonomous harness-generation system that systematically improves correctness throughout the generation process. At its core is the Four Principles framework -- Logic Correctness (P1), API Protocol Compliance (P2), Security Boundary Respect (P3), and Entry Point Adequacy (P4) -- the first source-level definition of harness correctness with mathematical specifications and implementable checks. We operationalize these principles in an autonomous LLM agent that produces harnesses satisfying P1-P4 through a generate-check-fix loop before any fuzzing begins. Deployed on 23 open-source projects spanning C/C++, Java, and JavaScript, the system submits 42 bug reports, of which 29 are fixed or confirmed upstream (including 3 CVEs) and only 2 are rejected (4.8% FP rate). During generation, the built-in P1/P2 checks automatically intercepted 58 harness-induced crashes that would otherwise have been false positives. Applied as a quality auditor to 586 existing production harnesses across 70 projects, the system identifies 53 violations (45 confirmed, 35 fixed). We release a dataset of 100 labeled harnesses for reproducible evaluation. Code and dataset are available at https://github.com/OwenSanzas/QuartetFuzz
- Abstract(参考訳): ファズテストは、C/C++ソフトウェアでメモリ安全性の脆弱性を見つける主要なテクニックであるが、その効果はファズハーネスの品質に依存している。
成長するツール群がハーネス生成を自動化するようになったが、ロジックエラー、API誤用、ライフサイクル違反といった、生成されたハーネスの正確性を体系的に保証するものではない。
LLMによる生成はハーネスの生成をスケールするので、制御不能な品質はスケールを負債に変える。
本稿では, 自動ハーネス生成システムであるQuantetFuzzについて述べる。
コアとなるFour Principlesフレームワーク -- Logic Correctness (P1)、API Protocol Compliance (P2)、Security Boundary Respect (P3)、Entry Point Adequacy (P4) -- は、数学的仕様と実装可能なチェックによるハーネスの正確性に関する最初のソースレベル定義である。
我々はこれらの原理を,ファジィ開始前に生成-チェック-フィックスループを介して,P1-P4を満たすハーネスを生成する自律LLMエージェントで運用する。
C/C++、Java、JavaScriptにまたがる23のオープンソースプロジェクトにデプロイされ、42のバグレポートを提出している。
世代間、内蔵されたP1/P2チェックは58回のハーネスによるクラッシュを自動で妨害した。
70のプロジェクトにわたる586の既存の生産用ハーネスに品質監査官として適用され、53の違反(45の確認、35の修正)を特定する。
再現可能な評価のための100個のラベル付きハーネスのデータセットをリリースする。
コードとデータセットはhttps://github.com/OwenSanzas/QuartetFuzzで入手できる。
関連論文リスト
- Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - FuzzAgent: Multi-Agent System for Evolutionary Library Fuzzing [8.054484953700365]
ライブラリファジィングはソフトウェアサプライチェーンの強化に不可欠だが、大規模に採用するコストは高い。
本稿では,図書館ファジィングを進化過程に変換するマルチエージェントシステムFuzzAgentを紹介する。
実世界の20のC/C++ライブラリ上で4つの最先端ベースラインに対してFuzzAgentを評価する。
論文 参考訳(メタデータ) (2026-05-14T06:21:33Z) - Meta-Harness: End-to-End Optimization of Model Harnesses [52.31507076660471]
本稿では,大規模言語モデル(LLM)アプリケーションのためのコード検索を行う外部ループシステムであるMeta-Harnessを紹介する。
オンラインテキスト分類では、Meta-Harnessは4倍少ないコンテキストトークンを使用しながら、最先端のコンテキスト管理システムを7.7ポイント改善する。
検索強化数学推論では、200 IMOレベルの問題の精度を5つの保留モデルの平均4.7ポイント向上する。
論文 参考訳(メタデータ) (2026-03-30T05:33:50Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All [57.23434868678603]
Live-kBenchは、新たに発見されたカーネルバグのエージェントをスクラップし、評価するセルフ進化ベンチマークの評価フレームワークである。
kEnvは、カーネルのコンパイル、実行、フィードバックのためのエージェントに依存しないクラッシュ解決環境である。
kEnvを用いて3つの最先端エージェントをベンチマークし、最初の試行で74%のクラッシュを解決したことを示す。
論文 参考訳(メタデータ) (2026-02-02T19:06:15Z) - Specification-Guided Repair of Arithmetic Errors in Dafny Programs using LLMs [79.74676890436174]
本稿では,障害の局所化と修復のためのオラクルとして形式仕様を用いたDafny用のAPRツールを提案する。
プログラム内の各ステートメントの状態を決定するために、Hoareロジックの使用を含む一連のステップを通じて、障害をローカライズします。
また, GPT-4o miniが74.18%と高い修理成功率を示した。
論文 参考訳(メタデータ) (2025-07-04T15:36:12Z) - May the Feedback Be with You! Unlocking the Power of Feedback-Driven Deep Learning Framework Fuzzing via LLMs [20.03968975178177]
ファズテスト(ファズテスト、fuzzing)は、ディープラーニング(DL)フレームワークのバグを見つけるための、シンプルで効果的な方法である。
本稿では,LLM(Large Language Model)とLLM(Generation LLM)という2つの大言語モデル(LLM)からなるフィードバック情報を効果的に活用するFUELを提案する。
FUELはPyTorchのラインコードカバレッジを改善し、最先端のベースラインよりも9.15%、14.70%向上できることを示す。
論文 参考訳(メタデータ) (2025-06-21T08:51:53Z) - CKGFuzzer: LLM-Based Fuzz Driver Generation Enhanced By Code Knowledge Graph [29.490817477791357]
本稿では,コード知識グラフによって駆動され,インテリジェントエージェントシステムによって駆動されるファズテスト手法を提案する。
コードナレッジグラフは、そのグラフの各ノードがコードエンティティを表す、プログラム間解析によって構築される。
CKGFuzzerは最先端技術と比較してコードカバレッジが平均8.73%向上した。
論文 参考訳(メタデータ) (2024-11-18T12:41:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。