論文の概要: An Empirical Analysis of CodeQL False Positives and Query Refinements for Java Vulnerabilities
- arxiv url: http://arxiv.org/abs/2609.04535v1
- Date: Thu, 03 Sep 2026 22:48:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.844907
- Title: An Empirical Analysis of CodeQL False Positives and Query Refinements for Java Vulnerabilities
- Title(参考訳): Javaの脆弱性に対するCodeQLの偽陽性とクエリリファインメントの実証分析
- Abstract要約: 110プロジェクトの167のCVEインスタンス上で、CodeQLのJavaセキュリティクエリスイートを実行しています。
我々は,500個の偽陽性経路と位置を手動でレビューし,ソースレベルの分類を構築した。
クエリレベルで偽陽性パターンの繰り返しを検出しフィルタするCodeQLの改良を実装している。
- 参考スコア(独自算出の注目度): 7.697021102902879
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Static application security testing (SAST) tools help developers find vulnerabilities before deployment, but false positives create substantial triage effort. We study whether CodeQL false positives in Java security analysis form recurring, explainable patterns that can be reduced by refining the analysis. We run CodeQL's Java security query suite on 167 CVE instances from 110 projects, focusing on the ten queries with the highest false positive rates. We manually review 500 sampled false positive paths and locations and construct a source-level taxonomy. The five categories are Missed Path Constraint or Sanitization (36.6%), Benign Execution Context (29.4%), Missing Trust Boundary Modeling (27.6%), Imprecise Concurrency Modeling (5%), and Imprecise Sink Modeling (1.4%). Guided by these findings, we implement CodeQL refinements that detect and filter recurring false positive patterns at the query level. The refinements remove 81.8% of reviewed false positives. Across the full selected-query dataset, they remove 15.8% of reported paths and locations while retaining 7 of 8 true positives. This shows that many false positives can be reduced in the analysis, although fixed refinements often depend on project-specific context. To address this generalization gap, we evaluate whether agentic coding tools can adapt refinement patterns to new projects. Given our patterns as templates, the two tools succeed on 56% and 62% of tasks, with query compile-pass rates above 90%. Without this guidance, both succeed on only 28%, while compile rates fall to 30-36%. These results support a refinement-oriented SAST workflow in which recurring false positives are modeled in CodeQL queries and automatically adapted to different project contexts, reducing repeated triage.
- Abstract(参考訳): 静的アプリケーションセキュリティテスト(SAST)ツールは、デプロイ前に脆弱性を見つけるのに役立つが、偽陽性は相当なトリアージ作業を引き起こす。
我々は、Javaのセキュリティ分析におけるコードQLの偽陽性が、分析を精査することで削減できる、繰り返し、説明可能なパターンを形成しているかどうかを調査する。
110プロジェクトの167のCVEインスタンス上で,CodeQLのJavaセキュリティクエリスイートを実行しています。
我々は,500個の偽陽性経路と位置を手動でレビューし,ソースレベルの分類を構築した。
5つのカテゴリは、ミス・パス制約または衛生化(36.6%)、良心的実行コンテキスト(29.4%)、ミス・トラスト境界モデリング(27.6%)、不正確並行モデリング(5%)、不正確シンク・モデリング(1.4%)である。
これらの知見に導かれて、クエリレベルで偽陽性パターンを繰り返し検出しフィルタリングするCodeQLの改良を実装した。
修正により、レビューされた偽陽性の81.8%が取り除かれた。
選択されたクエリーデータセット全体にわたって、報告されたパスとロケーションの15.8%を削除し、8つの真正の7を保持した。
このことは、多くの偽陽性を解析において減少させることができることを示しているが、固定された改善はしばしばプロジェクト固有の文脈に依存する。
この一般化のギャップに対処するために,エージェント型コーディングツールが新たなプロジェクトに改良パターンを適用できるかどうかを評価する。
テンプレートとしての私たちのパターンを考えると、この2つのツールは56%と62%のタスクで成功し、クエリのコンパイルパス率は90%以上です。
このガイダンスがなければ、どちらもわずか28%で成功し、コンパイル率は30~36%に低下する。
これらの結果は、CodeQLクエリで繰り返し偽陽性がモデル化され、異なるプロジェクトコンテキストに自動的に適合する改善指向のSASTワークフローをサポートし、繰り返しトリアージを削減している。
関連論文リスト
- CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation [1.8589311604031529]
CodeAssayは10のソフトウェアエンジニアリングカテゴリにまたがる185のPythonタスクの分類学第一のベンチマークである。
監査済みの真実、生成と修復のための公開テスト、グレーディングのための隠されたテスト、突然変異ベースのテストスーツ検証、選択されたコードプロパティ対策を組み合わせる。
論文 参考訳(メタデータ) (2026-08-04T12:15:17Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions [52.50730821321986]
大規模言語モデル(LLM)におけるバージョンレベルのリスクの大規模評価を初めて行った。
我々は1000のStack OverflowプログラミングタスクのベンチマークであるPinTrace上で10のLLMを評価した。
LLM バージョン選択は LLM ベース開発における第1級, 以前は見落とされたリスクサーフェスとして確認された。
論文 参考訳(メタデータ) (2026-05-07T13:52:59Z) - QASecClaw: A Multi-Agent LLM Approach for False Positive Reduction in Static Application Security Testing [0.0]
静的アプリケーションセキュリティテストと,大規模言語モデルに基づくコンテキストコードレビューのコーディングを組み合わせたマルチエージェントアプローチであるQASecClawを提案する。
SASTエンジンが最初に脆弱性を報告し、Large Language ModelベースのSAST Filter Agentがソースコードコンテキストで各発見をレビューし、それが真正か偽正かを決定する。
論文 参考訳(メタデータ) (2026-05-03T14:05:52Z) - LLM-Guided Issue Generation from Uncovered Code Segments [2.9610847900970856]
IssueSpecterは未発見のコードセグメントのバグを見つけ、優先順位付けされた実行可能なイシューレポートを自動的に生成する。
我々は、13のアクティブメンテナンスPythonプロジェクトでIssueSpecterを評価し、10,467のイシューレポートを生成した。
論文 参考訳(メタデータ) (2026-04-28T21:10:53Z) - Agentic Jackal: Live Execution and Semantic Value Grounding for Text-to-JQL [1.5773713958458309]
自然言語をJira Query Language(JQL)にマッピングするためのオープンな実行ベースのベンチマークは存在しない。
Jackalは、20万以上の問題のあるライブJiraインスタンスで10万の検証済みのNL-JQLペアで構成される、最初の大規模実行ベースのテキスト-to-JQLベンチマークである。
論文 参考訳(メタデータ) (2026-04-10T16:27:31Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - Evaluating NL2SQL via SQL2NL [45.88028371034407]
新しいフレームワークは意味論的に等価で語彙的に多様なクエリを生成する。
最先端のモデルは、標準ベンチマークが示すよりもはるかに脆弱だ。
論文 参考訳(メタデータ) (2025-09-04T21:03:59Z) - CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification [71.34070740261072]
本稿では,テストケースの生成と完成におけるモデルの能力を評価するためのベンチマークCLOVERを提案する。
ベンチマークはタスク間でのコード実行のためにコンテナ化されています。
論文 参考訳(メタデータ) (2025-02-12T21:42:56Z) - ProofAug: Efficient Neural Theorem Proving via Fine-grained Proof Structure Analysis [50.020850767257095]
本稿では,LLMに様々な粒度で自動化手法を付加するProofAugを提案する。
本手法は,オープンソースのDeep-math-7bベースモデルとIsabelle証明アシスタントを用いて,MiniF2Fベンチマークで検証した。
また、ProofAugのLean 4バージョンを実装し、Kimina-Prover-seek-Distill-1.5Bのパス@1のパフォーマンスを44.3%から50.4%に改善します。
論文 参考訳(メタデータ) (2025-01-30T12:37:06Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z) - Finding 709 Defects in 258 Projects: An Experience Report on Applying CodeQL to Open-Source Embedded Software (Experience Paper) -- Extended Report [5.1138836487878825]
SASTツールは滅多に使われません。プロジェクトのわずか3%は、自明なコンパイラ分析を越えています。
開発者は、非効率性と偽陽性という認識を、採用制限の理由として挙げた。
258プロジェクト全体で、CodeQLは709の真の欠陥を報告し、偽陽性率は34%だった。
セキュリティ上の脆弱性は535件(75%)あり、その中にはMicrosoft、Amazon、Apache Foundationが管理する主要なプロジェクトも含まれる。
論文 参考訳(メタデータ) (2023-09-30T00:49:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。