論文の概要: LLMSec-AV: A Vulnerability Taxonomy and LLM-Driven Software Weakness Discovery Framework for Autonomous Vehicles
- arxiv url: http://arxiv.org/abs/2609.09386v1
- Date: Tue, 08 Sep 2026 19:39:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.798466
- Title: LLMSec-AV: A Vulnerability Taxonomy and LLM-Driven Software Weakness Discovery Framework for Autonomous Vehicles
- Title(参考訳): LLMSec-AV: 自律走行車のための脆弱性分類とLCM駆動型ソフトウェア弱さ発見フレームワーク
- Abstract要約: 明示的な自動車両(AV)セキュリティ知識を持つ大規模言語モデル(LLM)は、ルールベースのツールを超えた弱点検出を改善する。
我々は、脆弱な18のクラス、脆弱性記録、セキュリティアドバイザリ、AVセキュリティ文献を備えたAV脆弱性分類を開発し、LLMベースの自動車両セキュリティ分析(LLMSec-AV)に統合した。
LLMSec-AVは、脆弱性発見のためのAV脆弱性分類を導入し、LLMが実際のAVソフトウェアで安全関連発見を特定し、整理することで、従来のアナライザを補完できることを示した。
- 参考スコア(独自算出の注目度): 6.341317643879287
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automated vehicles rely on millions of lines of safety-critical software, yet general-purpose analyzers do not understand which code can affect vehicle motion. This study asks whether large language models (LLMs) with explicit automated-vehicle (AV) security knowledge improve weakness detection beyond rule-based tools. We developed an AV vulnerability taxonomy with 18 weakness classes from vulnerability records, security advisories, and AV-security literature, and integrated it into LLM-based Security Analysis for Automated Vehicles (LLMSec-AV). Evaluated on Autoware, the framework decomposed 770 translation units into 4,673 functions and analyzed 161 functions under four prompting conditions involving taxonomy context, retrieval from 374 prior disclosures, and multi-step analysis. Findings were compared with 46 weakness locations mined from upstream fixes and a flag-volume-matched permutation baseline. CodeQL, Semgrep, cppcheck, and the Clang Static Analyzer evaluated the same code, with AV-specific rules added to CodeQL and Semgrep. Generated fuzzing harnesses were tested using AFL++ and sanitizers. LLM conditions recovered up to 76% of the 46 known weakness locations, outperforming conventional analyzers. CodeQL, Semgrep, and the Clang Static Analyzer matched none, while cppcheck matched one despite 1,301 alerts. Unaided prompting achieved similar detection performance, showing that the taxonomy did not drive recall. However, taxonomy context increased the share of findings assigned to a weakness class from near zero to over 80%, improving interpretability and triage. Six of the 18 classes could not be directly represented as static-analysis rules. LLMSec-AV introduces an AV-specific, machine-readable vulnerability taxonomy for weakness discovery and shows that LLMs can complement conventional analyzers by identifying and organizing safety-relevant findings in real AV software.
- Abstract(参考訳): 自動走行車は何百万行もの安全クリティカルなソフトウェアに依存しているが、汎用アナライザはどのコードが車両の動きに影響を与えるかを理解していない。
本研究では,明示的な自動車両(AV)セキュリティ知識を持つ大規模言語モデル(LLM)が,ルールベースのツールを超えた弱点検出を改善するかどうかを問う。
我々は、脆弱性記録、セキュリティアドバイザリ、AVセキュリティ文献から18の弱点クラスを持つAV脆弱性分類を開発し、LLMベースの自動車両セキュリティ分析(LLMSec-AV)に統合した。
770の翻訳ユニットを4,673の関数に分解し,分類学的文脈,374の事前開示からの検索,多段階解析を含む4つの条件下で161の関数を解析した。
発見は、上流修正から採掘された46箇所の弱点と、フラグボリュームの置換ベースラインと比較された。
CodeQL、Semgrep、cppcheck、Clang Static Analyzerは同じコードを評価し、CodeQLとSemgrepにAV固有のルールを追加した。
AFL++とサニタイザを用いてファジィハーネスの生成試験を行った。
LLM条件は46の既知の弱点の76%まで回復し、従来の分析装置よりも優れていた。
CodeQL、Semgrep、Clang Static Analyzerは一致せず、cppcheckは1,301アラートにもかかわらず1つに一致した。
Unaidedは同様の検出性能を達成し、分類がリコールを促さないことを示した。
しかし,分類学の文脈は,弱度クラスに割り当てられた発見のシェアを,ほぼゼロから80%以上に増加させ,解釈可能性とトリアージを改善した。
18クラスのうち6クラスは静的分析ルールとして直接表現できなかった。
LLMSec-AVは、脆弱性発見のためのAV固有の機械読み取り可能な脆弱性分類を導入し、LLMが実際のAVソフトウェアで安全関連発見を特定し、整理することで、従来のアナライザを補完できることを示した。
関連論文リスト
- Vulnerability Localization Benchmark: Measuring Agentic Security Analysis at Repository Scale [54.83971397981572]
言語モデルエージェントは、ソフトウェアリポジトリ全体を通してますます運用される。
サイバーセキュリティ評価は、関連するコードを見つけることよりも、脆弱性を検出、再生、または修復できるかどうかを測定する。
脆弱性のローカライゼーションについて検討する。弱点クラスと不慣れなリポジトリが与えられた場合、その弱点に関連する実装ファイルを特定する。
論文 参考訳(メタデータ) (2026-09-14T17:44:51Z) - Beyond Static Guarantees: Measuring the Static-Pass Dynamic-Fail Gap in Security-Sensitive and LLM-Generated Python Code [2.1410799064827235]
本稿では、静的スキャニング、Common Weaknession推論、Dockerコンテナでの自律的なエクスプロイト検証を組み合わせた、静的Pass動的ステージエージェントパイプラインについて紹介する。
SecurityEval、RedCode、CyberNativeのデータセットから1,355のサンプルを評価した。
動的検証は95のファイルで有効性を確認し、部分的に確認し、インクルーシブパイプラインレートは14.53%である。
論文 参考訳(メタデータ) (2026-09-09T19:02:55Z) - LLM-Assisted Dynamic Threat Analysis for Attacker-Reachable Software Weaknesses in Autonomous Vehicles [6.008950554571275]
大規模言語モデル(LLM)が自律走行スタックの静的解析を自動化できるかを検討する。
1,375の判定ルール,2,274の検証チェック,482のインプット・トゥ・セーフティ・アウトプットフローを識別し,コンパイラの静的解析を行う。
2つのローカルオープンウェイトLDM、非静的コンテキストアブレーション、ナイーブテンプレートベースラインは3,700個のアーティファクトセットを生成する。
主な結果は、ビルド統合失敗の分類であり、最初のショットコンパイル失敗の80%は、プログラムロジックよりも依存性の配線から発生していることを示している。
論文 参考訳(メタデータ) (2026-08-13T16:33:44Z) - From Attack Simulation to SIEM Rule: Deterministic Detection-as-Code Synthesis with Probe-Level Traceability [51.56484100374058]
セキュリティチームは、自身のシステムに対する攻撃をシミュレートして、監視が真の侵入者を捕まえるかどうかをチェックする。
人間はそのギャップを手でブリッジし、それぞれの発見を読み、対応するシグマルールを書きます。
ロックされたコーパスからプローブが引き出されると,この変換が部分的に自動化されることを示す。
論文 参考訳(メタデータ) (2026-06-03T14:26:25Z) - SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization [50.71047638695205]
RLM(Reasoning Language Model)は、プログラミングにおいてますます使われている言語モデルである。
しかし、最先端のRLMでさえ、生成されたコードに重大なセキュリティ脆弱性を頻繁に導入する。
我々は、構造化されたセキュリティ推論を内部化するためのRTMを教える微調整パイプラインであるSecPIを提案する。
論文 参考訳(メタデータ) (2026-04-04T04:29:11Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - Multi-Agent Taint Specification Extraction for Vulnerability Detection [49.27772068704498]
コンテナ分析を使用した静的アプリケーションセキュリティテスト(SAST)ツールは、高品質な脆弱性検出結果を提供するものとして広く見なされている。
本稿では,Large Language Models (LLM) のセマンティック理解と従来の静的プログラム解析を戦略的に組み合わせたマルチエージェントシステムであるSemTaintを提案する。
私たちは、SemTaintを最先端のSASTツールであるCodeQLと統合し、これまでCodeQLで検出できなかった162の脆弱性の106を検出して、その効果を実証しています。
論文 参考訳(メタデータ) (2026-01-15T21:31:51Z) - SeBERTis: A Framework for Producing Classifiers of Security-Related Issue Reports [8.545800179148442]
SEBERTISは、Deep Neural Networks(DNN)を語彙的キューに依存しない分類器として訓練するフレームワークである。
当社のフレームワークは,1万件のGitHubイシューレポートをキュレートしたコーパスのセキュリティ関連問題を検出する上で,0.9880のF1スコアを達成した。
論文 参考訳(メタデータ) (2025-12-17T01:23:11Z) - ParaVul: A Parallel Large Language Model and Retrieval-Augmented Framework for Smart Contract Vulnerability Detection [43.41293570032631]
ParaVulは、スマートコントラクト脆弱性検出の信頼性と精度を向上させるための、検索強化フレームワークである。
LLM微調整のためのスパースローランド適応(SLoRA)を開発した。
脆弱性契約データセットを構築し,RAG(Retrieval-Augmented Generation)システムを開発した。
論文 参考訳(メタデータ) (2025-10-20T03:23:41Z) - Can LLM Prompting Serve as a Proxy for Static Analysis in Vulnerability Detection [9.269926508651091]
大規模言語モデル(LLM)は、脆弱性検出などの安全クリティカルなコードタスクに制限があることを示している。
本稿では,脆弱性の自然言語命令を,対照的な連鎖推論と統合する戦略を提案する。
本研究は,静的アナライザの厳格な手作りルールに代えて,セキュリティ対応のプロンプト技術が有効であることを示す。
論文 参考訳(メタデータ) (2024-12-16T18:08:14Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z) - IRIS: LLM-Assisted Static Analysis for Detecting Security Vulnerabilities [14.188864624736938]
大規模な言語モデル(LLM)は印象的なコード生成機能を示しているが、そのような脆弱性を検出するためにコードに対して複雑な推論を行うことはできない。
我々は,LLMと静的解析を体系的に組み合わせ,セキュリティ脆弱性検出のための全体リポジトリ推論を行うニューロシンボリックアプローチであるIRISを提案する。
論文 参考訳(メタデータ) (2024-05-27T14:53:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。