論文の概要: Evaluating Open-Weight LLMs for Generating Structured Threat Information for Autonomous Vehicle Vulnerabilities
- arxiv url: http://arxiv.org/abs/2607.16175v1
- Date: Fri, 17 Jul 2026 17:55:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.927427
- Title: Evaluating Open-Weight LLMs for Generating Structured Threat Information for Autonomous Vehicle Vulnerabilities
- Title(参考訳): 自動運転車の危険度評価のための構造的脅威情報生成のためのオープンウェイトLCMの評価
- Authors: Md Erfan, Ahmed Ryan, Md Kamal Hossain Chowdhury, Md Rayhanur Rahman,
- Abstract要約: 我々は構造化脅威情報表現(STIX)を生成するためのオープンウェイト大言語モデル(LLM)を評価する。
我々は、脆弱性記述をSTIXドメインオブジェクト(SDO)、STIXオブジェクト(SRO)、Common Weaknession(CWE)、MITRE ATT&CK技術マッピングにマッピングするCAV-STIXと呼ばれるデータセットを構築した。
- 参考スコア(独自算出の注目度): 0.30915521808748864
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Connected and Autonomous Vehicles (CAVs) rely on interconnected software and hardware components, including sensors, Electronic Control Units, in-vehicle infotainment systems, and telematics units, where vulnerabilities can compromise assets, users, and vehicle operations. These vulnerabilities are commonly documented as plain text in the Common Vulnerabilities and Exposures (CVE) database; however, security practitioners require structured information about affected assets, types of weaknesses, and attack behaviors to effectively mitigate the risks from these vulnerabilities. To this end, we evaluate open-weight Large Language Models (LLMs) for generating Structured Threat Information Expression (STIX), a well-known structured format for representing threat information, for CAV-related CVEs. We construct a dataset called CAV-STIXGen that maps CAV vulnerability descriptions to STIX domain objects (SDO), STIX relationship objects (SRO), Common Weakness Enumeration (CWE), and MITRE ATT&CK techniques mappings. Using this dataset, we evaluated 11 open-weight LLMs (4B to 120B parameters) across various prompting strategies and temperatures. Single-model configurations achieve F1 scores of 0.94 for SDO, 0.63 for SRO, and 0.99 for CWE mapping, while complete MITRE ATT&CK mapping remains challenging. In a multi-agent setup, Gemma-4-31B and Codestral-22B achieve F1 scores of 0.91 for SDOs and 0.43 for SROs, respectively. Lastly, we analyze CWE and MITRE ATT&CK co-occurrences to identify recurring threat patterns in the CAV domain, demonstrating how AI-assisted vulnerability-to-STIX translation can automate threat intelligence and prioritize defense in transportation security.
- Abstract(参考訳): コネクテッド・アンド・オートマチック・ビークルズ(CAV)は、センサー、電子制御ユニット、車内インフォテインメントシステム、テレマティクスユニットなど、相互接続されたソフトウェアやハードウェアコンポーネントに依存しており、そこでは脆弱性が資産、ユーザー、車両操作を損なう可能性がある。
これらの脆弱性は、一般的にCommon Vulnerabilities and Exposures (CVE)データベースのプレーンテキストとして文書化されているが、セキュリティ実践者は、これらの脆弱性からリスクを効果的に軽減するために、影響を受ける資産、弱点の種類、攻撃行動に関する構造化された情報を必要とする。
そこで我々は,CAV関連CVEに対して,脅威情報を表す構造化フォーマットであるStructured Threat Information Expression (STIX) を生成するために,オープンウェイトなLarge Language Model (LLMs) を評価する。
我々は、CAV脆弱性記述をSTIXドメインオブジェクト(SDO)、STIX関係オブジェクト(SRO)、CWE(Common Weakness Enumeration)、MITRE ATT&CK技術マッピングにマッピングするCAV-STIXGenと呼ばれるデータセットを構築した。
本データセットを用いて, 各種のプロンプト戦略および温度に対して, 11個のオープンウェイトLCM (4B〜120Bパラメータ) を評価した。
SDOは0.94点、SROは0.63点、CWEマッピングは0.99点、完全なMITREATT&CKマッピングは依然として難しい。
マルチエージェント設定では、Gemma-4-31BとCodestral-22BはそれぞれSDOが0.91、SROが0.43となる。
最後に、CWEとMITRE ATT&CKの共起を解析して、CAVドメインにおける繰り返し発生する脅威パターンを識別し、AIによる脆弱性対STIX翻訳が脅威知性を自動化し、交通安全における防御を優先する方法を実証する。
関連論文リスト
- CVE-TTP KG: Knowledge Graph Linking Software Vulnerabilities to Attack Behaviors [3.4943147506551555]
この作業は、脆弱性とMITRE ATT&CKフレームワークの振る舞いパターンを結びつけることでギャップを埋める。
CySecBERTのマクロF1スコアは87.71%(技術)と96.16%(戦術)である。
これらのアウトプットはNeo4jベースのCyber Threat Knowledge Graphに統合され、脆弱性の構造化された可視化を可能にする。
論文 参考訳(メタデータ) (2026-06-30T12:14:22Z) - When the Manual Lies: A Realistic Benchmark to Evaluate MCP Poisoning Attacks for LLM Agents [43.702131498259384]
本稿では,新しいセマンティックアタックであるTDP(Tool Description Poisoning)を体系的に検討する。
TDPでは、悪意のある命令はツールの実行可能なコードに埋め込まれず、記述的なメタデータに隠蔽的に注入される。
この研究は、TDP用に調整された最初の特別なセキュリティベンチマークを提供し、高度なエージェントシステムの認知層と計画層の確保に不可欠な洞察を提供する。
論文 参考訳(メタデータ) (2026-05-22T08:34:48Z) - Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming [64.48633529149579]
本稿では,VLA(Vision-Language-Action)モデルの言語的変異に対する脆弱性を明らかにするための新しいフレームワークを提案する。
本手法は, ストレス試験用VLAエージェントへのスケーラブルなアプローチを示すため, 平均作業成功率を93.33%から5.85%に下げる。
論文 参考訳(メタデータ) (2026-04-07T08:43:36Z) - DREAM: Dynamic Red-teaming across Environments for AI Models [28.267208528754082]
我々は,動的多段階攻撃に対する大規模言語モデル(LLM)の評価フレームワークであるDREAMを紹介する。
DREAMの中核は、脆弱性のステートフルでクロスドメインな理解を維持するために、クロス環境適応知識グラフ(CE-AKG)を使用している。
これらの攻撃鎖は、ほとんどのモデルで70%以上のケースで成功している。
論文 参考訳(メタデータ) (2025-12-22T04:11:57Z) - The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search [58.8834056209347]
大規模言語モデル(LLM)は、有害な出力を誘導するために安全ガードレールをバイパスするジェイルブレイク攻撃に弱いままである。
CKA-Agent(Correlated Knowledge Attack Agent)は、ターゲットモデルの知識基盤の適応的木構造探索としてジェイルブレイクを再構成する動的フレームワークである。
論文 参考訳(メタデータ) (2025-12-01T07:05:23Z) - Automated Vulnerability Validation and Verification: A Large Language Model Approach [7.482522010482827]
本稿では、生成AI、特に大規模言語モデル(LLM)を利用したエンドツーエンド多段階パイプラインを提案する。
本手法は,国立脆弱性データベース(National Vulnerability Database)のCVE開示情報から抽出する。
これは、Retrieval-Augmented Generation (RAG)を使用して、外部の公開知識(例えば、脅威アドバイザリ、コードスニペット)で拡張する。
パイプラインは生成されたアーティファクトを反復的に洗練し、テストケースでのアタック成功を検証し、複雑なマルチコンテナセットアップをサポートする。
論文 参考訳(メタデータ) (2025-09-28T19:16:12Z) - CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale [45.97598662617568]
我々は188のソフトウェアプロジェクトにわたる1,507の実際の脆弱性を特徴とする大規模ベンチマークであるCyberGymを紹介した。
我々はCyberGymが35のゼロデイ脆弱性と17の歴史的不完全なパッチを発見できることを示した。
これらの結果は、CyberGymは、サイバーセキュリティにおけるAIの進歩を測定するための堅牢なベンチマークであるだけでなく、直接的な現実世界のセキュリティ効果を生み出すためのプラットフォームでもあることを強調している。
論文 参考訳(メタデータ) (2025-06-03T07:35:14Z) - Output Constraints as Attack Surface: Exploiting Structured Generation to Bypass LLM Safety Mechanisms [0.9091225937132784]
我々は、従来のデータプレーンの脆弱性に対して、重要な制御プレーン攻撃面を明らかにする。
本稿では、構造的出力制約を武器として安全機構をバイパスする新しいジェイルブレイククラスであるConstrained Decoding Attackを紹介する。
本研究は, 現状のLLMアーキテクチャにおける重要なセキュリティ盲点を明らかにし, 制御面脆弱性に対処するため, LLM安全性のパラダイムシフトを促すものである。
論文 参考訳(メタデータ) (2025-03-31T15:08:06Z) - ASSERT: Automated Safety Scenario Red Teaming for Evaluating the
Robustness of Large Language Models [65.79770974145983]
ASSERT、Automated Safety Scenario Red Teamingは、セマンティックなアグリゲーション、ターゲットブートストラップ、敵の知識注入という3つの方法で構成されている。
このプロンプトを4つの安全領域に分割し、ドメインがモデルの性能にどのように影響するかを詳細に分析する。
統計的に有意な性能差は, 意味的関連シナリオにおける絶対分類精度が最大11%, ゼロショット逆数設定では最大19%の絶対誤差率であることがわかった。
論文 参考訳(メタデータ) (2023-10-14T17:10:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。