論文の概要: A Structured Cyber Threat Intelligence Dataset Using STIX 2.1 Entities and MITRE ATT&CK Mappings
- arxiv url: http://arxiv.org/abs/2607.23312v1
- Date: Sat, 25 Jul 2026 17:59:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.058851
- Title: A Structured Cyber Threat Intelligence Dataset Using STIX 2.1 Entities and MITRE ATT&CK Mappings
- Title(参考訳): STIX 2.1 Entities と MITRE ATT&CK マッピングを用いた構造化サイバー脅威情報データセット
- Abstract要約: 本研究では,150の英語CTIレポートを手作業で構築したデータセットを提案する。
複雑な実体関係と正規化された敵行動を保持するレポートレベルのデータセットは、依然として限られている。
このデータセットは、CTI情報抽出、知識グラフの構築、インシデント分析、脅威属性のベンチマークを提供する。
- 参考スコア(独自算出の注目度): 0.20415910628419062
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Cyber threat intelligence (CTI) reports are typically written in unstructured formats, which complicates the extraction and analysis of important entities and adversarial behaviors. Although existing CTI research provides extraction tools, knowledge-graph frameworks, and MITRE ATT&CK mapped datasets, curated report-level datasets that preserve complex entity relationships and normalized adversarial behaviors remain limited. To address this limitation, this study presents a manually constructed dataset of 150 English-language CTI reports, each represented as STIX 2.1 based graphs, which includes 4,777 STIX entities, 5,817 STIX relationships in total, and 1,273 STIX attack-pattern entities (adversarial behaviors) mapped to 269 unique MITRE ATT&CK Enterprise techniques and sub-techniques. Twenty five randomly sampled reports were independently assessed by two cybersecurity researchers, which shows substantial inter-rater agreement. Disagreements were subsequently adjudicated to establish a gold-standard reference dataset. Four locally deployed open-source LLMs were evaluated as automated judges against this adjudicated reference sample. Qwen3.6:27B achieved the strongest overall performance, with a maximum kappa score of 0.803, micro-F1 scores exceeding 92%, and false-positive rates below 5%. The dataset provides a benchmark for CTI information extraction, knowledge-graph construction, incident analysis, and threat attribution. The findings further indicate that locally deployed LLMs can support human reviewers in identifying annotation inconsistencies, but expert validation remains essential.
- Abstract(参考訳): サイバー脅威インテリジェンス(CTI)レポートは、通常は非構造化形式で書かれており、重要な実体や敵の行動の抽出と分析を複雑にしている。
既存のCTI研究は、抽出ツール、ナレッジグラフフレームワーク、MITRE ATT&CKマップされたデータセットを提供するが、複雑なエンティティ関係と正規化された敵行動を保持するレポートレベルのデータセットは限定的のままである。
この制限に対処するため、本研究では、STIX 2.1ベースのグラフで表される150の英語CTIレポートのデータセットを手作業で作成し、それぞれ4,777のSTIXエンティティ、合計5,817のSTIXリレーション、1,273のSTIXアタックパターンエンティティ(逆動作)を269のユニークなMITRE ATT&CK Enterpriseテクニックとサブ技術にマッピングした。
ランダムにサンプリングされた20件の報告書は、2人のサイバーセキュリティ研究者によって独立して評価された。
その後、金本位基準データセットを確立するために不一致の判決が下された。
4つのローカルにデプロイされたオープンソースLCMを,この適応された参照サンプルに対して自動判定として評価した。
Qwen3.6:27Bは、最大カッパスコア0.803、マイクロF1スコア92%以上、偽陽性率5%以下で最高成績を達成した。
このデータセットは、CTI情報抽出、知識グラフの構築、インシデント分析、脅威属性のベンチマークを提供する。
この結果は、ローカルにデプロイされたLLMが、アノテーションの不整合を識別する人間レビュアーを支援できることを示しているが、専門家による検証は依然として不可欠である。
関連論文リスト
- Evaluating Open-Source LLMs for Multi-Label ATT&CK Technique Classification on CTI Reports [3.7098231493739764]
敵戦術、技術、共通知識(ATT&CK)を用いたサイバー脅威インテリジェンス(CTI)の分類は、積極的な防御には不可欠であるが、歴史的には広範囲な人的努力を必要としている。
LLM(Pre-Large Language Model)の自動化は、このプロセスを加速させたが、構造化されていないCTIレポートに見られる複雑な言語と多段階の攻撃パターンを解決できなかった。
LLMは、文脈推論を用いて非構造化テキストを理解することで、以前の制限に対処した。
現在の評価は、実世界のCTIレポートの複雑さを無視する単純化された単一技術文に依存しており、その結果は膨らんだ結果をもたらすことが多い。
論文 参考訳(メタデータ) (2026-06-16T17:04:15Z) - Context-aware Entity-Relation Extraction for Threat Intelligence Knowledge Graphs [0.7591490481106252]
サイバーセキュリティ知識グラフ(CKG)は、多様なサイバー脅威インテリジェンス(CTI)ソースを構造化されたクエリ可能なフォーマットに統合する。
現在のパイプラインベースのアプローチは、しばしばエラーの伝搬、抽出精度の低減、一般化可能性の制限に悩まされる。
本稿では,脅威エンティティを正確に抽出し分類するためのパイプラインアーキテクチャであるCTiKG(Context-aware Threat Intelligence Knowledge Graph)フレームワークを紹介する。
論文 参考訳(メタデータ) (2026-05-15T12:42:47Z) - DataClaw: A Process-Oriented Agent Benchmark for Exploratory Real-World Data Analysis [76.98578575566184]
DataClawは、探索的実世界のデータ分析のためのプロセス指向のベンチマークである。
企業、産業、および政策ドメイン全体で約2億6600万の現実世界の記録がある。
DataClawは、エージェントがどこまで進歩し、その推論がどこで壊れるかを測定する。
論文 参考訳(メタデータ) (2026-05-04T11:57:09Z) - Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements [78.87065404966002]
既存のベンチマークは、主に質問レベルで質問をキュレートする。
ベンチマーク構築をゼロから再考するステートメントベースのベンチマークであるEncyclo-Kを提案する。
論文 参考訳(メタデータ) (2025-12-31T13:55:54Z) - AutoMalDesc: Large-Scale Script Analysis for Cyber Threat Research [81.04845910798387]
脅威検出のための自然言語の説明を生成することは、サイバーセキュリティ研究において未解決の問題である。
本稿では,大規模に独立して動作する自動静的解析要約フレームワークAutoMalDescを紹介する。
アノテーション付きシード(0.9K)データセットや方法論,評価フレームワークなど,100万以上のスクリプトサンプルの完全なデータセットを公開しています。
論文 参考訳(メタデータ) (2025-11-17T13:05:25Z) - From Text to Actionable Intelligence: Automating STIX Entity and Relationship Extraction [8.623367082899946]
AZERGはセキュリティアナリストが自動的に構造化STIX表現を生成するのを支援するために設計されたツールである。
タスク固有の微調整を適用し、関連するエンティティを正確に抽出し、STIX仕様に従ってそれらの関係を推測する。
我々のモデルは、T1の84.43%、T2の88.49%、T3の95.47%、現実世界のシナリオでの84.60%のF1スコアを達成した。
論文 参考訳(メタデータ) (2025-07-22T13:27:09Z) - FORGE: An LLM-driven Framework for Large-Scale Smart Contract Vulnerability Dataset Construction [34.20628333535654]
FORGEはスマートコントラクト脆弱性データセットを構築するための最初の自動化アプローチである。
81,390のソリッドリティファイルと27,497の脆弱性を296のCWEカテゴリに分類したデータセットを生成した。
その結果、現在の検出能力の重大な制限が明らかになった。
論文 参考訳(メタデータ) (2025-06-23T16:03:16Z) - CTI-HAL: A Human-Annotated Dataset for Cyber Threat Intelligence Analysis [2.7862108332002546]
サイバー脅威インテリジェンス(CTI)の情報源は、しばしば非構造化されており、自然言語で情報を自動的に抽出することは困難である。
近年,CTIデータからAIを自動抽出する方法が研究されている。
我々は,MITRE ATT&CKフレームワークに基づいて,CTIレポートを手作業で構築し,構造化した新しいデータセットを提案する。
論文 参考訳(メタデータ) (2025-04-08T09:47:15Z) - SciER: An Entity and Relation Extraction Dataset for Datasets, Methods, and Tasks in Scientific Documents [49.54155332262579]
我々は,科学論文のデータセット,メソッド,タスクに関連するエンティティに対して,新たなエンティティと関係抽出データセットをリリースする。
我々のデータセットには、24k以上のエンティティと12kの関係を持つ106の注釈付きフルテキストの科学出版物が含まれています。
論文 参考訳(メタデータ) (2024-10-28T15:56:49Z) - Exploiting Contextual Target Attributes for Target Sentiment
Classification [53.30511968323911]
TSCの既存のPTLMベースモデルは、1)PTLMをコンテキストエンコーダとして採用した微調整ベースモデル、2)テキスト/単語生成タスクに分類タスクを転送するプロンプトベースモデル、の2つのグループに分類される。
我々は,PTLM を TSC に活用する新たな視点として,言語モデリングと文脈的ターゲット属性による明示的ターゲットコンテキスト相互作用の利点を同時に活用する。
論文 参考訳(メタデータ) (2023-12-21T11:45:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。