論文の概要: Benchmarking and Exploring the Capabilities of LLMs for Attack Investigations
- arxiv url: http://arxiv.org/abs/2606.10281v1
- Date: Tue, 09 Jun 2026 01:09:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-10 15:40:58.240411
- Title: Benchmarking and Exploring the Capabilities of LLMs for Attack Investigations
- Title(参考訳): 攻撃調査におけるLDMの能力評価と探索
- Authors: Aniket Anand, Yiwei Hou, Daniel Fields, Alex Kantchelian, David Tao, Kurt Thomas, Grant Ho,
- Abstract要約: AuditBenchはLinuxとWindowsマシンから収集されたシステム監査ログで構成されている。
攻撃調査における監査ログの分析において,5つのフロンティアLCMの性能評価と解析を行った。
- 参考スコア(独自算出の注目度): 4.7293402755875364
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper presents AuditBench, a new benchmark dataset for evaluating the capabilities of LLMs at investigating security-related system audit logs. We design and use this benchmark to explore the performance of LLMs on four log-investigation tasks that incident response teams commonly perform, ranging from triaging alerts generated by detectors to identifying persistence mechanisms on compromised systems. AuditBench consists of system audit logs collected from Linux and Windows machines, and spans over 50 different security investigation scenarios, including both malicious and benign activity. Using our benchmark, we evaluate and analyze the performance of five frontier LLMs at analyzing audit logs for attack investigations. Our analysis illuminates how LLM performance and error profiles vary according to different design choices, such as differences in model size, data representation, prompt construction, and specific investigation tasks. Additionally, we characterize the quality of the explanations produced by LLMs and the types of errors that models make across our benchmark. Collectively, our work provides a foundation for assessing the capabilities of LLMs for investigating security logs, novel insights for practitioners using LLMs in security operations, and important directions for future research.
- Abstract(参考訳): 本稿では,セキュリティ関連システム監査ログの調査におけるLLMの能力を評価するためのベンチマークデータセットであるAuditBenchを提案する。
我々はこのベンチマークを設計・使用し、インシデント対応チームが通常実行する4つのログ調査タスクにおけるLCMの性能を調査する。
AuditBenchはLinuxとWindowsマシンから収集されたシステム監査ログで構成されており、悪意と良性の両方を含む50以上のセキュリティ調査シナリオにまたがっている。
本ベンチマークを用いて,攻撃調査における監査ログの分析において,5つのフロンティアLCMの性能評価と解析を行った。
本分析では, モデルサイズ, データ表現, 即時構築, 特定の調査タスクなど, 設計上の選択によってLLMの性能や誤差がどう異なるのかを照らし出す。
さらに、LLMによる説明の質と、モデルがベンチマークで生成するエラーの種類を特徴付ける。
本研究は,セキュリティログの調査のためのLLMの機能評価基盤,セキュリティ操作にLLMを使用する実践者のための新たな洞察,今後の研究のための重要な方向性を提供する。
関連論文リスト
- Towards Agentic Investigation of Security Alerts [0.07646713951724012]
セキュリティアナリストは、アラートの量と検出システムが提供する低コンテキストに圧倒されます。
初期段階の調査は通常、複数のログソース間で手動の相関を必要とする。
本稿では,事前定義されたクエリを付加した大規模言語モデル(LLM)を活用する実験的なエージェントワークフローを提案する。
論文 参考訳(メタデータ) (2026-04-28T16:52:12Z) - Towards Secure Logging: Characterizing and Benchmarking Logging Code Security Issues with LLMs [7.469801665862114]
安全でないロギングプラクティスは、不注意に機密情報を公開したり、ログインジェクションのような攻撃を可能にする。
コードのセキュリティ問題に関する包括的な分類を導き、一般的な4つの問題カテゴリと10のパターンを包含する。
本稿では,ログセキュリティ問題の検出と修復におけるLLMの能力を評価するために,さまざまなコンテキスト知識を取り入れた自動フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-22T05:54:45Z) - LogReasoner: Empowering LLMs with Expert-like Coarse-to-Fine Reasoning for Automated Log Analysis [66.79746720402811]
汎用大規模言語モデル(LLM)は、専門家の認識と整合した構造化推論を定式化し、推論ステップの正確な詳細を提供するのに苦労する。
我々は,LLMが専門家のようなログ解析タスクを推論できるように設計された粗粒度拡張フレームワークであるLogReasonerを提案する。
我々は,Qwen-2.5 や Llama-3 といったオープンソースの LLM を用いて,ログ解析の4つのタスクについてLogReasoner の評価を行った。
論文 参考訳(メタデータ) (2025-09-25T06:26:49Z) - IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis [60.32962597618861]
IDA-Benchは、多ラウンドの対話シナリオで大規模言語モデルを評価する新しいベンチマークである。
エージェント性能は、最終的な数値出力と人間由来のベースラインを比較して判断する。
最先端のコーディングエージェント(Claude-3.7-thinkingなど)でさえ50%のタスクを成功させ、シングルターンテストでは明らかでない制限を強調している。
論文 参考訳(メタデータ) (2025-05-23T09:37:52Z) - Navigating the Risks: A Survey of Security, Privacy, and Ethics Threats in LLM-Based Agents [67.07177243654485]
この調査は、大規模言語モデルに基づくエージェントが直面するさまざまな脅威を収集、分析する。
LLMをベースとしたエージェントの6つの重要な特徴を概説する。
4つの代表エージェントをケーススタディとして選択し,実践的に直面する可能性のあるリスクを分析した。
論文 参考訳(メタデータ) (2024-11-14T15:40:04Z) - Beyond Binary: Towards Fine-Grained LLM-Generated Text Detection via Role Recognition and Involvement Measurement [51.601916604301685]
大規模言語モデル(LLM)は、オンライン談話における信頼を損なう可能性のあるコンテンツを生成する。
現在の手法はバイナリ分類に重点を置いており、人間とLLMのコラボレーションのような現実のシナリオの複雑さに対処できないことが多い。
バイナリ分類を超えてこれらの課題に対処するために,LLM生成コンテンツを検出するための新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2024-10-18T08:14:10Z) - LogEval: A Comprehensive Benchmark Suite for Large Language Models In Log Analysis [32.46940506638522]
ログ解析タスクにおける大規模言語モデルの性能を評価するために設計されたベンチマークスイートであるLogEvalを紹介する。
このベンチマークでは、ログ解析、ログ異常検出、ログ障害診断、ログ要約などのタスクをカバーしている。
LogEvalは4000の公開ログデータエントリを使用して各タスクを評価し、各タスクに対して15の異なるプロンプトを使用して、徹底的で公正な評価を保証する。
論文 参考訳(メタデータ) (2024-07-02T02:39:33Z) - An Insight into Security Code Review with LLMs: Capabilities, Obstacles, and Influential Factors [9.309745288471374]
セキュリティコードレビューは時間と労力を要するプロセスです。
既存のセキュリティ分析ツールは、一般化の貧弱、偽陽性率の高い、粗い検出粒度に悩まされている。
大きな言語モデル(LLM)は、これらの課題に対処するための有望な候補と考えられている。
論文 参考訳(メタデータ) (2024-01-29T17:13:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。