論文の概要: SCRIPTIOC-BENCH: A Benchmark for Recognizing Actionable Threat Intelligence from Script-Based Malware using LLMs
- arxiv url: http://arxiv.org/abs/2609.06149v1
- Date: Sat, 05 Sep 2026 15:47:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.209873
- Title: SCRIPTIOC-BENCH: A Benchmark for Recognizing Actionable Threat Intelligence from Script-Based Malware using LLMs
- Title(参考訳): SCRIPTIOC-BENCH:LLMを用いたスクリプトベースのマルウェアから行動可能な脅威知能を認識するベンチマーク
- Abstract要約: 大規模言語モデル(LLM)は、セキュリティ分析において有望であるが、悪意のあるスクリプトからIOCを回復する能力はいまだ探索されていない。
実世界のスクリプト上で静的IOC抽出能力を測定するベンチマークであるSCRIPTIOC-BENCHを提案する。
我々は,プロプライエタリかつオープンウェイトなLLMを幅広く評価し,IOCのリカバリがモデルスケール全体にわたって困難であることを示す。
- 参考スコア(独自算出の注目度): 35.45887691929597
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Script-based malware remains a prevalent attack technique. These scripts often contain indicators of compromise (IOCs) that provide actionable threat intelligence. However, statically recovering such indicators is challenging, as relevant values may be dispersed or transformed within code. Although large language models (LLMs) have shown promise in security analysis, their ability to recover IOCs from malicious scripts remains underexplored. We present SCRIPTIOC-BENCH, a benchmark for measuring static IOC extraction capability on real-world malicious scripts. The benchmark comprises 634 manually verified JavaScript, PowerShell, and VBScript malware samples covering four IOC types (URLs, domains, IP addresses, and filesystem artifacts). We further stratify ground-truth IOCs by recovery level, distinguishing directly exposed indicators from those requiring decoding or reconstruction. Using this benchmark, we evaluate a broad range of proprietary and open-weight LLMs and show that IOC recovery without execution remains challenging across model scales: the strongest model reaches only 65.4 F1. To characterize how recovery fails, we introduce a false-positive taxonomy and use it to compare the error profiles of the evaluated models. We further study two mitigations on a small open-weight model, deterministic string utilities and task-specific adaptation, finding that they provide complementary recovery gains, raise precision, and shift errors toward sample-grounded mismatches.
- Abstract(参考訳): スクリプトベースのマルウェアは依然として一般的な攻撃手法である。
これらのスクリプトは、しばしば行動可能な脅威知性を提供する妥協の指標(IOC)を含んでいる。
しかし、関連する値がコード内で分散したり変換される可能性があるため、そのようなインジケータを静的に復元することは難しい。
大規模言語モデル(LLM)はセキュリティ分析において有望であることを示しているが、悪意のあるスクリプトからIOCを回復する能力はいまだ探索されていない。
現実世界の悪意のあるスクリプト上で静的IOC抽出能力を測定するベンチマークであるSCRIPTIOC-BENCHを提案する。
ベンチマークは、634人の手作業によるJavaScript、PowerShell、VBScriptのマルウェアサンプルで構成され、4つのIOCタイプ(URL、ドメイン、IPアドレス、ファイルシステムアーティファクト)をカバーしている。
さらに,復号化や復号化を必要とするものと直接露見した指標を区別し,回復レベルでの地道IOCの成層化を進めた。
このベンチマークを用いて、幅広いプロプライエタリかつオープンウェイトなLCMを評価し、IOCのリカバリがモデルスケールで困難であり、最強のモデルが65.4 F1にしか達していないことを示す。
回復の失敗を特徴付けるために, 偽陽性分類を導入し, 評価モデルの誤差プロファイルを比較する。
さらに、小型オープンウェイトモデル、決定論的文字列ユーティリティ、タスク固有の適応に関する2つの軽減策について検討し、それらが相補的なリカバリゲインを提供し、精度を高め、サンプルグラウンドのミスマッチに向けてエラーをシフトすることを発見した。
関連論文リスト
- Cross-Cutting Security Analysis of LLM-Generated Code via Metamorphic Testing and Association Rule Mining [0.7844254062143549]
大規模言語モデル(LLM)はセキュリティ上の脆弱性のあるコードを生成することが多いが、これらの弱点を分離することは滅多にない。
本稿では,セキュリティ指向のメタモルフィックリレーショナル(MR)とアソシエーションルール(AR)マイニングを組み合わせて,LLM生成コードの脆弱性を検出するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-13T19:10:10Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - Running in CIRCLE? A Simple Benchmark for LLM Code Interpreter Security [0.0]
大規模言語モデル(LLM)は、ネイティブコードインタプリタを統合し、リアルタイム実行機能を実現する。
これらの統合は、システムレベルのサイバーセキュリティの脅威をもたらす可能性がある。
本稿では、CPU、メモリ、ディスクリソースの枯渇をターゲットとした1,260プロンプトからなる単純なベンチマークであるCIRCLE(Code-Interpreter Resilience Check for LLM Exploits)を提案する。
論文 参考訳(メタデータ) (2025-07-25T16:06:16Z) - One Token to Fool LLM-as-a-Judge [52.45386385722788]
大規模言語モデル(LLM)は、自動化された審査員としてますます信頼され、評価を支援し、他のモデルを訓練するための報酬信号を提供する。
生成的報酬モデルは、ハッキングに対して体系的に影響を受けやすい。
論文 参考訳(メタデータ) (2025-07-11T17:55:22Z) - CASTLE: Benchmarking Dataset for Static Code Analyzers and LLMs towards CWE Detection [2.5228276786940182]
本稿では,異なる手法の脆弱性検出能力を評価するためのベンチマークフレームワークであるCASTLEを紹介する。
我々は,25個のCWEをカバーする250個のマイクロベンチマークプログラムを手作りしたデータセットを用いて,静的解析ツール13,LLM10,形式検証ツール2を評価した。
論文 参考訳(メタデータ) (2025-03-12T14:30:05Z) - Benchmarking LLMs and LLM-based Agents in Practical Vulnerability Detection for Code Repositories [8.583591493627276]
JitVulは、各関数をその脆弱性導入とコミットの修正にリンクする脆弱性検出ベンチマークである。
思考・行動・観察と相互言語的文脈を活用するReAct Agentsは,良性のあるコードと区別する上で,LLMよりも優れた性能を示すことを示す。
論文 参考訳(メタデータ) (2025-03-05T15:22:24Z) - Can LLM Prompting Serve as a Proxy for Static Analysis in Vulnerability Detection [9.269926508651091]
大規模言語モデル(LLM)は、脆弱性検出などの安全クリティカルなコードタスクに制限があることを示している。
本稿では,脆弱性の自然言語命令を,対照的な連鎖推論と統合する戦略を提案する。
本研究は,静的アナライザの厳格な手作りルールに代えて,セキュリティ対応のプロンプト技術が有効であることを示す。
論文 参考訳(メタデータ) (2024-12-16T18:08:14Z) - Exploring Automatic Cryptographic API Misuse Detection in the Era of LLMs [60.32717556756674]
本稿では,暗号誤用の検出において,大規模言語モデルを評価するための体系的評価フレームワークを提案する。
11,940個のLCM生成レポートを詳細に分析したところ、LSMに固有の不安定性は、報告の半数以上が偽陽性になる可能性があることがわかった。
最適化されたアプローチは、従来の手法を超え、確立されたベンチマークでこれまで知られていなかった誤用を明らかにすることで、90%近い顕著な検出率を達成する。
論文 参考訳(メタデータ) (2024-07-23T15:31:26Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。