論文の概要: Beyond the Syntax: Do Security Experts Trust LLMs for NIDS Rule Engineering?
- arxiv url: http://arxiv.org/abs/2607.05916v1
- Date: Tue, 07 Jul 2026 07:09:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.43037
- Title: Beyond the Syntax: Do Security Experts Trust LLMs for NIDS Rule Engineering?
- Title(参考訳): シンタックスを超えて - セキュリティ専門家は、NIDSルールエンジニアリングのためにLLMを信頼しているか?
- Authors: Lorenzo di Filippo, Enkeleda Bardhi, Andrea Agiollo, Alessandro Palma, Silvia Bonomi, Fernando Kuipers,
- Abstract要約: 本稿では,Large Language Models(LLMs)に基づくNIDSルールエンジニアリングを人間中心で調査する。
LLMは構文的に正しい規則を生成するが、専門家は部分的にしか展開できないと考えている。
大規模モデルは構文的に有効な規則を一貫して生成するが、小型モデルはIDSルールの生成にはほとんど効果がない。
- 参考スコア(独自算出の注目度): 70.17374586573033
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As network threats evolve, manual NIDS rule engineering has become a critical operational bottleneck. While Large Language Models (LLMs) show promise for automating this process, their ability to produce production-ready rules remains unvalidated. This paper presents a human-centered investigation into LLM-based NIDS rule engineering, formalizing a grounded generation framework and evaluating it through a user study with 10 domain experts. Our evaluation reveals a syntax-semantics paradox: although LLMs generate syntactically correct rules, experts find them only partially deployable due to low specificity and logic hallucinations in 12% of cases. While the system received a favorable SUS score of 67, practitioners remain skeptical of its autonomous capabilities, viewing LLMs as support tools for drafting and verification rather than independent generators. Finally, our statistical analysis indicates that while large-scale models ($\geq 70B$) consistently produce syntactically valid rules, small models ($\leq 4B$) are largely ineffective for IDS rule generation.
- Abstract(参考訳): ネットワークの脅威が進化するにつれて、手動のNIDSルールエンジニアリングが重要な運用ボトルネックとなっている。
大規模言語モデル(LLM)は、このプロセスを自動化することを約束しているが、プロダクション対応のルールを作成する能力は、まだ有効ではない。
本稿では, LLMに基づくNIDSルールエンジニアリングを人間中心で調査し, 基礎となる生成フレームワークを定式化し, ドメインエキスパート10名によるユーザスタディを通じて評価する。
LLMは構文的に正しい規則を生成するが、専門家は12%のケースで低特異性や論理幻覚のために部分的にしか展開できないと考えている。
システムには67のSUSスコアが与えられたが、その自律能力には懐疑的であり、LSMを独立した発電機ではなく、起草と検証のための支援ツールと見なしている。
最後に、我々の統計分析は、大規模なモデル($\geq 70B$)が構文的に有効なルールを一貫して生成するのに対し、小さなモデル($\leq 4B$)はIDSのルール生成にはほとんど効果がないことを示している。
関連論文リスト
- VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents [57.240036084348354]
本稿では,ロボットスキルコントラクトの検証誘導自己進化のためのフレームワークであるVASOを紹介する。
VASOは論理的に一貫性のないスキル契約を検証し、グローバルおよびローカルな時間的仕様に対してスキルによって誘発される計画を検証する。
Clearpath Jackal と PX4 のクアッドコプタータスクでは、VASO は100点未満の最適化サンプルを使用して97.2% の形式的な仕様準拠に達した。
論文 参考訳(メタデータ) (2026-06-03T20:02:35Z) - Are LLMs Reliable Code Reviewers? Systematic Overcorrection in Requirement Conformance Judgement [8.059802912761919]
我々は,大規模言語モデル(LLM)が自然言語要求にマッチするコードの体系的失敗を明らかにする。
より詳細なプロンプト設計、特に説明や修正提案を必要とするものは、より高い誤判定率をもたらす。
そこで本稿では,提案した修正を実効的証拠として扱う固定誘導検証フィルタを提案する。
論文 参考訳(メタデータ) (2026-02-28T08:35:25Z) - N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator [2.741826749835854]
N-GLAREは、完全なテキスト生成の必要性を回避して、モデルの潜在表現を完全に操作する。
潜在表現のAPT(Angular-Probabilistic Trajectory)を分析することで、隠蔽層ダイナミクスを特徴付ける。
N-GLAREは、トークンコストとランタイムコストの1%未満で、大規模なレッドチームテストの差別的傾向を再現する。
論文 参考訳(メタデータ) (2025-11-18T07:03:58Z) - Reasoning with Confidence: Efficient Verification of LLM Reasoning Steps via Uncertainty Heads [104.9566359759396]
データ駆動の不確実性スコアに基づくステップレベルの推論検証の軽量な代替案を提案する。
本研究は, LLMの内部状態が不確実性を符号化し, 信頼性の高い検証信号として機能することが示唆された。
論文 参考訳(メタデータ) (2025-11-09T03:38:29Z) - Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models [25.337295202341608]
大規模言語モデル(LLM)は、安全で正確でインテリジェントな実世界のシナリオによって制御され、ガイドされるはずである。
LLMの推論規則追従能力を評価しようとする従来の研究は、推論規則追従のシナリオと命令追従のシナリオを区別することができない。
本稿では、まず、推論規則追従の概念を明らかにし、推論規則追従能力の多様化範囲を評価するための総合的なベンチマークであるルールベンチを提案する。
論文 参考訳(メタデータ) (2024-07-11T12:26:55Z) - CLOMO: Counterfactual Logical Modification with Large Language Models [109.60793869938534]
本稿では,新しいタスク,CLOMO(Counterfactual Logical Modification)と高品質な人間アノテーションベンチマークを紹介する。
このタスクでは、LLMは所定の論理的関係を維持するために、与えられた議論的テキストを順応的に変更しなければなりません。
LLMの自然言語出力を直接評価する革新的な評価指標である自己評価スコア(SES)を提案する。
論文 参考訳(メタデータ) (2023-11-29T08:29:54Z) - Leveraging Large Language Models for Automated Proof Synthesis in Rust [6.202137610101939]
大規模言語モデル(LLM)は、コード解析と合成に成功している。
我々は、LLMと静的解析を組み合わせることで、Verusと呼ばれるRustベースの形式検証フレームワークの不変性、アサーション、その他の証明構造を合成する。
プロトタイプでは,検証タスクを複数の小さなタスクに分割し,反復的にGPT-4をクエリし,その出力と軽量な静的解析を組み合わせる。
論文 参考訳(メタデータ) (2023-11-07T05:47:47Z) - Large Language Models are Not Yet Human-Level Evaluators for Abstractive
Summarization [66.08074487429477]
抽象的な要約のための自動評価器として,大規模言語モデル(LLM)の安定性と信頼性について検討する。
また、ChatGPTとGPT-4は、一般的に使われている自動測定値よりも優れていますが、人間の代替品として準備ができていません。
論文 参考訳(メタデータ) (2023-05-22T14:58:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。