論文の概要: Multi-LLM Consensus Framework for Evaluating Banking-Sector NIDS Dataset Coverage of MITRE ATT&CK Techniques
- arxiv url: http://arxiv.org/abs/2608.00895v1
- Date: Sat, 01 Aug 2026 23:23:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.982714
- Title: Multi-LLM Consensus Framework for Evaluating Banking-Sector NIDS Dataset Coverage of MITRE ATT&CK Techniques
- Title(参考訳): MITRE ATT&CK技術を用いた銀行セクタNIDSデータセット評価のためのマルチLLM合意フレームワーク
- Abstract要約: グローバルバンキングネットワークのシステム的臨界は、先進的な永続的脅威に対する高いプライオリティ目標を放棄している。
標準ベンチマークで高い精度を達成するNIDSモデルは、しばしば運用銀行環境で失敗する。
本稿では,既存のNIDSベンチマークデータセットが攻撃行動をどの程度カバーしているかを評価するセクター対応評価手法について検討する。
- 参考スコア(独自算出の注目度): 1.2151807224130857
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The systemic criticality of global banking networks has ren-dered them high-priority targets for advanced persistent threats, neces-sitating Network Intrusion Detection Systems (NIDS) whose operational effectiveness must extend beyond statistical accuracy. However, a signif-icant validation gap persists between experimental NIDS performance and real-world effectiveness: NIDS models that achieve high accuracy on standard benchmarks often fail in operational banking environments because generic datasets lack sector-specific patterns, such as SWIFT and ATM-related intrusions, that characterize real financial threats. To address this, the paper investigates a sector-aware evaluation method-ology that systematically assesses how well existing NIDS benchmark datasets cover the attack behaviors most relevant to banking infrastruc-ture. The methodology maps documented adversary behaviors from the MITRE ATT&CK knowledge base to NIDS benchmarks while enforcing the realistic sensor limitations defined by NIST SP 800-94. Leveraging a multi-LLM consensus engine with four state-of-the-art models, we evalu-ated 210 banking-specific adversary techniques to derive a baseline of 68 network-observable behaviors for systematic coverage analysis. Results across five benchmark datasets demonstrate that UNSW-NB15 achieves the highest utility with an 82.2% weighted coverage score (though only 18.4% reflects direct, technique-level evidence), while CIC-DDoS2019 re-veals an 89.9% blind spot for core banking behaviors. These findings es-tablish a reproducible foundation for sector-aware NIDS evaluation and highlight the urgent need for banking-native datasets.
- Abstract(参考訳): グローバルバンキングネットワークのシステム的臨界性は、高度に永続的な脅威に対する高いプライオリティ目標、必要なネットワーク侵入検知システム(NIDS)の運用効率を統計的正確性を超えて延ばさなければならない。
標準ベンチマークで高い精度を達成するNIDSモデルは、SWIFTやATM関連の侵入のようなセクター固有のパターンを欠いているため、運用銀行環境ではしばしば失敗する。
そこで本研究では,既存のNIDSベンチマークデータセットが,銀行のインフラ構築に最も関係のある攻撃行動をどのようにカバーしているかを体系的に評価するセクターアウェア評価手法について検討する。
この方法論は、NIST SP 800-94で定義された現実的なセンサー制限を強制しながら、MITRE ATT&CK知識ベースからNIDSベンチマークに文書化された敵の振る舞いをマッピングする。
マルチLLMコンセンサスエンジンを4つの最先端モデルで活用し、210の銀行固有の敵技術を評価し,68のネットワーク観測行動のベースラインを導出し,系統的カバレッジ分析を行った。
5つのベンチマークデータセットによる結果は、UNSW-NB15が82.2%の重み付きカバレッジスコア(18.4%が直接的、技術レベルの証拠を反映している)で最高のユーティリティを達成していることを示している。
これらの知見は、セクター対応NIDS評価のための再現可能な基盤を創出し、バンキングネイティブデータセットの緊急性を強調している。
関連論文リスト
- eBPF-Based Cybersecurity Mechanisms: A Systematic Literature Review [1.5885137911617144]
拡張バークレーパケットフィルタ(eBPF)は、現代のオペレーティングシステムにおける動的セキュリティ強化を可能にするカーネルレベルのフレームワークとして登場した。
この体系的な文献レビューは、PRISMA方法論を適用して、eBPFベースのサイバーセキュリティメカニズムに関する査読された研究を特定し、分類し、合成する。
論文 参考訳(メタデータ) (2026-08-27T08:17:34Z) - Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks [0.36748639131154315]
本研究は、確立されたベンチマーク設定の堅牢性を調査し、本質的なバイアスを測定する方法を検討する。
本実験では,評価設定が変更された場合のベンチマーク動作に有意な差がみられた。
モデル固有の不安定性を観察し、より堅牢で包括的な安全性評価フレームワークの必要性を明確に示す。
論文 参考訳(メタデータ) (2026-05-11T14:27:39Z) - Assessing Generalisation Capability of Machine Learning Models for Intrusion Detection [12.976685413458243]
本研究では,UNSW-NB15とTON_IoTを用いた侵入検出のための教師付き機械学習モデルの一般化能力について検討した。
ランダムフォレスト、ロジスティック回帰、ネイブベイズは、同じデータセットとクロスデータセット設定で評価された。
その結果,侵入検出における大きな一般化ギャップが明らかとなった。
論文 参考訳(メタデータ) (2026-05-06T01:59:09Z) - Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents [6.787194586338237]
エージェント安全ベンチマークを評価機器として用いた最初の系統解析を行った。
カバレッジマトリックスは、幅広いリスクカバレッジを示すが、方法論的な収束は限定的である一方で、分類学的分析では、サンドボックス、制約付き、しばしば安全のみの評価に集中した行動的ベンチマークコアが示される。
ランドスケープ全体では、ベンチマークの選択は矛盾する安全性の結論を導き、カバレッジカウントはしばしばオーバーステート評価の深さ、環境忠実度形状が報告される安全性、フィールドがエージェント内部リスクよりも外部に不均等に課せられること、メートル法フラグメンテーション制限の比較、そして効果的に不当なままである。
論文 参考訳(メタデータ) (2026-04-11T04:25:19Z) - SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization [50.71047638695205]
RLM(Reasoning Language Model)は、プログラミングにおいてますます使われている言語モデルである。
しかし、最先端のRLMでさえ、生成されたコードに重大なセキュリティ脆弱性を頻繁に導入する。
我々は、構造化されたセキュリティ推論を内部化するためのRTMを教える微調整パイプラインであるSecPIを提案する。
論文 参考訳(メタデータ) (2026-04-04T04:29:11Z) - ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis [96.92417622318267]
ATBenchは、エージェント安全性の構造化、多様性、現実的な評価のための軌道レベルのベンチマークである。
リスクソース、障害モード、現実世界の危害の3つの側面に沿ってエージェント的リスクを編成する。
1000個の軌道(安全503個、安全497個)があり、平均9.01ターンと3.95kトークンがあり、2,084個のツールにまたがるプールから1,954個のツールが呼び出されている。
論文 参考訳(メタデータ) (2026-04-02T13:26:20Z) - CUARewardBench: A Benchmark for Evaluating Reward Models on Computer-using Agent [46.41047559759938]
CUA(Computer-using Agent)は、オペレーティングシステムやソフトウェアインターフェースとの自然なインタラクションを通じてタスクの完了を可能にするエージェントである。
Reward モデルは有望な代替手段を提供するが、CUA 評価におけるその有効性はほとんど未検討である。
CUARewardBenchは4つの重要なコントリビューションから構成される。
論文 参考訳(メタデータ) (2025-10-21T12:53:40Z) - Confidence-Based Response Abstinence: Improving LLM Trustworthiness via Activation-Based Uncertainty Estimation [7.3923284353934875]
本稿では,大規模言語モデル(LLM)出力の正しさと密接に一致したRAGシステムにおける信頼度推定手法を提案する。
提案手法は、生のフィードフォワードネットワーク(FFN)を自己回帰信号として活用することにより、事前の不確実性定量化手法を拡張した。
我々の結果は、アクティベーションに基づく信頼度モデリングが、信頼性の高いRAGデプロイメントへのスケーラブルでアーキテクチャを意識したパスを提供することを示した。
論文 参考訳(メタデータ) (2025-10-15T16:55:56Z) - INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance [48.22571187209047]
INSEvaは、保険におけるAIシステムの知識と能力を評価するために設計された中国のベンチマークである。
INSEvaは、ビジネス領域、タスクフォーマット、難易度、認知知識次元をカバーする多次元評価分類を特徴としている。
本ベンチマークでは,オープンエンド応答における忠実度と完全度の両方を評価するための調整された評価手法を実装した。
論文 参考訳(メタデータ) (2025-08-27T03:13:40Z) - Advancing Embodied Agent Security: From Safety Benchmarks to Input Moderation [52.83870601473094]
エンボディード・エージェントは、複数のドメインにまたがって大きな潜在能力を示す。
既存の研究は主に、一般的な大言語モデルのセキュリティに重点を置いている。
本稿では, エンボディエージェントの保護を目的とした新しい入力モデレーションフレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-22T08:34:35Z) - Free Lunch for Generating Effective Outlier Supervision [46.37464572099351]
本稿では, ほぼ現実的な外乱監視を実現するための超効率的な手法を提案する。
提案したtextttBayesAug は,従来の方式に比べて偽陽性率を 12.50% 以上削減する。
論文 参考訳(メタデータ) (2023-01-17T01:46:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。