論文の概要: Beyond Gradient-Based Attacks: Adversarial Robustness and Explainability Stability in Cybersecurity Classifiers
- arxiv url: http://arxiv.org/abs/2607.01679v1
- Date: Thu, 02 Jul 2026 04:10:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.658009
- Title: Beyond Gradient-Based Attacks: Adversarial Robustness and Explainability Stability in Cybersecurity Classifiers
- Title(参考訳): グラディエント・ベース・アタックを超えて:サイバーセキュリティ・クラシファイアにおける敵対的ロバスト性と説明可能性の安定性
- Abstract要約: サイバーセキュリティ分類器に対する敵対的な攻撃は、予測の低下と説明の不安定化という2つの脅威を引き起こす。
非微分可能木モデルに適用可能な3つのブラックボックス手法を含む5つの攻撃を評価する。
2軸のフレームワークは、観測された攻撃ランクを説明し、ツリーアンサンブル評価のための実践的なガイダンスを与える。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adversarial attacks on cybersecurity classifiers pose a dual threat: degrading predictions and destabilising the SHAP-based explanations that security analysts rely on to understand and triage alerts. We extend our prior MLP conference study to Random Forest and XGBoost across four tabular security datasets (phishing URLs, UNSW-NB15, NF-ToN-IoT, HIKARI-2021), evaluating five attacks including three black-box methods applicable to non-differentiable tree models. We introduce the Explainability Stability Index (ESI), a scalar metric computed from TreeSHAP attribution drift under adversarial perturbation, reported on the same [0,1] scale as the Robustness Index (RI). A key finding is that gradient-based black-box attacks (ZOO) produce degenerate results against XGBoost (apparent RI ~0.98) due to piecewise-constant prediction surfaces, while score-based Square Attack reveals genuine vulnerability (RI ~0.36). These degenerate perturbations still drive substantial attribution drift: XGBoost ESI ~0.06-0.16 despite near-perfect ZOO robustness, versus 0.14-0.29 for RF, showing that prediction robustness and explanation stability are distinct axes requiring joint measurement. A two-axis framework (gradient dependence, query efficiency) explains the observed attack ranking and yields practical guidance for tree ensemble evaluation. A step-size ablation explains a counterintuitive PGD anomaly on z-score normalised tabular data.
- Abstract(参考訳): セキュリティアナリストが理解とトリアージの警告に頼っているSHAPベースの説明を劣化させ、不安定化させる。
我々は,従来のMLPカンファレンス研究をRandom ForestとXGBoostに拡張し,4つの表付きセキュリティデータセット(フィッシングURL,UNSW-NB15,NF-ToN-IoT,HIKARI-2021)を解析し,非微分木モデルに適用可能な3つのブラックボックスメソッドを含む5つの攻撃を評価した。
本研究では, 逆方向の摂動下でのTreeSHAPの帰属ドリフトから計算したスカラー尺度である Explainability Stability Index (ESI) を導入し, ロバストネス指数 (RI) と同じ[0,1]スケールで報告した。
重要な発見は、勾配ベースのブラックボックスアタック(ZOO)がピースワイズな予測面のためにXGBoost(透明RI ~0.98)に対して退化した結果を生成するのに対して、スコアベースのスクエアアタックは真の脆弱性(RI ~0.36)を明らかにすることである。
XGBoost ESI ~0.06-0.16 ほぼ完全なZOOのロバスト性にもかかわらず、RFは 0.14-0.29 であり、予測のロバスト性と説明の安定性が関節測定を必要とする軸であることを示している。
2軸のフレームワーク(段階的依存、クエリ効率)は、観測された攻撃ランクを説明し、ツリーアンサンブル評価のための実用的なガイダンスを与える。
ステップサイズアブレーションはzスコア正規化表データに逆直観的なPGD異常を説明する。
関連論文リスト
- Beyond Detection Accuracy: Measuring Explanation Cost, Stability, and Utility for Resource-Aware IoT Intrusion Detection [0.0]
本研究は,IoT侵入検出のための予測効率,説明コスト,局所的説明安定性,選択的説明を共同で評価する。
XGBoostは全体で最強の予測プロファイルを提供し、ランダムフォレストは最低の偽陽性率を生み出した。
論文 参考訳(メタデータ) (2026-08-11T01:18:07Z) - Crushing the Evidence: A Dual-Penalty Evasion Framework for Fooling White-Box Explainable AI Auditors [4.377640147713394]
ポストホックモデルの説明器は、高感度ドメインのモデルを監査するために広くデプロイされている。
説明可能性パイプラインにおける潜在的な攻撃について、いくつかの研究がなされている。
より強力なホワイトボックス、勾配調整型回避攻撃フレームワークを導入する。
論文 参考訳(メタデータ) (2026-08-01T10:03:14Z) - Stabilising Explainability Fragility in Cybersecurity AI: The Impact and Mitigation of Multicollinearity in Public Benchmark Datasets [1.1172382217477128]
多重線型性は帰属分散を膨らませるという公式な定理を導入する。
線形、ツリーベース、カーネル、ニューラルの4つのモデルが、フルおよびプルーニングされた機能セットで評価されている。
本稿では,説明可能性の脆弱性スコア(Explainability Fragility Score)の新たな指標と,拡張複雑性を緩和する2つの新しい手法を提案する。
論文 参考訳(メタデータ) (2026-05-21T14:20:33Z) - Towards Trustworthy Depression Estimation via Disentangled Evidential Learning [50.22167852149165]
EviDepはうつ病の重症度を共同で定量化する明らかな学習フレームワークである。
EviDepは、堅牢な証拠合成を保証するために厳密な情報整合性を強制する。
最先端の予測精度と優れた不確実性校正を実現し、信頼できる臨床スクリーニングのための堅牢なフェールセーフメカニズムを提供する。
論文 参考訳(メタデータ) (2026-04-17T13:27:11Z) - ThreatFormer-IDS: Robust Transformer Intrusion Detection with Zero-Day Generalization and Explainable Attribution [0.0]
IoTおよび産業ネットワークの侵入検出には、進化するトラフィックと限定されたラベルの下で信頼性を維持しながら、低い偽陽性率で稀な攻撃を検出できるモデルが必要である。
本研究では,トランスフォーマーをベースとしたシーケンシャルモデリングフレームワークThreatFormer-IDSを提案する。
時系列評価を備えたToN IoTベンチマークでは、ThreatFormer-IDSがAUCROC 0.994、AUC-PR 0.956、Recall@1%FPR 0.910を達成した。
論文 参考訳(メタデータ) (2026-02-26T23:20:42Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - Empirical Analysis of Adversarial Robustness and Explainability Drift in Cybersecurity Classifiers [0.0]
本稿では,2つのサイバーセキュリティ領域にまたがる敵対的堅牢性と説明可能性に関する実証的研究について述べる。
精度摂動曲線の領域として定義される量的指標であるロバストネス指数(RI)を導入する。
Phishing WebサイトとNB15データセットの実験では、一貫性のある堅牢性傾向が示されている。
論文 参考訳(メタデータ) (2026-02-06T05:30:37Z) - BadDet+: Robust Backdoor Attacks for Object Detection [10.393154496941527]
BadDet+は、Regional Misclassification Attacks(RMA)とObject Disappearance Attacks(ODA)を統合したペナルティベースのフレームワークである。
実世界のベンチマークでは、BadDet+は、クリーンなパフォーマンスを維持しながら既存のRMAやOdaベースラインよりも優れた合成と物理の転送を実現している。
これらの結果は、物体検出における重大な脆弱性と、特殊防御の必要性を浮き彫りにしている。
論文 参考訳(メタデータ) (2026-01-28T21:46:33Z) - The Eminence in Shadow: Exploiting Feature Boundary Ambiguity for Robust Backdoor Attacks [51.468144272905135]
深層ニューラルネットワーク(DNN)は、バックドア攻撃に対して脆弱なままでも重要なアプリケーションを支える。
バックドア攻撃を標的とした理論的解析を行い,不均質なモデル操作を実現するための疎い決定境界に着目した。
エミネンス(Eminence)は、理論的な保証と固有なステルス特性を持つ、説明可能で堅牢なブラックボックスバックドアフレームワークである。
論文 参考訳(メタデータ) (2025-12-11T08:09:07Z) - Natural Geometry of Robust Data Attribution: From Convex Models to Deep Networks [9.553350856191743]
コンベックスモデルからディープネットワークへ拡張するロバスト属性の統一フレームワークを提案する。
凸設定では、検証可能なカバレッジ保証を備えたW-RIF(Wasserstein-Robust Influence Function)を導出する。
ディープネットワークでは、ユークリッド認証がスペクトル増幅によって空白化されることを実証する。
論文 参考訳(メタデータ) (2025-12-09T20:40:27Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - CausalDiff: Causality-Inspired Disentanglement via Diffusion Model for Adversarial Defense [61.78357530675446]
人間は、本質的な要因のみに基づいて判断するので、微妙な操作によって騙されるのは難しい。
この観察に触発されて、本質的なラベル因果因子を用いたラベル生成をモデル化し、ラベル非因果因子を組み込んでデータ生成を支援する。
逆の例では、摂動を非因果因子として識別し、ラベル因果因子のみに基づいて予測することを目的としている。
論文 参考訳(メタデータ) (2024-10-30T15:06:44Z) - IDEA: Invariant Defense for Graph Adversarial Robustness [60.0126873387533]
敵攻撃に対する不変因果判定法(IDEA)を提案する。
我々は,情報理論の観点から,ノードと構造に基づく分散目標を導出する。
実験によると、IDEAは5つのデータセットすべてに対する5つの攻撃に対して、最先端の防御性能を達成している。
論文 参考訳(メタデータ) (2023-05-25T07:16:00Z) - On Trace of PGD-Like Adversarial Attacks [77.75152218980605]
敵対的攻撃は、ディープラーニングアプリケーションに対する安全性とセキュリティ上の懸念を引き起こす。
モデルの勾配一貫性を反映した適応応答特性(ARC)特性を構築する。
私たちの方法は直感的で、軽量で、非侵襲的で、データ不要です。
論文 参考訳(メタデータ) (2022-05-19T14:26:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。