論文の概要: Crushing the Evidence: A Dual-Penalty Evasion Framework for Fooling White-Box Explainable AI Auditors
- arxiv url: http://arxiv.org/abs/2608.00566v1
- Date: Sat, 01 Aug 2026 10:03:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 21:56:46.371086
- Title: Crushing the Evidence: A Dual-Penalty Evasion Framework for Fooling White-Box Explainable AI Auditors
- Title(参考訳): 証拠を破る - 説明可能なホワイトボックスAI監査者のためのデュアルペナルティ・エベイジョン・フレームワーク
- Abstract要約: ポストホックモデルの説明器は、高感度ドメインのモデルを監査するために広くデプロイされている。
説明可能性パイプラインにおける潜在的な攻撃について、いくつかの研究がなされている。
より強力なホワイトボックス、勾配調整型回避攻撃フレームワークを導入する。
- 参考スコア(独自算出の注目度): 4.377640147713394
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-hoc model explainers such as LIME, SHAP, and Integrated Gradients are widely deployed to audit models in high-stakes sensitive domains, including finance, healthcare, and social welfare. This ensures the model's transparency and acceptability. However, a few studies have examined potential attacks in the explainability pipeline. Adversaries can attempt to conceal algorithmic biases or backdoors using adversarial explanation attacks. These attacks have relied on scaffolding out-of-distribution (OOD) detectors that toggle predictions when queried by an explainer. Consequently, defenses have been developed to successfully neutralize these black-box attacks by identifying their anomalous perturbation footprints. In this paper, we demonstrate a critical vulnerability by introducing a more potent white-box, gradient-regularized evasion attack framework. By employing a continuous-embedding dual-penalty framework, we directly penalize trigger feature gradients during training on in-distribution data. Since our approach embeds the evasion logic natively into the model parameters, without relying on OOD scaffolding wrappers, it generates smooth, in-distribution predictions that leave no anomaly footprint. Empirical evaluations across four benchmark tabular datasets (COMPAS, German Credit, IEEE-CIS, and Communities & Crime) confirm that our method systematically crushes target feature attribution to near-zero (<0.02), maintains >90% Attack Success Rates, and fundamentally bypasses Conditional Anomaly Detection.
- Abstract(参考訳): LIME、SHAP、Integrated Gradientsといったポストホックモデルの解説者は、金融、医療、社会福祉など、高機密領域のモデルを監査するために広くデプロイされている。
これにより、モデルの透明性と受容性が保証される。
しかし、いくつかの研究が説明可能性パイプラインの潜在的な攻撃について調査している。
敵は、敵の説明攻撃を使ってアルゴリズムのバイアスやバックドアを隠そうとする。
これらの攻撃は、説明者によってクエリされたときに予測を切り替えるOOD検出器の足場に頼っている。
その結果、それらの異常な摂動フットプリントを特定することによって、これらのブラックボックス攻撃を正常に中和する防衛技術が開発された。
本稿では、より強力なホワイトボックス、勾配調整型回避攻撃フレームワークを導入することで、重大な脆弱性を実証する。
連続埋め込み型デュアルペナルティ・フレームワークを用いることで、インディストリビューションデータのトレーニング中にトリガー特徴勾配を直接ペナルティ化する。
提案手法では, OODスキャフォールディングラッパーを頼らずにモデルパラメータに回避ロジックをネイティブに組み込むため, 異常なフットプリントを残さないスムーズな分布予測が生成される。
4つのベンチマーク表データセット(COMPAS, German Credit, IEEE-CIS, Communities & Crime)の実証評価により,本手法は目標特徴属性をほぼゼロ(0.02)に体系的に分解し,攻撃成功率を90%以上維持し,条件付き異常検出を根本的に回避することを確認した。
関連論文リスト
- AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation [48.55515767840701]
AIスロープ(AI slop)は、アーティファクト、幻覚的脆弱性、可視だが正しくないパッチ、セマンティックに再パッケージされたバグレポートである。
本稿では,実証的証拠を調査し,統一メカニズムを特定し,信頼に値するトリアージへの道筋をたどる。
論文 参考訳(メタデータ) (2026-08-26T11:48:38Z) - SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense [77.70598852234149]
テキスト・トゥ・ビデオ(T2V)生成モデルは、現実世界のデプロイにおいてジェイルブレイク攻撃に対して脆弱である。
安全なクロスアテンション・ローカライゼーションと正規化のための機能レベル防衛機構であるSafeCAを提案する。
実験の結果、SafeCAは主流のT2Vモデルでジェイルブレイクの成功率を約20%削減することが示された。
論文 参考訳(メタデータ) (2026-08-11T14:01:24Z) - Secure-CHG: A Comprehensive Framework for Robust and Fair Federated Learning via Hybrid Defense and Contribution-Aware Trust [4.5294318938213465]
フェデレート・ラーニング(FL)は、ステルスなバックドア攻撃に非常に敏感である。
後期失敗」という基本的脆弱性を特定。
本稿では,防衛パラダイムを形態的検出から本質的な意味的貢献の検証へ転換するハイブリッドフレームワークSecure-CHGを提案する。
論文 参考訳(メタデータ) (2026-06-30T02:53:16Z) - TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models [19.148124494194317]
我々は,小規模モデルを堅牢な推論ファイアウォールに変換するプロセス誘導型セキュリティフレームワークであるTraceGuardを提案する。
提案手法は,推理トレースを信頼できないペイロードとして扱い,詳細な防衛戦略を確立する。
グレーボックス設定における適応的敵に対する堅牢性を実証し、TraceGuardを実用的で低レイテンシなセキュリティプリミティブとして確立する。
論文 参考訳(メタデータ) (2026-03-02T22:19:13Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - MISLEADER: Defending against Model Extraction with Ensembles of Distilled Models [56.09354775405601]
モデル抽出攻撃は、クエリアクセスを通じてブラックボックスモデルの機能を複製することを目的としている。
既存のディフェンスでは、アタッカークエリにはオフ・オブ・ディストリビューション(OOD)サンプルがあることを前提としており、不審な入力を検出し破壊することができる。
OOD仮定に依存しない新しい防衛戦略であるMISLEADERを提案する。
論文 参考訳(メタデータ) (2025-06-03T01:37:09Z) - Towards Model Resistant to Transferable Adversarial Examples via Trigger Activation [95.3977252782181]
知覚不能な摂動によって特徴づけられる敵対的な例は、彼らの予測を誤解させることで、ディープニューラルネットワークに重大な脅威をもたらす。
本稿では,移動可能な敵例(TAE)に対して,より効率的かつ効果的に堅牢性を高めることを目的とした,新たなトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2025-04-20T09:07:10Z) - Indiscriminate Disruption of Conditional Inference on Multivariate Gaussians [60.22542847840578]
敵対的機械学習の進歩にもかかわらず、敵対者の存在下でのガウスモデルに対する推論は特に過小評価されている。
我々は,意思決定者の条件推論とその後の行動の妨害を希望する自己関心のある攻撃者について,一組の明らかな変数を乱すことで検討する。
検出を避けるため、攻撃者は、破損した証拠の密度によって可否が決定される場合に、攻撃が可否を示すことを望んでいる。
論文 参考訳(メタデータ) (2024-11-21T17:46:55Z) - BadGD: A unified data-centric framework to identify gradient descent vulnerabilities [10.996626204702189]
BadGDは、敵の操作を理解し緩和するための新しい標準を設定している。
この研究は、このようなデータ中心の攻撃によって引き起こされる深刻な脅威を強調し、機械学習における堅牢な防御の必要性を強調している。
論文 参考訳(メタデータ) (2024-05-24T23:39:45Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z) - DALA: A Distribution-Aware LoRA-Based Adversarial Attack against
Language Models [64.79319733514266]
敵攻撃は入力データに微妙な摂動をもたらす可能性がある。
最近の攻撃方法は比較的高い攻撃成功率(ASR)を達成することができる。
そこで本研究では,分散ロラをベースとしたDALA(Adversarial Attack)手法を提案する。
論文 参考訳(メタデータ) (2023-11-14T23:43:47Z) - Kick Bad Guys Out! Conditionally Activated Anomaly Detection in Federated Learning with Zero-Knowledge Proof Verification [31.38942054994932]
フェデレーテッド・ラーニング(FL)システムは敵の攻撃を受けやすい。
RedJasperは、現実世界のFLデプロイメント用に特別に設計された2段階の異常検出手法である。
第1段階で不審な活動を特定し、第2段階を条件付きで活性化し、不審な局所モデルをさらに精査する。
論文 参考訳(メタデータ) (2023-10-06T07:09:05Z) - Theoretically Principled Trade-off for Stateful Defenses against
Query-Based Black-Box Attacks [26.905553663353825]
我々は,ステートフルディフェンスに対する検出と偽陽性率のトレードオフを理論的に評価する。
このトレードオフがブラックボックス攻撃の収束に与える影響を分析する。
論文 参考訳(メタデータ) (2023-07-30T22:31:01Z) - IMBERT: Making BERT Immune to Insertion-based Backdoor Attacks [45.81957796169348]
バックドア攻撃は、機械学習モデルに対する汚いセキュリティ脅威だ。
IMBERTは、被害者モデルから得られた勾配または自己注意スコアを用いて、バックドア攻撃に対する自己防衛を行う。
我々の実証研究は、IMBERTが挿入されたトリガーの98.5%を効果的に識別できることを示した。
論文 参考訳(メタデータ) (2023-05-25T22:08:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。