論文の概要: MaliciousSkillBench: A Comprehensive Benchmark for Malicious Agent Skill Detection
- arxiv url: http://arxiv.org/abs/2608.19901v1
- Date: Thu, 20 Aug 2026 11:13:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.538558
- Title: MaliciousSkillBench: A Comprehensive Benchmark for Malicious Agent Skill Detection
- Title(参考訳): MaliciousSkillBench: 悪質エージェントスキル検出のための総合ベンチマーク
- Abstract要約: MaliciousSkillBenchは、悪意のあるエージェントスキル検出のための包括的なベンチマークである。
我々は13の公開ソースを統合し、そのうち11つはCoreの悪意のあるアーティファクトに貢献し、8,414の生の悪意のあるレコードを7,539の正規化されたユニクティックIDに減らした。
そして、3つの学習されたテキスト検出器と3つの既製のスキルスキャナを評価した。
- 参考スコア(独自算出の注目度): 24.37473229751569
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent Skills extend LLM agents with reusable instruction packages that may also include scripts, resources, and service configuration. This creates a direct distribution channel for malicious behavior, yet existing malicious-Skill datasets are fragmented across sources, artifact formats, evidence regimes, and benign coverage; duplicated and structurally related content further complicates direct aggregation and evaluation. We present MaliciousSkillBench, a comprehensive benchmark for malicious Agent Skill detection. We consolidate 13 public sources, 11 of which contribute Core malicious artifacts, and reduce 8,414 raw malicious records to 7,539 normalized-unique identities in 4,588 operational structural families. After conservative cross-label conflict exclusion, the primary benchmark contains 9,740 Skills: 7,505 malicious and 2,235 benign. To characterize its coverage, we harmonize 11 attack categories for 4,983 malicious identities with supported source-native mappings and find substantial differences in threat composition across sources. We then evaluate three learned text detectors and three off-the-shelf Skill scanners. Learned detectors achieve 0.882-0.932 Random Macro-F1 but only 0.653-0.665 under Source-Disjoint evaluation; the strongest word TF-IDF SVM scores 0.932/0.916/0.665 on Random/structural-disjoint/Source-Disjoint while retaining 95.6% malicious recall but producing 62.4% benign FPR on held-out sources. Off-the-shelf scanners occupy different but also unsatisfactory operating regimes, reducing false positives only at the cost of sharply lower malicious recall. Together, these results show that reliable malicious-Skill detection requires both broader cross-source benchmark coverage and evaluation that jointly measures attack detection and benign over-flagging.
- Abstract(参考訳): Agent Skillsは、スクリプト、リソース、サービス構成を含む再利用可能な命令パッケージでLLMエージェントを拡張する。
これは悪意のある振る舞いのための直接的な配布チャネルを生成するが、既存の悪意あるスキルデータセットはソース、アーティファクトフォーマット、エビデンスレジーム、良質なカバレッジで断片化されている。
悪意のあるエージェントスキル検出のための包括的なベンチマークであるMaliciousSkillBenchを紹介する。
我々は13の公開資料を統合し、そのうち11はCoreの悪質なアーティファクトに寄与し、8,414件の生の悪質な記録を4,588の運用構造系で7,539件に減らした。
保守的なクロスラベルの衝突排除の後、主要なベンチマークには9,740のスキルが含まれている:7,505の悪意と2,235の良心。
対象範囲を特徴付けるために,ソースネイティブマッピングをサポートする悪意のある4,983件の攻撃カテゴリを調和させ,ソース間の脅威構成にかなりの差異を見出す。
そして、3つの学習されたテキスト検出器と3つの既製のスキルスキャナを評価した。
TF-IDF SVM scores 0.932/0.916/0.665 on Random/structural-disjoint/Source-Disjoint は95.6%の悪質なリコールを保ちながら62.4%の良質なFPRを生成する。
市販のスキャナーは異なるが不満足な運用体制を占有し、悪質なリコールのコストを著しく下げるだけで偽陽性を減らしている。
これらの結果から、信頼性の高い悪質スキル検出には、より広範なクロスソースベンチマークカバレッジと、攻撃検出と良質な過剰フラグングを共同で測定する評価が必要であることが示唆された。
関連論文リスト
- CodePoisonRAG: Knowledge Poisoning Attacks on Retrieval-Augmented Code Generation [47.354635260745134]
我々は、良質な固定コードエントリを有毒なアーティファクトに変換する上流知識汚染フレームワークであるCodePoisonRAGを紹介した。
JavaとCにまたがる10のCWEクラスをカバーする85の有毒アーティファクトを構築した。
論文 参考訳(メタデータ) (2026-09-02T16:11:01Z) - Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems [1.7327102304628392]
Retrieval-Augmented Generation (RAG) は、Large Language Model (LLM) を外部知識で出力する。
本稿では,自然言語推論(NLI)の事実検証,関連性重み付けによる5信号毒素検出,信頼指数T = 0.4 F + 0.35 C + 0.25 (1 - P) を組み合わせた評価エージェントを提案する。
Llama 3.3 70BのTrathfulQAでは、エージェントは91%の精度と100%の精度に達し、インストラクションインジェクションで100%リコールされる。
論文 参考訳(メタデータ) (2026-08-21T13:42:41Z) - SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification [0.0]
nsfaguardは、エージェントAIシステムを運用上の脅威から保護するためのガードレールフレームワークである。
まず,185種のリスク変異をCIA-Triad-grounded 階層に分類するNSFA分類について紹介する。
凍結したバックボーン上の識別的分類ヘッドと解釈可能なオフライン監査のためのSFTに基づく生成推論を組み合わせたデュアルモードアプローチを開発した。
論文 参考訳(メタデータ) (2026-07-13T07:28:45Z) - SkillMutator: Benchmarking and Defending Language-and-Code Cross-modal Attacks on LLM Agent Skills [7.465256215885481]
大きな言語モデル(LLM)エージェントは、エージェントスキルをロードすることで、実行時にその機能を拡張する。
スキルの振る舞いは自然言語命令と実行可能コードの両方に依存しているため、その安全性を評価するにはクロスモーダル推論が必要である。
我々は、Agent Skillsに対する言語とコードのクロスモーダル攻撃をインストール時に検出する最初のベンチマークであるSkillMutatorを紹介した。
論文 参考訳(メタデータ) (2026-06-12T06:27:12Z) - MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills [24.371534406647978]
MalSkillBenchは、悪質なエージェントスキルの最初のランタイム検証ベンチマークである。
コードインジェクションは94.5%に達するが、迅速なインジェクションは75.8%に過ぎない。
データセット、パイプライン、ベースライン、結果をリリースしています。
論文 参考訳(メタデータ) (2026-06-05T10:43:19Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Behavioral Integrity Verification for AI Agent Skills [9.127363793428119]
我々はこれを行動整合性検証(BIV)問題として定式化する。
OpenClawレジストリの49,943のスキルでは、逸脱分類が広範な記述と実装のギャップを明らかにしている。
906スキルの悪質なスキル検出ベンチマークでは、BIVは0.946のF1に達し、最先端のルールベースとシングルパスのLCMベースラインを上回っている。
論文 参考訳(メタデータ) (2026-05-12T08:41:09Z) - ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems [56.613157564882925]
悪意のある行動は、一見良心的なツールに埋め込まれ、エージェントの実行を静かにハイジャックしたり、機密データをリークしたり、無許可のアクションをトリガーしたりする。
影響は拡大しているが、このような脅威を評価するための包括的なベンチマークは今のところ存在しない。
実ネットワークの相互作用を観測してサプライチェーン中毒を検出するネットワークレベルのガードレールフレームワークであるShieldNetを提案する。
論文 参考訳(メタデータ) (2026-04-06T05:15:00Z) - Credential Leakage in LLM Agent Skills: A Large-Scale Empirical Study [51.717224133855886]
サードパーティのスキルはLLMエージェントを強力な能力で拡張するが、特権のある環境では機密情報を扱うことが多い。
静的解析,サンドボックステスト,手動検査を用いて17,022のスキル(SkillsMPで170,226からサンプリング)を分析した。
我々は,1,708の課題で520の脆弱なスキルを識別し,10の漏洩パターン(事故4件,反対6件)の分類を導出する。
論文 参考訳(メタデータ) (2026-04-03T14:50:16Z) - Understanding NPM Malicious Package Detection: A Benchmark-Driven Empirical Analysis [10.599261033874884]
NPMエコシステムは、ソフトウェアサプライチェーン攻撃の主要なターゲットとなっている。
ベンチマークによるNPMマルウェア検出の実証分析を行う。
我々は、11の行動カテゴリと8の回避テクニックを付加した、6,420の悪意のある7,288の良性パッケージのデータセットを構築した。
論文 参考訳(メタデータ) (2026-03-29T07:04:31Z) - CausalDiff: Causality-Inspired Disentanglement via Diffusion Model for Adversarial Defense [61.78357530675446]
人間は、本質的な要因のみに基づいて判断するので、微妙な操作によって騙されるのは難しい。
この観察に触発されて、本質的なラベル因果因子を用いたラベル生成をモデル化し、ラベル非因果因子を組み込んでデータ生成を支援する。
逆の例では、摂動を非因果因子として識別し、ラベル因果因子のみに基づいて予測することを目的としている。
論文 参考訳(メタデータ) (2024-10-30T15:06:44Z) - Malicious Agent Detection for Robust Multi-Agent Collaborative Perception [52.261231738242266]
多エージェント協調(MAC)知覚は、単エージェント認識よりも敵攻撃に対して脆弱である。
MAC知覚に特異的な反応防御であるMADE(Malicious Agent Detection)を提案する。
我々は、ベンチマーク3DデータセットV2X-simとリアルタイムデータセットDAIR-V2Xで包括的な評価を行う。
論文 参考訳(メタデータ) (2023-10-18T11:36:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。