論文の概要: ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners
- arxiv url: http://arxiv.org/abs/2608.09732v1
- Date: Mon, 10 Aug 2026 15:32:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.346335
- Title: ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners
- Title(参考訳): ColluSkill:Evading Agent Skill Scannersの対人クロススキル構成
- Authors: Puyu Zeng, Simeng Qin, Jingzhi Li, Ju Jia, Zheli Liu, Xiaojun Jia,
- Abstract要約: LLMベースのエージェントシステムにおいて,エージェントスキルが重要な攻撃面として浮上している。
現在の防衛は、主に個々のスキルを検査し、クロススキル構成からのリスクを十分に検査する。
完全悪意のある意図を相互依存サブペイロードに分解する,コルーシブなマルチスキルチェーンアタックフレームワークであるColruSkillを提案する。
- 参考スコア(独自算出の注目度): 23.03858552822385
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent skills are emerging as an important attack surface in LLM-based agent systems. Through an empirical study of existing skill scanners, we find that current defenses mainly inspect individual skills, leaving risks from cross-skill composition insufficiently examined. This creates a practical blind spot: multiple locally plausible skills may pass security checks while collectively forming a harmful workflow during agent execution. To investigate this threat, we propose ColluSkill, a collusive multi-skill-chain attack framework that decomposes a complete malicious intent into interdependent sub-payloads embedded in independently packaged skills. The attack does not rely on any single malicious skill, but emerges from the ordered composition of locally plausible behaviors through contextual dependencies, artifact passing, and execution handoffs. ColluSkill further employs LLM-based chain planning and scanner-feedback refinement to preserve chain-level attack semantics while reducing suspicious signals in individual sub-skills. To defend against such attacks, we propose ChainGuard, a context-aware skill-chain scanner that jointly analyzes a candidate skill and the skills already installed in the agent environment. ChainGuard reconstructs cross-skill dependencies, artifact flows, capability compositions, and downstream behaviors to identify risks that emerge only at the workflow level. Experiments on six representative skill scanners show that ColluSkill achieves an average attack success rate of 96.0% and consistently outperforms the evaluated single-skill and multi-skill attack baselines. Meanwhile, ChainGuard reduces the attack success rate to 22.5% while allowing 99.5% of benign workflows to pass, highlighting the importance of chain-level security analysis for agent skill ecosystems.
- Abstract(参考訳): LLMベースのエージェントシステムにおいて,エージェントスキルが重要な攻撃面として浮上している。
既存の技術スキャナーの実証研究により、現状の防御は個々のスキルを主に検査し、クロススキル構成のリスクを十分に検証していることがわかった。
複数のローカルでもっともらしいスキルがセキュリティチェックをパスし、エージェントの実行中に有害なワークフローを集合的に形成する。
この脅威を調査するために、我々は、完全に悪意のある意図を独立したパッケージ化されたスキルに組み込んだ相互依存サブペイロードに分解する、協調的なマルチスキル・チェーン・アタック・フレームワークであるColruSkillを提案する。
この攻撃は、単一の悪意あるスキルに頼るのではなく、コンテキスト依存、アーティファクトパス、実行ハンドオフを通じて、ローカルでもっともらしい振る舞いの順序付けから発生する。
ColluSkillはさらにLLMベースのチェーン計画とスキャナフィードバックの改良を採用して、チェーンレベルの攻撃セマンティクスを維持しつつ、個々のサブスキルにおける疑わしい信号を減らす。
このような攻撃に対して防御するために,エージェント環境にすでに設置されているスキルと候補スキルを共同で分析するコンテキスト認識型スキルチェーンスキャナChainGuardを提案する。
ChainGuardは、クロススキル依存関係、アーティファクトフロー、機能構成、下流の振る舞いを再構築して、ワークフローレベルでのみ発生するリスクを特定する。
6つの代表的なスキルスキャナの実験は、ColruSkillが96.0%の平均攻撃成功率を達成し、評価されたシングルスキルとマルチスキル攻撃ベースラインを一貫して上回っていることを示している。
一方、ChainGuardは攻撃の成功率を22.5%に減らし、99.5%の良心的なワークフローを通過させ、エージェントスキルエコシステムにおけるチェーンレベルのセキュリティ分析の重要性を強調している。
関連論文リスト
- Cloak and Detonate: Scanner Evasion and Dynamic Detection of Agent Skill Malware [15.064889350201511]
悪意のあるスキルは、認証情報を盗んだり、ソースコードを流出させたり、バックドアをインストールしたりできる。
既存の防御はパターンマッチングやLSM-as-judge分析を用いる。
サンドボックスでスキルを実行する行動中心の監査ツールであるSkillDetonateを提案する。
論文 参考訳(メタデータ) (2026-07-02T16:00:52Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning [34.60596020541521]
我々はBadSkillを紹介します。BadSkillは、モデル・イン・スキル脅威サーフェスをターゲットとするバックドア攻撃の定式化です。
BadSkillでは、敵が隠れペイロードをアクティベートするために、組み込まれたモデルがバックドアで調整された、一見良心的なスキルを公開している。
ベンチマークは8つのトリガータスクと5つの非トリガー制御スキルを含む13のスキルにまたがっており、主な評価セットは571の負のクラスクエリと396のトリガー整列クエリである。
BadSkillは8つのトリガースキルの平均攻撃成功率(ASR)を99.5%まで達成し、負のクラスのクエリに対して強い良識的な精度を維持している。
論文 参考訳(メタデータ) (2026-04-10T14:48:29Z) - SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement [66.44008181092832]
LLMベースのエージェントシステムは、その能力を拡張するためにオープンレジストリからのエージェントスキルにますます依存している。
SkillAttackは、敵のプロンプトを通じて、スキル脆弱性の脆弱性を検証できるフレームワークである。
論文 参考訳(メタデータ) (2026-04-05T06:25:11Z) - SkillProbe: Security Auditing for Emerging Agent Skill Marketplaces via Multi-Agent Collaboration [22.680481305584028]
SkillProbeはマルチエージェントコラボレーションによって駆動されるマルチステージセキュリティ監査フレームワークである。
ClawHubから2500の現実世界スキルを対象とした8つの主流シリーズを用いた大規模評価を行った。
私たちの結果は、ダウンロードボリュームが信頼できるプロキシのセキュリティ品質ではないという、重大な人気セキュリティのパラドックスを明らかにしました。
論文 参考訳(メタデータ) (2026-03-22T02:31:27Z) - Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain [82.98626829232899]
自分自身のインタラクションからのデータに対する微調整のAIエージェントは、AIサプライチェーン内の重要なセキュリティ脆弱性を導入している。
敵は容易にデータ収集パイプラインに毒を盛り、検出しにくいバックドアを埋め込むことができる。
論文 参考訳(メタデータ) (2025-10-03T12:47:21Z) - AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning [78.5751183537704]
AdvEvo-MARLは、タスクエージェントに安全性を内部化する、共進化型マルチエージェント強化学習フレームワークである。
外部ガードに頼るのではなく、AdvEvo-MARLは攻撃者と防御者を共同で最適化する。
論文 参考訳(メタデータ) (2025-10-02T02:06:30Z) - BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks [58.959622170433725]
BlindGuardは、攻撃固有のラベルや悪意のある振る舞いに関する事前の知識を必要とせずに学習する、教師なしの防御方法である。
BlindGuardはマルチエージェントシステムにまたがる多様な攻撃タイプ(即時注入、メモリ中毒、ツール攻撃)を効果的に検出する。
論文 参考訳(メタデータ) (2025-08-11T16:04:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。