論文の概要: SkillProbe: Security Auditing for Emerging Agent Skill Marketplaces via Multi-Agent Collaboration
- arxiv url: http://arxiv.org/abs/2603.21019v1
- Date: Sun, 22 Mar 2026 02:31:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.196537
- Title: SkillProbe: Security Auditing for Emerging Agent Skill Marketplaces via Multi-Agent Collaboration
- Title(参考訳): SkillProbe:マルチエージェントコラボレーションによるエージェントスキルマーケットプレースのセキュリティ監査
- Abstract要約: SkillProbeはマルチエージェントコラボレーションによって駆動されるマルチステージセキュリティ監査フレームワークである。
ClawHubから2500の現実世界スキルを対象とした8つの主流シリーズを用いた大規模評価を行った。
私たちの結果は、ダウンロードボリュームが信頼できるプロキシのセキュリティ品質ではないという、重大な人気セキュリティのパラドックスを明らかにしました。
- 参考スコア(独自算出の注目度): 22.680481305584028
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: With the rapid evolution of Large Language Model (LLM) agent ecosystems, centralized skill marketplaces have emerged as pivotal infrastructure for augmenting agent capabilities. However, these marketplaces face unprecedented security challenges, primarily stemming from semantic-behavioral inconsistency and inter-skill combinatorial risks, where individually benign skills induce malicious behaviors during collaborative invocation. To address these vulnerabilities, we propose SkillProbe, a multi-stage security auditing framework driven by multi-agent collaboration. SkillProbe introduces a "Skills-for-Skills" design paradigm, encapsulating auditing processes into standardized skill modules to drive specialized agents through a rigorous pipeline, including admission filtering, semantic-behavioral alignment detection, and combinatorial risk simulation. We conducted a large-scale evaluation using 8 mainstream LLM series across 2,500 real-world skills from ClawHub. Our results reveal a striking popularity-security paradox, where download volume is not a reliable proxy for security quality, as over 90% of high-popularity skills failed to pass rigorous auditing. Crucially, we discovered that high-risk skills form a single giant connected component within the risk-link dimension, demonstrating that cascaded risks are systemic rather than isolated occurrences. We hope that SkillProbe will inspire researchers to provide a scalable governance infrastructure for constructing a trustworthy Agentic Web. SkillProbe is accessible for public experience at skillhub.holosai.io.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントエコシステムの急速な進化に伴い、中央集権的なスキルマーケットプレースがエージェント機能を増強するための重要な基盤として現れている。
しかし、これらのマーケットプレースは、主にセマンティックビヘイビアの不整合と、個別に良心的なスキルが協調的呼び出し中に悪意ある振る舞いを誘発するスキル間の複合的リスクに起因して、前例のないセキュリティ上の課題に直面している。
これらの脆弱性に対処するため,マルチエージェントコラボレーションによるマルチステージセキュリティ監査フレームワークであるSkillProbeを提案する。
SkillProbeは"スキル・フォー・スキル(Skills-for-Skills)"設計パラダイムを導入し、監査プロセスを標準化されたスキルモジュールにカプセル化して、入出力フィルタリング、セマンティックビヘイビアアライメント検出、組合せリスクシミュレーションを含む厳密なパイプラインを通じて専門エージェントを駆動する。
我々はClawHubから2500の現実世界スキルを対象とした8つのLLMシリーズを用いた大規模評価を行った。
高い人気を持つスキルの90%以上が厳格な監査に合格しなかったため、ダウンロード量はセキュリティ品質の信頼できるプロキシにはならない。
重要なことに、リスクリンクの次元において、リスクの高いスキルが単一の巨大連結コンポーネントを形成し、カスケードされたリスクは孤立した事象ではなく体系的であることを示した。
SkillProbeが研究者に、信頼できるエージェントWebを構築するためのスケーラブルなガバナンスインフラストラクチャを提供することを願っています。
SkillProbe は skillhub.holosai.io で一般公開されている。
関連論文リスト
- ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners [23.03858552822385]
LLMベースのエージェントシステムにおいて,エージェントスキルが重要な攻撃面として浮上している。
現在の防衛は、主に個々のスキルを検査し、クロススキル構成からのリスクを十分に検査する。
完全悪意のある意図を相互依存サブペイロードに分解する,コルーシブなマルチスキルチェーンアタックフレームワークであるColruSkillを提案する。
論文 参考訳(メタデータ) (2026-08-10T15:32:44Z) - $S^3$: Improving Agent Safety through Multi-Stage Defense [6.9152314145765]
大規模言語モデル(LLM)エージェントは、複雑なタスクを達成するために、メモリ、計画、ツール実行といったステージを持つ多段階のエージェントに依存している。
既存の安全手法は、独立したステージのみを保護し、統合が困難であり、ワークフロー全体を通して包括的な保護を持たないエージェントを残している。
不均一な安全設計を明示的なステージ意味を持つ再利用可能な構成可能なコンポーネントとして表現する統合抽象化であるStage-Specific Safety Skillsを紹介する。
我々は、エージェントワークフロー全体を通してリスク検出と緩和のために、ガードエージェントがステージ固有の安全スキルを編成する多段階防衛フレームワークであるS3$を提案する。
論文 参考訳(メタデータ) (2026-08-03T02:06:06Z) - OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills [14.078280127843108]
サードパーティのスキルには、実際の実行時にのみ発生する、潜伏する安全リスクが含まれる。
本研究では,現在のエージェントシステムがどのようにリスクを認識し,回避しているかを体系的に調査する。
定量的かつ質的な評価を支援するために,263のリスクスキルを含む専用安全ベンチマークOpenSkillRiskを構築した。
論文 参考訳(メタデータ) (2026-07-22T13:24:09Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security [57.35851886874902]
エージェントAIシステムは、複雑なタスクを自律的に実行するが、その多段階の軌道には、信頼性に挑戦する新たな障害モードが導入されている。
この調査では、リスクの高いデプロイメントに不可欠な2つのコアディメンションを通じて、信頼できるエージェントAIを精査する。
各次元について、重要な概念を明確にし、エージェントワークフローに沿ってリスクが発生する場所を特定し、ステージ目標の緩和戦略を要約する。
論文 参考訳(メタデータ) (2026-05-17T10:26:37Z) - SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement [66.44008181092832]
LLMベースのエージェントシステムは、その能力を拡張するためにオープンレジストリからのエージェントスキルにますます依存している。
SkillAttackは、敵のプロンプトを通じて、スキル脆弱性の脆弱性を検証できるフレームワークである。
論文 参考訳(メタデータ) (2026-04-05T06:25:11Z) - LiaisonAgent: An Multi-Agent Framework for Autonomous Risk Investigation and Governance [11.009578207207419]
LiaisonAgentは、技術的リスク検出とビジネスレベルのリスク管理のギャップを埋めるために設計された、自律的なマルチエージェントシステムである。
このシステムは、エンドツーエンドのツールコール成功率97.8%、リスク判定精度95%を達成する。
論文 参考訳(メタデータ) (2026-02-27T08:42:52Z) - SkillNet: Create, Evaluate, and Connect AI Skills [159.47504178122156]
SkillNetは、大規模にAIスキルを作成し、評価し、組織化するように設計されたオープンインフラストラクチャである。
私たちのインフラストラクチャは、20万を超えるスキルのリポジトリ、インタラクティブなプラットフォーム、多目的Pythonツールキットを統合しています。
論文 参考訳(メタデータ) (2026-02-26T14:24:02Z) - Agent Skills: A Data-Driven Analysis of Claude Skills for Extending Large Language Model Functionality [9.192260493061754]
エージェントスキルは、再利用可能なプログラムのようなモジュールで大きな言語モデル(LLM)エージェントを拡張する。
主要なマーケットプレースから40,285の公開スキルを大規模かつデータ駆動で分析する。
以上の結果から,コミュニティの注目度の変化を追及する短時間でスキルパブリッシュが発生する傾向が示唆された。
論文 参考訳(メタデータ) (2026-02-08T15:14:12Z) - Towards Unifying Quantitative Security Benchmarking for Multi Agent Systems [0.0]
AIシステムの進化 自律エージェントが協力し、情報を共有し、プロトコルを開発することでタスクを委譲するマルチエージェントアーキテクチャをますます展開する。
そのようなリスクの1つはカスケードリスクである。あるエージェントの侵入はシステムを通してカスケードし、エージェント間の信頼を利用して他人を妥協させる。
ACI攻撃では、あるエージェントに悪意のあるインプットまたはツールエクスプロイトが注入され、そのアウトプットを信頼するエージェント間でカスケードの妥協とダウンストリーム効果が増幅される。
論文 参考訳(メタデータ) (2025-07-23T13:51:28Z) - SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents [58.21223208538351]
本研究は,モバイルマルチモーダルエージェントを取り巻くセキュリティ問題について考察する。
行動シーケンス情報を組み込んだリスク識別機構の構築を試みる。
また、大規模言語モデルに基づく自動アセスメントスキームも設計している。
論文 参考訳(メタデータ) (2025-07-01T15:10:00Z) - A Proposal for Evaluating the Operational Risk for ChatBots based on Large Language Models [39.58317527488534]
3つの主要なステークホルダーに対する潜在的な脅威を同時に評価する新しいリスク評価指標を提案する。
メトリクスを検証するために、脆弱性テスト用のオープンソースのフレームワークであるGarakを活用しています。
その結果、セキュアで信頼性の高いAI駆動会話システムの運用における多次元リスクアセスメントの重要性が浮き彫りになった。
論文 参考訳(メタデータ) (2025-05-07T20:26:45Z) - HAICOSYSTEM: An Ecosystem for Sandboxing Safety Risks in Human-AI Interactions [95.49509269498367]
本稿では,多様な複雑な社会的相互作用におけるAIエージェントの安全性を調べるフレームワークであるHAICOSYSTEMを提案する。
私たちは7つの領域(医療、金融、教育など)にわたる92のシナリオに基づいて1840のシミュレーションを実行します。
我々の実験は、最先端のLSMは、プロプライエタリかつオープンソースの両方で、50%以上のケースで安全リスクを示すことを示した。
論文 参考訳(メタデータ) (2024-09-24T19:47:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。