論文の概要: OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills
- arxiv url: http://arxiv.org/abs/2607.20121v1
- Date: Wed, 22 Jul 2026 13:24:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.089922
- Title: OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills
- Title(参考訳): OpenSkillRisk: 現実世界のリスクの高いサードパーティスキルを使用する場合のベンチマークエージェントの安全性
- Authors: Qiyuan Liu, Tingfeng Hui, Kun Zhan, Kaike Zhang, Ning Miao,
- Abstract要約: サードパーティのスキルには、実際の実行時にのみ発生する、潜伏する安全リスクが含まれる。
本研究では,現在のエージェントシステムがどのようにリスクを認識し,回避しているかを体系的に調査する。
定量的かつ質的な評価を支援するために,263のリスクスキルを含む専用安全ベンチマークOpenSkillRiskを構築した。
- 参考スコア(独自算出の注目度): 14.078280127843108
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM-based agents leverage third-party skills to extend their capabilities in open-world scenarios. However, third-party skills can introduce extra security vulnerabilities, as seemingly harmless skills can contain latent safety risks that only emerge during actual execution. In this work, we conduct a systematic investigation into how well current agent systems recognize and avoid such risks. To support quantitative and qualitative evaluation, we construct OpenSkillRisk, a dedicated safety benchmark containing 263 risky skills collected from public skill marketplaces. We classify these skills into seven categories based on their threat types and pair each skill with a standardized user task and a corresponding sandbox for controlled evaluation. Distinct from prior benchmarks, OpenSkillRisk not only covers more realistic and diverse unsafe scenarios, but also provides a fine-grained analysis to diagnose the behavioral patterns of agents in such scenarios. We conduct comprehensive experiments covering three mainstream CLI agent frameworks and thirteen state-of-the-art LLMs. Experimental results show that no tested system handles risky skills reliably: even the safest configurations still execute unsafe actions in about 17% of cases. Context-dependent and system-level risks are especially difficult for current agent systems to avoid. Our behavioral analysis reveals three recurring failure patterns: agents may fail to recognize the risk, recognize it but fail to intervene before acting, or follow skill instructions beyond the user's intended scope. These findings highlight the need to improve both risk reasoning in LLMs and execution control in agent frameworks.
- Abstract(参考訳): LLMベースのエージェントは、サードパーティのスキルを活用して、オープンワールドシナリオにおける能力を拡張する。
しかし、サードパーティのスキルは、一見無害なスキルが実際の実行時にのみ発生する潜伏する安全リスクを含むため、さらなるセキュリティ脆弱性をもたらす可能性がある。
本研究では,現在のエージェントシステムがどのようにリスクを認識し,回避しているかを体系的に調査する。
定量的かつ質的な評価を支援するために,公開スキル市場から収集した263のリスクスキルを含む専用の安全ベンチマークであるOpenSkillRiskを構築した。
我々はこれらのスキルを脅威タイプに基づいて7つのカテゴリに分類し、各スキルを標準化されたユーザタスクと、制御された評価のためのサンドボックスにペアリングする。
以前のベンチマークとは違い、OpenSkillRiskはより現実的で多様な安全でないシナリオをカバーしているだけでなく、そのようなシナリオにおけるエージェントの振る舞いパターンを診断するためのきめ細かい分析も提供している。
3つのメインストリームCLIエージェントフレームワークと13の最先端LLMに関する総合的な実験を行った。
最も安全な設定でさえ、約17%のケースで安全でないアクションを実行します。
コンテキスト依存およびシステムレベルのリスクは、現在のエージェントシステムでは特に避けがたい。
エージェントはリスクを認識しなかったり、それを認識できなかったり、行動の前に介入しなかったり、ユーザの意図した範囲を超えてスキル指示に従う。
これらの知見は、LSMにおけるリスク推論とエージェントフレームワークにおける実行制御の両方を改善する必要性を強調している。
関連論文リスト
- SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents [87.26967184869198]
SeClawは、仕様駆動のセキュリティタスク合成と、自律エージェントの実行ベースのセキュリティ評価を組み合わせたフレームワークである。
ベンチマークは、リソース、ユーザタスク、環境、本質的なエージェントの振る舞いから生じるリスクをカバーしている。
論文 参考訳(メタデータ) (2026-06-01T14:23:42Z) - SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement [66.44008181092832]
LLMベースのエージェントシステムは、その能力を拡張するためにオープンレジストリからのエージェントスキルにますます依存している。
SkillAttackは、敵のプロンプトを通じて、スキル脆弱性の脆弱性を検証できるフレームワークである。
論文 参考訳(メタデータ) (2026-04-05T06:25:11Z) - A Systematic Security Evaluation of OpenClaw and Its Variants [26.64519805689193]
本稿では,6つの代表的なOpenClaw-Seriesエージェントフレームワークのセキュリティ評価について述べる。
エージェント実行ライフサイクル全体にわたって、代表的な攻撃行動をカバーする205のテストケースのベンチマークを構築した。
以上の結果から, 評価されたエージェントはいずれも重大なセキュリティ上の脆弱性を示し, エージェント化されたシステムは, 基礎となるモデルよりもかなりリスクが高いことがわかった。
論文 参考訳(メタデータ) (2026-04-03T15:52:36Z) - SkillProbe: Security Auditing for Emerging Agent Skill Marketplaces via Multi-Agent Collaboration [22.680481305584028]
SkillProbeはマルチエージェントコラボレーションによって駆動されるマルチステージセキュリティ監査フレームワークである。
ClawHubから2500の現実世界スキルを対象とした8つの主流シリーズを用いた大規模評価を行った。
私たちの結果は、ダウンロードボリュームが信頼できるプロキシのセキュリティ品質ではないという、重大な人気セキュリティのパラドックスを明らかにしました。
論文 参考訳(メタデータ) (2026-03-22T02:31:27Z) - The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment [148.80266237240713]
暗黙のトレーニング時間安全リスクは、モデルの内部インセンティブとコンテキスト背景情報によって引き起こされる。
5つのリスクレベル、10つのきめ細かいリスクカテゴリ、3つのインセンティブを持つ分類を導入した。
我々の結果は、過度に見過ごされているが、訓練における緊急の安全上の課題を特定します。
論文 参考訳(メタデータ) (2026-02-04T04:23:58Z) - LM Agents May Fail to Act on Their Own Risk Knowledge [15.60032437959883]
言語モデル(LM)エージェントは、安全クリティカルなシナリオにおいて、様々な潜在的な、深刻なリスクをもたらす。
Sudo rm -rf /*' が危険なのか?」といった質問に対して "Yes" と答えることが多いが、インスタンス化された軌跡におけるそのようなリスクを特定できない可能性が高い。
論文 参考訳(メタデータ) (2025-08-19T02:46:08Z) - OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety [58.201189860217724]
OpenAgentSafetyは,8つの危機リスクカテゴリにまたがるエージェントの動作を評価する包括的なフレームワークである。
従来の作業とは異なり、我々のフレームワークは、Webブラウザ、コード実行環境、ファイルシステム、bashシェル、メッセージングプラットフォームなど、実際のツールと対話するエージェントを評価します。
ルールベースの分析とLSM-as-judgeアセスメントを組み合わせることで、過度な行動と微妙な不安全行動の両方を検出する。
論文 参考訳(メタデータ) (2025-07-08T16:18:54Z) - AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions [64.85086226439954]
本稿では,有害な指示に対するVLMエージェントの安全性を評価するためのベンチマークであるSAFEを提案する。
SAFEは、SAFE−THOR、SAFE−VERSE、SAFE−DIAGNOSEの3つの成分からなる。
我々は、ハザード認識を安全な計画と実行に翻訳する体系的な失敗を明らかにする。
論文 参考訳(メタデータ) (2025-06-17T16:37:35Z) - Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models [29.569220030102986]
textbfBeyond Safe Answers (BSA) ベンチは,3つの異なるSSAシナリオタイプに構成された2,000のチャレンジインスタンスからなる,新しいベンチマークである。
19の最先端のLEMの評価では、このベンチマークの難しさが示され、最高性能のモデルはリスクの合理性を正確に識別する上で、わずか38.0%の精度しか達成していない。
我々の研究は、LEMの安全性推論の忠実さを評価し改善するための総合的な評価ツールを提供し、真にリスクを意識し、確実に安全なAIシステムの開発を進める。
論文 参考訳(メタデータ) (2025-05-26T08:49:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。