論文の概要: When Safe Skills Collide: Measuring Compositional Risk in Agent Skill Ecosystems
- arxiv url: http://arxiv.org/abs/2606.00448v1
- Date: Sat, 30 May 2026 00:38:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.46487
- Title: When Safe Skills Collide: Measuring Compositional Risk in Agent Skill Ecosystems
- Title(参考訳): 安全スキルが衝突した場合:エージェントスキル生態系における構成的リスクの測定
- Abstract要約: LLMエージェントは、エージェントの運用能力を拡大するコミュニティに貢献するスキルにますます依存している。
エージェントAIシステムにおける中核的な安全問題として、安全でないスキルが安全でないスキルセットに構成できるかどうかについて検討する。
3つのコンポーネントからなる構成セキュリティ測定フレームワークであるSkillReactを紹介します。
- 参考スコア(独自算出の注目度): 7.628682710807044
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents increasingly rely on community-contributed skills that expand an agent's operational capability set. We study a core safety problem in agentic AI systems: whether individually safe skills can compose into unsafe installed skill sets. We present SkillReact, a compositional security measurement framework with three components: a deterministic static-composition benchmark, a two-rater LLM-assisted human-adjudication pipeline, and an action-based exploitability harness. On 1,520 ClawHub skills, 651 pass individual inspection and form 211,575 pairs; the benchmark flags 22.25% of these as structural candidates. We treat this raw rate as a recall-oriented scanner ceiling and calibrate it against human judgment: in a pattern-stratified audit, roughly one in five flagged pair-pattern hits survives as a real compositional risk (population-weighted validity 18.2%, our headline result), implying about 14K genuine risk memberships in a single registry that per-skill scanning misses by construction, since every pair is individually safe. An action-based harness then probes when these candidates become model-issued tool calls, and finds realization gated by host-model disposition: on an anchor-conditioned dropper subset, Haiku-4-5 issues the dropper-stage tool call on all 39 direct-prompt trials (36 of them the full download-then-execute chain, 3 download-only), Opus-4-7 stops at the download, and Sonnet-4-6 refuses outright. A control that holds the request fixed and varies only the installed skills finds compliance highest with no skills installed: a composition fixes which capabilities are reachable, while the host model decides whether to use them. Together these motivate install-time compositional checks and capability isolation as complements to per-skill scanning.
- Abstract(参考訳): LLMエージェントは、エージェントの運用能力を拡大するコミュニティに貢献するスキルにますます依存している。
エージェントAIシステムにおける中核的な安全問題として、安全でないスキルが安全でないスキルセットに構成できるかどうかについて検討する。
本稿では,SkillReact,決定論的静的構成ベンチマーク,2レータLDM支援型ヒューマンアジュディテーションパイプライン,アクションベースのエクスプロイザビリティハーネスという,3つのコンポーネントからなる構成的セキュリティ測定フレームワークについて紹介する。
1,520のClawHubスキルでは、651が個別の検査に合格し、211,575対を形成する。
我々は、この生レートをリコール指向スキャナーの天井として扱い、人間の判断に対して校正する:パターン階層化された監査では、フラグ付きペアパターンのヒットの5分の1が真の構成上のリスク(人口重み付けの妥当性18.2%、私たちの見出し結果)として生き残り、個々のペアが個別に安全であるため、単一のレジストリに14Kの真のリスクメンバシップが存在することを示唆している。
アンカー条件のドロップパーサブセットでは、Haiku-4-5は39のダイレクトプロンプトトライアルでドロップパーステージのツールコールを発行する(うち36つはフルダウンロード実行チェーン、3つはダウンロードのみ)。
要求を固定して変更するコントロールは、インストールされたスキルのみがコンプライアンスの最高レベルに到達し、コンポジションが到達可能な機能を修正する一方で、ホストモデルがそれらを使用するかどうかを決定する。
これらが組み合わさって、インストール時の構成チェックと機能分離がスキルごとのスキャンの補完となる。
関連論文リスト
- SkillAtlas: An Attack Trace Library for Agent Skills [67.18648151130607]
我々は、プライベートエージェントスキルセキュリティレポートバンドルをレビュー、修正、検索可能なパブリックケースに変換する、ホストされた攻撃トレースライブラリであるSkillAtlasを紹介する。
図書館には3,014のケース、6,589のトレース、151,131のステップ、233の影響を受けたスキル、8のリスクカテゴリが含まれている。
論文 参考訳(メタデータ) (2026-09-11T16:44:39Z) - SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification [0.0]
nsfaguardは、エージェントAIシステムを運用上の脅威から保護するためのガードレールフレームワークである。
まず,185種のリスク変異をCIA-Triad-grounded 階層に分類するNSFA分類について紹介する。
凍結したバックボーン上の識別的分類ヘッドと解釈可能なオフライン監査のためのSFTに基づく生成推論を組み合わせたデュアルモードアプローチを開発した。
論文 参考訳(メタデータ) (2026-07-13T07:28:45Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Contractual Skills: A GovernSpec Design Framework for Enterprise AI Agents [8.419155861590548]
本稿では,SKILL.mdファイルを可読性のあるタスクコントラクトとして整理するための,GovernSpecにインスパイアされた設計フレームワークであるコントラクトスキルを提案する。
このフレームワークは、コントラクトスキル、GovernSpec YAMLコントラクト、モデルコンテキストプロトコル(MCP)サーフェス、ツールアダプタ、ランタイムガードレール、トレース、評価システムの境界を明確にしている。
論文 参考訳(メタデータ) (2026-05-21T15:40:05Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills [34.459758668563964]
本稿では,信頼できないエージェントスキルに対するプレロード監査を,堅牢な3方向分類タスクとして定式化する。
本稿では,役割認識型エビデンス抽出,選択的セマンティック検証,一貫性保存を組み合わせたSkillGuard-Robustを紹介する。
SkillGuard-Robust on SkillGuardBench and two public-ecosystem extension through five large evaluation view from 254 to 404 package。
論文 参考訳(メタデータ) (2026-04-28T01:32:27Z) - SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills [0.0]
SkillSieveは3層検出フレームワークで、必要に応じてより深く分析する。
400スキルのラベル付きベンチマークでは、SkillSieveは0.800 F1を達成し、ClawVetの0.421を上回った。
論文 参考訳(メタデータ) (2026-04-08T00:58:48Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Formal Analysis and Supply Chain Security for Agentic AI Skills [0.0]
SkillFortifyは、エージェントスキルサプライチェーンのための最初の公式分析フレームワークである。
抽象解釈に基づく健全な静的解析フレームワークを提供する。
SATベースの解像度は1000ノードグラフを100ミリ秒以下で処理するのに対し、100%精度と0%偽陽性率は540スキルで達成する。
論文 参考訳(メタデータ) (2026-02-27T06:21:53Z) - Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale [26.757365536859453]
AIエージェントフレームワークの台頭はエージェントスキル、命令を含むモジュールパッケージ、エージェント機能を動的に拡張する実行可能なコードを導入した。
このアーキテクチャは強力なカスタマイズを可能にするが、スキルは暗黙の信頼と最小限の拒否によって実行され、重要なが不適合なアタックサーフェスを生み出す。
2つの主要な市場から42,447のスキルを収集し、この新興エコシステムの最初の大規模な経験的セキュリティ分析を行います。
論文 参考訳(メタデータ) (2026-01-15T12:31:52Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Steering MoE LLMs via Expert (De)Activation [118.23403783503026]
LLM(Large Language Models)におけるMixture-of-Experts (MoE)は、各トークンを専用のFeed-Forward Networks (FFN)のサブセットを介してルーティングする。
我々は,行動関連の専門家を検知し,制御することで,MoEモデルをステアリングするフレームワークであるSteerMoEを提案する。
論文 参考訳(メタデータ) (2025-09-11T17:55:09Z) - OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety [58.201189860217724]
OpenAgentSafetyは,8つの危機リスクカテゴリにまたがるエージェントの動作を評価する包括的なフレームワークである。
従来の作業とは異なり、我々のフレームワークは、Webブラウザ、コード実行環境、ファイルシステム、bashシェル、メッセージングプラットフォームなど、実際のツールと対話するエージェントを評価します。
ルールベースの分析とLSM-as-judgeアセスメントを組み合わせることで、過度な行動と微妙な不安全行動の両方を検出する。
論文 参考訳(メタデータ) (2025-07-08T16:18:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。