論文の概要: SkillSentry: Adaptive Honey Worlds for Dynamic Safety Testing of Agent Skills
- arxiv url: http://arxiv.org/abs/2608.03485v1
- Date: Tue, 04 Aug 2026 11:22:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 07:04:20.714272
- Title: SkillSentry: Adaptive Honey Worlds for Dynamic Safety Testing of Agent Skills
- Title(参考訳): SkillSentry: エージェントスキルの動的安全性テストのための適応型ハニーワールド
- Authors: Nizhang Li, Zonghao Ying, Xiangfan Wu, Zonglei Jing, Xixun Lin, Hao Zhang, Wenxin Zhang, Jiaye Lin, Quanchen Zou, Xiangzheng Zhang,
- Abstract要約: SkillSentryは、適応的なハニーワールドに基づいた動的安全テストフレームワークである。
我々は適応的な蜂蜜世界に基づく動的安全テストフレームワークであるSkillSentryを紹介する。
- 参考スコア(独自算出の注目度): 8.77014008687218
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: External skills extend the capabilities of large language model agents, but also introduce an execution-time attack surface: a skill that appears benign under inspection may reveal harmful behavior only after particular environmental states, resources, or interaction histories are encountered. Existing scanners primarily rely on static analysis, predefined rules, or one-shot semantic judgments, making such conditional behavior difficult to elicit and attribute. We present SkillSentry, a dynamic safety-testing framework based on adaptive honey worlds. SkillSentry infers the intended capability boundary of a skill, constructs an LLM-simulated environment with controlled decoy resources, and adaptively generates tasks to explore its behavioral states. It then compares skill-enabled trajectories with matched no-skill executions, grounding suspicious behaviors in source code and verified execution traces before making a final decision. We evaluate SkillSentry against seven scanner configurations. SkillSentry achieves 99.50% Recall and 96.26% average F1 on standard benchmarks. Under semantics-preserving evasion, it reaches 92.95% average F1, compared with 80.07% for the strongest baselines. Our code is available at https://github.com/nizhangli062-jpg/SkillSentry-Adaptive-Honey-Worlds-for-Dynamic-Safety-Testing-of- Agent-Skills.
- Abstract(参考訳): 外部スキルは、大規模な言語モデルエージェントの能力を拡張するだけでなく、実行時の攻撃面も導入する。
既存のスキャナーは主に静的解析、事前定義されたルール、またはワンショットのセマンティック判断に依存しており、そのような条件付き動作は引き起こしや属性付けが困難である。
我々は適応的な蜂蜜世界に基づく動的安全テストフレームワークであるSkillSentryを紹介する。
SkillSentryは、スキルの意図した能力境界を推論し、制御されたデコイリソースでLLMシミュレーション環境を構築し、その動作状態を探索するタスクを適応的に生成する。
そして、スキル対応のトラジェクトリと、一致したスキルなしの実行を比較し、ソースコードに不審な振る舞いと、最終的な決定の前に検証された実行トレースを土台にします。
SkillSentryを7つのスキャナ構成に対して評価する。
SkillSentryは標準ベンチマークで99.50%のリコールと96.26%の平均F1を達成した。
セマンティックス保存の回避の下では、平均F1は92.95%、最強のベースラインは80.07%に達する。
私たちのコードはhttps://github.com/nizhangli062-jpg/SkillSentry-Adaptive-Honey-Worlds-for-Dynamic-Safety-Testing-of- Agent-Skillsで利用可能です。
関連論文リスト
- Cloak and Detonate: Scanner Evasion and Dynamic Detection of Agent Skill Malware [15.064889350201511]
悪意のあるスキルは、認証情報を盗んだり、ソースコードを流出させたり、バックドアをインストールしたりできる。
既存の防御はパターンマッチングやLSM-as-judge分析を用いる。
サンドボックスでスキルを実行する行動中心の監査ツールであるSkillDetonateを提案する。
論文 参考訳(メタデータ) (2026-07-02T16:00:52Z) - SkillMutator: Benchmarking and Defending Language-and-Code Cross-modal Attacks on LLM Agent Skills [7.465256215885481]
大きな言語モデル(LLM)エージェントは、エージェントスキルをロードすることで、実行時にその機能を拡張する。
スキルの振る舞いは自然言語命令と実行可能コードの両方に依存しているため、その安全性を評価するにはクロスモーダル推論が必要である。
我々は、Agent Skillsに対する言語とコードのクロスモーダル攻撃をインストール時に検出する最初のベンチマークであるSkillMutatorを紹介した。
論文 参考訳(メタデータ) (2026-06-12T06:27:12Z) - Runtime Skill Audit: Targeted Runtime Probing for Agent Skill Security [42.77195311830774]
スキル監査(Skill Audit、RSA)は、スキル仲介エージェントがターゲットランタイム条件下で実際に何をするかを問うことによって、スキルを監査する動的分析手法である。
RSA 90.0%の精度が88.0%の真正レートと8.0%の偽正レートで、最高の静的ベースラインよりも13.0ポイント精度が向上した。
自己進化攻撃の下では、静的検出器は1、2ラウンド後に崩壊し、RSAはラウンド全体で20の悪意のあるスキルのうち19-20を検知し続けている。
論文 参考訳(メタデータ) (2026-06-10T05:29:34Z) - VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents [57.240036084348354]
本稿では,ロボットスキルコントラクトの検証誘導自己進化のためのフレームワークであるVASOを紹介する。
VASOは論理的に一貫性のないスキル契約を検証し、グローバルおよびローカルな時間的仕様に対してスキルによって誘発される計画を検証する。
Clearpath Jackal と PX4 のクアッドコプタータスクでは、VASO は100点未満の最適化サンプルを使用して97.2% の形式的な仕様準拠に達した。
論文 参考訳(メタデータ) (2026-06-03T20:02:35Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces [28.615215165815297]
SkillSafetyBenchは、スキルを介する安全性障害を評価するためのベンチマークである。
ローカライズされた非ユーザアタックは、常に安全でない振る舞いを誘導できることを示す。
その結果, エージェントの安全性は, モデルレベルのアライメントだけでなく, エージェントがいかにスキルを解釈するかにも依存していることがわかった。
論文 参考訳(メタデータ) (2026-05-12T12:03:54Z) - Behavioral Integrity Verification for AI Agent Skills [9.127363793428119]
我々はこれを行動整合性検証(BIV)問題として定式化する。
OpenClawレジストリの49,943のスキルでは、逸脱分類が広範な記述と実装のギャップを明らかにしている。
906スキルの悪質なスキル検出ベンチマークでは、BIVは0.946のF1に達し、最先端のルールベースとシングルパスのLCMベースラインを上回っている。
論文 参考訳(メタデータ) (2026-05-12T08:41:09Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents [58.65256663334316]
我々は,対話型シミュレーション環境におけるLLMエージェントの安全性を考慮したタスク計画のための最初のベンチマークであるSafeAgentBenchを紹介する。
SafeAgentBenchは、(1)10の潜在的な危険と3つのタスクタイプをカバーするために厳格にキュレートされた750のタスクの実行可能な多種多様な高品質データセット、(2)低レベルコントローラを備えた普遍的な実施環境、9つの最先端ベースラインに対して17のハイレベルアクションでマルチエージェント実行をサポートするSafeAgentEnv、(3)実行とセマンティックの両方の観点から信頼性の高い評価方法を含む。
論文 参考訳(メタデータ) (2024-12-17T18:55:58Z) - BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models [57.5404308854535]
大型言語モデル(LLM)における安全バックドア攻撃は、正常な相互作用中の検出を回避しながら、安全でない振る舞いをステルス的に引き起こすことができる。
モデル埋め込み空間において,バックドアトリガーが比較的均一なドリフトを引き起こすという知見を活かした緩和手法であるBEEARを提案する。
両レベル最適化手法は、不要な振る舞いを誘発する普遍的な埋め込み摂動を特定し、モデルパラメータを調整し、これらの摂動に対する安全な振舞いを強化する。
論文 参考訳(メタデータ) (2024-06-24T19:29:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。