論文の概要: Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents
- arxiv url: http://arxiv.org/abs/2609.01487v1
- Date: Tue, 01 Sep 2026 16:19:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.832018
- Title: Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents
- Title(参考訳): Defense-as-Skill: スキル強化エージェントのための実行時ガードスキルの進化
- Authors: Xiaofang Yang, Ziqi Miao, Dianbo Sui, Jing Shao, Lijun Li,
- Abstract要約: 我々は、ランタイムガード自体をインストール可能で、検査可能で、編集可能なスキルとして実装する防衛パラダイムであるDefense-as-Skillを提案する。
私たちのガードであるSkillSonarは、ユーザのタスク境界に対するセンシティブなアクションをチェックし、各アクションを許容、再計画、確認決定にルーティングします。
- 参考スコア(独自算出の注目度): 30.77975669386977
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Skill-augmented agents load reusable skills as persistent runtime context, improving task performance but also giving malicious skills a durable channel for steering future actions. Such skills may leak secrets, corrupt code, bypass approvals, or stage data for exfiltration only after a concrete user task and workspace state make the unsafe action appear useful. This makes pre-install vetting insufficient and calls for runtime, task-conditioned protection. We propose Defense-as-Skill, a defense paradigm that implements the runtime guard itself as an installable, inspectable, and editable skill. Our guard, SkillSonar, runs alongside untrusted task skills and checks sensitive actions against the user's task boundary, routing each action to an allow, replan, or confirmation decision without modifying the underlying agent runtime. To study this setting, we construct SCOPE-R, a task-conditioned dataset covering 6 risk families and 21 sub-categories, with 206 attack-confirmed malicious instances and 43 benign tasks. We then improve SkillSonar on the SCOPE-R training subset using runtime guard-skill evolution, a Monte-Carlo Tree Search procedure that evolves the on-disk guard skill from feedback on the rollouts. Across Claude Code and OpenClaw, the evolved guard substantially reduces attack success while maintaining a favorable safety-utility trade-off. On repeated GLM-5 runs, SkillSonar reduces ID ASR from 0.482 to 0.104 and OOD ASR from 0.606 to 0.115. Further analyses demonstrate transfer across victim models, held-out risk families, and external benchmarks, as well as retained protection against adaptive attackers. Ablations further show that explicit safety responsibility assignment and the skill-native representation are both important to the observed gains.
- Abstract(参考訳): スキル強化されたエージェントは、永続的なランタイムコンテキストとして再利用可能なスキルをロードし、タスクパフォーマンスを向上させると同時に、悪意のあるスキルを将来のアクションを操縦するための耐久性のあるチャネルを提供する。
このようなスキルは、特定のユーザタスクとワークスペース状態が安全でないアクションを有用に見せかけた後にのみ、シークレットや破損したコード、承認をバイパスするステージデータをリークする可能性がある。
これにより、プレインストールのベッティングが不十分になり、実行時、タスク条件付きプロテクションが要求される。
我々は、ランタイムガード自体をインストール可能で、検査可能で、編集可能なスキルとして実装する防衛パラダイムであるDefense-as-Skillを提案する。
当社のガードであるSkillSonarは、信頼できないタスクスキルとともに動作し、ユーザのタスク境界に対するセンシティブなアクションをチェックし、基盤となるエージェントランタイムを変更することなく、各アクションを許容、計画、確認決定にルーティングします。
SCOPE-Rは6つのリスクファミリーと21のサブカテゴリをカバーするタスク条件付きデータセットで、攻撃確認された悪意のある206のインスタンスと43の良質なタスクを持つ。
次に,SkillSonar on the SCOPE-R training subset using runtime guard-skill evolution, a Monte-Carlo Tree Search procedure that developed the on-disk guard skills from feedback on the rollouts。
Claude CodeとOpenClaw全体で、進化したガードは、良好な安全ユーティリティトレードオフを維持しながら、攻撃の成功を大幅に削減する。
GLM-5の繰り返しで、SkillSonarはID ASRを0.482から0.104に減らし、OOD ASRを0.606から0.115に減らした。
さらなる分析では、被害者モデル、ホールドアウトリスクファミリー、および外部ベンチマーク間の転送、およびアダプティブアタッカーに対する保護が示されている。
アブレーションは、明らかな安全責任の割り当てとスキルネイティブの表現が、観察された利益にとって重要であることを示している。
関連論文リスト
- TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation [13.298401993417611]
TRUSSは、機能的で安全性の高いエージェントスキルを生成するためのエビデンスガイド付きフレームワークである。
我々は,SkillGenBenchの168個のSkillInjectアーティファクト,155個のSkillSafetyBenchケース,および187個のタスクについてTRUSSを評価した。
スキル生成では、TRUSSはタスク効率を17.11%から52.94%に引き上げ、ベンチマークセキュリティ率は50.80%から100.00%に向上した。
論文 参考訳(メタデータ) (2026-08-18T09:52:57Z) - Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents [7.8654950055159345]
我々はSkillMisevo-Gymを紹介した。SkillMisevo-Gymは、エージェントフレームワーク間でスキル状態をバージョン管理するライフサイクルアウェアハーネスである。
また、安全でないコンテンツを修復し、その後の再利用を管理するラッパーであるSafeEvolveを紹介します。
論文 参考訳(メタデータ) (2026-08-13T05:47:43Z) - SkillGuard: A Permission Framework for Agent Skills [14.787581333168859]
我々はスキル中心のパーミッションフレームワークであるSkillGuardを紹介した。
SkillGuardを実世界の315のスキルとSkillInjectで評価した。
論文 参考訳(メタデータ) (2026-06-02T02:01:53Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement [66.44008181092832]
LLMベースのエージェントシステムは、その能力を拡張するためにオープンレジストリからのエージェントスキルにますます依存している。
SkillAttackは、敵のプロンプトを通じて、スキル脆弱性の脆弱性を検証できるフレームワークである。
論文 参考訳(メタデータ) (2026-04-05T06:25:11Z) - Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models [64.47869632167284]
従来の言語モデル(LM)の安全性アライメントは、リアクティブで非結合な手順に依存している。
このシーケンシャルなアプローチはミスマッチを生み出し、攻撃者は時代遅れの防御に過度に適合する一方、守備側は出現する脅威に常に遅れをとどめている。
我々は,攻撃者と防御エージェントが継続的なインタラクションを通じて共進化するオンラインセルフプレイ強化学習アルゴリズムであるSelf-RedTeamを提案する。
論文 参考訳(メタデータ) (2025-06-09T06:35:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。