論文の概要: Auto-Policy, not Auto-Skill: Compiled Agent Skills for the Physical World
- arxiv url: http://arxiv.org/abs/2608.25091v1
- Date: Tue, 25 Aug 2026 19:40:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.422545
- Title: Auto-Policy, not Auto-Skill: Compiled Agent Skills for the Physical World
- Title(参考訳): オート・ポリティィ」ではなく「オート・スキル」:物理世界のためのコンパイルされたエージェントスキル
- Abstract要約: 自己進化型スキルハーネスは、自動的によりアドバイザリなオーケストレーションを生成する。
スキルはエージェントがどのように振る舞うかを記述し、ポリシーはどの動作がアクションになるかを決定します。
ツール間ではなく、Skillアーティファクト内に存在する型付き権威層であるEdge Skillguardを提案する。
- 参考スコア(独自算出の注目度): 6.238629583105336
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-evolving Skill harnesses (AutoSkills, Hermes Agent) generate more advisory orchestration automatically; their reported gains are efficiency, not safety. This misses the actual gap: a Skill describes how an agent should behave; a Policy decides which behavior is allowed to become an action. Today's format covers the first with markdown and scripts; the second is left to the model. Generating more Skills scales the gap, not the safety, especially when a wrong invocation can unlock a door or move money. Two adjacent attacks are documented: malicious skills compromising cloud software, and jailbroken LLM-controlled robots causing physical harm. Their intersection, malicious agent skills causing physical harm, follows directly but has not been reported. We name this class Borrowed Authority: Skills format gives the receiving agent no typed way to reject an inter-agent permission claim, so a malicious or misused Skill can drive actuation by attaching one. We propose Edge Skillguard, a typed authority layer that lives inside the Skill artifact rather than between tools as workflow engines do, with guards over world state and sensor evidence. On a live edge control-plane testbed, the guards reject 60/60 borrowed-authority requests across five attack variants without blocking benign requests, and the result holds at 5x scale and across hosts over a Tailscale mesh. These results suggest that high-risk Skills should co-package typed invocation policy with procedural knowledge, so that physical actions depend on machine-checkable evidence rather than peer-agent claims.
- Abstract(参考訳): 自己進化型スキルハーネス(AutoSkills, Hermes Agent)は、よりアドバイス的なオーケストレーションを自動的に生成する。
スキルはエージェントがどのように振る舞うかを記述し、ポリシーはどの動作がアクションになるかを決定します。
今日のフォーマットでは1つ目がマークダウンとスクリプトで、もう1つがモデルに委ねられている。
より多くのスキルを生み出すことは、特に間違った呼び出しがドアをアンロックしたり、お金を動かしたりする場合に、安全ではなくギャップを縮める。
クラウドソフトウェアを悪用する悪質なスキルと、ジェイルブレイクされたLLM制御ロボットの2つの隣接する攻撃が記録されている。
彼らの交点、悪意のあるエージェントのスキルは、直接に従うが、報告されていない。
私たちはこのクラスをBorrowed Authorityと名付けます: Skillsフォーマットは、受信エージェントがエージェント間の許可請求を拒否する型付けの方法を提供しないので、悪意のあるまたは誤用されたスキルは、それをアタッチすることでアクティベーションを駆動します。
ワークフローエンジンのようにツール間ではなく、Skillアーティファクト内に存在する型付き権威層であるEdge Skillguardを提案する。
ライブエッジコントロールプレーンのテストベッドでは、ガードは5つの攻撃タイプにまたがって60/60のオーソリティリクエストを拒否する。
これらの結果から, リスクの高いスキルは, 手続き的知識と協調して, 物理的行動は, ピアエージェントの主張ではなく, マシンチェック可能な証拠に依存することが示唆された。
関連論文リスト
- Agent Safety Is Action Alignment [5.990318568221089]
アクションセーフティは重みには設置できないと我々は主張する。
不変の特権として表現され、アクションバウンダリでモデルに強制される。
論文 参考訳(メタデータ) (2026-06-27T05:26:43Z) - SkillGuard: A Permission Framework for Agent Skills [14.787581333168859]
我々はスキル中心のパーミッションフレームワークであるSkillGuardを紹介した。
SkillGuardを実世界の315のスキルとSkillInjectで評価した。
論文 参考訳(メタデータ) (2026-06-02T02:01:53Z) - SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction [89.03272793385054]
エージェントスキルはエージェントワークフローにおける特権的な位置を占め、サードパーティスキルを脆弱な攻撃面にする。
我々はスキルベースアタックのベンチマークであるSkillHarmを紹介した。
攻撃成功率はFPPが86.3%、SMPが69.3%である。
論文 参考訳(メタデータ) (2026-06-01T17:45:39Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks [27.120130204872325]
SkillInjectは、広く使われているLLMエージェントの、スキルファイルによるインジェクションに対する感受性を評価するベンチマークである。
SkillInjectには、明らかに悪意のあるインジェクションから、その他の正当な命令に隠された微妙なコンテキスト依存的なアタックまで、202のインジェクションタスクペアが含まれている。
以上の結果から,今日のエージェントは,フロンティアモデルによる攻撃成功率の最大80%に対して,非常に脆弱であることが示唆された。
論文 参考訳(メタデータ) (2026-02-23T18:59:27Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - Malicious Agent Skills in the Wild: A Large-Scale Security Empirical Study [47.60135753021306]
サードパーティのエージェントスキルは、LLMベースのエージェントを拡張して、命令ファイルとユーザのマシン上で動作する実行可能なコードを生成する。
結果として生じる脅威を特徴づけるために、地中真実のデータセットは存在しない。
我々は,98,380のスキルを行動検証することで,悪質なエージェントスキルのラベル付きデータセットを構築した。
論文 参考訳(メタデータ) (2026-02-06T09:52:27Z) - Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models [64.47869632167284]
従来の言語モデル(LM)の安全性アライメントは、リアクティブで非結合な手順に依存している。
このシーケンシャルなアプローチはミスマッチを生み出し、攻撃者は時代遅れの防御に過度に適合する一方、守備側は出現する脅威に常に遅れをとどめている。
我々は,攻撃者と防御エージェントが継続的なインタラクションを通じて共進化するオンラインセルフプレイ強化学習アルゴリズムであるSelf-RedTeamを提案する。
論文 参考訳(メタデータ) (2025-06-09T06:35:12Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。