論文の概要: A Finger on the Scale: Covert Policy Steering through Agentic Skills
- arxiv url: http://arxiv.org/abs/2609.02564v1
- Date: Wed, 02 Sep 2026 13:15:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.360739
- Title: A Finger on the Scale: Covert Policy Steering through Agentic Skills
- Title(参考訳): スケールの指:エージェントスキルによるカバートポリシーステアリング
- Abstract要約: 再利用可能なエージェントスキルは、タスクプロシージャ、ツールユースガイダンス、出力制約を備えた大きな言語モデル(LLM)エージェントを拡張する。
我々は、その宣言された機能とユーザ認証された目的と整合し続けるために、スキルによるポリシーを必要とするスキルポリシーの整合性を定式化する。
SkillShiftは、明示的なコマンドインジェクションやタスクハイジャックを使わずに、隠蔽ポリシーステアリングのための制約付きブラックボックスフレームワークである。
- 参考スコア(独自算出の注目度): 42.71897827897363
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reusable agent skills extend large language model (LLM) agents with task procedures, tool-use guidance, and output constraints. Yet these skills also act as externalized behavioral policies, which create a supply-chain risk: a third-party skill may preserve the declared task and valid output interface while covertly redirecting agent decisions toward an undisclosed objective. We formalize Skill Policy Integrity, which requires a Skill-induced policy to remain aligned with its declared functionality and the user-authorized objective. We further present SkillShift, a constrained black-box framework for covert policy steering without explicit target command injection or task hijacking. It combines semantically plausible policy edits with hierarchical validation, failure-guided optimization, and strategy compression to preserve effectiveness, output validity, transferability, and inconspicuousness. We instantiate this threat in agentic commerce and software dependency use, with SkillShift achieving attacker-favored selection rates of 81.33% and 63.33% while maintaining a 100% utility-preserving rate. The frozen policies also transfer without further optimization across heterogeneous LLM backends and agent environments. Moreover, the evaluated scanners fail to detect the constructed skills, motivating behavioral auditing of reusable skills as agent policy artifacts.
- Abstract(参考訳): 再利用可能なエージェントスキルは、タスクプロシージャ、ツールユースガイダンス、出力制約を備えた大きな言語モデル(LLM)エージェントを拡張する。
サードパーティのスキルは、宣言されたタスクと有効な出力インターフェースを保持しながら、エージェントの決定を秘密裏に非開示の目的に向けてリダイレクトする。
我々は、その宣言された機能とユーザ認証された目的と整合し続けるために、スキルによるポリシーを必要とするスキルポリシーの整合性を定式化する。
さらに、明示的なターゲットコマンドインジェクションやタスクハイジャックを使わずに、隠蔽ポリシーステアリングのための制約付きブラックボックスフレームワークであるSkillShiftについても紹介する。
セマンティックに妥当なポリシー編集と階層的検証、障害誘導最適化、および戦略圧縮を組み合わせることで、有効性、出力の有効性、転送可能性、不明瞭性を維持できる。
SkillShiftは攻撃者が好む選択率81.33%と63.33%を達成し、100%のユーティリティ保存率を維持している。
凍結されたポリシーは、ヘテロジニアスなLLMバックエンドとエージェント環境をまたいださらなる最適化なしに転送される。
さらに、評価されたスキャナは、構築されたスキルの検出に失敗し、再利用可能なスキルの行動監査をエージェントポリシーアーティファクトとして動機付ける。
関連論文リスト
- A Policy Algebra for Trust-Preserving Agentic AI Execution [5.943264605557423]
本稿では,エージェント能力の行使可能な信頼性エンベロープを定義するポリシー代数を提案する。
この評価は、能力ベンチマークではなく、信頼性と信頼性のトレードオフとして解釈される。
論文 参考訳(メタデータ) (2026-08-17T10:59:15Z) - SkillGuard: A Permission Framework for Agent Skills [14.787581333168859]
我々はスキル中心のパーミッションフレームワークであるSkillGuardを紹介した。
SkillGuardを実世界の315のスキルとSkillInjectで評価した。
論文 参考訳(メタデータ) (2026-06-02T02:01:53Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning [11.76119198695392]
大規模な言語モデルエージェントは、複雑なタスクを解決するために、ますます外部スキルに依存している。
既存の手法では、外部スキルは永続的なガイダンスとして蓄積するか、ポリシーに内部化され、ゼロスキル推論につながると仮定している。
パラメトリック能力の制限とスキル間の不均一な限界貢献により、最適なアクティブスキルセットは非モノトニック、タスク、ステージ依存である。
論文 参考訳(メタデータ) (2026-05-11T17:55:13Z) - PolicyBank: Evolving Policy Understanding for LLM Agents [51.86716874651299]
PolicyBankは構造化されたツールレベルの政策洞察を維持し、それらを反復的に洗練する。
PolicyBankは、人間の神託に対するギャップの最大82%を閉じている。
論文 参考訳(メタデータ) (2026-04-16T20:29:30Z) - SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement [66.44008181092832]
LLMベースのエージェントシステムは、その能力を拡張するためにオープンレジストリからのエージェントスキルにますます依存している。
SkillAttackは、敵のプロンプトを通じて、スキル脆弱性の脆弱性を検証できるフレームワークである。
論文 参考訳(メタデータ) (2026-04-05T06:25:11Z) - SoK: Agentic Skills -- Beyond Tool Use in LLM Agents [6.356997609995175]
エージェントシステムは、より確実にロングホライゾンを実行するために、再利用可能な手続き能力、すなわちエージェントスキルに依存している。
本論文は,全ライフサイクルのスキルレイヤ(発見,実践,蒸留,貯蔵,構成,評価,更新)をマッピングする。
我々は、スキルベースのエージェントのセキュリティとガバナンスの影響を分析し、サプライチェーンのリスク、スキルペイロードによるインジェクションの促進、信頼度の高い実行をカバーします。
論文 参考訳(メタデータ) (2026-02-24T13:11:38Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - Effective Red-Teaming of Policy-Adherent Agents [10.522087614181745]
タスク指向のLLMベースのエージェントは、適格性やキャンセルルールの返金といった厳格なポリシーを持つドメインで、ますます使われています。
本稿では,個人的利益のためにポリシーに忠実なエージェントを活用することを目的とした,敵対的ユーザに焦点を当てた新たな脅威モデルを提案する。
CRAFTは、ポリシーを意識した説得戦略を利用して、顧客サービスシナリオにおいてポリシーに忠実なエージェントを弱体化させるマルチエージェントのレッドチームシステムである。
論文 参考訳(メタデータ) (2025-06-11T10:59:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。