論文の概要: SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces
- arxiv url: http://arxiv.org/abs/2607.02345v1
- Date: Thu, 02 Jul 2026 15:49:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.909346
- Title: SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces
- Title(参考訳): SkillFuzz: オープンスキルマーケットプレースにおける不適切なインテント発見のためのファジングスキルコンポジション
- Authors: Jinwei Hu, Yi Dong, Youcheng Sun, Xiaowei Huang,
- Abstract要約: オープンスキルマーケットプレースは、コミュニティに貢献するスキルを共同で活性化することで、エージェントを組み立てることを可能にする。
結果として、個々に良心的なスキルが相互作用し、意図しない目的に向けてエージェントをリダイレクトし、暗黙の意図(暗黙の意図)を表現できる。
本稿では、構造化されたスキル契約を抽出し、契約ガイド付きモンテカルロ木探索を用いて競合する可能性のあるコンポジションを優先順位付けする、最初の実行不要なテスト手法であるスキルファズを提案する。
- 参考スコア(独自算出の注目度): 20.34628050914095
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM)-based agents increasingly automate software engineering tasks through reusable skills, natural-language instruction documents that guide planning and execution. Open skill marketplaces enable users to assemble agents by co-activating community-contributed skills, but marketplace operators typically audit skills in isolation. As a result, individually benign skills may interact to redirect an agent toward unintended objectives, which we term implicit intents. Detecting such intents is challenging because the effect emerges only through skill composition, execution environments are often unavailable at admission time, and the space of possible co-activations grows exponentially with marketplace size. In this paper, we formulate implicit-intent discovery as a fuzzing problem over skill compositions, where skill compositions are the unit under test, planning artifacts expose agent intent before execution, and deviations from a skill-free baseline serve as a differential oracle. Based on this formulation, we propose skillfuzz, the first execution-free testing approach that extracts structured skill contracts and uses contract-guided Monte Carlo Tree Search to prioritize potentially conflicting compositions. Across representative skill-marketplace workloads, skillfuzz discovers over 1,000 distinct implicit intents under a fixed query budget, confirms more than 80% of the highest-risk flagged compositions during execution-time validation, and identifies substantially more high-severity implicit intents than alternative search strategies while exploring only a fraction of the pairwise interaction space they require.
- Abstract(参考訳): 大規模言語モデル(LLM)ベースのエージェントは、再利用可能なスキル、計画と実行をガイドする自然言語命令文書を通じて、ソフトウェアエンジニアリングタスクを自動化する。
オープンスキルマーケットプレースでは、コミュニティに分散したスキルを共同で実行することでエージェントを組み立てることができるが、マーケットプレースオペレータは通常、単独でスキルを監査する。
結果として、個々に良心的なスキルが相互作用し、意図しない目的に向けてエージェントをリダイレクトし、暗黙の意図(暗黙の意図)を表現できる。
このような意図を検出することは、その効果がスキル構成によってのみ現れること、実行環境が入場時に利用できないこと、可能なコアクティベーションの空間が市場規模とともに指数関数的に大きくなること、など、難しい。
本稿では,スキルコンポジションがテスト対象の単位であり,計画的アーティファクトが実行前にエージェントインテントを公開し,スキルフリーベースラインからの逸脱が微分オラクルとして機能する,という,スキルコンポジションに対するファジリング問題として暗黙的な発見を定式化する。
この定式化に基づいて、構造化されたスキル契約を抽出し、契約ガイド付きモンテカルロ木探索を用いて競合する可能性のある構成を優先順位付けする、最初の実行不要なテスト手法であるスキルファズを提案する。
代表的なスキルマーケットプレースのワークロード全体では、固定されたクエリ予算の下で1,000以上の明確な暗黙の意図を発見し、実行時バリデーション中に最もリスクの高いフラグ付けされたコンポジションの80%以上を確認し、代替の検索戦略よりもはるかに重要で暗黙の意図を特定しながら、必要なペアのインタラクションスペースのごく一部を探索する。
関連論文リスト
- Generative Skill Composition for LLM Agents [58.47191648555256]
LLMエージェントは複雑なタスクを解決するためのスキルの恩恵を受ける。
スキルライブラリが成長するにつれて、適切なスキル構成を選択することが中心的なボトルネックとして現れている。
本稿では,タスク条件付きスキルシーケンス予測として構造化されたスキルコンポジションをインスタンス化するSkillComposerを提案する。
論文 参考訳(メタデータ) (2026-06-30T17:53:09Z) - SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment [10.850946672552277]
スキル中心アセスメントのためのエンドツーエンドフレームワークであるSkillAuditを紹介します。
実用性、効率/コスト、安全性にまたがる包括的多次元評価レポートを生成する。
トップランクの現実世界のスキルパッケージをスキャンした結果、スキルの7%以上が危険な状態にあることがわかった。
論文 参考訳(メタデータ) (2026-06-21T17:40:05Z) - Anything2Skill: Compiling External Knowledge into Reusable Skills for Agents [27.965275812765015]
Anything2Skillは、異種外部の知識を再利用可能な、検索可能な、エージェントの実行可能なスキルにコンパイルする分類誘導フレームワークである。
我々は、Anything2SkillとRAGを組み合わせることで、それぞれ98.85%と94.10%の成功率が得られることを示した。
論文 参考訳(メタデータ) (2026-06-08T10:24:32Z) - SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization [99.18305770138677]
エージェントスキルは、エージェントの推論とアクションをガイドする再利用可能な戦略である。
現在の技術構築手法は、問題を一発抽出として扱う。
本稿では,スキル構築を3つの学習可能な操作に分解するフレームワークであるSkillComposerを紹介する。
論文 参考訳(メタデータ) (2026-06-04T12:16:08Z) - SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement [66.44008181092832]
LLMベースのエージェントシステムは、その能力を拡張するためにオープンレジストリからのエージェントスキルにますます依存している。
SkillAttackは、敵のプロンプトを通じて、スキル脆弱性の脆弱性を検証できるフレームワークである。
論文 参考訳(メタデータ) (2026-04-05T06:25:11Z) - EvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification [85.3692584167951]
Anthropicは、LLMエージェントが多段階のプロフェッショナルタスクに取り組むためのスキルの概念を提案する。
ツールは単一の自己完結型関数であり、スキルは相互依存型多ファイルアーティファクトの構造化バンドルである。
EvoSkillsは、エージェントが複雑なマルチファイルスキルパッケージを自律的に構築できる自己進化型スキルフレームワークである。
論文 参考訳(メタデータ) (2026-04-02T06:43:20Z) - SoK: Agentic Skills -- Beyond Tool Use in LLM Agents [6.356997609995175]
エージェントシステムは、より確実にロングホライゾンを実行するために、再利用可能な手続き能力、すなわちエージェントスキルに依存している。
本論文は,全ライフサイクルのスキルレイヤ(発見,実践,蒸留,貯蔵,構成,評価,更新)をマッピングする。
我々は、スキルベースのエージェントのセキュリティとガバナンスの影響を分析し、サプライチェーンのリスク、スキルペイロードによるインジェクションの促進、信頼度の高い実行をカバーします。
論文 参考訳(メタデータ) (2026-02-24T13:11:38Z) - SkillDiffuser: Interpretable Hierarchical Planning via Skill Abstractions in Diffusion-Based Task Execution [75.2573501625811]
拡散モデルは、ロボット軌道計画の強力な可能性を示している。
高レベルの命令からコヒーレントな軌道を生成することは依然として困難である。
エンド・ツー・エンドの階層的計画フレームワークであるSkillDiffuserを提案する。
論文 参考訳(メタデータ) (2023-12-18T18:16:52Z) - Skill-Based Reinforcement Learning with Intrinsic Reward Matching [77.34726150561087]
Intrinsic Reward Matching (IRM) を提案する。
IRMにより、従来のスキル選択方法よりもはるかに効果的に事前訓練されたスキルを活用できる。
論文 参考訳(メタデータ) (2022-10-14T00:04:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。