論文の概要: Demystifying Agent Skills for Smart Contract Auditing: Design, Effectiveness, Behavioral Impact
- arxiv url: http://arxiv.org/abs/2609.29454v1
- Date: Thu, 24 Sep 2026 12:09:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.910326
- Title: Demystifying Agent Skills for Smart Contract Auditing: Design, Effectiveness, Behavioral Impact
- Title(参考訳): スマートコントラクト監査のためのデマイチグエージェントスキル:設計,有効性,行動への影響
- Abstract要約: LLMエージェント、特にClaude CodeとOpenAI Codexは、コーディングエージェント以外の汎用ツールとして登場している。
今のところ、そのようなスキルがどのように設計されているか、それが実際にエージェントの有効性や行動に与える影響についてはほとんど分かっていない。
- 参考スコア(独自算出の注目度): 13.707057049430475
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents, notably Claude Code and OpenAI Codex, are emerging as versatile tools beyond coding agents only. These agents can be enhanced with skills---reusable artifacts that package domain knowledge, workflows, and tool-use instructions. To date, however, little is known about how such skills are designed or how they affect agent effectiveness and behavior in practice. In this paper, we investigate these questions in smart contract security auditing, a domain in which agents have shown substantial promise. We systematically collect 83 smart contract audit skills from the wild and evaluate them on EVMBench across seven agent--model configurations. Our study examines three dimensions: (i) the design characteristics of audit skills, including their structure, knowledge representations, workflows, and tool dependencies; (ii) their effectiveness in improving vulnerability detection; and (iii) their influence on agent execution trajectories. We find that audit skills are mostly lightweight but heterogeneous in design, covering a broad yet imbalanced range of vulnerability types. Their effectiveness is determined primarily by the model rather than the agent harness: Codex/GPT-5.5 achieves the largest gains, improving detection score by 22.8% and captured award by 43.2%. We further find that skill triggering is a key bottleneck. When triggered, skills preserve a shared six-stage audit workflow while exhibiting distinct loading patterns and differential effects on agent behavior across configurations. We release our skill corpus and artifacts to support future research.
- Abstract(参考訳): LLMエージェント、特にClaude CodeとOpenAI Codexは、コーディングエージェント以外の汎用ツールとして登場している。
これらのエージェントは、ドメイン知識、ワークフロー、ツール使用指示をパッケージ化する、再利用可能なアーティファクトで拡張することができる。
しかし、今のところ、そのようなスキルがどのように設計されているか、それが実際にエージェントの有効性や行動に与える影響についてはほとんど分かっていない。
本稿では,スマートコントラクトセキュリティ監査におけるこれらの課題について検討する。
我々は,83のスマートコントラクト監査スキルを組織的に収集し,EVMBench上で7つのエージェントモデル構成で評価した。
本研究は,3つの次元について検討する。
一 監査スキルの構造、知識表現、ワークフロー及びツール依存を含む設計上の特徴
二 脆弱性検出の改善における効果、及び
三 代理人執行軌道に影響を及ぼすこと。
監査スキルは、主に軽量だが、設計上は異質であり、広範囲で不均衡な脆弱性タイプをカバーしている。
Codex/GPT-5.5は最大のゲインを獲得し、検出スコアを22.8%改善し、捕獲されたアワードは43.2%向上した。
さらに、スキルのトリガーが重要なボトルネックであることに気付きました。
起動すると、スキルは共有された6段階の監査ワークフローを保持し、異なるロードパターンとエージェントの動作に対する差分効果を示す。
今後の研究を支援するために、スキルコーパスとアーティファクトをリリースします。
関連論文リスト
- Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents [67.97365535829098]
経験から学ぶことは、有能で自己改善型の大規模言語モデル(LLM)エージェントの開発に不可欠である。
Evo-Harnessは、ノイズの多いシングルショット実行を、クロスドメインとトピックレベルの適応のための再利用可能なスキルハーネスに蒸留する。
本分析は,エボ・ハーネスの有効性を実証し,LLMエージェントがリアルタイムで効果的に学習する方法の原理的理解を提供する。
論文 参考訳(メタデータ) (2026-08-15T06:43:56Z) - Demystifying Agent Skills: Why They Work-Until They Don't [58.92875630998418]
既存の評価は、スキルが集約されたタスクの成功を改善するかどうかを主に測定する。
我々は、表現、結果アノテーション、検索難易度、スキルのクロスフレームワークの影響を分離する。
我々はこれらの観察を3つの高レベルカテゴリと12のスキルユースモードの分類に集約する。
論文 参考訳(メタデータ) (2026-08-14T07:26:38Z) - Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents [9.71657681051469]
本稿では,タスクの失敗とコストの低下を特定の負荷スキルにもたらすことによって,スキルが引き起こすエージェントの失敗を包括的に分析する。
我々はSkillsBenchとSWE-Skills-Benchでこのフレームワークをインスタンス化し、125の機能障害と182の効率低下を含む307のスキル誘発障害を発生させる。
安全で低コストなスキル再利用のための研究トピックとツールの改善を提案する。
論文 参考訳(メタデータ) (2026-08-12T10:15:19Z) - A Framework for Evaluating Agentic Skills at Scale [0.4509560087514856]
エージェントスキルは構造化され、エージェント能力を増強する再利用可能な知識アーティファクトである。
個々のスキルを評価するための再利用可能な方法論は存在しない。
本稿では,スキルライターが現実的なタスクを構築できる評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-16T11:46:56Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization [99.18305770138677]
エージェントスキルは、エージェントの推論とアクションをガイドする再利用可能な戦略である。
現在の技術構築手法は、問題を一発抽出として扱う。
本稿では,スキル構築を3つの学習可能な操作に分解するフレームワークであるSkillComposerを紹介する。
論文 参考訳(メタデータ) (2026-06-04T12:16:08Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - SoK: Agentic Skills -- Beyond Tool Use in LLM Agents [6.356997609995175]
エージェントシステムは、より確実にロングホライゾンを実行するために、再利用可能な手続き能力、すなわちエージェントスキルに依存している。
本論文は,全ライフサイクルのスキルレイヤ(発見,実践,蒸留,貯蔵,構成,評価,更新)をマッピングする。
我々は、スキルベースのエージェントのセキュリティとガバナンスの影響を分析し、サプライチェーンのリスク、スキルペイロードによるインジェクションの促進、信頼度の高い実行をカバーします。
論文 参考訳(メタデータ) (2026-02-24T13:11:38Z) - Understanding Software Engineering Agents Through the Lens of Traceability: An Empirical Study [15.97770416681533]
ソフトウェアエンジニアリングエージェント(SWEエージェント)は、ユーザの入力を解釈し、環境フィードバックに応答することで、自律的に動作する。
本稿では,SWEエージェントの動作を,実行トレースのレンズを通してシステマティックに解析する。
論文 参考訳(メタデータ) (2025-06-10T00:41:54Z) - Re-TASK: Revisiting LLM Tasks from Capability, Skill, and Knowledge Perspectives [54.14429346914995]
CoT(Chain-of-Thought)は、大規模言語モデル(LLM)による複雑な問題を解決する重要な方法となっている。
本稿では,LLMタスクを能力,スキル,知識の観点から再考する理論モデルであるRe-TASKフレームワークを紹介する。
多様な領域にわたる実験は、Re-TASKの有効性を示す。
論文 参考訳(メタデータ) (2024-08-13T13:58:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。