論文の概要: Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?
- arxiv url: http://arxiv.org/abs/2608.04828v1
- Date: Wed, 05 Aug 2026 13:29:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.940127
- Title: Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?
- Title(参考訳): スキル・ユース:LLMはエージェント・ハーネスのスキルを実際に使えるか?
- Authors: Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao,
- Abstract要約: プログレッシブな開示下でのスキル使用を評価するベンチマークであるSkill-Useを紹介する。
トリガーは、エージェントが関連するスキルを起動するかどうかを計測し、コンプライアンスは、それが所定の手順に従うかを忠実に測定し、バウンダリは、それが禁止された操作を避けるかどうかを計測する。
スキル・ユース(SU)スコアは、スキルが起動された後にのみ3つとクレジットの実行を組み合わせる。
- 参考スコア(独自算出の注目度): 38.776828282073865
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) agents increasingly rely on skills, structured documents that specify when to act, which procedure to follow, and which tools are allowed. Existing evaluations mostly judge the quality of a skill or its contribution to task success, leaving unexamined whether an agent can recognize a relevant skill and apply it on its own. We introduce Skill-Use, a benchmark that evaluates skill use under progressive disclosure, where an agent sees only a skill's name and short description and must retrieve the full procedure before following it. Skill-Use separates three facets of skill use. Trigger measures whether the agent invokes the relevant skill, Compliance measures how faithfully it follows the prescribed procedure, and Boundary measures whether it avoids forbidden operations. A Skill-Use (SU) score combines the three and credits execution only after the skill is triggered. Skill-Use pairs 79 real skills with 177 executable tasks across nine domains, each grounded in real files, run in an isolated Docker sandbox, and scored by a trajectory-based rubric. Evaluating eight LLMs under two agent harnesses, we find that reliable skill use remains out of reach, as the strongest configuration reaches an SU of only 0.613. Triggering and procedural compliance fail as independent bottlenecks, and both scores and model rankings shift with the harness, so skill use behaves as a capability conditioned on the harness rather than a fixed property of the model.
- Abstract(参考訳): 大きな言語モデル(LLM)エージェントは、スキルや、いつ行動するか、どの手順に従うか、どのツールが許されるかを指定する構造化ドキュメントにますます依存している。
既存の評価は、主にスキルの品質やタスクの成功への貢献を判断し、エージェントが関連するスキルを認識してそれを適用することができるかどうかを判断する。
Skill-Useはプログレッシブな開示下でのスキル使用を評価するベンチマークで、エージェントはスキルの名前と短い説明しか見ず、それに従う前に完全な手順を検索しなければならない。
Skill-Useは、スキル使用の3つの側面を分離する。
トリガーは、エージェントが関連するスキルを起動するかどうかを計測し、コンプライアンスは、それが所定の手順に従うかを忠実に測定し、バウンダリは、それが禁止された操作を避けるかどうかを計測する。
スキル・ユース(SU)スコアは、スキルが起動された後にのみ3つとクレジットの実行を組み合わせる。
Skill-Useは79のスキルと9つのドメインで177の実行可能なタスクをペアリングする。
2つのエージェントハーネスの下で8つのLSMを評価すると、最強構成がわずか0.613のSUに達するため、信頼性の高いスキル使用は到達できないことがわかった。
トリガリングと手続き的コンプライアンスは独立したボトルネックとして失敗し、スコアとモデルランキングの両方がハーネスによってシフトする。
関連論文リスト
- Generative Skill Composition for LLM Agents [58.47191648555256]
LLMエージェントは複雑なタスクを解決するためのスキルの恩恵を受ける。
スキルライブラリが成長するにつれて、適切なスキル構成を選択することが中心的なボトルネックとして現れている。
本稿では,タスク条件付きスキルシーケンス予測として構造化されたスキルコンポジションをインスタンス化するSkillComposerを提案する。
論文 参考訳(メタデータ) (2026-06-30T17:53:09Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - Skill Coverage: A Test Adequacy Metric for Agent Skills [17.60316723069748]
エージェントスキルは、タスクと実行コンテキストをまたいだ大きな言語モデルエージェントをガイドする再利用可能な手続き的知識をエンコードする。
テスト対象のスキルアーティファクトを対象として扱う,テストの妥当性指標であるスキルカバレッジを導入します。
SkillsBenchにスキルカバレッジを適用すると、既存のベンチマークの実行はスキル行動の制約の39.90から43.98%しかカバーしていないことが明らかになった。
論文 参考訳(メタデータ) (2026-06-09T10:16:05Z) - SkillRevise: Improving LLM-Authored Agent Skills via Trace-Conditioned Skill Revision [41.562357872885826]
SkillReviseはエージェントスキルを反復的に洗練するために設計された実行基盤フレームワークである。
SkillReviseは、実行エビデンスからスキル欠陥を診断し、一般的なメモリから関連する修復原則を検索し、実行順に編集を適用する。
単発ベースラインを大幅に上回り、SkillsBenchにおけるベースエージェントの成功率は36.05%から61.63%に向上した。
論文 参考訳(メタデータ) (2026-05-31T10:19:13Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - SkillGen: Verified Inference-Time Agent Skill Synthesis [60.927977774369516]
SkillGenは、ベースエージェントによって生成されたトラジェクトリから単一の監査可能なスキルを合成するフレームワークである。
再利用可能な成功パターン、繰り返し発生する障害モード、そして近くの成功に現れるが失敗に欠ける行動を特定する。
SkillGenの重要な特徴は、エージェントスキルを、全体的なパフォーマンスに対するスキルのネット効果を実証的に検証するための介入としてモデル化することです。
論文 参考訳(メタデータ) (2026-05-09T19:24:11Z) - SkillMaster: Toward Autonomous Skill Mastery in LLM Agents [27.651128308229378]
SkillMasterは、エージェントに新しいスキルを作り、既存のスキルを洗練させ、タスク解決中に蓄積したスキルを選択する訓練フレームワークである。
第一に、私たちは、軌道インフォームドスキルレビューを通じてエージェントを訓練し、完成したエピソードの証拠に基づいて、提案、更新、保持するためのエージェントを指導する。
第2に、各候補スキル編集は、関連するプローブタスクに対する対実的ユーティリティによって評価され、スキル編集決定を訓練するための直接学習信号を提供する。
第3に、DualAdv-GRPOを導入し、タスク解決行動とスキル編集決定の利点を個別に推定し、タスク解決における共同トレーニングを安定化する。
論文 参考訳(メタデータ) (2026-05-09T05:03:00Z) - SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks [61.89812116484928]
エージェントスキルは、LLMエージェントを推論時に増強する手続き的知識の構造化パッケージである。
SkillsBenchは、11のドメインにわたる86のタスクのベンチマークであり、キュレートされたスキルと決定論的検証との組み合わせを示す。
キュレートされたスキルは平均パスレートを16.2ポイント(pp)上昇させるが、効果は領域によって大きく異なる。
自己生成スキルは平均的に何の利益も与えず、モデルが消費から得られる手続き的な知識を確実に説明できないことを示している。
論文 参考訳(メタデータ) (2026-02-13T07:06:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。