論文の概要: SkillCorpus: Consolidating and Evaluating the Open Skill Ecosystem for Real-World LLM Agents
- arxiv url: http://arxiv.org/abs/2607.15557v4
- Date: Thu, 23 Jul 2026 10:15:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 16:18:54.637026
- Title: SkillCorpus: Consolidating and Evaluating the Open Skill Ecosystem for Real-World LLM Agents
- Title(参考訳): SkillCorpus: 実世界のLLMエージェントのためのオープンスキルエコシステムの構築と評価
- Authors: Yanze Wang, Pengfei Yao, Tianyi Sun, Chuanrui Hu, Yan Xiao, Yunyun Han, Yifan Chen, Jun Sun, Yafeng Deng,
- Abstract要約: SkillCorpusは、オープンスキルのエコシステムを集約し、キュレートし、マッチングし、評価するフレームワークです。
マルチステージパイプラインを通した821,000人のクロールスキルを、16クラスの分類と3つの品質面(実用性、堅牢性、安全性)によって構成された96,401のスキルにフィルタリングする。
我々は,3つのベンチマーク(SkillsBench,GDPVal,QwenClawBench),2つのハーネス,2つのオープンバックボーン(フロンティアロバストネスチェック)でエンドツーエンドを評価する。
- 参考スコア(独自算出の注目度): 16.77727447235193
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent skills, SKILL files that package reusable procedural knowledge for an LLM agent, are a popular mechanism for extending agent capabilities. Public repositories now host them in large and growing numbers, yet these artifacts are fragmented, redundant, and uneven in quality, and their value in practice is unclear. A core question remains open, namely how to consolidate this open-source SKILL ecosystem into a single usable corpus, and what bounds its benefit on real-world agent tasks. We present SkillCorpus, a framework that aggregates, curates, matches, and evaluates the open skill ecosystem at scale. It filters ~821,000 crawled skills through a multi-stage pipeline into 96,401 skills organised by a 16-class taxonomy and three quality facets (utility, robustness, safety), and pairs them with a fine-tuned retrieval-and-selection stack that matches task-relevant skills. We evaluate end-to-end across three benchmarks (SkillsBench, GDPVal, QwenClawBench), two harnesses, and two open backbones with a frontier robustness check. Integrating SkillCorpus yields consistent gains across all three benchmarks, largest on SkillsBench (+7.5 pp). An operational analysis traces the gains to a coverage boundary and a harness boundary. SkillCorpus is, to our knowledge, the first end-to-end account of when a curated, retrieval-served community corpus improves real agent tasks, and where it does not. The dataset, models, and code will be released upon acceptance.
- Abstract(参考訳): LLMエージェントに再利用可能な手続き的知識をパッケージ化するエージェントスキル、SKILLファイルは、エージェント能力を拡張するための一般的なメカニズムである。
公開リポジトリは大規模かつ増加する数でホストされているが、これらのアーティファクトは断片化されており、冗長であり、品質が不均一である。
すなわち、このオープンソースのSKILLエコシステムを単一の使用可能なコーパスに統合する方法と、現実世界のエージェントタスクにどのようなメリットがあるのか、という点だ。
SkillCorpusは、オープンスキルのエコシステムを集約し、キュレートし、マッチングし、評価するフレームワークです。
マルチステージパイプラインを通じて約821,000のクロールスキルを、16クラスの分類と3つの品質面(実用性、堅牢性、安全性)によって構成された96,401のスキルにフィルタリングし、タスク関連スキルにマッチする微調整された検索と選択のスタックと組み合わせる。
我々は,3つのベンチマーク(SkillsBench,GDPVal,QwenClawBench),2つのハーネス,2つのオープンバックボーン(フロンティアロバストネスチェック)でエンドツーエンドを評価する。
SkillCorpusの統合は、SkillsBench (+7.5 pp)で最大の3つのベンチマークで一貫した利得を得る。
運用分析は、ゲインをカバレッジ境界とハーネス境界にトレースする。
SkillCorpusは、私たちの知る限り、キュレートされた検索可能なコミュニティコーパスが実際のエージェントタスクを改善し、どこでそうしていないかを、エンド・ツー・エンドで最初に説明します。
データセット、モデル、コードは受け入れ次第リリースされる。
関連論文リスト
- Generative Skill Composition for LLM Agents [58.47191648555256]
LLMエージェントは複雑なタスクを解決するためのスキルの恩恵を受ける。
スキルライブラリが成長するにつれて、適切なスキル構成を選択することが中心的なボトルネックとして現れている。
本稿では,タスク条件付きスキルシーケンス予測として構造化されたスキルコンポジションをインスタンス化するSkillComposerを提案する。
論文 参考訳(メタデータ) (2026-06-30T17:53:09Z) - VISUALSKILL: Multimodal Skills for Computer-Use Agents [63.79539541125141]
ターゲットアプリケーション毎に調整された階層型マルチモーダルスキルであるVISUALSKILLを提案する。
著者によるドキュメンテーションとライブアプリケーションUI探索を組み合わせた2段階のパイプラインで、それぞれのスキルを構築します。
2つのCUAベンチマークでは、Claude Code CLIエージェントがClaude Opus 4.6によって支援され、VISUALSKILLで平均スコア0.456に達した。
論文 参考訳(メタデータ) (2026-06-16T19:57:07Z) - AcademiClaw: When Students Set Challenges for AI Agents [69.70303995121154]
AcademiClaw(アカデミクロー)は、大学生の実際の学術的切断から直接引き出された80の複雑な長い水平タスクのベンチマークである。
最高のモデルでさえ、55%のパスレートしか達成できないことを示す。
AcademiClawとそのオープンソースデータとコードが、OpenClawコミュニティにとって有用なリソースになることを願っています。
論文 参考訳(メタデータ) (2026-05-04T14:40:42Z) - SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization [61.37478254738943]
推論時のスキル向上は基本的に制限されている。
SKILL0は,スキル内部化のためのコンテキスト内強化学習フレームワークである。
SKILL0は標準のRLベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-04-02T17:03:05Z) - SkillRouter: Skill Routing for LLM Agents at Scale [18.540967600258607]
ユーザタスクが与えられたら、システムは、下流の計画や実行の前に、関連するスキルを特定する必要がある。
既存のエージェントスタックはプログレッシブな開示に依存しており、完全な実装ボディを隠蔽しながら、スキル名と記述のみを公開する。
1.2Bのコンパクトなフルテキスト検索/参照パイプラインであるSkillを提示する。
論文 参考訳(メタデータ) (2026-03-23T18:23:59Z) - SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering? [27.583012125198568]
SWE-Skills-Benchは、現実のソフトウェア工学におけるエージェントスキルの限界効用を分離する最初の要件駆動ベンチマークである。
49の公開SWEスキルと、特定のコミットにピン留めされた本物のGitHubリポジトリと、明確な受け入れ基準を持つ要件ドキュメントをペアリングする。
以上の結果から,スキルインジェクションのメリットは,迅速な採用よりもはるかに限定的であることが示唆された。
論文 参考訳(メタデータ) (2026-03-16T15:16:31Z) - Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scale [28.43462779191672]
AgentSkillOSは、スキル選択、オーケストレーション、エコシステムレベルの管理のための原則化されたフレームワークである。
AgentSkillOSには2つのステージがある。 (i) スキルを機能ツリーに整理する管理スキル。
(ii) DAGベースのパイプラインを通じて複数のスキルを検索し、オーケストレーションし、実行するタスクの解決。
論文 参考訳(メタデータ) (2026-03-02T18:46:47Z) - SkillNet: Create, Evaluate, and Connect AI Skills [159.47504178122156]
SkillNetは、大規模にAIスキルを作成し、評価し、組織化するように設計されたオープンインフラストラクチャである。
私たちのインフラストラクチャは、20万を超えるスキルのリポジトリ、インタラクティブなプラットフォーム、多目的Pythonツールキットを統合しています。
論文 参考訳(メタデータ) (2026-02-26T14:24:02Z) - SoK: Agentic Skills -- Beyond Tool Use in LLM Agents [6.356997609995175]
エージェントシステムは、より確実にロングホライゾンを実行するために、再利用可能な手続き能力、すなわちエージェントスキルに依存している。
本論文は,全ライフサイクルのスキルレイヤ(発見,実践,蒸留,貯蔵,構成,評価,更新)をマッピングする。
我々は、スキルベースのエージェントのセキュリティとガバナンスの影響を分析し、サプライチェーンのリスク、スキルペイロードによるインジェクションの促進、信頼度の高い実行をカバーします。
論文 参考訳(メタデータ) (2026-02-24T13:11:38Z) - Cross-modal Retrieval Models for Stripped Binary Analysis [62.89251403093734]
BinSeekは、取り除かれたバイナリコード分析のための最初の2段階のクロスモーダル検索フレームワークである。
BinSeekEmbeddingは、バイナリコードのセマンティックな関連性を学ぶために、大規模なデータセットでトレーニングされている。
BinSeek-Rerankerは、コンテキスト拡張による記述に対する候補コードの関連性を慎重に判断することを学ぶ。
論文 参考訳(メタデータ) (2025-12-11T07:58:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。