論文の概要: SkillCorpus: Consolidating and Evaluating the Open Skill Ecosystem for Real-World LLM Agents
- arxiv url: http://arxiv.org/abs/2607.15557v3
- Date: Tue, 21 Jul 2026 02:11:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.258115
- Title: SkillCorpus: Consolidating and Evaluating the Open Skill Ecosystem for Real-World LLM Agents
- Title(参考訳): SkillCorpus: 実世界のLLMエージェントのためのオープンスキルエコシステムの構築と評価
- Abstract要約: SkillCorpusは、オープンスキルのエコシステムを集約し、キュレートし、マッチングし、評価するフレームワークです。
マルチステージパイプラインを通した821,000人のクロールスキルを、16クラスの分類と3つの品質面(実用性、堅牢性、安全性)によって構成された96,401のスキルにフィルタリングする。
我々は,3つのベンチマーク(SkillsBench,GDPVal,QwenClawBench),2つのハーネス,2つのオープンバックボーン(フロンティアロバストネスチェック)でエンドツーエンドを評価する。
- 参考スコア(独自算出の注目度): 13.205114117769583
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent skills, SKILL files that package reusable procedural knowledge for an LLM agent, are a popular mechanism for extending agent capabilities. Public repositories now host them in large and growing numbers, yet these artifacts are fragmented, redundant, and uneven in quality, and their value in practice is unclear. A core question remains open, namely how to consolidate this open-source SKILL ecosystem into a single usable corpus, and what bounds its benefit on real-world agent tasks. We present SkillCorpus, a framework that aggregates, curates, matches, and evaluates the open skill ecosystem at scale. It filters ~821,000 crawled skills through a multi-stage pipeline into 96,401 skills organised by a 16-class taxonomy and three quality facets (utility, robustness, safety), and pairs them with a fine-tuned retrieval-and-selection stack that matches task-relevant skills. We evaluate end-to-end across three benchmarks (SkillsBench, GDPVal, QwenClawBench), two harnesses, and two open backbones with a frontier robustness check. Integrating SkillCorpus yields consistent gains across all three benchmarks, largest on SkillsBench (+7.5 pp). An operational analysis traces the gains to a coverage boundary and a harness boundary. SkillCorpus is, to our knowledge, the first end-to-end account of when a curated, retrieval-served community corpus improves real agent tasks, and where it does not. The dataset, models, and code will be released upon acceptance.
- Abstract(参考訳): LLMエージェントに再利用可能な手続き的知識をパッケージ化するエージェントスキル、SKILLファイルは、エージェント能力を拡張するための一般的なメカニズムである。
公開リポジトリは大規模かつ増加する数でホストされているが、これらのアーティファクトは断片化されており、冗長であり、品質が不均一である。
すなわち、このオープンソースのSKILLエコシステムを単一の使用可能なコーパスに統合する方法と、現実世界のエージェントタスクにどのようなメリットがあるのか、という点だ。
SkillCorpusは、オープンスキルのエコシステムを集約し、キュレートし、マッチングし、評価するフレームワークです。
マルチステージパイプラインを通じて約821,000のクロールスキルを、16クラスの分類と3つの品質面(実用性、堅牢性、安全性)によって構成された96,401のスキルにフィルタリングし、タスク関連スキルにマッチする微調整された検索と選択のスタックと組み合わせる。
我々は,3つのベンチマーク(SkillsBench,GDPVal,QwenClawBench),2つのハーネス,2つのオープンバックボーン(フロンティアロバストネスチェック)でエンドツーエンドを評価する。
SkillCorpusの統合は、SkillsBench (+7.5 pp)で最大の3つのベンチマークで一貫した利得を得る。
運用分析は、ゲインをカバレッジ境界とハーネス境界にトレースする。
SkillCorpusは、私たちの知る限り、キュレートされた検索可能なコミュニティコーパスが実際のエージェントタスクを改善し、どこでそうしていないかを、エンド・ツー・エンドで最初に説明します。
データセット、モデル、コードは受け入れ次第リリースされる。
関連論文リスト
- Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills [86.15447717549154]
私たちは、スキルを創造し、研究中にそれらを使用する、スキル駆動型研究エージェントであるDisCoを紹介します。
私たちはこの欠落したレイヤの運用知識を、メソッドの知識を機能させるのと分離するノウハウと呼んでいる。
論文 参考訳(メタデータ) (2026-09-02T15:49:41Z) - Generative Skill Composition for LLM Agents [58.47191648555256]
LLMエージェントは複雑なタスクを解決するためのスキルの恩恵を受ける。
スキルライブラリが成長するにつれて、適切なスキル構成を選択することが中心的なボトルネックとして現れている。
本稿では,タスク条件付きスキルシーケンス予測として構造化されたスキルコンポジションをインスタンス化するSkillComposerを提案する。
論文 参考訳(メタデータ) (2026-06-30T17:53:09Z) - SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment [10.850946672552277]
スキル中心アセスメントのためのエンドツーエンドフレームワークであるSkillAuditを紹介します。
実用性、効率/コスト、安全性にまたがる包括的多次元評価レポートを生成する。
トップランクの現実世界のスキルパッケージをスキャンした結果、スキルの7%以上が危険な状態にあることがわかった。
論文 参考訳(メタデータ) (2026-06-21T17:40:05Z) - VISUALSKILL: Multimodal Skills for Computer-Use Agents [63.79539541125141]
ターゲットアプリケーション毎に調整された階層型マルチモーダルスキルであるVISUALSKILLを提案する。
著者によるドキュメンテーションとライブアプリケーションUI探索を組み合わせた2段階のパイプラインで、それぞれのスキルを構築します。
2つのCUAベンチマークでは、Claude Code CLIエージェントがClaude Opus 4.6によって支援され、VISUALSKILLで平均スコア0.456に達した。
論文 参考訳(メタデータ) (2026-06-16T19:57:07Z) - SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization [99.18305770138677]
エージェントスキルは、エージェントの推論とアクションをガイドする再利用可能な戦略である。
現在の技術構築手法は、問題を一発抽出として扱う。
本稿では,スキル構築を3つの学習可能な操作に分解するフレームワークであるSkillComposerを紹介する。
論文 参考訳(メタデータ) (2026-06-04T12:16:08Z) - AcademiClaw: When Students Set Challenges for AI Agents [69.70303995121154]
AcademiClaw(アカデミクロー)は、大学生の実際の学術的切断から直接引き出された80の複雑な長い水平タスクのベンチマークである。
最高のモデルでさえ、55%のパスレートしか達成できないことを示す。
AcademiClawとそのオープンソースデータとコードが、OpenClawコミュニティにとって有用なリソースになることを願っています。
論文 参考訳(メタデータ) (2026-05-04T14:40:42Z) - SkillX: Automatically Constructing Skill Knowledge Bases for Agents [27.56549031749266]
SkillXは、プラグアンドプレイのスキル知識ベースを構築するための、完全に自動化されたフレームワークである。
3つのシナジスティックなイノベーションに基づいて構築された、完全に自動化されたパイプラインを通じて運用される。
実験の結果、SkillKBは、より弱いベースエージェントにプラグインされた場合、タスクの成功と実行効率を一貫して改善している。
論文 参考訳(メタデータ) (2026-04-06T16:09:33Z) - SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization [61.37478254738943]
推論時のスキル向上は基本的に制限されている。
SKILL0は,スキル内部化のためのコンテキスト内強化学習フレームワークである。
SKILL0は標準のRLベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-04-02T17:03:05Z) - SkillRouter: Skill Routing for LLM Agents at Scale [18.540967600258607]
ユーザタスクが与えられたら、システムは、下流の計画や実行の前に、関連するスキルを特定する必要がある。
既存のエージェントスタックはプログレッシブな開示に依存しており、完全な実装ボディを隠蔽しながら、スキル名と記述のみを公開する。
1.2Bのコンパクトなフルテキスト検索/参照パイプラインであるSkillを提示する。
論文 参考訳(メタデータ) (2026-03-23T18:23:59Z) - SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering? [27.583012125198568]
SWE-Skills-Benchは、現実のソフトウェア工学におけるエージェントスキルの限界効用を分離する最初の要件駆動ベンチマークである。
49の公開SWEスキルと、特定のコミットにピン留めされた本物のGitHubリポジトリと、明確な受け入れ基準を持つ要件ドキュメントをペアリングする。
以上の結果から,スキルインジェクションのメリットは,迅速な採用よりもはるかに限定的であることが示唆された。
論文 参考訳(メタデータ) (2026-03-16T15:16:31Z) - Organizing, Orchestrating, and Benchmarking Agent Skills at Ecosystem Scale [28.43462779191672]
AgentSkillOSは、スキル選択、オーケストレーション、エコシステムレベルの管理のための原則化されたフレームワークである。
AgentSkillOSには2つのステージがある。 (i) スキルを機能ツリーに整理する管理スキル。
(ii) DAGベースのパイプラインを通じて複数のスキルを検索し、オーケストレーションし、実行するタスクの解決。
論文 参考訳(メタデータ) (2026-03-02T18:46:47Z) - SkillNet: Create, Evaluate, and Connect AI Skills [159.47504178122156]
SkillNetは、大規模にAIスキルを作成し、評価し、組織化するように設計されたオープンインフラストラクチャである。
私たちのインフラストラクチャは、20万を超えるスキルのリポジトリ、インタラクティブなプラットフォーム、多目的Pythonツールキットを統合しています。
論文 参考訳(メタデータ) (2026-02-26T14:24:02Z) - SoK: Agentic Skills -- Beyond Tool Use in LLM Agents [6.356997609995175]
エージェントシステムは、より確実にロングホライゾンを実行するために、再利用可能な手続き能力、すなわちエージェントスキルに依存している。
本論文は,全ライフサイクルのスキルレイヤ(発見,実践,蒸留,貯蔵,構成,評価,更新)をマッピングする。
我々は、スキルベースのエージェントのセキュリティとガバナンスの影響を分析し、サプライチェーンのリスク、スキルペイロードによるインジェクションの促進、信頼度の高い実行をカバーします。
論文 参考訳(メタデータ) (2026-02-24T13:11:38Z) - Cross-modal Retrieval Models for Stripped Binary Analysis [62.89251403093734]
BinSeekは、取り除かれたバイナリコード分析のための最初の2段階のクロスモーダル検索フレームワークである。
BinSeekEmbeddingは、バイナリコードのセマンティックな関連性を学ぶために、大規模なデータセットでトレーニングされている。
BinSeek-Rerankerは、コンテキスト拡張による記述に対する候補コードの関連性を慎重に判断することを学ぶ。
論文 参考訳(メタデータ) (2025-12-11T07:58:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。