論文の概要: GitSkills: A Dataset of Agent Skills on GitHub
- arxiv url: http://arxiv.org/abs/2608.10906v1
- Date: Tue, 11 Aug 2026 13:28:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:46.050887
- Title: GitSkills: A Dataset of Agent Skills on GitHub
- Title(参考訳): GitSkills: GitHub上のエージェントスキルのデータセット
- Abstract要約: アントロピックはこのフォーマットをオープン仕様として2025年10月に導入した。
GitSkillsは、2026年7月に282,200のパブリックリポジトリから収集された3,797,117のSKILL.mdファイルのデータセットである。
- 参考スコア(独自算出の注目度): 2.4569987564636726
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: An agent skill is a folder containing a SKILL.md file with instructions for a language-model agent, optionally accompanied by scripts and reference files. The agent loads the skill when it judges that a task matches the skill description. Anthropic introduced the format in October 2025 as an open specification. Nine months later, we find that skill files in the millions sit in public GitHub repositories. Skills are unlike the artifacts the SE research community usually mines: they are written mainly in natural language, a model selects them probabilistically at run time, and no compiler or type checker verifies the selection. They also have no central registry or package manager, so they spread by copying folders between repositories. How developers write, reuse, and maintain skills is therefore an empirical question, and no existing dataset records this population. We present GitSkills, a dataset of 3,797,117 SKILL.md files collected from 282,200 public repositories in July 2026. The dataset retains every file occurrence with its repository, path, and content hash. It groups identical files into 1,877,981 distinct contents and enriches one representative per group with the full text, parsed front matter, folder contents, repository metadata, and, for a subset, the commit history of the file. A single self- contained SQLite file supports research on the adoption, reuse, structure, authorship, maintenance, and security of agent skills.
- Abstract(参考訳): エージェントスキルは、言語モデルエージェントの命令を含むSKILL.mdファイルを含むフォルダで、オプションでスクリプトと参照ファイルが付属する。
エージェントは、タスクがスキル記述と一致すると判断すると、スキルをロードする。
アントロピックはこのフォーマットをオープン仕様として2025年10月に導入した。
9ヶ月後、数百万のスキルファイルがGitHubの公開リポジトリにあることがわかりました。
主に自然言語で書かれ、モデルは実行時に確率的にそれらを選択し、コンパイラや型チェッカーが選択を検証する。
また、中央レジストリやパッケージマネージャも持っていないため、リポジトリ間でフォルダをコピーすることで拡散する。
開発者がどのようにスキルを書き、再利用し、維持するかは実証的な問題であり、既存のデータセットがこの人口を記録していない。
私たちは、2026年7月に282,200のパブリックリポジトリから収集された3,797,117のSKILL.mdファイルのデータセットであるGitSkillsを紹介します。
データセットは、リポジトリ、パス、コンテンツハッシュで、すべてのファイルの発生を保持します。
同一のファイルを1,877,981の異なる内容に分類し、全文、パースされたフロントマター、フォルダの内容、リポジトリメタデータ、サブセットのコミット履歴をグループごとに1つに集約する。
自己完結したSQLiteファイルは、エージェントスキルの採用、再利用、構造、オーサシップ、メンテナンス、セキュリティに関する研究をサポートする。
関連論文リスト
- Skill Issue: Lessons from Optimizing Repository SKILLs for Coding Agents [0.09558392439655013]
コーディングエージェントは、SKILLsからリポジトリの知識を読み取るようになっている。
最近の研究は、ベンチマークに対して文書を最適化することで、これらのファイルを自動で合成する。
より難しいタスク --- リポジトリのプルリクエストをマージし、単一の凍結されたベースコミットでリターンし、同じエージェントがそれなしでよいかどうかで候補ドキュメントをスコアします。
論文 参考訳(メタデータ) (2026-09-11T11:41:29Z) - SpecMine: A Large-Scale Corpus of Spec-Driven Development Artifacts [7.933620345044633]
SpecMineは、パブリックGitHubリポジトリでSpec-Driven Development (SDD)をキャプチャする。
これにより、AIエージェントの時代にソフトウェアがどのように特定されているか、コミュニティで初めて研究することができる。
論文 参考訳(メタデータ) (2026-08-25T22:43:30Z) - Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability [49.415740364852105]
デプロイされたエージェントは、エージェント自身がジェネリックファイルツールを通じて読み込み、書き込み、再編成するマークダウンファイルのディレクトリツリーとして、長期記憶をますます保持する。
以前のシステムではメモリ表現を設計し、それらを検索し、デフォルトの2つの動作仮定を未検証のまま残した。
LLMエージェントのためのチャンクベースメモリの最初の体系的探索を行う。
論文 参考訳(メタデータ) (2026-07-29T08:59:43Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - VISUALSKILL: Multimodal Skills for Computer-Use Agents [63.79539541125141]
ターゲットアプリケーション毎に調整された階層型マルチモーダルスキルであるVISUALSKILLを提案する。
著者によるドキュメンテーションとライブアプリケーションUI探索を組み合わせた2段階のパイプラインで、それぞれのスキルを構築します。
2つのCUAベンチマークでは、Claude Code CLIエージェントがClaude Opus 4.6によって支援され、VISUALSKILLで平均スコア0.456に達した。
論文 参考訳(メタデータ) (2026-06-16T19:57:07Z) - COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation [58.84646485020439]
人為的なAIスキルを生成するための自動トレース・ツー・スキル蒸留システムを提案する。
COLLEAGUE.SKILLは、実践、メンタルモデル、意思決定のための能力トラックと、コミュニケーションスタイル、インタラクションルール、修正履歴のための有界な行動トラックの2つのトラックを持つバージョン付きのスキルパッケージを生成する。
論文 参考訳(メタデータ) (2026-05-29T12:59:08Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents? [3.2610504259514754]
実世界のタスクにコンテキストファイルが有効かどうかを検討する。
コンテクストファイルはリポジトリのコンテキストを提供しないのに比べてタスクの成功率を低下させる傾向がある。
我々は、コンテキストファイルからの不要な要求はタスクを難しくし、人間によるコンテキストファイルは最小限の要求だけを記述するべきであると結論付けている。
論文 参考訳(メタデータ) (2026-02-12T14:15:22Z) - FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents [53.03492387564392]
我々はFS-Researcherを紹介した。FS-Researcherはファイルシステムベースのフレームワークで、永続的なワークスペースを通じてコンテキストウィンドウを超えて深い研究をスケールする。
Context Builderエージェントはインターネットを閲覧し、構造化されたノートを書き、ソースを階層的な知識ベースにアーカイブする。
その後、レポートライターエージェントが最終レポートセクションをセクションごとに構成し、知識ベースを事実のソースとして扱う。
論文 参考訳(メタデータ) (2026-02-02T03:00:19Z) - Agent READMEs: An Empirical Study of Context Files for Agentic Coding [8.019313057979522]
我々は1,925のリポジトリから2,303のエージェントコンテキストファイルを調べ、それらの構造、保守、およびコンテンツを特徴付ける。
これらのファイルは静的なドキュメントではなく、コンフィグレーションコードのように進化し、頻繁で小さな追加によって維持される複雑で読みにくいアーティファクトであることが分かりました。
これらの結果は、開発者がコンテキストファイルを使用してエージェントを機能させる一方で、エージェント記述コードの安全性やパフォーマンスを保証するためのガードレールはほとんど提供せず、ツールやプラクティスの改善の必要性を強調していることを示している。
論文 参考訳(メタデータ) (2025-11-17T02:18:55Z) - Repository-Aware File Path Retrieval via Fine-Tuned LLMs [0.11726720776908518]
大規模言語モデル(LLM)は自然言語を理解できるが、リポジトリの詳細は明らかにされていない。
本稿では,QLoRAとUnslothを最適化した強力なLLMを微調整するファイルパス検索手法を提案する。
Flask、Click、Jinja、FastAPI、PyTorchなどのPythonプロジェクトを微調整し、高い検索精度を得る。
論文 参考訳(メタデータ) (2025-10-09T22:49:10Z) - Repository-level Code Search with Neural Retrieval Methods [25.222964965449286]
我々は、リポジトリレベルのコード検索のタスクを、ユーザの質問やバグに対処するのに最も関係のある、コードリポジトリの現在の状態からファイルの集合を検索するものとして定義する。
提案手法は,コミットメッセージに対するBM25ベースの検索と,CodeBERTを用いて関連するファイルを識別するニューラルリランクを組み合わせたものである。
7つの人気のあるオープンソースリポジトリから生成された新しいデータセットの実験では、MAP、MRR、P@1がBM25ベースラインに対して最大80%改善されている。
論文 参考訳(メタデータ) (2025-02-10T21:59:01Z) - An Empirical Study of Dotfiles Repositories Containing User-Specific Configuration Files [1.7556600627464058]
数十万がGitHubにリポジトリを公開している。
GitHubで公開ホストされているdotfilesリポジトリを収集、分析しました。
トップ500のGitHubユーザのうち25.8%が、何らかの形で公開アクセス可能なdotfilesリポジトリを維持していることがわかった。
論文 参考訳(メタデータ) (2025-01-30T18:32:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。