論文の概要: SpecMine: A Large-Scale Corpus of Spec-Driven Development Artifacts
- arxiv url: http://arxiv.org/abs/2608.25202v2
- Date: Thu, 27 Aug 2026 18:48:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 15:11:36.077358
- Title: SpecMine: A Large-Scale Corpus of Spec-Driven Development Artifacts
- Title(参考訳): SpecMine: 大規模な仕様駆動開発アーティファクト
- Abstract要約: SpecMineは、パブリックGitHubリポジトリでSpec-Driven Development (SDD)をキャプチャする。
これにより、AIエージェントの時代にソフトウェアがどのように特定されているか、コミュニティで初めて研究することができる。
- 参考スコア(独自算出の注目度): 9.568855797591082
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Spec-Driven Development (SDD) is a fast-emerging practice in which a structured natural-language specification, written by a developer, or (more often) drafted by an AI tool and then curated by the developer, drives an AI coding agent's implementation. A wave of tooling (GitHub Spec Kit [3], OpenSpec [4], AWS Kiro [5], and dozens of others) has appeared since 2025, yet the artifacts these tools produce have never been studied at scale. We present SpecMine, a corpus that captures SDD in public GitHub repositories through two censuses: a broad census of spec.md/specs.md files covering most tools (470,795 files across 73,030 repositories, attributed to 17 named tools), and a Kiro census of its distinct requirements/design/tasks layout (98,574 files across 12,910 repositories). Each spec is enriched with full repository metadata, complete commit history, and parsed document structure. How a spec becomes code is itself an open question, so for 11 tools we sweep every pull request that touches a spec in their repositories with at least ten stars, capturing 5,992 such PRs across 581 repositories with their changesets. That makes the simplest workflow, spec and implementation changing together in one PR, directly observable, and a census-wide index of 2,421,323 typed references (1.28M to code files, 863k to sibling documents, 152k to PRs, 62k refs, 43k branches, 22k issues) gives a second, independent link from spec to code. SpecMine lets the community study, for the first time, how software is specified in the age of AI agents.
- Abstract(参考訳): 仕様駆動開発(SDD)は、開発者によって書かれた構造化された自然言語仕様、あるいは(より頻繁に)AIツールによってドラフトされ、それから開発者がキュレートされた、AIコーディングエージェントの実装を駆動する、急速に進化するプラクティスである。
ツーリングの波(GitHub Spec Kit [3]、OpenSpec [4]、AWS Kiro [5]など)は2025年以来現れているが、これらのツールが生み出すアーティファクトは大規模に研究されていない。
SpecMineは、GitHubの公開リポジトリでSDDをキャプチャするコーパスで、ほとんどのツールをカバーするSpec.md/specs.mdファイル(73,030リポジトリで470,795ファイル、名前付きツールで17)と、独自の要求/設計/タスクレイアウト(12,910リポジトリで98,574ファイル)である。
各仕様には、完全なリポジトリメタデータ、完全なコミット履歴、解析されたドキュメント構造が備わっている。
仕様がコードになる方法自体がオープンな問題であるので、11のツールに対して、少なくとも10個の星を持つリポジトリの仕様に触れるすべてのプルリクエストを精査し、581のリポジトリにわたる5,992個のPRを変更セットで取得します。
これにより、最も単純なワークフロー、仕様、実装を1つのPRで一緒に変更し、直接観測可能で、国勢調査全体で2,421,323の型付き参照(コードファイルの1.28M、ドキュメントの863k、PRの152k、PRの62krefs、43kブランチ、22kイシュー)で、仕様からコードへの2番目の独立したリンクを提供する。
SpecMineは、AIエージェントの時代にソフトウェアがどのように特定されているか、コミュニティで初めて研究する。
関連論文リスト
- CommitDistill: A Lightweight Knowledge-Centric Memory Layer for Software Repositories [0.5872014229110213]
ソフトウェアは、コミットメッセージ、プルリクエストの議論、スレッド発行に大量の構造化されていない知識を蓄積します。
エージェントのタイプメモリアーキテクチャ(MemGPT、生成エージェント、YangらのPlugMemモジュール)に関する最近の研究は、エージェントメモリは生の対話テキストではなく、蒸留された型付き知識であるべきだと主張している。
私たちは、決定論的、依存性なし、ローカルのみ、埋め込みなしという制約のある体制の下で、ソフトウェアリポジトリ自身のgit履歴にそのスタンスを適用します。
論文 参考訳(メタデータ) (2026-05-18T12:14:28Z) - A Dataset of Agentic AI Coding Tool Configurations [11.087963504113937]
データセットには5つのツール(Claude Code、GitHub Copilot、OpenAI Codex、Cursor、Gemini)にわたる4,738のリポジトリと8つの設定メカニズムが含まれている。
我々は15,591個の構成アーティファクト、これらの構成アーティファクトに関連する18,167個の構成ファイルの全内容、そして148,519個のAI共著コミットを収集した。
このデータは、コンテキストエンジニアリング、AIツールの採用パターン、人間とAIのコラボレーションに関する研究をサポートする。
論文 参考訳(メタデータ) (2026-05-08T19:58:27Z) - Agent READMEs: An Empirical Study of Context Files for Agentic Coding [8.019313057979522]
我々は1,925のリポジトリから2,303のエージェントコンテキストファイルを調べ、それらの構造、保守、およびコンテンツを特徴付ける。
これらのファイルは静的なドキュメントではなく、コンフィグレーションコードのように進化し、頻繁で小さな追加によって維持される複雑で読みにくいアーティファクトであることが分かりました。
これらの結果は、開発者がコンテキストファイルを使用してエージェントを機能させる一方で、エージェント記述コードの安全性やパフォーマンスを保証するためのガードレールはほとんど提供せず、ツールやプラクティスの改善の必要性を強調していることを示している。
論文 参考訳(メタデータ) (2025-11-17T02:18:55Z) - Trace: Securing Smart Contract Repository Against Access Control Vulnerability [58.02691083789239]
GitHubはソースコード、ドキュメント、設定ファイルを含む多数のスマートコントラクトリポジトリをホストしている。
サードパーティの開発者は、カスタム開発中にこれらのリポジトリからコードを参照、再利用、フォークすることが多い。
スマートコントラクトの脆弱性を検出する既存のツールは、複雑なリポジトリを扱う能力に制限されている。
論文 参考訳(メタデータ) (2025-10-22T05:18:28Z) - Your Build Scripts Stink: The State of Code Smells in Build Scripts [7.543600033457145]
セキュアでないURLはMavenビルドスクリプトで最も一般的なコードの臭いでした。
HardcodedPaths/URLはGradleとCMakeのスクリプトでよく見られる。
ワイルドカードの使用は、Makefilesで最も頻繁に見られる臭いとして現れた。
論文 参考訳(メタデータ) (2025-06-22T09:01:42Z) - Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning [70.04746094652653]
機械学習論文を機能コードリポジトリに変換するフレームワークであるPaperCoderを紹介した。
PaperCoderは3つの段階で動作する。計画、図によるシステムアーキテクチャの設計、ファイル依存の特定、構成ファイルの生成である。
次に、モデルベースおよび人的評価の両方に基づいて、機械学習論文からコード実装を生成するPaperCoderを評価する。
論文 参考訳(メタデータ) (2025-04-24T01:57:01Z) - CLOVER: A Test Case Generation Benchmark with Coverage, Long-Context, and Verification [71.34070740261072]
本稿では,テストケースの生成と完成におけるモデルの能力を評価するためのベンチマークCLOVERを提案する。
ベンチマークはタスク間でのコード実行のためにコンテナ化されています。
論文 参考訳(メタデータ) (2025-02-12T21:42:56Z) - An Empirical Study of Dotfiles Repositories Containing User-Specific Configuration Files [1.7556600627464058]
数十万がGitHubにリポジトリを公開している。
GitHubで公開ホストされているdotfilesリポジトリを収集、分析しました。
トップ500のGitHubユーザのうち25.8%が、何らかの形で公開アクセス可能なdotfilesリポジトリを維持していることがわかった。
論文 参考訳(メタデータ) (2025-01-30T18:32:46Z) - DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories [83.5195424237358]
既存のベンチマークは、現実世界のコードリポジトリと不整合である。
我々はDevEvalという新しいベンチマークを提案し、これは3つの進歩がある。
DevEvalは117のリポジトリから1,874のサンプルを持ち、10の人気のあるドメインをカバーする。
論文 参考訳(メタデータ) (2024-05-30T09:03:42Z) - VSCode: General Visual Salient and Camouflaged Object Detection with 2D Prompt Learning [104.74705190239119]
4つのSODタスクと3つのCODタスクに共同で対処する新しい2Dプロンプト学習モデルであるVSCodeを紹介する。
基礎モデルとしてVSTを利用し、エンコーダ・デコーダアーキテクチャ内で2Dプロンプトを導入し、ドメインとタスク固有の知識を学習する。
VSCodeは、6つのタスクで26のデータセットで最先端のメソッドのパフォーマンスを向上する。
論文 参考訳(メタデータ) (2023-11-25T12:34:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。