論文の概要: Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)
- arxiv url: http://arxiv.org/abs/2607.06505v1
- Date: Tue, 07 Jul 2026 17:06:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.596821
- Title: Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)
- Title(参考訳): 北米産業分類システム(NAICS)を用いたGitHubリポジトリの産業分類
- Abstract要約: GitHubは数億のパブリックリポジトリをホストしているが、リポジトリから標準化された業界セクターへのネイティブマッピングは公開していない。
NAICS-GHは、米国、欧州連合、オーストラリアをカバーするソースプールから作成した6,588のGitHubリポジトリの公開コーパスである。
ラベルは、BAAI/bge-large-en埋め込み、FAISS検索、GPT-4.1スコアを組み合わせた検索・検証パイプラインによって作成される。
- 参考スコア(独自算出の注目度): 46.877501276559165
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: GitHub hosts hundreds of millions of public repositories, but the platform exposes no native mapping from repositories to standardized industry sectors. This gap limits empirical work on the geography of innovation, the industrial composition of open-source production, and the diffusion of new technologies across economic sectors. We present NAICS-GH, a publicly released corpus of 6,588 GitHub repositories drawn from source pools covering the United States, the European Union, and Australia, each labeled with a 2-digit sector from the North American Industry Classification System (NAICS 2022). Labels are produced by a retrieve-and-verify pipeline that combines BAAI/bge-large-en embeddings, FAISS retrieval, and GPT-4.1 rubric scoring. The pipeline narrows about 1.37 million source repositories to 31,178 candidate repository-sector pairs and retains 6,588 high-confidence labels with score at least 8. Re-running the retrieval pipeline end to end reproduces the candidate set to within 0.03 percent. On a 2,421-repository human-validated random sample, the released labels attain 96.98 percent precision, with Wilson 95 percent confidence interval [96.23, 97.59]. We benchmark six pretrained encoders on the released corpus; RoBERTa-large reaches 86.45 percent F1 and 86.35 percent accuracy on a held-out 20 percent test set. The dataset, Croissant metadata, pipeline code, prompts, and fine-tuned checkpoint are released under CC-BY-4.0 and MIT licenses.
- Abstract(参考訳): GitHubは数億のパブリックリポジトリをホストしているが、リポジトリから標準化された業界セクターへのネイティブマッピングは公開していない。
このギャップは、イノベーションの地理学、オープンソース生産の産業構成、そして経済分野にまたがる新しい技術の拡散に関する経験的な研究を制限する。
NAICS-GHは、6,588のGitHubリポジトリの公開コーパスで、米国、欧州連合、オーストラリアをカバーするソースプールから作成され、それぞれが北米産業分類システム(NAICS 2022)から2桁のセクターにラベル付けされている。
ラベルは、BAAI/bge-large-en埋め込み、FAISS検索、GPT-4.1ルーリックスコアを組み合わせたレトリート・アンド・バリデーション・パイプラインで作成されている。
このパイプラインは、約137万のソースリポジトリを31,178のレポジトリ-セクタペアに絞り込み、少なくともスコア8の6,588の高信頼ラベルを保持する。
検索パイプラインを終端に再実行すると、候補を0.03パーセント以内に再現する。
2,421-repository human-validated random sampleでは、放出されたラベルは96.98パーセントの精度で、Wilson 95%の信頼区間 (96.23, 97.59] を達成している。
RoBERTa-largeは86.45パーセントのF1と86.35パーセントの精度で、20%のテストセットが保留されている。
データセット、Croissantメタデータ、パイプラインコード、プロンプト、微調整されたチェックポイントは、CC-BY-4.0とMITライセンス下でリリースされている。
関連論文リスト
- MediaWiki Code2Code Search: Neural Retrieval for the Semantic Discovery of Open-Source Software Entities [0.5279475826661643]
本稿では,意味的コード-コード発見のためのニューラル検索システムであるCode2 InformationCode Searchを紹介する。
2500以上の大規模リポジトリにまたがる構造的(関数,型,テンプレート)のコードにより,本システムは計算意図に基づく検索を可能にする。
我々はスプリットビルドアーキテクチャを採用し、CPUのみのサービス層から集中的なオフラインインデックスを分離しています。
論文 参考訳(メタデータ) (2026-07-29T11:07:07Z) - A Sovereign, Open-Source Foundation Model for German and English [50.08096276509294]
Soofi S 30B-A3B(ソフィー S 30B-A3B)は、ドイツのマムバ・トランスフォーマー・ファウンデーション・モデルである。
そのハイブリッド設計はトークン毎に30Bパラメータの3Bのみを起動し、コンテキストが大きくなるにつれて推論キャッシュをほぼ一定に保ちます。
論文 参考訳(メタデータ) (2026-07-10T13:51:41Z) - GitReq: A Gold Standard Dataset for Software Quality Requirements [0.28675177318965045]
GitHubのイシュートラッカには、数百万の開発者による品質上の懸念が含まれている。
公開されているGitHubデータセットは、これらをきめ細かいソフトウェア品質カテゴリに分類していない。
55,588人の生のGitHub候補から抽出された6,302人のエキスパート検証済みの要件で構成されるGitReq GitHub Requirement Issueを構築してリリースする。
論文 参考訳(メタデータ) (2026-06-20T00:05:32Z) - ProCUA-SFT Technical Report [80.97543110323542]
コンピュータ使用エージェント(CUA)の訓練には、全デスクトップ環境で収集された大規模で多様な軌跡データが必要である。
93Kの合成軌道から抽出した3.1MステップレベルのSFTサンプルのデータセットであるProCUA-SFTについて述べる。
ProCUA-SFTの微調整UI-TARS 7Bは、OSWorldで45.0%、ベースモデルよりも18.7ポイント改善されている。
論文 参考訳(メタデータ) (2026-06-15T22:04:11Z) - Building Digital Societies as Ecosystems: How Recognition and Repeat Relationships Sustain Cross-Community Work in Open Source [0.525685083367962]
2001年10月から2022年5月までに,464のサイバーセキュリティプロジェクトと11,372人のコントリビュータからなる2部構成のコントリビュータリポジトリグラフを再構築して,オープンソースソフトウェア(OSS)エコシステムにおけるクロスバウンダリーコラボレーションを測定する。
論文 参考訳(メタデータ) (2026-05-24T13:04:24Z) - Naver-News-KO: A Korean News Summarization Dataset for Open-Source Fine-Tuning of Summarization Models [0.0]
このデータセットは、2022年7月の10日間の窓越しにNaver Newsから収集された27,400対(文書、要約)の韓国ニュース要約データセットである。
データセットは2023年1月からHugging Face Hubで公開されており、2026年5月現在、月間約33,000ダウンロードを受け付けている。
目標は、新しいベンチマークを提案するのではなく、すでにこのデータセットを使用しているダウンストリーム作業に対して、決定可能なリファレンスを提供することだ。
論文 参考訳(メタデータ) (2026-05-12T12:25:49Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - Delta-Based Neural Architecture Search: LLM Fine-Tuning via Code Diffs [48.83701310501069]
大規模言語モデル(LLM)は、ニューラルアーキテクチャ生成の強力な可能性を示している。
既存のアプローチは、ゼロから完全なモデル実装を生成します。
我々はデルタ符号生成法を提案し、細調整されたLLMはコンパクトな統一差分を生成する。
論文 参考訳(メタデータ) (2026-05-06T13:32:05Z) - Reducing Maintenance Burden in Behaviour-Driven Development: A Paraphrase-Robust Duplicate-Step Detector with a 1.1M-Step Open Benchmark [1.9537983097153042]
振る舞い駆動開発スイートは、ドキュメント化されたメンテナンスコストとステップ重複の重複を蓄積します。
私たちはこれまでで最大の組織横断的なBDDステップコーパスをリリースします。
論文 参考訳(メタデータ) (2026-04-22T11:44:05Z) - Governance Architecture for Autonomous Agent Systems: Threats, Framework, and Engineering Practice [0.0]
実行サンドボックス(L1)、意図検証(L2)、ゼロトラスト間認証(L3)、不変監査ロギング(L4)からなる4層フレームワークであるレイヤガバナンスアーキテクチャ(LGA)を提案する。
LGAを評価するために、1,081のツールコールサンプル(インジェクション、RAG中毒、悪意のあるスキルプラグインなど)のベンチマーク(中国語のオリジナル、機械翻訳による英語)を構築し、それをオープンソースの代表的なエージェントフレームワークであるOpenClawに適用する。
論文 参考訳(メタデータ) (2026-03-07T13:05:14Z) - RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository [52.98970048197381]
RepoGenesisは、リポジトリレベルのエンドツーエンドWebマイクロサービス生成のための、最初の多言語ベンチマークである。
18のドメインと11のフレームワークに106のリポジトリ(60のPython、46のJava)があり、1,258のAPIエンドポイントと2,335のテストケースが検証されている。
その結果、高いAC(最大73.91%)とDSR(最大100%)にもかかわらず、最高のパフォーマンスのシステムはPythonで23.67%のPass@1、Javaで21.45%しか達成していないことが明らかになった。
論文 参考訳(メタデータ) (2026-01-20T13:19:20Z) - Benchmarking Large Language Models for Geolocating Colonial Virginia Land Grants [0.0]
バージニアの17世紀から18世紀の土地特許は、主に物語のメッツ・アンド・バウンドの記述として残っている。
本研究では、これらの散文を地理的に正確な緯度・経度座標に変換する際に、現在世代の大言語モデル(LLM)を体系的に評価する。
論文 参考訳(メタデータ) (2025-07-27T21:49:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。