論文の概要: GitBugs: Bug Reports for Duplicate Detection, Retrieval Augmented Generation, Triage, and More
- arxiv url: http://arxiv.org/abs/2504.09651v1
- Date: Sun, 13 Apr 2025 16:55:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-04-23 03:29:07.532267
- Title: GitBugs: Bug Reports for Duplicate Detection, Retrieval Augmented Generation, Triage, and More
- Title(参考訳): GitBugs: 重複検出、検索拡張生成、トリアージなどのためのバグレポート
- Authors: Avinash Patil,
- Abstract要約: 私たちはGitBugsを紹介します。9つのアクティブにメンテナンスされているオープンソースプロジェクトから15万以上のバグレポートを収集し、簡潔で最新のデータセットです。
GitBugsはGithub、Bugzilla、Jiraのイシュートラッカからのデータを集約し、分類タスクの標準化されたカテゴリフィールドを提供する。
予報分析ノートや、重複率や解像度時間などの詳細なプロジェクトレベルの統計情報が含まれている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Bug reports provide critical insights into software quality, yet existing datasets often suffer from limited scope, outdated content, or insufficient metadata for machine learning. To address these limitations, we present GitBugs-a comprehen- sive and up-to-date dataset comprising over 150,000 bug reports from nine actively maintained open-source projects, including Firefox, Cassandra, and VS Code. GitBugs aggregates data from Github, Bugzilla and Jira issue trackers, offering standardized categorical fields for classification tasks and predefined train/test splits for duplicate bug detection. In addition, it includes ex- ploratory analysis notebooks and detailed project-level statistics, such as duplicate rates and resolution times. GitBugs supports various software engineering research tasks, including duplicate detection, retrieval augmented generation, resolution prediction, automated triaging, and temporal analysis. The openly licensed dataset provides a valuable cross-project resource for bench- marking and advancing automated bug report analysis. Access the data and code at https://github.com/av9ash/gitbugs/.
- Abstract(参考訳): バグレポートは、ソフトウェアの品質に関する重要な洞察を提供するが、既存のデータセットは、スコープの制限、時代遅れなコンテンツ、あるいは機械学習に不十分なメタデータに悩まされることが多い。
これらの制限に対処するために、Firefox、Cassandra、VS Codeを含む9つのアクティブにメンテナンスされているオープンソースプロジェクトからの15万以上のバグレポートからなるGitBugs-a comprehen-sive and up-to-dateデータセットを紹介します。
GitBugsはGithub、Bugzilla、Jiraのイシュートラッカからのデータを集約し、分類タスクの標準化されたカテゴリフィールドと重複バグ検出のための事前定義されたトレイン/テスト分割を提供する。
さらに、前学説分析ノートや、重複率や解像度時間などの詳細なプロジェクトレベルの統計情報も含んでいる。
GitBugsは、重複検出、検索拡張生成、解像度予測、自動トリアージ、時間解析など、さまざまなソフトウェアエンジニアリング研究タスクをサポートする。
オープンソースライセンスのデータセットは、ベンチマーキングと自動バグレポート分析の進歩のための貴重なクロスプロジェクトリソースを提供する。
https://github.com/av9ash/gitbugs/でデータとコードにアクセスする。
関連論文リスト
- BugsRepo: A Comprehensive Curated Dataset of Bug Reports, Comments and Contributors Information from Bugzilla [0.0]
font Familypplselectfont BugsRepoはMozillaプロジェクトから派生した多面的データセットである。
バグレポートのメタデータとコメントのデータセットと,修正あるいはクローズされたバグレポート119,585の詳細な記録が含まれている。
第2に、フォントファミリpplselectfont BugsRepoは、Mozillaコミュニティメンバー19,351名からなるコントリビュータ情報データセットを備えている。
第3に、データセットは10,351の構造化バグレポートサブセットを提供する。
論文 参考訳(メタデータ) (2025-04-26T05:24:21Z) - Automated Duplicate Bug Report Detection in Large Open Bug Repositories [3.481985817302898]
大規模なオープンソースプロジェクトのユーザやコントリビュータは,問題追跡システムにソフトウェア欠陥や拡張要求(バグレポートとして知られる)を報告している。
オープンバグレポジトリにおける重複バグレポートを自動的に検出する機械学習手法に基づく新しい手法を提案する。
論文 参考訳(メタデータ) (2025-04-21T01:55:54Z) - CodeRAG-Bench: Can Retrieval Augment Code Generation? [78.37076502395699]
検索拡張生成を用いたコード生成の系統的,大規模な解析を行う。
まず、コード生成タスクの3つのカテゴリを含む総合的な評価ベンチマークであるCodeRAG-Benchをキュレートする。
CodeRAG-Bench上のトップパフォーマンスモデルについて、1つまたは複数のソースから検索したコンテキストを提供することにより検討する。
論文 参考訳(メタデータ) (2024-06-20T16:59:52Z) - Mining Bug Repositories for Multi-Fault Programs [0.25782420501870285]
個々のエントリで複数のバグを識別するデータセットの拡張について説明する。
テストケースの移植とフォールトロケーションの翻訳を,バグの公開と発見に使用しています。
したがって、実際のソフトウェアプロジェクトの中で、真のマルチフォールトバージョンのデータセットを提供します。
論文 参考訳(メタデータ) (2024-03-28T06:35:55Z) - Fact Checking Beyond Training Set [64.88575826304024]
本稿では,レトリバーリーダが,あるドメインのラベル付きデータに基づいてトレーニングし,別のドメインで使用する場合,性能劣化に悩まされることを示す。
本稿では,レトリバー成分を分散シフトに対して頑健にするための逆アルゴリズムを提案する。
次に、これらのデータセットから8つの事実チェックシナリオを構築し、モデルと強力なベースラインモデルのセットを比較します。
論文 参考訳(メタデータ) (2024-03-27T15:15:14Z) - PreciseBugCollector: Extensible, Executable and Precise Bug-fix
Collection [8.79879909193717]
正確な多言語バグ収集手法であるPreciseBugCollectorを紹介する。
外部バグリポジトリでリポジトリをマップしてバグタイプ情報をトレースするバグトラッカと、プロジェクト固有のバグを生成するバグインジェクタの2つの新しいコンポーネントに基づいている。
現在、PreciseBugCollectorは2968のオープンソースプロジェクトから抽出された1057818のバグを含んでいる。
論文 参考訳(メタデータ) (2023-09-12T13:47:44Z) - Auto-labelling of Bug Report using Natural Language Processing [0.0]
ルールとクエリベースのソリューションは、明確なランキングのない、潜在的な類似バグレポートの長いリストを推奨します。
本論文では,NLP手法の組み合わせによる解を提案する。
カスタムデータトランスフォーマー、ディープニューラルネットワーク、および非汎用機械学習メソッドを使用して、既存の同一バグレポートを検索する。
論文 参考訳(メタデータ) (2022-12-13T02:32:42Z) - Using Developer Discussions to Guide Fixing Bugs in Software [51.00904399653609]
我々は,タスク実行前に利用可能であり,また自然発生しているバグレポートの議論を,開発者による追加情報の必要性を回避して利用することを提案する。
このような議論から派生したさまざまな自然言語コンテキストがバグ修正に役立ち、オラクルのバグ修正コミットに対応するコミットメッセージの使用よりもパフォーマンスの向上につながることを実証する。
論文 参考訳(メタデータ) (2022-11-11T16:37:33Z) - DapStep: Deep Assignee Prediction for Stack Trace Error rePresentation [61.99379022383108]
本稿では,バグトリアージ問題を解決するための新しいディープラーニングモデルを提案する。
モデルは、注目された双方向のリカレントニューラルネットワークと畳み込みニューラルネットワークに基づいている。
ランキングの質を向上させるために,バージョン管理システムのアノテーションから追加情報を利用することを提案する。
論文 参考訳(メタデータ) (2022-01-14T00:16:57Z) - S3M: Siamese Stack (Trace) Similarity Measure [55.58269472099399]
本稿では、深層学習に基づくスタックトレースの類似性を計算する最初のアプローチであるS3Mを紹介します。
BiLSTMエンコーダと、類似性を計算するための完全接続型分類器をベースとしている。
私たちの実験は、オープンソースデータとプライベートなJetBrainsデータセットの両方において、最先端のアプローチの優位性を示しています。
論文 参考訳(メタデータ) (2021-03-18T21:10:41Z) - D2A: A Dataset Built for AI-Based Vulnerability Detection Methods Using
Differential Analysis [55.15995704119158]
静的解析ツールによって報告されたラベル問題に対する差分解析に基づくアプローチであるD2Aを提案する。
D2Aを使用して大きなラベル付きデータセットを生成し、脆弱性識別のためのモデルをトレーニングします。
論文 参考訳(メタデータ) (2021-02-16T07:46:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。