論文の概要: Integrating Crash Report Mining and LLMs for Bug Localization and Repair: An Industrial Report
- arxiv url: http://arxiv.org/abs/2609.04483v1
- Date: Thu, 03 Sep 2026 21:04:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.820377
- Title: Integrating Crash Report Mining and LLMs for Bug Localization and Repair: An Industrial Report
- Title(参考訳): バグの局所化と修復のためのクラッシュレポートマイニングとLCMの統合:産業報告
- Abstract要約: 大規模産業ソフトウェアシステムにおけるクラッシュ報告バグの分析には、相当なメンテナンス作業が必要である。
最高のパフォーマンス設定では最大71%のローカライズが可能で、完全なデータセットのクラッシュバグの52%を正しく修正する。
- 参考スコア(独自算出の注目度): 7.575395371401797
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Analyzing crash-report bugs in large-scale industrial software systems requires substantial maintenance effort, particularly in production environments where developers must handle large volumes of crash reports and source code artifacts to localize and fix their root causes. While recent studies have shown that Large Language Models (LLMs) can assist with maintenance tasks, little is known about their effectiveness in supporting developers in analyzing crash-report bugs and repairing bugs associated with groups of crash reports in industrial settings. To address this gap, we investigate whether integrating crash report mining techniques---specifically stack trace clustering and suspicious file and method ranking---with LLMs can support crash localization and repair in production environments. We conduct a retrospective evaluation of five LLMs under four prompt configurations. After that, we chose the best model to run on 38 crash bugs collected from two large Java enterprise systems. We further analyze the structural characteristics and explanatory patterns of LLM-generated responses and assess localization and repair effectiveness through manual validation. Our results show that the best-performing configuration localizes up to 71% and correctly repairs 52% of crash bugs on the full dataset. These findings provide empirical evidence that combining crash report mining with LLM-based repair can effectively support debugging activities in industrial maintenance workflows.
- Abstract(参考訳): 大規模産業ソフトウェアシステムにおけるクラッシュ報告バグの分析には、特に開発者が根本原因のローカライズと修正のために大量のクラッシュレポートとソースコードアーティファクトを処理しなければならない運用環境において、大幅なメンテナンス作業が必要となる。
最近の研究では、LLM(Large Language Models)がメンテナンスタスクを補助できることが示されているが、クラッシュ報告バグの分析や、産業環境でのクラッシュ報告のグループに関連するバグの修正において、開発者を支援する効果についてはほとんど分かっていない。
このギャップに対処するために,特にスタックトレースクラスタリングや不審なファイルやメソッドのランク付けなど,クラッシュレポートマイニング技術を統合することで,LCMが本運用環境におけるクラッシュローカライズや修復を支援することができるかどうかを検討する。
我々は,4つの素早い構成の下で5つのLLMの振り返り評価を行う。
その後、2つの大きなJavaエンタープライズシステムから収集された38のクラッシュバグを実行するのに最適なモデルを選択しました。
さらに,LLM生成応答の構造的特徴と説明的パターンを分析し,手動検証による局所化と修復の有効性を評価する。
結果から,最も優れた構成では最大71%のローカライズが可能で,全データセットのクラッシュバグの52%を正しく修復できることがわかった。
これらの結果は, 産業用メンテナンスワークフローにおいて, クラッシュレポートマイニングとLLMをベースとした修復を併用すれば, デバッグ活動が効果的に支援できるという実証的証拠を提供する。
関連論文リスト
- How Do LLMs Read Bug Reports? An Empirical Study of Attention in LLMs for Automated Program Repair [7.1093539424910155]
本稿では,Large Language Model (LLM) を用いたプログラム修復における注意パターンの実証的研究を行った。
実際のPythonとJavaの319のバグを分析し、バグレポートのセクション間でモデルの注意がどのように分散されているかを調査します。
修復は複数の診断部位に分散した注意が特徴である。
論文 参考訳(メタデータ) (2026-07-28T15:38:12Z) - Detect--Repair--Verify for LLM-Generated Code: A Multi-Language, Multi-Granularity Empirical Study [10.18490328199727]
大規模な言語モデルは実行可能なソフトウェアアーチファクトを生成することができるが、そのセキュリティはエンドツーエンドの評価が難しいままである。
本研究では、脆弱性を検出し、修復し、セキュリティおよび機能テストで再チェックするDRVワークフローを通じて、その問題を調査する。
現在の証拠の4つのギャップに対処する: LLMの生成したアーティファクトの試験的なベンチマークの欠如、パイプラインレベルの有効性に関する限られた証拠、修正ガイダンスとしての検出レポートの不確実な信頼性、検証中の不確実な修復信頼性。
論文 参考訳(メタデータ) (2026-03-24T18:18:30Z) - JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees [64.57426735981902]
複雑なシステムのメンテナンスにおいて、障害木は問題を特定し、ターゲットとするソリューションを提供するために使用される。
画像として格納されたフォールトツリーを,大規模言語モデルで直接処理可能にするために,新しいフォールトツリーのテキスト表現を提案する。
複雑な環境におけるロバストな相互作用を強調するマルチターン対話システムのためのベンチマークを構築した。
論文 参考訳(メタデータ) (2026-03-24T09:13:43Z) - Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All [57.23434868678603]
Live-kBenchは、新たに発見されたカーネルバグのエージェントをスクラップし、評価するセルフ進化ベンチマークの評価フレームワークである。
kEnvは、カーネルのコンパイル、実行、フィードバックのためのエージェントに依存しないクラッシュ解決環境である。
kEnvを用いて3つの最先端エージェントをベンチマークし、最初の試行で74%のクラッシュを解決したことを示す。
論文 参考訳(メタデータ) (2026-02-02T19:06:15Z) - InspectCoder: Dynamic Analysis-Enabled Self Repair through interactive LLM-Debugger Collaboration [71.18377595277018]
大きな言語モデル(LLM)は、診断が難しい複雑なロジックエラーを伴うバグの多いコードを生成することが多い。
対話型デバッガ制御による動的解析を LLM に委ねる初のエージェントプログラム修復システムである InspectCoder を提案する。
論文 参考訳(メタデータ) (2025-10-21T06:26:29Z) - RelRepair: Enhancing Automated Program Repair by Retrieving Relevant Code [11.74568238259256]
RelRepairは関連するプロジェクト固有のコードを取得し、プログラムの自動修復を強化する。
広く研究されている2つのデータセット、Defects4J V1.2 と ManySStuBs4J について RelRepair の評価を行った。
論文 参考訳(メタデータ) (2025-09-20T14:07:28Z) - Crash Report Enhancement with Large Language Models: An Empirical Study [21.842377922082104]
大規模言語モデルでは, 故障箇所, 根本原因の説明, 修復提案を追加することで, 事故報告を向上できるかどうかを検討する。
実世界の492件の事故報告のデータセットでは、LSMが実施した報告はTop-1問題局所化の精度を10.6%から40.2-43.1%に改善した。
手動による評価と LLM-as-a-judge の評価は,Agenic-LLM がより強力な根本原因の説明と,より実用的な修復指導を提供することを示している。
論文 参考訳(メタデータ) (2025-09-16T21:02:57Z) - Exploring Automatic Cryptographic API Misuse Detection in the Era of LLMs [60.32717556756674]
本稿では,暗号誤用の検出において,大規模言語モデルを評価するための体系的評価フレームワークを提案する。
11,940個のLCM生成レポートを詳細に分析したところ、LSMに固有の不安定性は、報告の半数以上が偽陽性になる可能性があることがわかった。
最適化されたアプローチは、従来の手法を超え、確立されたベンチマークでこれまで知られていなかった誤用を明らかにすることで、90%近い顕著な検出率を達成する。
論文 参考訳(メタデータ) (2024-07-23T15:31:26Z) - Learning Traffic Crashes as Language: Datasets, Benchmarks, and What-if Causal Analyses [76.59021017301127]
我々は,CrashEventという大規模トラフィッククラッシュ言語データセットを提案し,実世界のクラッシュレポート19,340を要約した。
さらに,クラッシュイベントの特徴学習を,新たなテキスト推論問題として定式化し,さらに様々な大規模言語モデル(LLM)を微調整して,詳細な事故結果を予測する。
実験の結果, LLMに基づくアプローチは事故の重大度を予測できるだけでなく, 事故の種類を分類し, 損害を予測できることがわかった。
論文 参考訳(メタデータ) (2024-06-16T03:10:16Z) - DebugBench: Evaluating Debugging Capability of Large Language Models [80.73121177868357]
DebugBench - LLM(Large Language Models)のベンチマーク。
C++、Java、Pythonの4つの主要なバグカテゴリと18のマイナータイプをカバーする。
ゼロショットシナリオで2つの商用および4つのオープンソースモデルを評価する。
論文 参考訳(メタデータ) (2024-01-09T15:46:38Z) - Exploring Large Language Models in Resolving Environment-Related Crash Bugs: Localizing and Repairing [36.4673637256627]
大規模言語モデル(LLM)は、ソフトウェア工学のタスクにおいて有望であることを示している。
実環境におけるクラッシュバグの解決におけるLLMの能力を評価するための,初の総合的研究を行った。
この結果から,コードクラッシュを解決する上ではローカライゼーションが最大の課題であることが明らかとなった。
論文 参考訳(メタデータ) (2023-12-16T13:41:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。