論文の概要: Rethinking Automated Program Repair: The Impact of Bug Complexity, Fault Localization, and LLM Cost-efficiency
- arxiv url: http://arxiv.org/abs/2608.14065v2
- Date: Mon, 17 Aug 2026 01:36:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 13:30:43.596917
- Title: Rethinking Automated Program Repair: The Impact of Bug Complexity, Fault Localization, and LLM Cost-efficiency
- Title(参考訳): 自動プログラム修復の再考:バグ複雑度, 故障局所化, LLMコスト効率の影響
- Authors: Junchi Liu, Ali Bigdeli, Roya Daneshi, Atu Ambala, Sudipto Ghosh, Fabio Santos,
- Abstract要約: 本研究は,バグの複雑化,障害の局所化,推論設定,コストによって,修復性能がどのように形成されているかに焦点を当てる。
構造的に複雑なバグや不正確な故障の局所化は、修復をより困難にするが、LLMベースのAPR技術は競争力のある修復効率を実現する。
- 参考スコア(独自算出の注目度): 1.9703625025720701
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Background: Software bugs remain a critical challenge in development, necessitating effective Automated Program Repair (APR) techniques. While Large Language Model (LLM)-based APR systems have shown promise, prior studies primarily focus on overall repair effectiveness. The effects of bug complexity, fault localization, reasoning settings, and repair cost-effectiveness remain insufficiently explored. Aims: This study presents a comprehensive empirical analysis of LLM-based APR, focusing on how repair performance is shaped by bug complexity, fault localization, reasoning settings, and costs. Method: We evaluate two APR techniques (ChatRepair and CodeCorrector) using three LLMs (DeepSeek, GPT, and Llama), and examine their performance across diverse levels of bug complexity and localization strategies through a multi-dimensional empirical framework and statistical analysis. Results: Although structurally complex bugs and imprecise fault localization make repair more challenging, LLM-based APR techniques still achieve competitive repair effectiveness. Imprecise fault localization can substantially enlarge the performance gap between APR techniques. Furthermore, higher-cost LLMs and stronger reasoning settings do not consistently yield better cost-efficiency, revealing a nontrivial trade-off between repair effectiveness and computational cost. Conclusions: Over 50% of moderately complex bugs can be repaired by low-cost LLM-based APR techniques. The repair effectiveness gap between APR techniques becomes larger as fault localization becomes less precise. GPT-5 repairs 7 and 39 more complex bugs than DeepSeek-V4-pro and DeepSeek-V3.2, respectively; whereas the total repair cost of DeepSeek-V3.2 shows the best cost-efficiency performance.
- Abstract(参考訳): 背景: ソフトウェアバグは開発において重要な課題であり、効果的な自動プログラム修復(APR)技術を必要とします。
LLM(Large Language Model)ベースのAPRシステムは将来性を示しているが、以前の研究は主に全体の修復効率に焦点を当てていた。
バグの複雑さ、障害のローカライゼーション、推論設定、費用対効果の修復効果はいまだ不十分である。
Aims: 本研究は, LLMベースのAPRの総合的な実証分析を行い, バグの複雑性, 障害の局所化, 推論設定, コストによって, 修復性能がどのように形成されているかに着目した。
方法: 3つのLLM(DeepSeek, GPT, Llama)を用いて2つのAPR手法(ChatRepair, CodeCorrector)を評価し,多次元経験的フレームワークと統計解析を用いて,多段階のバグ複雑性と局所化戦略の多様性を検討した。
結果: 構造的に複雑なバグや不正確な故障の局所化は修復をより困難にしますが, LLMベースのAPR技術は依然として競争力のある修復効率を実現しています。
不正確なフォールトローカライゼーションは、APR技術のパフォーマンスギャップを大幅に拡大することができる。
さらに、高コストのLCMとより強力な推論設定は、常により良いコスト効率をもたらすわけではなく、修理効率と計算コストの非自明なトレードオフが明らかになる。
結論: 適度に複雑なバグの50%以上は、低コストのLLMベースのAPR技術で修復できる。
故障局所化の精度が低下するにつれて, APR 技術間の補修効率ギャップが大きくなる。
GPT-5はDeepSeek-V4-proとDeepSeek-V3.2よりも7と39の複雑なバグを修復する。
関連論文リスト
- Optimized Deferral for Imbalanced Settings [52.48138985215643]
学習アルゴリズムは、複雑な入力や不確実な入力を専門の専門家にルーティングすることで、大幅に改善することができる。
遅延学習として知られるこのアプローチは、自然言語生成、診断、コンピュータビジョンといった領域において不可欠である。
本稿では,専門家の不均衡な環境下での2段階学習の遅延に関する総合的研究について述べる。
論文 参考訳(メタデータ) (2026-04-30T11:15:37Z) - Self-Correction Distillation for Structured Data Question Answering [50.98882432829651]
小型言語モデル(LLM)は、構造化クエリの生成時にエラーを起こしやすい。
小型LCMの構造データQA能力を向上させるための自己補正蒸留(SCD)法を提案する。
論文 参考訳(メタデータ) (2025-11-11T09:01:51Z) - Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs [57.10533368622962]
大規模言語モデル(LLM)の自己補正は、推論性能を高める重要な要素として現れる。
本研究では,自己補正戦略の有効性を評価するためのベンチマークであるCorrectBenchを紹介する。
その結果,1) 自己補正手法は, 複雑な推論タスクにおいて, 精度を向上させることが可能であり, 2) 異なる自己補正戦略の混合により, 効率は低下するものの, さらなる改善がもたらされることが明らかとなった。
論文 参考訳(メタデータ) (2025-10-17T02:40:19Z) - BloomAPR: A Bloom's Taxonomy-based Framework for Assessing the Capabilities of LLM-Powered APR Solutions [19.682278660857584]
ブルームの分類を基盤とした新しい動的評価フレームワークであるBloomAPRを紹介する。
我々のフレームワークは、段階的に複雑な推論レベルを越えて、LLMによるAPRソリューションの認知能力を評価するための構造化されたアプローチを提供する。
以上の結果から,これらのソリューションは基本的推論能力を示す一方で,合成されたバグによって性能が向上することが示唆された。
論文 参考訳(メタデータ) (2025-09-29T20:16:11Z) - Specification-Guided Repair of Arithmetic Errors in Dafny Programs using LLMs [79.74676890436174]
本稿では,障害の局所化と修復のためのオラクルとして形式仕様を用いたDafny用のAPRツールを提案する。
プログラム内の各ステートメントの状態を決定するために、Hoareロジックの使用を含む一連のステップを通じて、障害をローカライズします。
また, GPT-4o miniが74.18%と高い修理成功率を示した。
論文 参考訳(メタデータ) (2025-07-04T15:36:12Z) - Hybrid Automated Program Repair by Combining Large Language Models and Program Analysis [12.7034916462208]
自動プログラム修復(APR)は、人間の開発者のバグ修正プロセスを合理化する可能性から、大きな注目を集めている。
本稿ではGIANTREPAIRと呼ばれる革新的なAPR手法を紹介する。
この知見に基づいて、GIANTREPAIRはまず、LLM生成したパッチからパッチスケルトンを構築して、パッチ空間を閉じ込め、その後、特定のプログラムに適した高品質なパッチを生成する。
論文 参考訳(メタデータ) (2024-06-03T05:05:12Z) - How Far Can We Go with Practical Function-Level Program Repair? [11.71750828464698]
本稿では,少数ショット学習機構と補修関連情報が機能レベルAPRに及ぼす影響について検討する。
補修関連情報のパワーを活用するために,デュアルLLM フレームワークを採用した LLM ベースの関数レベル APR 手法,すなわち SRepair を提案する。
論文 参考訳(メタデータ) (2024-04-19T12:14:09Z) - The Right Prompts for the Job: Repair Code-Review Defects with Large
Language Model [15.885824575879763]
自動プログラム修復(APR)技術は、コードレビュー(CR)プロセス中にプログラム欠陥を発見して修復する手作業を減らす可能性がある。
しかし、既存のAPRアプローチにまつわる限られた精度とかなりの時間的コストは、産業的な実践において採用を妨げている。
近年のLLM(Large Language Models)の進歩により、自然言語やプログラミング言語を理解する能力が向上し、レビューコメントに基づいたパッチの生成が可能になった。
論文 参考訳(メタデータ) (2023-12-29T06:12:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。