論文の概要: Large Language Models for Programming: Actually Fixing or Reimplementing Incorrect Code?
- arxiv url: http://arxiv.org/abs/2609.29410v1
- Date: Thu, 24 Sep 2026 11:33:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.884467
- Title: Large Language Models for Programming: Actually Fixing or Reimplementing Incorrect Code?
- Title(参考訳): プログラミングのための大規模言語モデル: 正しくないコードの修正や再実装は可能か?
- Abstract要約: 大規模言語モデルは、様々なプログラミング環境における問題を効果的に解決し、バグを修正することができる。
この研究は、LLMがバグの解決方法からバグを修正するまでの期間を、人間によるパッチと比較して決定することに焦点を当てている。
- 参考スコア(独自算出の注目度): 43.54755402165517
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Recent studies have shown that Large Language Models can effectively solve problems and fix bugs in diverse programming environments, including competitive programming. Existing approaches primarily evaluate LLM performance in problem solving or bug fixing independently, but do not explore the relationship between these two capabilities. This work focuses on determining how much the LLM deviates from a buggy solution to fix the bug compared to a human-written patch, and if there is a bias towards generating entirely new solutions. We construct a dataset with all the submissions ($\sim$ 3000) from a couple of users from Codeforces, and we match each buggy submission with its corresponding human fix. By using the similarity between the buggy solution and the human fix as a baseline, we evaluate the quality of LLM-generated bug fixes on 3 OpenAI GPT models (gpt-5-nano, gpt-5-mini, gpt-5.1). We check if the generated solutions solve the problem by using the Codeforces-R1 dataset, an openly available dataset that has tests generated with the DeepSeek-R1 model. Our findings suggest that LLMs tend to modify more lines than necessary compared to human fixes and, in some cases, generate entirely new solutions. We also observe that LLMs solve more problems correctly when allowed to generate solutions from scratch rather than patch buggy submissions, even when those submissions are close to the human patch. This has important implications for the design of AI-assisted programming tools, particularly in supporting user debugging processes and promoting incremental problem-solving strategies rather than solution replacement.
- Abstract(参考訳): 近年の研究では、大規模言語モデルは、競争力のあるプログラミングを含む様々なプログラミング環境の問題を効果的に解決し、バグを修正することができることが示されている。
既存のアプローチは、主に問題解決やバグ修正を個別に評価するが、これらの2つの機能の関係について調べることはない。
この研究は、LLMが人書きのパッチよりもバグの多いソリューションからバグを修正するためにどの程度の時間を逸脱するか、そして全く新しいソリューションを生成するためのバイアスがあるかどうかを判断することに焦点を当てている。
Codeforcesのユーザ数名から、すべてのサブミット($3000)でデータセットを構築し、各バギーなサブミットとそれに対応するヒューマンフィックスをマッチングします。
本研究は,3つのOpenAI GPTモデル(gpt-5-nano,gpt-5-mini,gpt-5-mini,gpt-5.1)におけるLLM生成バグフィックスの品質を評価する。
生成されたソリューションが、DeepSeek-R1モデルで生成されたテストを持つ公開データセットであるCodeforces-R1データセットを使用することで、その問題を解決するかどうかを確認する。
以上の結果から, LLMは人為的な修正よりも多くの行を変更できる傾向があり, 場合によっては全く新しい解決法が生み出されることが示唆された。
また、LLMは、人間のパッチに近づいたとしても、バグのあるサブミッションにパッチを当てるよりも、スクラッチからソリューションを生成することができれば、より正確な問題を解決します。
これは、AI支援プログラミングツールの設計、特にユーザデバッグプロセスのサポートと、ソリューション置換よりも漸進的な問題解決戦略の促進に重要な意味を持つ。
関連論文リスト
- Do AI models help produce verified bug fixes? [62.985237003585674]
大規模言語モデルは、ソフトウェアバグの修正に使用される。
本稿では,プログラマが大規模言語モデルを用いて,自身のスキルを補完する方法について検討する。
その結果は、プログラムバグに対する保証された修正を提供するAIとLLMの適切な役割への第一歩となる。
論文 参考訳(メタデータ) (2025-07-21T17:30:16Z) - PATCH: Empowering Large Language Model with Programmer-Intent Guidance and Collaborative-Behavior Simulation for Automatic Bug Fixing [34.768989900184636]
バグ修正は、ソフトウェア開発とメンテナンスにおいて重要な意味を持つ。
最近の研究は、ソフトウェアバグを自動的に解決する大規模言語モデル(LLM)の可能性を探ることに大きく貢献している。
論文 参考訳(メタデータ) (2025-01-27T15:43:04Z) - Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems [62.76627483915117]
大規模言語モデル(LLM)は、最近、数学と推論ベンチマークで印象的なパフォーマンスを達成した。
直感的なパズルにインスパイアされた11のユニークな検索問題を含む新しいベンチマークであるSearchBenchを紹介した。
ステップバイステップで言語のみの推論を用いることで、最も先進的なLLMでさえ、SearchBenchの解決に失敗することを示します。
論文 参考訳(メタデータ) (2024-06-18T00:44:58Z) - DeepCode AI Fix: Fixing Security Vulnerabilities with Large Language
Models [3.1690235522182104]
大規模言語モデル(LLM)は、様々なプログラミングタスクの解決にますます使われている。
長距離コード関係を学習するモデルを必要とするため,タスクは困難であることを示す。
本稿では,LLMのクエリと微調整のための新しいアプローチにより,これらの課題に対処する手法を提案する。
論文 参考訳(メタデータ) (2024-02-19T18:35:40Z) - DebugBench: Evaluating Debugging Capability of Large Language Models [80.73121177868357]
DebugBench - LLM(Large Language Models)のベンチマーク。
C++、Java、Pythonの4つの主要なバグカテゴリと18のマイナータイプをカバーする。
ゼロショットシナリオで2つの商用および4つのオープンソースモデルを評価する。
論文 参考訳(メタデータ) (2024-01-09T15:46:38Z) - Exploring Large Language Models in Resolving Environment-Related Crash Bugs: Localizing and Repairing [36.4673637256627]
大規模言語モデル(LLM)は、ソフトウェア工学のタスクにおいて有望であることを示している。
実環境におけるクラッシュバグの解決におけるLLMの能力を評価するための,初の総合的研究を行った。
この結果から,コードクラッシュを解決する上ではローカライゼーションが最大の課題であることが明らかとなった。
論文 参考訳(メタデータ) (2023-12-16T13:41:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。