論文の概要: Anchored Self-Play for Code Repair
- arxiv url: http://arxiv.org/abs/2607.03523v1
- Date: Fri, 03 Jul 2026 17:51:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.639716
- Title: Anchored Self-Play for Code Repair
- Title(参考訳): コード修復のためのアンコールセルフプレイ
- Abstract要約: コード修復は言語モデル(LM)の重要な機能である
本稿では,1つのモデルを強化学習で訓練し,バグを生成して修正する__generator--fixer self-play__を提案する。
BugSourceBenchでは、セルフプレイは難しいが非現実的なバグへと向かっている。
本稿では,参照バグの生成と混合のためのコード埋め込み型類似性報酬をフィクスチャトレーニングに付加することにより,小さな参照セットでセルフプレイをアンロックするAnchored Self-Play (ASP)を提案する。
- 参考スコア(独自算出の注目度): 68.0728003844994
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Code repair is an important capability for language models (LMs): given a buggy program and unit tests, an LM must produce a fixed program that passes the tests. Because code repair data is limited, we aim to scale supervision by using an LM to generate bug--fix tasks. We propose __generator--fixer self-play__, in which a single model is trained with reinforcement learning to generate bugs and fix them. As the fixer improves, the generator adapts to produce more difficult bugs, yielding an automatic curriculum. To test whether this curriculum generalizes, we introduce BugSourceBench, a repair benchmark spanning realistic bug sources: bugs in human-written code, LM-generated code, and human-edited LM-generated code. On BugSourceBench, we find that self-play drifts toward difficult but unrealistic bugs, improving on synthetic bugs but degrading on human-authored ones. We propose Anchored Self-Play (ASP), which anchors self-play with a small reference set by adding a code-embedding similarity reward for generation and mixing reference bugs into fixer training. Across bug sources, ASP achieves the best fix rates, improving average fix rate over standard self-play by $+24\%$ relative / $+7.0$ pp absolute, with gains on bugs from both LMs and humans.
- Abstract(参考訳): コード修復は言語モデル(LM)の重要な機能である。バグのあるプログラムとユニットテストが与えられた場合、LMはテストに合格する固定プログラムを生成する必要がある。
コード修復データに制限があるため、LMを用いてバグ修正タスクを生成することにより、監督を拡大することを目的としている。
フィクスダーが改良されるにつれて、ジェネレータはより難しいバグを発生させ、自動的なカリキュラムを生成する。
このカリキュラムが一般化されるかどうかを確認するため,実際のバグソースにまたがる修復ベンチマークであるBugSourceBenchを紹介した。
BugSourceBenchでは、自己プレイが難しいが非現実的なバグに移行し、合成バグを改善するが、人間によって認可されたバグは分解する。
本稿では,参照バグの生成と混合のためのコード埋め込み型類似性報酬をフィクスチャトレーニングに付加することにより,小さな参照セットでセルフプレイをアンロックするAnchored Self-Play (ASP)を提案する。
バグソース全体にわたって、ASPは最高の修正率を獲得し、標準のセルフプレイよりも平均的な修正レートを$+24\%$ relative / $+7.0$ pp絶対値で改善した。
関連論文リスト
- BugPilot: Complex Bug Generation for Efficient Learning of SWE Skills [59.003563837981886]
高品質なバグは、次世代の言語モデルベースソフトウェアエンジニアリング(SWE)エージェントをトレーニングする鍵となる。
難易度および多種多様なバグを合成する新しい方法を提案する。
論文 参考訳(メタデータ) (2025-10-22T17:58:56Z) - Do AI models help produce verified bug fixes? [62.985237003585674]
大規模言語モデルは、ソフトウェアバグの修正に使用される。
本稿では,プログラマが大規模言語モデルを用いて,自身のスキルを補完する方法について検討する。
その結果は、プログラムバグに対する保証された修正を提供するAIとLLMの適切な役割への第一歩となる。
論文 参考訳(メタデータ) (2025-07-21T17:30:16Z) - Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation [69.62857948698436]
大規模言語モデル(LLM)の最近の進歩は、コーディングベンチマークのパフォーマンスを改善している。
しかし、手軽に利用できる高品質なデータの枯渇により、改善は停滞している。
本稿では,単一モデルのコードとテスト生成能力を共同で改善するセルフプレイ・ソルバ検証フレームワークであるSol-Verを提案する。
論文 参考訳(メタデータ) (2025-02-20T18:32:19Z) - PATCH: Empowering Large Language Model with Programmer-Intent Guidance and Collaborative-Behavior Simulation for Automatic Bug Fixing [34.768989900184636]
バグ修正は、ソフトウェア開発とメンテナンスにおいて重要な意味を持つ。
最近の研究は、ソフトウェアバグを自動的に解決する大規模言語モデル(LLM)の可能性を探ることに大きく貢献している。
論文 参考訳(メタデータ) (2025-01-27T15:43:04Z) - Investigating the Transferability of Code Repair for Low-Resource Programming Languages [57.62712191540067]
大規模言語モデル(LLM)は、コード生成タスクにおいて顕著なパフォーマンスを示している。
近年の作業は、連鎖推論や蒸留といった現代的な技術を統合することで、コード修復のプロセスを強化している。
高低資源言語と低低資源言語の両方でコード修復を蒸留する利点について検討する。
論文 参考訳(メタデータ) (2024-06-21T05:05:39Z) - A Deep Dive into Large Language Models for Automated Bug Localization and Repair [12.756202755547024]
大規模言語モデル(LLM)は、自動プログラム修復(APR)など、様々なソフトウェアエンジニアリングタスクにおいて顕著な効果を示している。
本研究では,LSMを用いた自動バグ修正について深く検討する。
異なるLLMを用いてバグの局所化と修正を分離することにより、多様なコンテキスト情報の効果的な統合が可能になる。
Toggleは、CodeXGLUEコード改善ベンチマークで、新しい最先端(SOTA)パフォーマンスを実現する。
論文 参考訳(メタデータ) (2024-04-17T17:48:18Z) - Assessing the Latent Automated Program Repair Capabilities of Large Language Models using Round-Trip Translation [44.3761164214368]
RTT(Round-Trip Translation): あるプログラミング言語から別のプログラミング言語や自然言語にコードを翻訳する。
JavaにおけるRTT生成パッチの詳細な量的および定性的な分析を行う。
RTTはHumanEval-JavaベンチマークでGPT-4を用いた164のバグのうち100件に対して可塑性パッチを生成し,97件を手作業で評価した。
論文 参考訳(メタデータ) (2024-01-15T22:36:31Z) - Challenging Bug Prediction and Repair Models with Synthetic Bugs [7.285779914390472]
BugFarmは任意のコードを複数の複雑なバグに変換する。
BUGFARMが生成した1.9万以上の変異株から435k以上のバグを総合的に評価する。
論文 参考訳(メタデータ) (2023-10-03T20:01:51Z) - Large Language Models of Code Fail at Completing Code with Potential
Bugs [30.80172644795715]
リアルタイムコード提案に触発されたバグコード補完問題について検討する。
潜在的なバグの存在は、高性能なCode-LLMの生成性能を著しく低下させる。
論文 参考訳(メタデータ) (2023-06-06T06:35:27Z) - Prompting Is All You Need: Automated Android Bug Replay with Large Language Models [28.69675481931385]
本稿では,バグ報告から迅速なエンジニアリングを通じてバグを自動的に再現する,新しい軽量なアプローチであるAdbGPTを提案する。
AdbGPTは、LLMから人間の知識と論理的推論を引き出すために、少数ショットの学習と連鎖推論を活用する。
この評価は,253.6秒で81.3%のバグレポートを再現するAdbGPTの有効性と有効性を示すものである。
論文 参考訳(メタデータ) (2023-06-03T03:03:52Z) - Break-It-Fix-It: Unsupervised Learning for Program Repair [90.55497679266442]
我々は2つの重要なアイデアを持つ新しいトレーニング手法であるBreak-It-Fix-It (BIFI)を提案する。
批判者は、実際の悪い入力でフィクスダーの出力をチェックし、トレーニングデータに良い(固定された)出力を追加する。
これらのアイデアに基づいて、よりペア化されたデータを生成するために、ブレーカとフィクスチャを同時に使用しながら、繰り返し更新する。
BIFIは既存のメソッドより優れており、GitHub-Pythonで90.5%、DeepFixで71.7%の修正精度がある。
論文 参考訳(メタデータ) (2021-06-11T20:31:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。