論文の概要: BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models
- arxiv url: http://arxiv.org/abs/2605.09134v2
- Date: Tue, 12 May 2026 15:29:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 18:21:07.014588
- Title: BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models
- Title(参考訳): BoostAPR: デュアルリワードモデルによる実行型強化学習による自動プログラム修復の促進
- Abstract要約: プログラム修復のための強化学習は、スパース実行フィードバックと、どの編集がバグを実際に修正するかが不明なシーケンスレベルの報酬によって妨げられる。
これらの課題に対処する3段階のフレームワークであるBoostAPRを紹介します。
- 参考スコア(独自算出の注目度): 9.519307176717094
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning for program repair is hindered by sparse execution feedback and coarse sequence-level rewards that obscure which edits actually fix bugs. We present BoostAPR, a three-stage framework addressing these challenges: (1) supervised fine-tuning on execution-verified demonstrations with reasoning traces, (2) training dual reward models--a sequence-level assessor and a line-level credit allocator--from execution outcomes, and (3) PPO optimization where the line-level model redistributes rewards to critical edit regions. This line-level credit assignment operates at an intermediate granularity naturally suited to code changes. Trained on SWE-Gym and evaluated on four benchmarks, BoostAPR achieves 40.7% on SWE-bench Verified (+22.9pp over base model), 24.8% on Defects4J (Python-to-Java transfer), 84.5% on HumanEval-Java, and 95.0% on QuixBugs, achieving competitive results among open-source models with strong cross-language generalization.
- Abstract(参考訳): プログラム修復のための強化学習は、スパース実行フィードバックと、どの編集がバグを実際に修正するかを曖昧にするような粗いシーケンスレベルの報酬によって妨げられる。
これらの課題に対処する3段階のフレームワークであるBoostAPRについて述べる。(1)推論トレースを用いた実行検証デモの微調整,(2)シーケンスレベルのアセスメントとラインレベルのアロケータのトレーニング,(3)ラインレベルのモデルが重要な編集領域に報酬を再分配するPPO最適化。
このラインレベルのクレジット代入は、コード変更に自然に適合する中間粒度で動作する。
SWE-Gymでトレーニングされ、4つのベンチマークで評価され、BoostAPRはSWE-bench Verified(+22.9pp over base model)で40.7%、Defects4J(Python-to-Javaトランスファー)で24.8%、HumanEval-Javaで84.5%、QuixBugsで95.0%を達成し、強力なクロス言語一般化を持つオープンソースモデルで競合する結果を得た。
関連論文リスト
- Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization [60.89431018071735]
グループ相対的な優位性を持つ強化学習は、訓練後の言語モデル推論のデファクトスタンダードとなっている。
異なる報酬プロファイルを持つロールアウトは、同じ利点を享受でき、現在の飽和度に関わらず、全ての目的が固定相対重みで最適化されることを示す。
本研究では,各報酬目標を独立に標準化し,目標飽和度をバッチレベルで推定した値に従って貢献を適応的に割引する飽和度認識再重み付けを導入する。
論文 参考訳(メタデータ) (2026-08-17T04:07:50Z) - TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation [6.268849049716121]
Test-Aware Policy Refinement (TaPR)は、実行フィードバックを高密度なターン毎のテストパス比報酬に変換するフレームワークである。
LiveCodeBenchの219のコード生成問題に関する6つのモデルにおいて、TaPRはプールされた3ターン成功率(Pass@3)を2.44ポイント改善した。
論文 参考訳(メタデータ) (2026-08-01T07:35:06Z) - SCOPE: Leveraging Subgoal Critiques for Code Generation [14.869703886733761]
本稿では,コード生成のプロファイラdサブゴール批判であるSCOPEを紹介する。
SCOPEはリーン指向の証明モデルを採用し、下流のコード生成のために3つの解析可能なフィードバックフィールドを生成する。
提案手法は、教師付き微調整、プロセス整合強化学習(RL)、フィードバック誘導推論を組み合わせたものである。
論文 参考訳(メタデータ) (2026-07-07T04:09:41Z) - ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning [75.26064451955199]
ExTraは、モデル自身のロールアウトから探索信号を抽出するフレームワークである。
GRPO上でQwen3-1.7Bをpass@1で約5ポイント、pass@16で+7ポイント改善する。
論文 参考訳(メタデータ) (2026-06-23T15:51:39Z) - VeriGate: Verifier-Gated Step-Level Supervision for GRPO [51.26100506256885]
グループ相対政策最適化は、検証者に基づく結果報酬を伴う推論モデルをトレーニングするための効果的なレシピである。
GRPO の検証子付き拡張である VeriGate を提案し,これらの制限を3つの設計選択で解決する。
We show that VeriGate improves average accuracy around 20% and 12% for 1.5B and 7B models respectively。
論文 参考訳(メタデータ) (2026-05-28T18:20:32Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration [0.0]
マルチターンタスクにおける強化学習を伴う訓練ツール呼び出しエージェントは依然として困難である。
本稿では,MT-GRPO と GTPO を用いて,現実的なカスタマーサービスタスクにおけるツールコールエージェントのトレーニングを行う。
論文 参考訳(メタデータ) (2026-04-03T08:36:03Z) - On the Effectiveness of Code Representation in Deep Learning-Based Automated Patch Correctness Assessment [27.074607600022315]
自動プログラム修復(APR)は、正しいパッチを作成しようとする試みであり、過去数十年間、学術と産業の両方から広く注目を集めてきた。
オーバーフィッティング問題に対処するため、コミュニティはパッチの正当性(APCAアプローチ)を予測するためのアプローチを多数提案している。
中でも,デザインの自動マッチングを目的とした局所的な深層学習アプローチが強くなってきている。
パッチの正確性には根本的な理由があるにもかかわらず、コード表現は体系的に研究されていない。
論文 参考訳(メタデータ) (2026-03-08T08:18:42Z) - SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning [39.1720897614261]
密度の高いステップレベルのフィードバックを提供するプロセス報酬モデル(PRM)は、強化学習の可能性を示している。
筆者らはSPARK(SPARK)という3段階のフレームワークを提案し、第1段階ではジェネレータモデルが多様な解を生成し、検証器モデルがそれらを評価する。
ステップレベルで複数の独立した検証を集約することで、根底的な結果管理を超越したプロセス報酬モデルのトレーニングデータが得られることを示す。
論文 参考訳(メタデータ) (2025-12-02T21:30:47Z) - Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains [97.5573252172065]
自動推論評価器(FARE)のファミリーを,簡易な反復的リジェクションサンプリング制御による微調整手法で訓練する。
FARE-8Bはより大型のRL訓練評価器に挑戦し、FARE-20Bはオープンソース評価器の新しい標準となる。
推論時リランカとして、FARE-20BはMATH上でのニアオークル性能を達成する。
論文 参考訳(メタデータ) (2025-10-20T17:52:06Z) - Automated Repair of C Programs Using Large Language Models [0.0]
本研究では,Cプログラムの修復を自動化する上で,LLM(Large Language Models)の可能性について検討する。
本稿では,SBFL(Spectrum-based Fault Localization),ランタイムフィードバック,Chain-of-Thought-structured(Chain-of-Thought-structured)を自動修復ループに統合するフレームワークを提案する。
我々の手法は44.93%の修理精度を達成し、最先端のAPRベースラインに対する3.61%の絶対的な改善を示している。
論文 参考訳(メタデータ) (2025-09-02T04:34:11Z) - Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback [59.078756231841574]
Critique-GRPOは、自然言語と数値フィードバックを統合して効果的なポリシー最適化を行うオンラインRLフレームワークである。
批判-GRPOは、教師付き学習とRLに基づく微調整法を8つの難解な数学、STEM、一般的な推論タスクで一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-06-03T17:39:02Z) - The Art of Repair: Optimizing Iterative Program Repair with Instruction-Tuned Models [48.073219761367184]
複数出力の生成と複数ラウンドの反復のバランスをとるAPRパイプラインについて検討する。
3つのサイズ(1K, 30K, 65K)と2つのテクニック(フルファインチューニングとLoRA)を持つAPRデータセット上で各モデルを微調整する。
その結果,微調整データセットのごく一部(1%)しか使用せず,最大78%の改善が達成できた。
論文 参考訳(メタデータ) (2025-05-05T18:06:51Z) - EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking [58.15568681219339]
大規模言語モデル(LLM)を評価するための新しいベンチマークであるEquiBenchを紹介する。
このタスクは、プログラムのセマンティクスについて推論するモデルの能力を直接テストする。
19の最先端LCMを評価し、最も難しいカテゴリでは、最高の精度は63.8%と76.2%であり、50%のランダムベースラインよりわずかに高い。
論文 参考訳(メタデータ) (2025-02-18T02:54:25Z) - Reinforcement Learning for Mutation Operator Selection in Automated Program Repair [11.756822700775668]
プログラム修復における突然変異演算子の選択に対する強化学習に基づくアプローチの有効性について検討する。
提案手法は, 言語, プログラミングレベル, 検索戦略であり, 既存の補修ツールに容易に拡張できる。
Defects4Jベンチマークから,実世界の353のバグに対するアプローチを評価した。
論文 参考訳(メタデータ) (2023-06-09T10:09:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。