論文の概要: RLPF: Reinforcement Learning from Performance Feedback for Code Generation
- arxiv url: http://arxiv.org/abs/2607.27271v1
- Date: Wed, 29 Jul 2026 11:39:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.278061
- Title: RLPF: Reinforcement Learning from Performance Feedback for Code Generation
- Title(参考訳): RLPF:コード生成のパフォーマンスフィードバックから強化学習
- Abstract要約: 評価基準としてのみ効率性を扱うのではなく、より高速な実装を好むようにコードエージェントを訓練する方法を研究する。
本稿では,パフォーマンスフィードバックからの強化学習である textbfRLPF を提案する。
PerfCodeBench の RLPF による微調整 Qwen3-32B は,修正および実行可能なソリューションを 11.1% から 54.6% に引き上げる。
- 参考スコア(独自算出の注目度): 44.39557506834191
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Code models are increasingly trained with execution feedback, but most training signals still stop at correctness. This leaves an important gap for systems code: two programs can pass the same tests while differing greatly in runtime. We study how to train code agents to prefer faster correct implementations, rather than treating efficiency only as an evaluation metric. The key difficulty is that runtime is a fragile reward. It is meaningful only after a program is correct, varies across tasks, and gives little guidance when most sampled programs fail to compile or run. We propose \textbf{RLPF}, reinforcement learning from performance feedback, which turns execution outcomes into a staged reward. Failed programs are ordered by execution progress, while correct programs are ranked by their relative improvement from the baseline toward the expert reference. This gives useful feedback before correctness and performance-sensitive feedback after correctness. Fine-tuning Qwen3-32B with RLPF on PerfCodeBench raises correct-and-runnable solutions from $11.1\%$ to $54.6\%$ and improves relative efficiency from $8.1\%$ to $38.6\%$. The trained model becomes competitive with stronger open-weight systems, and its optimization behavior transfers modestly to EffiBench-X. Additional studies show that model-generated references provide useful but weaker supervision, and that the full composite reward is more reliable than correctness-only or runtime-only baselines. These results suggest that code agents can be trained not only to pass tests, but also to optimize the programs they write.
- Abstract(参考訳): コードモデルは、ますます実行フィードバックでトレーニングされていますが、ほとんどのトレーニングシグナルは、正確さで停止します。
2つのプログラムは同じテストをパスできるが、実行時に大きく異なる。
評価基準としてのみ効率性を扱うのではなく、より高速な実装を好むようにコードエージェントを訓練する方法を研究する。
重要な難点は、ランタイムが脆弱な報酬であることです。
プログラムが正しい場合のみ意味があり、タスクによって異なり、ほとんどのサンプルプログラムがコンパイルや実行に失敗した場合、ほとんどガイダンスを与えない。
本稿では,パフォーマンスフィードバックからの強化学習である‘textbf{RLPF} を提案する。
障害プログラムは実行進捗によって順序付けされ、正しいプログラムはベースラインからエキスパートリファレンスへの相対的な改善によってランク付けされる。
これにより、正確性よりも前の有用なフィードバックと、正確性後のパフォーマンスに敏感なフィードバックが得られる。
PerfCodeBench 上の RLPF による微調整 Qwen3-32B は、正解を 11.1 % から 5.6 % に引き上げ、相対効率を 8.1 % から 38.6 % に改善する。
訓練されたモデルはより強力なオープンウェイトシステムと競合し、最適化の挙動はエフィベンチXに控えめに伝達される。
さらなる研究により、モデル生成参照は有用だがより弱い監視を提供し、完全な複合報酬は正当性のみまたは実行時のみのベースラインよりも信頼性が高いことが示されている。
これらの結果は、コードエージェントはテストに合格するだけでなく、記述したプログラムを最適化するために訓練することができることを示唆している。
関連論文リスト
- Write, Execute, Refine: From Skill Followers to Skill Optimizers via Reinforcement Learning from Execution Feedback [52.78692582507693]
専門家による自然言語スキルは、ツール使用エージェントを改善することができるが、エージェントによるスキルは、スキルを使用しないよりも8-11ポイント悪い。
本研究では,中間的スキルから実行経験を訓練状態に整理する方法について検討する。
論文 参考訳(メタデータ) (2026-08-18T09:52:48Z) - When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study [77.64957118012423]
検証可能な報酬(RLVR)による強化学習は、大規模言語モデル推論において大きな進歩をもたらした。
最近の研究は、多数決や信頼に基づくスコアなど、モデル自身の信号から報酬を導き出すことによって、この問題に対処している。
本稿では,コード生成における本質的な報酬手法の体系的研究について述べる。
論文 参考訳(メタデータ) (2026-06-18T19:15:50Z) - REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards [15.458797431655961]
検証可能な報酬を伴う強化学習は、大規模言語モデルにおける明示的な推論を改善する共通の方法となっている。
しかし、最終回答の正確性だけでは、推論トレースが信頼できるか、信頼できるか、あるいはそれを消費するモデルに有用かは明らかになっていない。
我々は、推論を消費可能な中間アーティファクトとして扱うプランナー・エグゼクタトレーニングフレームワークであるTraceLiftを提案する。
論文 参考訳(メタデータ) (2026-05-05T15:24:40Z) - ACE: Self-Evolving LLM Coding Framework via Adversarial Unit Test Generation and Preference Optimization [28.464748466548965]
ACEは、ソルバ・アドバイザリーアーキテクチャに基づく自己進化型コード生成フレームワークである。
実行中心の監視を通じて、アクティブな障害発見を優先する。
ACEは強いソルバよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-04-17T07:20:01Z) - ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning [9.137158235106941]
ExecVerifyは、実行トレースから得られた検証済みのホワイトボックス報酬を組み込むことで、テキストの模倣を越えている。
ExecVerifyでトレーニングされた7Bモデルは、コード推論ベンチマークで32Bモデルに匹敵するパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-11T18:49:45Z) - CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning [57.24524263804788]
コード検証は、LLMベースのコード生成の検証後において重要な役割を果たす。
既存の教師付き微調整手法は、データの不足、高い失敗率、推論効率の低下に悩まされている。
機能的な報酬しか持たない単純RLは、難しいブランチやサンプルに対して効果的な単体テストを生成することができないことを示す。
論文 参考訳(メタデータ) (2026-01-30T10:33:29Z) - NExT: Teaching Large Language Models to Reason about Code Execution [50.93581376646064]
大規模言語モデル(LLM)のコードは通常、プログラムの表面テキスト形式に基づいて訓練される。
NExTは,プログラムの実行トレースを検査し,実行時の動作を判断する手法である。
論文 参考訳(メタデータ) (2024-04-23T01:46:32Z) - Learning from Self-Sampled Correct and Partially-Correct Programs [96.66452896657991]
そこで本研究では,モデルが学習中にサンプリングを行い,自己サンプリングされた完全正当プログラムと部分正当プログラムの両方から学習することを提案する。
自己サンプリング型プログラムと部分修正型プログラムを併用することで,学習とサンプリングプロセスのガイドに役立てることができることを示す。
提案手法は,MLEを用いた単一の参照プログラムからの学習と比較して,パス@kの性能を3.1%から12.3%向上させる。
論文 参考訳(メタデータ) (2022-05-28T03:31:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。