論文の概要: Prompt Optimization for LLM Code Generation via Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2605.19102v1
- Date: Mon, 18 May 2026 20:42:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-20 15:03:08.981216
- Title: Prompt Optimization for LLM Code Generation via Reinforcement Learning
- Title(参考訳): 強化学習によるLLM符号生成のプロンプト最適化
- Authors: Ali Mohammadi Esfahani, Nafiseh Kahani, Samuel A. Ajila,
- Abstract要約: 大規模言語モデル(LLM)は自然言語からコードを生成することができるが、その性能は素早い定式化に敏感である。
逐次的意思決定問題として改良を促進させる強化学習に基づくフレームワークを提案する。
CodeT5+,CodeLLaMA,DeepSeek-Coder を用いて,MBPP+,HumanEval+,APPS上のフレームワークを凍結コードジェネレータとして評価した。
- 参考スコア(独自算出の注目度): 0.5735035463793009
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) can generate code from natural language, but their performance is highly sensitive to prompt formulation. We propose a reinforcement-learning-based framework that models prompt refinement as a sequential decision-making problem. A Proximal Policy Optimization (PPO) agent iteratively improves prompts using a hybrid action space that combines direct generation, genetic lexical mutation and semantic rewriting, guided by shaped rewards derived from unit-test feedback. We evaluate the framework on MBPP+, HumanEval+, and APPS using CodeT5+, CodeLLaMA, and DeepSeek-Coder as frozen code generators. On the 500-task MBPP+ test set, the PPO agent achieves strict Pass@1 scores of 57.58%, 64.80%, and 85.50%, respectively, outperforming EPiC, Reflexion, and Random-Hybrid. Soft-Pass@1 reaches 67.90%, 73.10%, and 88.20%, respectively. Similar improvements are observed on HumanEval+ and APPS across all backbone models. The results demonstrate that reinforcement learning with shaped test-driven rewards improves functional correctness in LLM-based code generation.
- Abstract(参考訳): 大規模言語モデル(LLM)は自然言語からコードを生成することができるが、その性能は高速な定式化に非常に敏感である。
逐次的意思決定問題として改良を促進させる強化学習に基づくフレームワークを提案する。
PPO(Proximal Policy Optimization)エージェントは、直接生成、遺伝的語彙変異、セマンティックリライトを組み合わせたハイブリッドアクション空間を使用してプロンプトを反復的に改善する。
CodeT5+,CodeLLaMA,DeepSeek-Coder を用いて,MBPP+,HumanEval+,APPS上のフレームワークを凍結コードジェネレータとして評価した。
500タスクのMBPP+テストセットでは、PPOエージェントは57.58%、64.80%、85.50%の厳格なPass@1スコアを達成し、EPiC、Reflexion、Random-Hybridを上回っている。
Soft-Pass@1は67.90%、73.10%、88.20%である。
同様の改善は、HumanEval+とAPPSで、すべてのバックボーンモデルで見られる。
その結果,LLMに基づくコード生成において,テスト駆動型報酬を用いた強化学習が機能的正当性を向上させることが示唆された。
関連論文リスト
- PPO guided Agentic Pipeline for Adaptive Prompt Selection and Test Case Generation [0.30786914102688595]
本稿では,強化学習駆動型エージェントフレームワークを用いた新しいテストケース生成手法を提案する。
フェーズ1では、ToT誘導最適化エージェントが冗長性を取り除き、ソースコードを分割し、最小化する。
フェーズIIでは、8つの異なるプロンプト技術の中からプロンプトを選択する問題を解くために、PPOベースのポリシーネットワークを訓練する。
PPOエージェントは、ラインとブランチのカバレッジの増加、探索されていないブランチに対する罰則、ソースコードの長さを減らす報酬の組み合わせに基づいて報酬を受け取る。
論文 参考訳(メタデータ) (2026-05-01T06:19:51Z) - MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization [103.74675519953898]
ロングチェーンのリフレクティブ推論は、複雑な現実世界の問題を解決するための前提条件である。
我々は42の難解な合成タスクの1,260のサンプルからなるベンチマークを構築した。
トレーニング後のデータを生成し、そのようなデータを活用するための学習パラダイムを探索する。
論文 参考訳(メタデータ) (2025-10-09T17:53:58Z) - GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning [106.98018881499362]
GEPA(Genetic-Pareto)は、自然言語を徹底的に組み込んで、試行錯誤から高度なルールを学ぶプロンプトである。
GEPAはシステムレベルの軌跡(推論、ツールコール、ツールアウトプットなど)をサンプリングし、自然言語でそれらを反映して問題を診断する。
ほんの数回だけロールアウトしても、大きな品質向上に繋がることが多い。
論文 参考訳(メタデータ) (2025-07-25T17:42:32Z) - Enhancing LLM-Based Code Generation with Complexity Metrics: A Feedback-Driven Approach [6.289275189295223]
本稿では,コード複雑度と大言語モデル生成コードの成功との関係について検討する。
提案手法では,既往の故障した出力からの複雑性メトリクスに基づいて,LCMに正しいコードを生成するための反復的フィードバック手法を提案する。
実験結果から,本手法は特に小型LCMでは顕著な改善が見られた。
論文 参考訳(メタデータ) (2025-05-29T19:06:14Z) - Process Supervision-Guided Policy Optimization for Code Generation [15.943210767010045]
単体テストフィードバックによる強化学習(RL)は、大規模言語モデルのLLM(LLM)コード生成を強化したが、完全なコード評価後にのみ提供されるスパース報酬に依存している。
本稿では,人間のコード修正を模倣したプロセス・リワード・モデル(PRM)を提案する。
論文 参考訳(メタデータ) (2024-10-23T07:22:33Z) - Applying RLAIF for Code Generation with API-usage in Lightweight LLMs [15.366324461797582]
Reinforcement Learning from AI Feedback (RLAIF)は、さまざまな領域で大きな可能性を証明している。
本稿では,軽量 (1B パラメータ) LLM のコード生成能力を改善するための RLAIF フレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-28T17:16:03Z) - SOEN-101: Code Generation by Emulating Software Process Models Using Large Language Model Agents [50.82665351100067]
FlowGenは、複数のLarge Language Model (LLM)エージェントに基づいたソフトウェアプロセスモデルをエミュレートするコード生成フレームワークである。
FlowGenScrumをHumanEval、HumanEval-ET、MBPP、MBPP-ETの4つのベンチマークで評価した。
論文 参考訳(メタデータ) (2024-03-23T14:04:48Z) - Guiding Large Language Models via Directional Stimulus Prompting [114.84930073977672]
我々は,特定の所望の出力に対して,ブラックボックス大言語モデル(LLM)を導くための新しいフレームワークであるDirectional Stimulus Promptingを紹介する。
LLMを直接調整するのではなく、小さな調整可能なポリシーモデルを用いて各入力インスタンスに対して補助的な指向性刺激プロンプトを生成する。
論文 参考訳(メタデータ) (2023-02-22T17:44:15Z) - Interactive Code Generation via Test-Driven User-Intent Formalization [60.90035204567797]
大きな言語モデル(LLM)は、非公式な自然言語(NL)の意図からコードを生成する。
自然言語は曖昧であり、形式的な意味論が欠けているため、正確性の概念を定義するのは難しい。
言語に依存しない抽象アルゴリズムと具体的な実装TiCoderについて述べる。
論文 参考訳(メタデータ) (2022-08-11T17:41:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。