論文の概要: SCOPE: Leveraging Subgoal Critiques for Code Generation
- arxiv url: http://arxiv.org/abs/2607.05810v1
- Date: Tue, 07 Jul 2026 04:09:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.396332
- Title: SCOPE: Leveraging Subgoal Critiques for Code Generation
- Title(参考訳): SCOPE:コード生成のためのサブゴナル批判を活用する
- Authors: Yueke Zhang, Yifan Zhang, Zihan Fang, Kevin Leach, Wei Zhang, Yu Huang,
- Abstract要約: 本稿では,コード生成のプロファイラdサブゴール批判であるSCOPEを紹介する。
SCOPEはリーン指向の証明モデルを採用し、下流のコード生成のために3つの解析可能なフィードバックフィールドを生成する。
提案手法は、教師付き微調整、プロセス整合強化学習(RL)、フィードバック誘導推論を組み合わせたものである。
- 参考スコア(独自算出の注目度): 14.869703886733761
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Code generation with large language models (LLMs) remains unreliable because generated programs can appear correct while still violating key semantic requirements in the natural language specification. Existing feedback-based methods improve over coder-only generation, but they often rely on unstructured critique or execution signals that do not explicitly identify what the code is semantically missing. We present SCOPE, a prover-initialized subgoal critic for code generation. SCOPE adapts a Lean-oriented prover model to produce three parseable feedback fields for downstream code generation: subgoals, gap analysis, and a robustness checklist. Our approach combines supervised fine-tuning, process-aligned reinforcement learning (RL), and feedback-guided inference, with two complementary rewards during RL: a dense reward for structured critique quality and a sparse reward based on whether the critique improves the coder's execution score. Experiments show that SCOPE improves over the compared feedback baselines. On LiveCodeBench V6, SCOPE achieves 39.4% pass@1, compared with 36.6% for Reflexion and 20.6% for the coder-only baseline. On BigCodeBench (Hard), it reaches 42.6%, surpassing Reflexion at 36.5% and coder-only generation at 34.5%. Further analysis shows that SCOPE's gains are concentrated in tasks with concrete semantic constraints and that its code corrections are more localized than Reflexion's.
- Abstract(参考訳): 大規模言語モデル(LLM)によるコード生成は、生成したプログラムは、自然言語仕様における重要なセマンティック要件に違反しながら、正しいように見えるため、信頼性が低いままである。
既存のフィードバックベースのメソッドはコーダのみの生成よりも改善されるが、多くの場合、コードがセマンティックに欠落していることを明確に識別しない非構造化の批判や実行信号に依存している。
コード生成における証明初期化サブゴール批判であるSCOPEについて述べる。
SCOPEはリーン指向の証明モデルを採用して,サブゴール,ギャップ分析,堅牢性チェックリストという,下流コード生成のための3つの解析可能なフィードバックフィールドを生成する。
提案手法は、教師付き微調整、プロセス整合強化学習(RL)、フィードバック誘導推論と、RL中の2つの相補的な報酬、すなわち構造化された批評品質に対する深い報酬と、その批評がコーダの実行スコアを改善するか否かに基づくスパース報酬を組み合わせたものである。
実験により、SCOPEは比較したフィードバックベースラインよりも改善することが示された。
LiveCodeBench V6では、SCOPEは39.4%のpass@1を達成するが、Reflexionは36.6%、コーダのみのベースラインは20.6%である。
BigCodeBench (Hard)では42.6%に達し、リフレクションを36.5%、コーダのみを34.5%で上回っている。
さらに分析したところ、SCOPEのゲインは具体的な意味的制約のあるタスクに集中しており、コード修正はReflexionよりもより局所的であることが示された。
関連論文リスト
- Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks [4.641791001110209]
我々は3つのコーディングタスクカテゴリ(生成、要約、分類)における推論品質を評価する最初のベンチマークであるCodeRQ-Benchを紹介する。
本研究では,エビデンスに基づく検証とあいまいさを考慮したスコア補正を組み合わせた2段階評価器VERAを提案する。
CodeRQ-Benchの実験によると、VERAは4つのデータセットで強いベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-04-14T07:12:46Z) - EvolveCoder: Evolving Test Cases via Adversarial Verification for Code Reinforcement Learning [46.87136299625531]
検証可能な報酬による強化学習(RLVR)は、大規模言語モデルにおけるコード生成を改善するための有望なアプローチである。
提案手法は, 候補解の実行挙動に基づいて, 反復的にテストケースを改良する, 解条件付き, 逆検証フレームワークを提案する。
EvolveCoder-22kは、大規模符号化強化学習データセットで、複数ラウンドの対角テストケースの進化を通して構築される。
論文 参考訳(メタデータ) (2026-03-13T06:26:50Z) - CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning [57.24524263804788]
コード検証は、LLMベースのコード生成の検証後において重要な役割を果たす。
既存の教師付き微調整手法は、データの不足、高い失敗率、推論効率の低下に悩まされている。
機能的な報酬しか持たない単純RLは、難しいブランチやサンプルに対して効果的な単体テストを生成することができないことを示す。
論文 参考訳(メタデータ) (2026-01-30T10:33:29Z) - BRIDGE: Building Representations In Domain Guided Program Verification [67.36686119518441]
BRIDGEは、検証をコード、仕様、証明の3つの相互接続ドメインに分解する。
提案手法は, 標準誤差フィードバック法よりも精度と効率を著しく向上することを示す。
論文 参考訳(メタデータ) (2025-11-26T06:39:19Z) - Turning the Tide: Repository-based Code Reflection [52.13709676656648]
マルチファイルリポジトリコンテキストにおけるコード理解と生成を評価するベンチマークであるLiveRepoReflectionを紹介する。
多様性、正確性、難易度を確保するため、6ドル(約6,800円)のプログラミング言語で厳格にテストケースをフィルタリングしました。
RepoReflection-Instructは、さまざまなソースから派生した大規模で品質の高い命令チューニングデータセットである。
論文 参考訳(メタデータ) (2025-07-14T02:36:27Z) - Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code [76.80306464249217]
本稿では,LLMにより良い理性を教えることを目的としたTeaRを提案する。
TeaRは、注意深いデータキュレーションと強化学習を活用して、コード関連のタスクを通じて最適な推論パスを発見するモデルをガイドする。
我々は、2つのベースモデルと3つの長いCoT蒸留モデルを用いて広範な実験を行い、モデルのサイズは15億から32億のパラメータから、Math、Knowledge、Code、Logical Reasoningにまたがる17のベンチマークにまたがる。
論文 参考訳(メタデータ) (2025-07-10T07:34:05Z) - CHORUS: Zero-shot Hierarchical Retrieval and Orchestration for Generating Linear Programming Code [0.0]
本研究では,Large Language Models (LLMs) のLinear Programming (LP) コード生成における効率性について検討する。
自然言語問題文からGurobiベースのLPコードを合成する検索拡張生成フレームワークCHORUSを提案する。
NL4-Codeベンチマークの実験では、CHORUSはベースラインや従来のRAGに比べて大きなマージンでオープンソースのLLMの性能を改善している。
論文 参考訳(メタデータ) (2025-05-02T16:36:57Z) - A Preliminary Study on the Robustness of Code Generation by Large Language Models [40.01096420024215]
CoderEvalベンチマークを用いて,LLM生成したコードロバスト性に関する実証的研究を行った。
出力の35.2%は、人間が書いたコードよりも堅牢ではなく、条件チェックの欠如による90%以上の欠陥があることがわかった。
このような問題に対処するため,モデルに依存しないフレームワークであるRobGenを提案する。
論文 参考訳(メタデータ) (2025-03-26T03:44:03Z) - Rewriting the Code: A Simple Method for Large Language Model Augmented Code Search [7.822427053078387]
Generation-Augmented Retrieval (GAR)フレームワークは、クエリを拡張するための例のコードスニペットを生成する。
本稿では、forスタイルの正規化内でコード(ReCo)を書き換える、シンプルで効果的な方法を提案する。
コードスタイル類似度(Code Style similarity)は、コード内のスタイリスティック類似度を定量化するための最初のメートル法である。
論文 参考訳(メタデータ) (2024-01-09T12:12:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。