論文の概要: ExeCRE: Execution-Consistency Guided Reliability Estimation for Self-Correcting Code Generation
- arxiv url: http://arxiv.org/abs/2608.04439v1
- Date: Wed, 05 Aug 2026 04:29:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.723366
- Title: ExeCRE: Execution-Consistency Guided Reliability Estimation for Self-Correcting Code Generation
- Title(参考訳): ExeCRE: 自己修正コード生成のための実行一貫性ガイドによる信頼性推定
- Authors: Yiru Dong, Richong Zhang, Fanshuang Kong, Si Chen,
- Abstract要約: ExeCRE(Execution-Consistency Guided code Reliability Estimation framework)を提案する。
多数のランダムに生成された入力に対して、実行出力の一貫性パターンを統計的に解析することにより、コードの信頼性を推定する。
実験により、ExeCREは効率と安定性の両方を一貫して改善し、ミスリード補正信号を著しく低減することが示された。
- 参考スコア(独自算出の注目度): 28.515743392951194
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have made notable progress in code generation, but they still struggle on challenging tasks that require sophisticated algorithms or complex implementations. Recent methods increasingly use code execution as feedback, especially in self-correction pipelines that construct verification signals from generated code. However, these pipelines often depend on supervision signals whose reliability is unknown, which can introduce misleading feedback, unnecessary revisions, and incorrect final answers. To address this issue, we propose ExeCRE, an Execution-Consistency guided code Reliability Estimation framework. Instead of judging candidate code by tests or LLM feedback, ExeCRE estimates code reliability by statistically analyzing consistency patterns in execution outputs over a large number of randomly generated inputs. It collects execution outputs over generated inputs, projects them into consistency signals, and applies the Dawid-Skene model to infer latent code reliability. We integrate ExeCRE into self-correction for code generation. Experiments show that ExeCRE consistently improves both effectiveness and stability, while substantially reducing misleading correction signals. Under GPT-5.2 on LiveCodeBench, the average number of misleading feedback cases on already correct code drops from 113.2 with a representative self-correction baseline to 14.0 with ExeCRE. As an additional study, we apply the same reliability estimation strategy to code-based mathematical reasoning and observe similar benefits. These results suggest that ExeCRE enables more reliable use of generated code in execution-based pipelines.
- Abstract(参考訳): 大規模言語モデル(LLM)はコード生成において顕著な進歩を遂げているが、高度なアルゴリズムや複雑な実装を必要とする課題に苦戦している。
最近の手法では、特に生成されたコードから検証信号を構成する自己補正パイプラインにおいて、フィードバックとしてコードの実行が増えている。
しかし、これらのパイプラインは信頼性が不明な監視信号に依存しており、誤ったフィードバック、不要な修正、誤った最終回答をもたらす可能性がある。
この問題に対処するため、ExeCRE(Execution-Consistency Guided code Reliability Estimation framework)を提案する。
テストやLLMフィードバックによって候補コードを判断する代わりに、ExeCREは、多数のランダムに生成された入力に対して実行出力の一貫性パターンを統計的に解析することで、コードの信頼性を推定する。
生成された入力に対して実行出力を収集し、整合性信号に投影し、遅延コードの信頼性を推測するためにDawid-Skeneモデルを適用する。
ExeCREをコード生成のための自己補正に統合します。
実験により、ExeCREは効率と安定性の両方を一貫して改善し、ミスリード補正信号を著しく低減することが示された。
LiveCodeBench の GPT-5.2 では、すでに正しいコードに対する誤解を招くフィードバックケースの平均数は 113.2 から ExeCRE で 14.0 に減少している。
追加的な研究として、コードに基づく数学的推論に同じ信頼性推定戦略を適用し、同様の利点を観察する。
これらの結果は、ExeCREが実行ベースのパイプラインで生成されたコードをより信頼性の高い使用を可能にすることを示唆している。
関連論文リスト
- Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs [69.52853771994451]
我々はLLaDA 2.0の復号軌道を解析し、繰り返し拡散信頼トラップを同定する。
本稿では,拡散復号化を進化過程とみなす訓練不要なテスト時間スケーリングフレームワークである進化復号法を提案する。
論文 参考訳(メタデータ) (2026-08-01T11:48:25Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - You Don't Need Public Tests to Generate Correct Code [0.9668407688201359]
大規模言語モデルには,有効な入力を自律的に構築し,自己補正のための実行フローをシミュレートする能力があることを示す。
我々は,LLMが反復的に計画し,独自のテスト入力を合成し,シミュレートされた実行を行うことで,地平データの必要性を解消するフレームワークであるDryRUNを紹介した。
論文 参考訳(メタデータ) (2026-04-23T12:21:03Z) - BACE: LLM-based Code Generation through Bayesian Anchored Co-Evolution of Code and Test Populations [0.9668407688201359]
我々は、ベイズ的共進化過程として合成を再構成するフレームワークであるBACEを紹介する。
BACEはプロプライエタリモデルとオープンウェイトな小言語モデルの両方で優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-30T16:40:11Z) - Scaling Agentic Verifier for Competitive Coding [66.11758166379092]
大規模言語モデル(LLM)は強力なコーディング能力を示しているが、1回の試行で競合するプログラミング問題を正しく解くのに苦戦している。
実行ベースの再ランク付けは、有望なテスト時間スケーリング戦略を提供するが、既存のメソッドは、難しいテストケースの生成または非効率的なランダム入力サンプリングによって制約される。
本稿では,プログラムの動作を積極的に推論し,高い差別性のあるテスト入力を検索するエージェント検証手法を提案する。
論文 参考訳(メタデータ) (2026-02-04T06:30:40Z) - Can LLMs Compress (and Decompress)? Evaluating Code Understanding and Execution via Invertibility [36.41073880422337]
RoundTripCodeEval(RTCE)は、4つの異なるコード実行推論タスクからなる包括的なベンチマークである。
ゼロショットプロンプト、実行トレースの教師付き微調整、自己回帰機構を用いて、最先端のコード-LLMを体系的に評価する。
RTCEは、既存のI/O予測、実行推論、ラウンドトリップの自然言語ベンチマークによって捉えられていない、これまで測定されていなかったいくつかの新しい洞察を表面化している。
論文 参考訳(メタデータ) (2026-01-19T21:09:48Z) - Probing Pre-trained Language Models on Code Changes: Insights from ReDef, a High-Confidence Just-in-Time Defect Prediction Dataset [0.0]
本稿では,22の大規模C/C++プロジェクトから得られた関数レベル修正の信頼性の高いベンチマークであるReDefを紹介する。
欠陥ケースはコミットの反転によって固定され、クリーンケースはポストホック履歴チェックによって検証される。
このパイプラインは3,164の欠陥と10,268のクリーンな修正をもたらし、既存のリソースよりも信頼性の高いラベルを提供する。
論文 参考訳(メタデータ) (2025-09-11T07:07:11Z) - Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion? [60.84912551069379]
Code-Development Benchmark (Codev-Bench)は、細粒度で現実世界、リポジトリレベル、開発者中心の評価フレームワークです。
Codev-Agentは、リポジトリのクローリングを自動化し、実行環境を構築し、既存のユニットテストから動的呼び出しチェーンを抽出し、データ漏洩を避けるために新しいテストサンプルを生成するエージェントベースのシステムである。
論文 参考訳(メタデータ) (2024-10-02T09:11:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。