論文の概要: Self-Improving Code Generation via Semantic Entropy and Behavioral Consensus
- arxiv url: http://arxiv.org/abs/2603.29292v1
- Date: Tue, 31 Mar 2026 05:55:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:03.18136
- Title: Self-Improving Code Generation via Semantic Entropy and Behavioral Consensus
- Title(参考訳): セマンティックエントロピーと行動合意による自己改善コード生成
- Authors: Huan Zhang, Wei Cheng, Wei Hu,
- Abstract要約: ConSelfは2つの重要なアイデアに基づいて構築された自己改善のアプローチである。
まず,問題レベルの不確実性を測定する新しい指標であるコードセマンティックエントロピーを導入する。
第2に、コンセンサス駆動直接選好最適化(Con-DPO)を提案する。
- 参考スコア(独自算出の注目度): 24.61607166744383
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Improving the code generation capabilities of large language models (LLMs) typically relies on supervised fine-tuning or preference optimization, both of which require costly external resources such as powerful teacher models or reliable test units. However, in real-world scenarios, it is much harder to obtain reference solutions and test oracles than problem descriptions and test inputs. In this paper, we tackle a challenging yet realistic question: Can a code language model improve itself without access to a superior teacher and a test oracle? To answer this, we propose ConSelf, a self-improving approach built upon two key ideas. First, we introduce code semantic entropy, a novel metric that measures problem-level uncertainty by assessing the functional diversity of program behaviors, enabling a curriculum construction with the most learnable problems. Second, we present consensus-driven direct preference optimization (Con-DPO), a preference-based fine-tuning method that weights each preference pair by its behavioral consensus, thereby mitigating the impact of noisy self-generated supervision. Experiments on various benchmarks and backbone LLMs demonstrate that ConSelf significantly outperforms baselines, validating the effectiveness of semantic entropy-based curriculum construction and consensus-driven optimization in improving code generation without external supervision.
- Abstract(参考訳): 大規模言語モデル(LLM)のコード生成能力を改善するには、教師付き微調整や好みの最適化が一般的で、どちらも強力な教師モデルや信頼性の高いテストユニットのような高価な外部リソースを必要とする。
しかし、現実のシナリオでは、問題記述やテストインプットよりも参照解やテストオラクルを得るのがずっと難しい。
コード言語モデルは、優れた教師とテストのオラクルにアクセスせずに、自分自身を改善できますか?
これに答えるために、我々は2つの重要なアイデアに基づいて構築された自己改善アプローチであるConSelfを提案する。
まず,プログラム動作の関数的多様性を評価することで,問題レベルの不確実性を測定する新しい指標であるコード意味エントロピーを導入し,最も学習しやすい問題を用いたカリキュラム構築を可能にする。
第2に、コンセンサス駆動の直接選好最適化(Con-DPO)を提案する。これは、それぞれの選好ペアを行動コンセンサスによって重み付けし、ノイズの多い自己生成監視の影響を緩和する選好に基づく微調整手法である。
様々なベンチマークとバックボーン LLM の実験により、ConSelf はベースラインを著しく上回り、セマンティックエントロピーベースのカリキュラム構築の有効性と、外部の監督なしにコード生成を改善するためのコンセンサス駆動の最適化の有効性を検証した。
関連論文リスト
- TAROT: Test-driven and Capability-adaptive Curriculum Reinforcement Fine-tuning for Code Generation with Large Language Models [26.385183692191873]
大規模言語モデル(LLM)はコーディングパラダイムを変えつつありますが、合成的に洗練され、堅牢なコードは依然として重要な課題です。
本稿では,テスト駆動型およびcApability-adaptive cuRriculum reinfOrcement fineTuning (TAROT)を提案する。
論文 参考訳(メタデータ) (2026-02-17T09:29:18Z) - Reasoning Distillation and Structural Alignment for Improved Code Generation [0.6933020649563103]
この研究は、大規模言語モデルの推論能力を、より速く、より安価にデプロイできる、より小さく、より効率的なモデルに蒸留する。
提案手法は,正解経路の同定を学習することで,VLLMの推論能力と問題解決能力をエミュレートするためにモデルを訓練する。
実験結果から,我々の微調整モデルは,安価で簡単な実装プロセスによって開発され,パス@1,平均データフロー,平均構文がメトリクスにマッチする点において,ベースラインモデルよりも大幅に優れていることがわかった。
論文 参考訳(メタデータ) (2025-10-20T14:47:47Z) - Scaling Code-Assisted Chain-of-Thoughts and Instructions for Model Reasoning [65.20602712957725]
Cacoは、高品質で検証可能な多様な命令-CoT推論データの合成を自動化する新しいフレームワークである。
我々の研究は、人間の介入なしに自己持続的で信頼できる推論システムを構築するためのパラダイムを確立します。
論文 参考訳(メタデータ) (2025-10-05T07:59:24Z) - Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs [102.48588475875749]
本稿では,新しい並列テスト時間スケーリングフレームワークであるGenerative Self-Refinement (GSR)を紹介する。
GSRは一連の候補応答を並列に生成し、その後自己精製を行い、新しい優れた解を合成する。
提案手法は,5つの数学ベンチマークにおいて,最先端性能を実現する。
論文 参考訳(メタデータ) (2025-08-27T06:51:48Z) - Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation [69.62857948698436]
大規模言語モデル(LLM)の最近の進歩は、コーディングベンチマークのパフォーマンスを改善している。
しかし、手軽に利用できる高品質なデータの枯渇により、改善は停滞している。
本稿では,単一モデルのコードとテスト生成能力を共同で改善するセルフプレイ・ソルバ検証フレームワークであるSol-Verを提案する。
論文 参考訳(メタデータ) (2025-02-20T18:32:19Z) - CodeDPO: Aligning Code Models with Self Generated and Verified Source Code [52.70310361822519]
我々は、コード生成に好み学習を統合するフレームワークであるCodeDPOを提案し、コードの正確性と効率性という2つの重要なコード優先要因を改善した。
CodeDPOは、コードとテストケースを同時に生成、評価するセルフジェネレーション・アンド・バリデーションメカニズムを利用して、新しいデータセット構築方法を採用している。
論文 参考訳(メタデータ) (2024-10-08T01:36:15Z) - SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models [54.78329741186446]
本稿では,コードに基づく批判モデルを用いて,質問コードデータ構築,品質管理,補完的評価などのステップをガイドする新しいパラダイムを提案する。
英語と中国語におけるドメイン内ベンチマークとドメイン外ベンチマークの両方の実験は、提案したパラダイムの有効性を実証している。
論文 参考訳(メタデータ) (2024-08-28T06:33:03Z) - Wait, that's not an option: LLMs Robustness with Incorrect Multiple-Choice Options [2.1184929769291294]
本研究は,LLMの命令追従能力と批判的推論とのバランスを評価するための新しいフレームワークを提案する。
トレーニング後のアライメントモデルでは,無効なオプションの選択がデフォルトとなることが多いが,ベースモデルでは,モデルサイズに合わせてスケールするリファリング機能が改善されている。
さらに、同様の指示追従バイアスを示す並列人間の研究を行い、これらのバイアスがアライメントに使用される人間のフィードバックデータセットを通してどのように伝播するかを示唆した。
論文 参考訳(メタデータ) (2024-08-27T19:27:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。