論文の概要: MineValiCoder: Reliable Code Generation with Test Case Quality Mining and Bipartite Graph-Based Mutual Validation
- arxiv url: http://arxiv.org/abs/2607.22471v1
- Date: Fri, 24 Jul 2026 16:39:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.187725
- Title: MineValiCoder: Reliable Code Generation with Test Case Quality Mining and Bipartite Graph-Based Mutual Validation
- Title(参考訳): MineValiCoder: テストケースの品質マイニングとグラフベースの相互検証を備えた信頼性の高いコード生成
- Authors: Zhen Zhao, Qihang Yang, Feifei Dai, Xiangfang Li, Bo Li,
- Abstract要約: コード品質とケース品質の相互強化に基づくクローズドループテスト駆動開発(TDD)フレームワークを提案する。
MineValiCoderは最先端のメソッドよりも大幅に優れています。
- 参考スコア(独自算出の注目度): 9.901505812242652
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Model (LLM)-based Test-Driven Development (TDD) has advanced automated code generation. However, existing approaches depend heavily on human-crafted test cases and cannot operate effectively when only natural-language requirements are available. Although recent work enables automatic test generation, it often overlooks the inherent stochasticity of LLMs, leading to two key defects: faulty tests generate misleading feedback that distorts code optimization, while mixed-quality test cases produce conflicting evaluation signals that hinder reliable code selection. To address these challenges, we propose MineValiCoder, a collaborative closed-loop TDD framework based on the mutual reinforcement of test-case quality and code quality. MineValiCoder comprises three modules. The Test Case Quality Mining (TCQM) module filters faulty test cases through self-validation, providing reliable optimization supervision. The Parallel TDD Refinement module iteratively optimizes code and generates diverse high-quality code candidates using validated test-case feedback. The Bipartite Graph-Based Code-Test Mutual Validation (BiCoTeV) module dynamically models code-test interactions and performs mutual validation scoring for stable and reliable optimal-code selection. Extensive evaluations across four LLMs and mainstream benchmarks show that MineValiCoder significantly outperforms state-of-the-art methods. Specifically, it achieves Pass@1 scores of 96.34% on HumanEval, 87.40% on MBPP, 64.00% on APPS, and 51.33% on LiveCodeBench. These results demonstrate the effectiveness of MineValiCoder in mitigating LLM stochasticity and improving the reliability of automated code generation.
- Abstract(参考訳): 大規模言語モデル(LLM)ベースのテスト駆動開発(TDD)は、高度な自動コード生成を備えている。
しかし、既存のアプローチは人為的なテストケースに大きく依存しており、自然言語の要件のみを利用できる場合、効果的に動作できない。
欠陥テストはコードの最適化を歪ませる誤解を招くが、混合品質のテストケースは信頼性の高いコード選択を妨げる相反する評価信号を生成する。
これらの課題に対処するために,テストケースの品質とコード品質の相互強化に基づいた,協調的なクローズループTDDフレームワークであるMineValiCoderを提案する。
MineValiCoderは3つのモジュールから構成される。
テストケース品質マイニング(TCQM)モジュールは、自己検証を通じて欠陥のあるテストケースをフィルタリングし、信頼性の高い最適化管理を提供する。
Parallel TDD Refinementモジュールは、コードを反復的に最適化し、検証済みのテストケースフィードバックを使用して、さまざまな高品質なコード候補を生成する。
Bipartite Graph-Based Code-Test Mutual Validation (BiCoTeV)モジュールは、動的にコード-テストインタラクションをモデル化し、安定かつ信頼性の高い最適コード選択のための相互検証スコアを実行する。
4つの LLM とメインストリームベンチマークの広範な評価は、MineValiCoder が最先端の手法を大幅に上回っていることを示している。
具体的には、HumanEvalが96.34%、MBPPが87.40%、APPSが64.00%、LiveCodeBenchが51.33%である。
これらの結果は、LLM確率性を緩和し、自動コード生成の信頼性を向上させるMineValiCoderの有効性を示す。
関連論文リスト
- ZeroCoder: Can LLMs Improve Code Generation Without Ground-Truth Supervision? [13.984583399745157]
RLVR(Reinforcement Learning with Verifiable Rewards)は、実行ベースのフィードバックを通じて改善する強力なパラダイムである。
既存の作業では、自己生成テストを使って報酬を土台にしようとしたが、差別的テストの欠如は、テスト生成に対するモデルの準最適性能による影響を制限した。
我々はZeroCoderについて紹介する。ZeroCoderは、自己生成されたコード-テストインタラクションから実行フィードバックを使用して、CoderとTesterを共同でトレーニングする完全なラベルなしの共進化フレームワークである。
論文 参考訳(メタデータ) (2026-04-09T06:24:54Z) - Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning [54.95476453942411]
コード生成のための強化学習は、単体テストのパスレートから検証可能な報酬に依存する。
最近のセルフプレイ手法は、1つのモデルでコードとテスト生成を統合する。
Code-A1は、人間のアノテーションによるテストでトレーニングされたコード生成のパフォーマンスマッチングまたはモデルを超えることを実現する。
論文 参考訳(メタデータ) (2026-03-16T17:58:13Z) - Consistency Meets Verification: Enhancing Test Generation Quality in Large Language Models Without Ground-Truth Solutions [1.9196411948992402]
ConVerTestは、既存のコード実装を必要とせず、信頼性の高いテストを合成するための、新しい2段階のパイプラインである。
BIGCODEBENCHとLESS BASIC PYTHON PROBLEMSベンチマークの実験では、ConVerTestはテストの妥当性、ラインカバレッジ、突然変異スコアを最大39%、28%、18%改善している。
論文 参考訳(メタデータ) (2026-02-11T04:40:38Z) - Use Property-Based Testing to Bridge LLM Code Generation and Validation [38.25155484701058]
大きな言語モデル(LLM)はコード生成において優れていますが、その出力が機能的に正しいことを保証することは、永続的な課題です。
本稿では,Property-Generated Solverを紹介した。Property-Based Testing (PBT)を活用して,高レベルのプログラム特性を検証する新しいフレームワークである。
プロパティ生成ソルバーには、コード生成と反復リファインメント専用のジェネレータと、PBTライフサイクルを管理するテスタという、2つの共同LLMベースのエージェントが使用されている。
論文 参考訳(メタデータ) (2025-06-23T06:01:12Z) - Learning to Solve and Verify: A Self-Play Framework for Code and Test Generation [69.62857948698436]
大規模言語モデル(LLM)の最近の進歩は、コーディングベンチマークのパフォーマンスを改善している。
しかし、手軽に利用できる高品質なデータの枯渇により、改善は停滞している。
本稿では,単一モデルのコードとテスト生成能力を共同で改善するセルフプレイ・ソルバ検証フレームワークであるSol-Verを提案する。
論文 参考訳(メタデータ) (2025-02-20T18:32:19Z) - Toward Automated Validation of Language Model Synthesized Test Cases using Semantic Entropy [0.5057850174013127]
現代の大規模言語モデル(LLM)ベースのプログラミングエージェントは、しばしば、生成されたコードを洗練するためにテスト実行フィードバックに依存する。
本稿では,LLMが生成したテストケースの自動検証にセマンティックエントロピーを利用する新しいフレームワークVALTESTを紹介する。
VALTESTはテストの妥当性を最大29%向上し、パス@1スコアの大幅な増加によって証明されたコード生成のパフォーマンスが向上することを示している。
論文 参考訳(メタデータ) (2024-11-13T00:07:32Z) - CodeDPO: Aligning Code Models with Self Generated and Verified Source Code [52.70310361822519]
我々は、コード生成に好み学習を統合するフレームワークであるCodeDPOを提案し、コードの正確性と効率性という2つの重要なコード優先要因を改善した。
CodeDPOは、コードとテストケースを同時に生成、評価するセルフジェネレーション・アンド・バリデーションメカニズムを利用して、新しいデータセット構築方法を採用している。
論文 参考訳(メタデータ) (2024-10-08T01:36:15Z) - CodeT: Code Generation with Generated Tests [49.622590050797236]
テストケースを自動的に生成するための事前学習言語モデルについて検討する。
CodeTは生成されたテストケースを使ってコードソリューションを実行し、次に最良のソリューションを選択します。
我々は,HumanEvalとMBPPのベンチマークを用いて,5種類の事前学習モデル上でCodeTを評価する。
論文 参考訳(メタデータ) (2022-07-21T10:18:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。