論文の概要: Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping
- arxiv url: http://arxiv.org/abs/2608.24135v2
- Date: Thu, 27 Aug 2026 03:39:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.779255
- Title: Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping
- Title(参考訳): 欠陥コード駆動テストケース合成とDense Reward ShapingによるロバストコードRL
- Authors: Yiwen Zhang, Xiaodong Yan, Zhenyu Huang, Deng Zhao, Liang Jiang, Qing Cui, Zujie Wen, Zhiqiang Zhang, Jun Zhou,
- Abstract要約: RobustTestsは、欠陥のあるコード駆動のテストケース合成戦略を特徴とするフレームワークである。
遅延論理的不一致を捕捉し、バリデータエージェントを使用して無効または冗長なテストケースをフィルタリングする。
我々は,ロバストテストによるQwen3-32Bの微調整により,LiveCodeBenchでは3%の絶対的なゲインが得られることを示す。
- 参考スコア(独自算出の注目度): 25.919848220574803
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Reinforcement Learning from Verifiable Rewards (RLVR) is pivotal for enhancing LLM code generation, yet its efficacy is often hindered by insufficient test case coverage, leading to reward hacking and policy degradation. To address this, we propose RobustTests, a framework featuring a faulty-code-driven test case synthesis strategy. By leveraging "near-correct" faulty codes, RobustTests captures latent logical discrepancies and employs validator agents with behavioral feature clustering to filter invalid or redundant test cases. Additionally, a stepwise dense reward function based on pass rates is introduced to mitigate false negatives and enhance training robustness. Using this pipeline, we construct an augmented version of the CodeContests+ dataset with superior diagnostic utility. Experimental results show that RL fine-tuning of Qwen3-32B via RobustTests achieves a 3% absolute gain on LiveCodeBench, demonstrating its effectiveness in advancing LLM code generation proficiency. Codes and data are available at https://huggingface.co/datasets/sid6/RobustTests.
- Abstract(参考訳): RLVR(Reinforcement Learning from Verifiable Rewards)は、LLMコード生成の強化に重要であるが、その有効性はテストケースのカバレッジ不足によって妨げられ、ハッキングやポリシーの劣化につながることが多い。
これを解決するために,コード駆動テストケース合成戦略の欠陥を特徴とするフレームワークであるRobustTestsを提案する。
に近い”欠陥コードを活用することで、RobustTestsは遅延論理的不一致をキャプチャし、振る舞い特徴クラスタリングを備えたバリデータエージェントを使用して、無効あるいは冗長なテストケースをフィルタリングする。
さらに、偽陰性を緩和し、トレーニングロバスト性を高めるために、パスレートに基づく段階的に密度の高い報酬関数を導入する。
このパイプラインを使用して、優れた診断ユーティリティを備えたCodeContests+データセットの拡張バージョンを構築します。
実験結果から,ロバストテストによるQwen3-32Bの微調整により,LiveCodeBenchが3%向上し,LLMコード生成精度が向上したことが示された。
コードとデータはhttps://huggingface.co/datasets/sid6/RobustTestsで入手できる。
関連論文リスト
- MineValiCoder: Reliable Code Generation with Test Case Quality Mining and Bipartite Graph-Based Mutual Validation [9.901505812242652]
コード品質とケース品質の相互強化に基づくクローズドループテスト駆動開発(TDD)フレームワークを提案する。
MineValiCoderは最先端のメソッドよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-07-24T16:39:06Z) - Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning [54.95476453942411]
コード生成のための強化学習は、単体テストのパスレートから検証可能な報酬に依存する。
最近のセルフプレイ手法は、1つのモデルでコードとテスト生成を統合する。
Code-A1は、人間のアノテーションによるテストでトレーニングされたコード生成のパフォーマンスマッチングまたはモデルを超えることを実現する。
論文 参考訳(メタデータ) (2026-03-16T17:58:13Z) - CodeHacker: Automated Test Case Generation for Detecting Vulnerabilities in Competitive Programming Solutions [8.163435280190027]
既存のベンチマークは、しばしば微妙なコーナーケースのカバレッジを欠いているため、誤った解決策を通すことができる。
CodeHackerは、プログラムの提出中に潜伏する脆弱性を暴露する逆テストケースを生成する。
実験によると、CodeHackerは既存のデータセットのTrue Negative Rate(TNR)を大幅に改善している。
論文 参考訳(メタデータ) (2026-02-23T05:59:30Z) - Consistency Meets Verification: Enhancing Test Generation Quality in Large Language Models Without Ground-Truth Solutions [1.9196411948992402]
ConVerTestは、既存のコード実装を必要とせず、信頼性の高いテストを合成するための、新しい2段階のパイプラインである。
BIGCODEBENCHとLESS BASIC PYTHON PROBLEMSベンチマークの実験では、ConVerTestはテストの妥当性、ラインカバレッジ、突然変異スコアを最大39%、28%、18%改善している。
論文 参考訳(メタデータ) (2026-02-11T04:40:38Z) - Scaling Agentic Verifier for Competitive Coding [66.11758166379092]
大規模言語モデル(LLM)は強力なコーディング能力を示しているが、1回の試行で競合するプログラミング問題を正しく解くのに苦戦している。
実行ベースの再ランク付けは、有望なテスト時間スケーリング戦略を提供するが、既存のメソッドは、難しいテストケースの生成または非効率的なランダム入力サンプリングによって制約される。
本稿では,プログラムの動作を積極的に推論し,高い差別性のあるテスト入力を検索するエージェント検証手法を提案する。
論文 参考訳(メタデータ) (2026-02-04T06:30:40Z) - CVeDRL: An Efficient Code Verifier via Difficulty-aware Reinforcement Learning [57.24524263804788]
コード検証は、LLMベースのコード生成の検証後において重要な役割を果たす。
既存の教師付き微調整手法は、データの不足、高い失敗率、推論効率の低下に悩まされている。
機能的な報酬しか持たない単純RLは、難しいブランチやサンプルに対して効果的な単体テストを生成することができないことを示す。
論文 参考訳(メタデータ) (2026-01-30T10:33:29Z) - ATGen: Adversarial Reinforcement Learning for Test Case Generation [78.48498301767079]
大きな言語モデル(LLM)はコード生成に優れていますが、その出力には微妙なバグが伴います。
既存のテスト生成方法は静的データセットに依存している。
我々は,対戦型強化学習を通じてテストケースジェネレータを訓練するフレームワークであるATGenを紹介する。
論文 参考訳(メタデータ) (2025-10-16T12:49:25Z) - Klear-CodeTest: Scalable Test Case Generation for Code Reinforcement Learning [43.30900834053253]
Klear-CodeTestは、厳密な検証機能を備えた総合的なテストケース合成フレームワークで、テストケースの品質と信頼性を保証する。
提案したG-Vフレームワークは,正規ケースとコーナーケースの両方を含む総合的なテストケースを生成し,テストカバレッジと解の正当性評価のための識別力を向上させる。
さらに,オンライン検証プラットフォームに最適化された多層セキュリティサンドボックスシステムを設計し,安全で信頼性の高いコード実行を保証する。
論文 参考訳(メタデータ) (2025-08-07T07:36:01Z) - KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding [49.56049319037421]
KodCodeは、高品質で検証可能なトレーニングデータを取得するという永続的な課題に対処する、合成データセットである。
自己検証手順によって体系的に検証される質問解決テスト三つ子を含む。
このパイプラインは大規模で堅牢で多様なコーディングデータセットを生成する。
論文 参考訳(メタデータ) (2025-03-04T19:17:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。