論文の概要: Do Code Language Models Use Tests? A Behavioral and Representational Study of Test-Driven Code Generation
- arxiv url: http://arxiv.org/abs/2607.26244v1
- Date: Tue, 28 Jul 2026 20:25:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.467412
- Title: Do Code Language Models Use Tests? A Behavioral and Representational Study of Test-Driven Code Generation
- Title(参考訳): コード言語モデルはテストを使うか? テスト駆動型コード生成の振る舞いと表現に関する研究
- Authors: Yunhao Liang, Chengguang Gan, Ruixuan Ying, Hanjun Wei, Zhe Cui, Shiwen Ni,
- Abstract要約: 我々は,HumanEval+,MBPP+および最近のLiveCodeBenchタスクを用いて,テスト駆動コード生成について検討した。
我々は、自然言語のみのプロンプトを、関連する可視性テスト、シャッフルアウトプット、無関係性テスト、アサーションのみのテスト、より強力なモデル生成合成テストと比較する。
- 参考スコア(独自算出の注目度): 14.44743150931186
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Public tests are widely used to guide large language model code generation, but whether models treat them as executable specifications or merely as extra prompt context remains unclear. We study test-driven code generation on HumanEval+, MBPP+, and recent LiveCodeBench tasks using Qwen2.5-Coder-7B and Qwen3.6-27B. We compare natural-language-only prompts with relevant visible tests, shuffled outputs, irrelevant tests, assertion-only tests, and stronger-model-generated synthetic tests. Evaluation combines hidden or private test pass rates with task-level behavior flips, linear probes, and layer-wise hidden-state shifts. Visible tests substantially improve Qwen2.5 performance on MBPP+ but have little or unstable effect on HumanEval+ and LiveCodeBench. For Qwen3.6 on LiveCodeBench, the natural-language-only pass rate rises from 13.1% to 39.4%, yet relevant original tests add only 2.9 percentage points (p = .458), and synthetic high5 tests add 1.7 points over their matched baseline (p = .701). More tests produce larger representation shifts, but accuracy gains quickly saturate or disappear; assertion-only and irrelevant-test prompts can strongly alter hidden states without improving correctness. After controlling for prompt length, task-level shifts are associated with both beneficial and harmful flips, with a substantially stronger association for harms. These results show that tests influence code models through both semantic guidance and prompt-context perturbation, and that representational change alone does not demonstrate effective test utilization.
- Abstract(参考訳): 公開テストは、大規模な言語モデルコード生成を導くために広く使用されているが、モデルがそれらを実行可能な仕様として扱うのか、あるいは単に追加のプロンプトコンテキストとして扱うのかは不明だ。
我々は,HumanEval+,MBPP+および最近のLiveCodeBenchタスクを用いたテスト駆動コード生成について,Qwen2.5-Coder-7BとQwen3.6-27Bを用いて検討した。
我々は、自然言語のみのプロンプトを、関連する可視性テスト、シャッフルアウトプット、無関係性テスト、アサーションのみのテスト、より強力なモデル生成合成テストと比較する。
評価は、隠れテストまたはプライベートテストのパスレートとタスクレベルの振る舞いのフリップ、線形プローブ、レイヤワイドな隠れ状態シフトを組み合わせる。
バイシブルテストはMBPP+でのQwen2.5のパフォーマンスを大幅に改善するが、HumanEval+とLiveCodeBenchにはほとんど、あるいは不安定な影響はない。
LiveCodeBenchのQwen3.6では、自然言語のみのパスレートは13.1%から39.4%に上昇するが、関連するオリジナルテストでは2.9ポイント(p = .458)しか増加せず、合成ハイ5テストではマッチしたベースライン(p = .701)で1.7ポイント上昇する。
より多くのテストはより大きな表現シフトを生成するが、精度は急速に飽和または消失し、アサーションのみおよび無関係なテストプロンプトは、正確性を改善することなく、隠れた状態を強く変更することができる。
迅速な長さを制御した後、タスクレベルのシフトは有益かつ有害なフリップの両方に関連付けられ、より強い害の関連がある。
これらの結果から,テストは意味指導とアクシデント・コンテクスト摂動の両方を通じてコードモデルに影響を与えることが示され,表現的変化だけでは効果的なテスト利用を証明できない。
関連論文リスト
- Breaking, Stale, or Missing? Benchmarking Coding Agents on Project-Level Test Evolution [20.606877071567958]
テスト進化のための最初のプロジェクトレベルのベンチマークであるTEBenchを紹介します。
TEBenchをDefects4Jプロジェクト上で4段階のパイプラインで構築する。
3つの産業エージェントフレームワークにまたがる7つの構成を評価する。
論文 参考訳(メタデータ) (2026-05-07T12:31:09Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning [54.95476453942411]
コード生成のための強化学習は、単体テストのパスレートから検証可能な報酬に依存する。
最近のセルフプレイ手法は、1つのモデルでコードとテスト生成を統合する。
Code-A1は、人間のアノテーションによるテストでトレーニングされたコード生成のパフォーマンスマッチングまたはモデルを超えることを実現する。
論文 参考訳(メタデータ) (2026-03-16T17:58:13Z) - Consistency Meets Verification: Enhancing Test Generation Quality in Large Language Models Without Ground-Truth Solutions [1.9196411948992402]
ConVerTestは、既存のコード実装を必要とせず、信頼性の高いテストを合成するための、新しい2段階のパイプラインである。
BIGCODEBENCHとLESS BASIC PYTHON PROBLEMSベンチマークの実験では、ConVerTestはテストの妥当性、ラインカバレッジ、突然変異スコアを最大39%、28%、18%改善している。
論文 参考訳(メタデータ) (2026-02-11T04:40:38Z) - CodeContests-O: Powering LLMs via Feedback-Driven Iterative Test Case Generation [71.42965967582147]
既存のアプローチは、Large Language Models (LLM) を用いたテストケースの合成を試みる
包括的なテストケース構築のために、textbfFeedback-Bench Iterative Framework$を提案します。
私たちのデータセットは、平均的真正率(TPR)が89.37%、真負率(TNR)が90.89%で、CodeContestsとCodeContests+をそれぞれ4.32%、9.37%で大幅に上回っている。
論文 参考訳(メタデータ) (2026-01-20T07:32:44Z) - Assertion-Aware Test Code Summarization with Large Language Models [0.0]
単体テストは、テスト意図を伝える簡潔な要約を欠くことが多い。
本稿では,開発者による要約と組み合わせた実世界のJavaテストケース91のベンチマークを示す。
論文 参考訳(メタデータ) (2025-11-09T04:58:32Z) - AugmenTest: Enhancing Tests with LLM-Driven Oracles [2.159639193866661]
AugmenTestは、大規模な言語モデルを活用して、テスト中のソフトウェアの利用可能なドキュメントに基づいて、正しいオーラクルを推測するアプローチである。
AugmenTestには4つのバリエーションがある: Simple Prompt、Extended Prompt、ジェネリックプロンプト付きRAG(テスト中のクラスやメソッドのコンテキストなしで)とSimple Prompt付きRAG。
結果は、最も保守的なシナリオでは、AugmenTestのExtended PromptがSimple Promptを一貫して上回り、正しいアサーションを生成するために30%の成功率を達成したことを示している。
論文 参考訳(メタデータ) (2025-01-29T07:45:41Z) - Effective Test Generation Using Pre-trained Large Language Models and
Mutation Testing [13.743062498008555]
大規模言語モデル(LLM)が生成するテストケースの有効性を,バグの発見の観点から改善するための MuTAP を導入する。
MuTAPは、プログラム・アンダー・テスト(PUT)の自然言語記述がない場合に有効なテストケースを生成することができる
提案手法は, 最大28%の人書きコードスニペットを検出できることを示す。
論文 参考訳(メタデータ) (2023-08-31T08:48:31Z) - Position: AI Evaluation Should Learn from How We Test Humans [65.36614996495983]
人間の評価のための20世紀起源の理論である心理測定は、今日のAI評価における課題に対する強力な解決策になり得る、と我々は主張する。
論文 参考訳(メタデータ) (2023-06-18T09:54:33Z) - CodeT: Code Generation with Generated Tests [49.622590050797236]
テストケースを自動的に生成するための事前学習言語モデルについて検討する。
CodeTは生成されたテストケースを使ってコードソリューションを実行し、次に最良のソリューションを選択します。
我々は,HumanEvalとMBPPのベンチマークを用いて,5種類の事前学習モデル上でCodeTを評価する。
論文 参考訳(メタデータ) (2022-07-21T10:18:37Z) - PRover: Proof Generation for Interpretable Reasoning over Rules [81.40404921232192]
本稿では,ルールベース上の二項質問に応答し,対応する証明を生成するトランスフォーマーモデルを提案する。
本モデルは,効率的な制約付き学習パラダイムを用いて,証明グラフに対応するノードやエッジを予測できることを学習する。
我々は、QAと証明生成のための有望な結果を示すために、合成、手書き、人文による規則ベースの実験を行う。
論文 参考訳(メタデータ) (2020-10-06T15:47:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。