論文の概要: CodeChat-Eval: Evaluating Large Language Models in Multi-Turn Code Refinement Dialogues
- arxiv url: http://arxiv.org/abs/2606.25747v2
- Date: Tue, 30 Jun 2026 12:52:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 13:50:27.693712
- Title: CodeChat-Eval: Evaluating Large Language Models in Multi-Turn Code Refinement Dialogues
- Title(参考訳): CodeChat-Eval: マルチターンコードリファインメント対話における大規模言語モデルの評価
- Abstract要約: 大規模言語モデル(LLM)は、コードの生成と洗練のために、ソフトウェア工学でますます使われています。
既存のベンチマークでは、このマルチターンコードリファインメントダイアログ設定が省略されるのが一般的である。
マルチターンコードリファインメント対話から評価セッションを構築する評価フレームワークであるCodeChat-Evalを紹介する。
- 参考スコア(独自算出の注目度): 6.475060769782328
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) are increasingly used in software engineering to generate and refine code. In practice, developers often continue from an initial code generation request with follow-up refinement instructions, such as requests to improve style, restructure implementation, or change the execution strategy while preserving the intended behaviour. However, existing benchmarks generally omit this multi-turn code refinement dialogue setting and therefore cannot evaluate whether LLMs maintain functional correctness, i.e., whether the refined code still passes the test suite for the original task. To address this limitation, we introduce CodeChat-Eval, an evaluation framework that constructs evaluation sessions from multi-turn code refinement dialogues using a dynamic instruction selection algorithm. Our empirical study on open-weight and proprietary LLMs observes a statistically significant decrease ranging from 19.2% (GPT-5 Nano) to 69.2% (Llama 3.1 8B) in functional correctness over multi-turn refinement. The largest correctness drops are associated with logic-level refinements and additive change requests. These findings indicate that LLMs struggle to maintain functional correctness during multi-turn code refinement dialogues, and highlight the need for benchmarks that evaluate functionality-preserving refinement beyond single-turn generation.
- Abstract(参考訳): 大規模言語モデル(LLM)は、コードの生成と洗練のために、ソフトウェア工学でますます使われています。
実際には、開発者は、スタイルを改善するリクエスト、再構造化実装、あるいは意図した振る舞いを維持しながら実行戦略を変更するといった、後続の洗練された指示で、初期コード生成リクエストを継続することが多い。
しかし、既存のベンチマークでは、このマルチターンコード修正ダイアログ設定を省略しているため、LLMが機能的正確性を維持しているかどうか、すなわち、洗練されたコードが元のタスクのテストスイートをパスしているかどうかを評価できない。
この制限に対処するため,動的命令選択アルゴリズムを用いて,マルチターンコードリファインメント対話から評価セッションを構築する評価フレームワークであるCodeChat-Evalを導入する。
オープンウェイトおよびプロプライエタリLCMの実験的研究は、多ターン精錬よりも機能的正しさにおいて、19.2%(GPT-5 Nano)から69.2%(Llama 3.1 8B)の統計的に有意な減少を観測している。
最大の正しさ低下は、ロジックレベルの改善と追加的な変更要求に関連している。
これらの結果から,LLMはマルチターンコードリファインメント対話において機能的正当性を維持するのに苦慮し,単一ターン生成以上の機能的リファインメントを評価するベンチマークの必要性を強調した。
関連論文リスト
- MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding [83.0805548642958]
MTAC-IFBenchは、ソフトウェア開発におけるインストラクションフォローのための包括的なベンチマークである。
6つのプライマリと18のセカンダリカテゴリにまたがるさまざまな制約を持つ、多ターンプログレッシブなソフトウェア開発指示が特徴である。
MTAC-IFBenchは、マルチターン命令フォローにおける既存のコードエージェントの重大な欠陥を認識し、インタラクションセッションが長くなるにつれてパフォーマンスが急速に低下する。
論文 参考訳(メタデータ) (2026-09-14T03:57:37Z) - Unlocking LLM Code Correction with Iterative Feedback Loops [5.504955093712013]
本研究では、コード障害の評価、修正パターンの分析、推論と非推論モデルの有効性の比較を行うメトリクスを紹介する。
その結果、推論モデルは反復よりも一貫して改善され、フィードバックを活用する際に非推論モデルよりも大幅に優れています。
論文 参考訳(メタデータ) (2026-06-16T04:47:42Z) - Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring [51.497900015187675]
Themis-CodePreferenceは、これまでで最大のコード好みのオープンソースコレクションで、多言語コード報酬モデルのスイートであるThemis-RMのトレーニングに使用しています。
多様な嗜好に基づいてトレーニングを行う場合, 積極的なスケーリング傾向, 強い言語間移動を示す実験とアブリケーションを行った。
論文 参考訳(メタデータ) (2026-05-01T16:07:34Z) - From Restructuring to Stabilization: A Large-Scale Experiment on Iterative Code Readability Refactoring with Large Language Models [5.31828955342405]
大規模言語モデル(LLM)は、自動化されたコードタスクにますます使われています。
この記事では、コード可読性のためのLLMの能力を体系的に研究する。
論文 参考訳(メタデータ) (2026-02-25T12:05:25Z) - AlignCoder: Aligning Retrieval with Target Intent for Repository-Level Code Completion [55.21541958868449]
リポジトリレベルのコード補完フレームワークであるAlignCoderを提案する。
我々のフレームワークは、初期クエリとターゲットコードのセマンティックギャップを橋渡しする拡張クエリを生成する。
我々は、拡張クエリにおける推論情報を活用してより正確な検索を行うAlignRetrieverのトレーニングに強化学習を採用する。
論文 参考訳(メタデータ) (2026-01-27T15:23:14Z) - IFEvalCode: Controlled Code Generation [69.28317223249358]
本稿では,Code LLMの命令追従能力を改善するために,前方および後方制約生成を提案する。
IFEvalCodeは、7つのプログラミング言語の1.6Kテストサンプルからなる多言語ベンチマークである。
論文 参考訳(メタデータ) (2025-07-30T08:08:48Z) - Turning the Tide: Repository-based Code Reflection [52.13709676656648]
マルチファイルリポジトリコンテキストにおけるコード理解と生成を評価するベンチマークであるLiveRepoReflectionを紹介する。
多様性、正確性、難易度を確保するため、6ドル(約6,800円)のプログラミング言語で厳格にテストケースをフィルタリングしました。
RepoReflection-Instructは、さまざまなソースから派生した大規模で品質の高い命令チューニングデータセットである。
論文 参考訳(メタデータ) (2025-07-14T02:36:27Z) - Pragmatic Reasoning improves LLM Code Generation [34.01862911727194]
大規模言語モデル(LLM)は、自然言語(NL)命令をプログラムコードに変換する上で、驚くべき可能性を示している。
この課題に対処するため、研究者はプログラムコードの複数の候補を生成し、それらを再帰して最良の解を識別するアプローチを提案している。
我々は,Rational Speech Act (RSA) フレームワーク上に構築された新しいコード候補付け機構であるCodeRSAを提案する。
論文 参考訳(メタデータ) (2025-02-20T12:44:26Z) - Intention is All You Need: Refining Your Code from Your Intention [19.827036493004435]
本稿では,従来のコメント・ツー・コード・プロセスを強化する意図に基づくコード改善手法を提案する。
提案手法は,意図抽出と意図誘導リビジョン生成という2つの重要な段階から構成される。
提案手法は,意図抽出において79%の精度を達成し,コードリファインメント生成において最大66%の精度を実現した。
論文 参考訳(メタデータ) (2025-02-12T07:26:13Z) - Automating Patch Set Generation from Code Review Comments Using Large Language Models [2.045040820541428]
5つの人気のあるLarge Language Model(LLM)にコードコンテキストを提供します。
実世界のコードレビューコメントから提案したコード変更(パッチセット)を得る。
生成したパッチセットを人為的なパッチセットの履歴データと比較することにより、各モデルの性能を慎重に評価する。
論文 参考訳(メタデータ) (2024-04-10T02:46:08Z) - Reasoning Runtime Behavior of a Program with LLM: How Far Are We? [25.451857140926943]
コードのための大規模な言語モデル(LLM)は、強力なコード理解と生成能力を示している。
コード推論は、コードLLMの最も重要な能力の1つである。
本稿では,プログラム実行によるLLMのコード推論能力と一貫性を評価するためのフレームワークであるRevalを提案する。
論文 参考訳(メタデータ) (2024-03-25T05:37:16Z) - InfiBench: Evaluating the Question-Answering Capabilities of Code Large Language Models [56.723509505549536]
InfiBenchは、私たちの知識に合ったコードのための、最初の大規模フリーフォーム質問回答(QA)ベンチマークです。
慎重に選択された234の高品質なStack Overflow質問で構成されており、15のプログラミング言語にまたがっている。
InfiBench上で100以上の最新のコードLLMに対して,系統的評価を行い,新しい知見と洞察に富んだ結果を得た。
論文 参考訳(メタデータ) (2024-03-11T02:06:30Z) - StepCoder: Improve Code Generation with Reinforcement Learning from
Compiler Feedback [58.20547418182074]
2つの主要コンポーネントからなるコード生成の新しいフレームワークであるStepCoderを紹介します。
CCCSは、長いシーケンスのコード生成タスクをCurriculum of Code Completion Subtaskに分割することで、探索課題に対処する。
FGOは、未実行のコードセグメントをマスクすることでのみモデルを最適化し、Fine-Grained Optimizationを提供する。
提案手法は,出力空間を探索し,対応するベンチマークにおいて最先端の手法より優れた性能を発揮する。
論文 参考訳(メタデータ) (2024-02-02T13:14:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。